EchoWM: modelos de mundo omni-modales abiertos y explorables | Representar y predecir la dinámica del entorno fusionando múltiples modalidades (visión, lenguaje, audio) | Simuladores neuronales del mundo que permiten a agentes y robots razonar, predecir y actuar en entornos reales
Abstract
PROBLEMA: la mayoría de los modelos de mundo existentes se limitan a una única modalidad o funcionan como cajas negras que solo generan los siguientes frames, lo que dificulta la predicción de la dinámica del entorno, el razonamiento causal y el uso en sistemas agénticos interactivos. SOLUCIÓN: EchoWM propone un modelo de mundo omni-modal, abierto y 'enterable' (pobrable en tiempo de inferencia), que integra representaciones de visión, lenguaje y otras señales para construir una comprensión integrada del mundo y permitir al agente preguntar, intervenir o explorar el modelo interno. METODOLOGÍA: entrena un mundo model dual con componentes generativos y razonadores unificados sobre datos multimodales masivos, incluyendo rutas de autoregresión para predicciones de estado y acción así como interfaces de control para intervenciones en latencia. RESULTADOS: el modelo demuestra una predicción multimodal más coherente y una mayor flexibilidad de interacción que alternativas unimodales, con mejoras cualitativas en coherencia de rol-longitud y aceptación en tareas de planificación agéntica. RELEVANCIA: aporta una arquitectura de modelo de mundo generalizable y auditabel que sirve de base para robótica, planeación de agentes y razonamiento en entornos abiertos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.