Zero-WAM: modelado mundo-acción en contexto a partir de vídeos humanos | Cómo aprender la dinámica del mundo observando a personas, sin entrenamiento específico por tarea | Técnica para que agentes robóticos generalicen a tareas abiertas usando solo vídeos humanos como demostración
Abstract
PROBLEMA: los agentes autónomos y los sistemas robóticos necesitan comprender cómo sus acciones transforman el mundo para resolver tareas abiertas, pero entrenar modelos mundo-acción suele requerir interacción propia costosa o conjuntos de datos específicos de cada tarea, lo que limita su escalabilidad y su aplicación a nuevos entornos. SOLUCIÓN: Zero-WAM propone el modelado mundo-acción en contexto (in-context world-action modeling): a partir de vídeos humanos, el modelo infiere la relación entre acciones y estados del entorno sin necesidad de fine-tuning específico, y generaliza a tareas abiertas no vistas. METODOLOGÍA: la propuesta se apoya en ejemplos proporcionados en contexto, extraídos de vídeos de personas realizando actividades, para construir asociaciones acción-efecto transferibles a otros cuerpos y entornos; evita el entrenamiento individual por tarea y aprovecha la observación pasiva como fuente de conocimiento de dinámica. RESULTADOS: según la propuesta del trabajo, el enfoque logra generalización a tareas abiertas sin entrenamiento adicional, superando la dependencia de datos de interacción propios que caracteriza a los métodos convencionales de aprendizaje de modelos de mundo. RELEVANCIA: es un avance directo para modelos de mundo y robótica, pues reduce drásticamente el coste de adquisición de datos de dinámica y acerca el aprendizaje de causalidad y física desde observación pasiva; además demuestra cómo el aprendizaje en contexto puede trasladarse de la comprensión del lenguaje a la predicción de entornos, un principio directamente aplicable a agentes multimodales.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.