Ir al contenido principalSaltar al contenido

Zero-WAM: modelado mundo-acción en contexto a partir de vídeos humanos | Cómo aprender la dinámica del mundo observando a personas, sin entrenamiento específico por tarea | Técnica para que agentes robóticos generalicen a tareas abiertas usando solo vídeos humanos como demostración

world-action modelmodelo mundo-acciónin-context learningaprendizaje en contextohuman videosvídeos humanosopen-ended task generalizationgeneralización a tareas abiertasroboticsrobótica

Abstract

PROBLEMA: los agentes autónomos y los sistemas robóticos necesitan comprender cómo sus acciones transforman el mundo para resolver tareas abiertas, pero entrenar modelos mundo-acción suele requerir interacción propia costosa o conjuntos de datos específicos de cada tarea, lo que limita su escalabilidad y su aplicación a nuevos entornos. SOLUCIÓN: Zero-WAM propone el modelado mundo-acción en contexto (in-context world-action modeling): a partir de vídeos humanos, el modelo infiere la relación entre acciones y estados del entorno sin necesidad de fine-tuning específico, y generaliza a tareas abiertas no vistas. METODOLOGÍA: la propuesta se apoya en ejemplos proporcionados en contexto, extraídos de vídeos de personas realizando actividades, para construir asociaciones acción-efecto transferibles a otros cuerpos y entornos; evita el entrenamiento individual por tarea y aprovecha la observación pasiva como fuente de conocimiento de dinámica. RESULTADOS: según la propuesta del trabajo, el enfoque logra generalización a tareas abiertas sin entrenamiento adicional, superando la dependencia de datos de interacción propios que caracteriza a los métodos convencionales de aprendizaje de modelos de mundo. RELEVANCIA: es un avance directo para modelos de mundo y robótica, pues reduce drásticamente el coste de adquisición de datos de dinámica y acerca el aprendizaje de causalidad y física desde observación pasiva; además demuestra cómo el aprendizaje en contexto puede trasladarse de la comprensión del lenguaje a la predicción de entornos, un principio directamente aplicable a agentes multimodales.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies