Modelado de mundo-acción en contexto (Zero-WAM) a partir de vídeos humanos para generalización de tareas abiertas | Cómo conseguir que un agente ejecute tareas nuevas sin reentrenar, modelando dinámicas del entorno y acciones desde ejemplos en contexto | Aprendizaje in-context de políticas de control desde vídeo humano para robótica y agentes encarnados
Abstract
PROBLEMA: LOs modelos de mundo-acción que combinan predicción de la dinámica del entorno con generación de acciones suelen requerir entrenamiento supervisado masivo con datos de interacción costosos, y no generalizan a tareas abiertas no vistas: capturar a la vez la evolución del entorno y las acciones correctas en una sola representación sigue siendo un reto, sobre todo si se quiere adaptar el agente a tareas nuevas sin reentrenar. SOLUCIÓN: Zero-WAM propone el modelado de mundo-acción en contexto: aprende una representación conjunta estado-acción y la explota en la inferencia, de modo que el agente resuelve tareas nuevas combinando ejemplos en contexto con el modelo de mundo aprendido, sin actualizar pesos y sin fine-tuning por tarea. METODOLOGÍA: El modelo se entrena sobre secuencias de vídeo de humanos realizando manipulación y tareas domésticas, apreendiendo a predecir dinámicas y a emitir accioness; en evaluación se presentan tareas no vistas acompañadas de demostraciones en contexto y se mide la tasa de éextio en entornos de manipulación robótica y simuladores, comparando contra baselines sin modelao de mundo y sin ejemplos en contexto. RESULTADOS: LOs autores reportan mejoras claras en precisión de ejecuación y cobertura de tareas abiertas frente a los baselines, con costes de desplegüe bajos porque no se reentrena por tarea; el análisié muestra que la combnación de modelao de mundo y ejemplos en contexto es el factor determinante del éextio. RELEVANCIA: Conecta los modelos de mundo con el aprendizaje en contexto, habilitando agentes encarnados y robóticos que se adaptan a tareas nuevas sin fine-tuning, y orienta el diseño de sistemas agénticos y de RL basado en modelo.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.