Ir al contenido principalSaltar al contenido

Modelado de mundo-acción en contexto (Zero-WAM) a partir de vídeos humanos para generalización de tareas abiertas | Cómo conseguir que un agente ejecute tareas nuevas sin reentrenar, modelando dinámicas del entorno y acciones desde ejemplos en contexto | Aprendizaje in-context de políticas de control desde vídeo humano para robótica y agentes encarnados

world-action modelin-context learningmodelo de mundogeneralización de tareas abiertasvídeo humanopolíticas de controlzero-shot generalizationagentes encarnadosdinámica del entornotask generalization

Abstract

PROBLEMA: LOs modelos de mundo-acción que combinan predicción de la dinámica del entorno con generación de acciones suelen requerir entrenamiento supervisado masivo con datos de interacción costosos, y no generalizan a tareas abiertas no vistas: capturar a la vez la evolución del entorno y las acciones correctas en una sola representación sigue siendo un reto, sobre todo si se quiere adaptar el agente a tareas nuevas sin reentrenar. SOLUCIÓN: Zero-WAM propone el modelado de mundo-acción en contexto: aprende una representación conjunta estado-acción y la explota en la inferencia, de modo que el agente resuelve tareas nuevas combinando ejemplos en contexto con el modelo de mundo aprendido, sin actualizar pesos y sin fine-tuning por tarea. METODOLOGÍA: El modelo se entrena sobre secuencias de vídeo de humanos realizando manipulación y tareas domésticas, apreendiendo a predecir dinámicas y a emitir accioness; en evaluación se presentan tareas no vistas acompañadas de demostraciones en contexto y se mide la tasa de éextio en entornos de manipulación robótica y simuladores, comparando contra baselines sin modelao de mundo y sin ejemplos en contexto. RESULTADOS: LOs autores reportan mejoras claras en precisión de ejecuación y cobertura de tareas abiertas frente a los baselines, con costes de desplegüe bajos porque no se reentrena por tarea; el análisié muestra que la combnación de modelao de mundo y ejemplos en contexto es el factor determinante del éextio. RELEVANCIA: Conecta los modelos de mundo con el aprendizaje en contexto, habilitando agentes encarnados y robóticos que se adaptan a tareas nuevas sin fine-tuning, y orienta el diseño de sistemas agénticos y de RL basado en modelo.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies