Ir al contenido principalSaltar al contenido

EnvACE: internalización de la dinámica del entorno mediante ensayos de mundo (world rehearsal) en RL agéntico | Cómo reducir las interacciones reales de un agente simulando trayectorias con un modelo de mundo aprendido | Técnica para que los agentes piensen antes de actuar y operen en entornos caros, lentos o peligrosos

world modelsmodelo de mundoworld rehearsalensayo mentalmodel-based reinforcement learningaprendizaje por refuerzo basado en modelosample efficiencyeficiencia de muestradinámica latentecomputer use agents

Abstract

PROBLEMA: Los agentes entrenados con aprendizaje por refuerzo agéntico necesitan miles de interacciones con el entorno real (navegador, sistema operativo, simulador) para aprender, lo que resulta lento y costoso, y en ocasiones inviable por riesgo o presupuesto. SOLUCIÓN: EnvACE internaliza la dinámica del entorno construyendo un modelo de mundo que el agente emplea para hacer 'ensayos mentales' (world rehearsal): antes de actuar, el agente simula trayectorias plausibles en el modelo de mundo y entrena con esa experiencia sintética, reduciendo drásticamente las interacciones reales necesarias. METODOLOGÍA: Arquitectura conjunta de un modelo de mundo (predictor de transiciones y estados latentes) y una política agéntica; el modelo de mundo se aprende de la experiencia real acumulada y se usa para generar rollouts sintéticos de alta calidad que se incorporan al buffer de entrenamiento on-policy. Se evalúa en entornos de computer use y navegación, comparando frente a agentes sin modelo de mundo y frente a enfoques clásicos de model-based RL. RESULTADOS: Mejora significativa de la eficiencia de muestra —el agente logra rendimientos comparables con una fracción de las interacciones reales— y mayor robustez ante cambios en el entorno gracias a la generalización del modelo de mundo. RELEVANCIA: Vincula modelos de mundo con RL agéntico: agentes que imaginan consecuencias antes de actuar, clave para el despliegue seguro en entornos caros, peligrosos o no deterministas y para sistemas predictivos basados en simulación.

Más info: Política de Cookies