Ir al contenido principalSaltar al contenido

EnvACE: internalización de la dinámica del entorno mediante ensayos de mundo (world rehearsal) en RL agéntico | Cómo reducir las interacciones reales de un agente simulando trayectorias con un modelo de mundo aprendido | Técnica para que los agentes piensen antes de actuar y operen en entornos caros, lentos o peligrosos

world modelsmodelo de mundoworld rehearsalensayo mentalmodel-based reinforcement learningaprendizaje por refuerzo basado en modelosample efficiencyeficiencia de muestradinámica latentecomputer use agents

Abstract

PROBLEMA: Los agentes entrenados con aprendizaje por refuerzo agéntico necesitan miles de interacciones con el entorno real (navegador, sistema operativo, simulador) para aprender, lo que resulta lento y costoso, y en ocasiones inviable por riesgo o presupuesto. SOLUCIÓN: EnvACE internaliza la dinámica del entorno construyendo un modelo de mundo que el agente emplea para hacer 'ensayos mentales' (world rehearsal): antes de actuar, el agente simula trayectorias plausibles en el modelo de mundo y entrena con esa experiencia sintética, reduciendo drásticamente las interacciones reales necesarias. METODOLOGÍA: Arquitectura conjunta de un modelo de mundo (predictor de transiciones y estados latentes) y una política agéntica; el modelo de mundo se aprende de la experiencia real acumulada y se usa para generar rollouts sintéticos de alta calidad que se incorporan al buffer de entrenamiento on-policy. Se evalúa en entornos de computer use y navegación, comparando frente a agentes sin modelo de mundo y frente a enfoques clásicos de model-based RL. RESULTADOS: Mejora significativa de la eficiencia de muestra —el agente logra rendimientos comparables con una fracción de las interacciones reales— y mayor robustez ante cambios en el entorno gracias a la generalización del modelo de mundo. RELEVANCIA: Vincula modelos de mundo con RL agéntico: agentes que imaginan consecuencias antes de actuar, clave para el despliegue seguro en entornos caros, peligrosos o no deterministas y para sistemas predictivos basados en simulación.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies