Ir al contenido principalSaltar al contenido

PlayWorld: evaluacion de modelos de mundo con agentes 'jugadores' jugando objetivos de largo horizonte | Como saber si un modelo de mundo es util de verdad para planear y decidir, no solo para predecir frames | Benchmark para medir modelos de mundo por objetivos compuestos ejecutables en horizontes largos

world modelsbenchmarklong-horizon objectivesmodel-based RLmodelos de mundoevaluacion de agentesagent playersplanningsimulacion de entorno

Abstract

PROBLEMA: los modelos de mundo se han vuelto centrales para la investigacion de agentes y robotica, pero su evaluacion suele quedarse en metricas de error de prediccion de imagenes o de videos a corto plazo: una buena restauracion de pixeles no garantiza que un modelo de mundo sirva para planificar, tomar decisiones ni completar tareas de muchos pasos. La brecha entre error de reconstruccion y utilidad real de comportamiento es cada vez mas clara. SOLUCION: PlayWorld es un benchmark que evalua modelos de mundo mediante agentes 'jugadores' que operan contra el modelo como si fuera un entorno de simulacion, con objetivos compuestos de largo horizonte: el modelo solo es val que cuando el jugador consigue encadenar subobjetivos ejecutables paso a paso dentro del mundo muestreado. METODOLOGIA: define lineas de entornos con dificultad escalonada, objetivos formados por subobjetivos conectados, herramientas de consola para que el agente actue sobre las predicciones del modelo del mundo (sean de video, latentes o accionados) y metricas de progreso compuesto; la evaluacion compara los ranking de modelos obtenidos con el nuevo protocolo frente a los metricos de reconstruccion estandar, incluida la cobertura de objetivos de largo plazo. RESULTADOS: el informe muestra que este tipo de evaluacion discrimina mucho mejor de los modelos del mundo que los errores de prediccion: predictores de pixeles excelentes pueden fallar en objetivos ejecutables de largo plazo y viceversa, y el ranking cambia segun la complejidad de los objetivos;cy la evaluacion resulta estable con distintas politicas de jugadores sometidos a la prueba. RELEVANCIA: ofrece un benchmark anclado a la utilidad de la planeacion para el aprendizado basado en modelos y los agentes de largo horizonte, y proporciona un estandar comparativo para guiar el entrenamiento y la selecion de arquitecturas de models del mundo e robotica y simulacion.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies