PlayWorld: benchmark de modelos de mundo evaluados con agentes jugadores en objetivos de largo horizonte | Cómo medir la calidad de los modelos de mundo haciendo que agentes los usen en tareas prolongadas de juego | Referencia de evaluación para comprobar predicción de mundo y planificación de agentes
Abstract
PROBLEMA: evaluar modelos de mundo es difícil porque las métricas de predicción de píxeles o frame por frame no reflejan la utilidad real del modelo para un agente que debe planificar y decidir en entornos de largo horizonte. Falta una prueba que mida la calidad a nivel de comportamiento. SOLUCIÓN: PlayWorld presenta un benchmark que evalúa modelos de mundo usando 'agentes jugadores': los modelos se integran en un bucle de control donde un agente interactúa con el entorno simulado apoyándose en las predicciones del modelo para alcanzar objetivos de largo horizonte. De este modo la calidad del modelo de mundo se mide por su contribución al desempeño agéntico y la planificación. METODOLOGÍA: se construyen entornos de juego con múltiples tareas prolongadas, se conecta cada modelo de mundo candidato a un agente y se registran métricas de éxito, eficiencia y consistencia temporal a lo largo de episodios largos, comparando distintos enfoques de modelado del mundo. RESULTADOS: el benchmark diferencia claramente los modelos según su capacidad de apoyar planificación de largo horizonte, mostrando que los mejores modelos de predicción no siempre son los que mejor sostienen el desempeño del agente. RELEVANCIA: establece un referente de evaluación conductual para modelos de mundo (Block 6), imprescindible para sistemas de planificación y robótica que dependen de predicciones fiables del entorno.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.