De la generación a la simulación: hasta dónde llegan los modelos de mundo como simuladores auténticos | Un análisis y benchmark sobre si los modelos de mundo pueden funcionar como simuladores físicos completos y fiables | Evaluación de las limitaciones actuales de los world models para la predicción física y la planificación
Abstract
PROBLEMA: gran parte de los modelos de mundo actuales se diseñan como generadores de suscripción del siguiente frame o del siguiente vídeo con fines de calidad de la generación, y no está claro si verdaderamente aprenden las leyes físicas del entorno ni si pueden usarse como simuladores fiables para la planificación y el razonamiento. SOLUCIÓN: este trabajo propone un diagnóstico y un marco de benchmark que diferencian entre 'un modelo que genera contenido plausible' y 'un modelo que simula correctamente el mundo', satisfaciendo las condiciones de fidelidad de largo alcance y consistencia física coherente. MÉTODO: diseñan pruebas que miden la coherencia de la dinámica, la extensión fiable del horizonte temporal, la invariancia ante condiciones y la utilidad real para la validación de políticas, comparando varios modelos de mundo representativos y generadores multimodales; se estudia cómo la calidad de la generación se desploma cuando se pide continuar más allá del horizonte entrenado. RESULTADOS: evidencian que la mayoría de los modelos actuales generan bien en el corto plazo pero fallan de forma sistemática en horizonte largo y en condiciones físicas invariantes, lo que demuestra que no cumplen aún el rol de auténticos simuladores; ofrecen un protocolo de evaluación reutilizable para la comunidad. RELEVANCIA: establece una metodología y un benchmark esenciales para orientar la investigación de modelos de mundo hacia la simulación fiable, tarea fundamental para la robótica, la planificación de agentes y el aprendizaje por refuerzo basado en modelos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.