PAWBench: benchmark para medir cuánto falta para un modelado de mundo alineado probabilísticamente | Cómo evaluar si un modelo de mundo captura la incertidumbre y la verdadera distribución de estados futuros del entorno | Evaluación estandarizada de world models por su calibración probabilística frente a la dinámica real
Abstract
PROBLEMA: Los modelos de mundo se evalúan casi siempre por calidad perceptual o por error medio de predicción determinista, ignorando si sus distribuciones de estados futuros están bien calibradas respecto a la dinámica real; esto oculta fallos graves en entornos estocásticos y produce modelos inutilizables para planificación bajo incertidumbre, donde la probabilidad importa tanto como el valor esperado. SOLUCIÓN: PAWBench propone un benchmark específico para medir el alineamiento probabilístico de los world models: qué tan cerca están las predicciones del modelo de la verdadera distribución de estados futuros del entorno, ofreciendo evaluación estandarizada y diagnósticos desglosados por tipo de entorno para responder con evidencia cuánto falta para un modelado de mundo probabilísticamente alineado. METODOLOGÍA: Recopila un conjunto de entornos simulados y juegos con dinámicas estocásticas y define métricas de calibración probabilística, cobertura de futuros posibles, divergencia entre distribuciones predichas y observadas, y utilidad de las predicciones para planificación y toma de decisiones; se evalúan world models de última generación entrenados con datos diversos. RESULTADOS: El benchmark muestra que varios modelos de vanguardia optimizan la exactitud media pero presentan calibración deficiente de la incertidumbre, revelando una brecha clara y cuantificable hacia el modelado de mundo correctamente alineado; la batería de métricas permite comparar modelos de forma fiable y reproducible. RELEVANCIA: Establece métricas de veracidad y calibración para modelos de mundo, esenciales para agentes y planificadores que razonan bajo incertidumbre, y complementa los benchmarks de razonamiento y agentes con una referencia evaluable para la comunidad.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.