Ir al contenido principalSaltar al contenido

PAWBench: benchmark para medir cuánto falta para un modelado de mundo alineado probabilísticamente | Cómo evaluar si un modelo de mundo captura la incertidumbre y la verdadera distribución de estados futuros del entorno | Evaluación estandarizada de world models por su calibración probabilística frente a la dinámica real

world modelingbenchmarkcalibración probabilísticaincertidumbrepredicción de estados futurosevaluación de modelos de mundoprobabilistic alignmententornos estocásticosplanificación bajo incertidumbremétricas de veracidad

Abstract

PROBLEMA: Los modelos de mundo se evalúan casi siempre por calidad perceptual o por error medio de predicción determinista, ignorando si sus distribuciones de estados futuros están bien calibradas respecto a la dinámica real; esto oculta fallos graves en entornos estocásticos y produce modelos inutilizables para planificación bajo incertidumbre, donde la probabilidad importa tanto como el valor esperado. SOLUCIÓN: PAWBench propone un benchmark específico para medir el alineamiento probabilístico de los world models: qué tan cerca están las predicciones del modelo de la verdadera distribución de estados futuros del entorno, ofreciendo evaluación estandarizada y diagnósticos desglosados por tipo de entorno para responder con evidencia cuánto falta para un modelado de mundo probabilísticamente alineado. METODOLOGÍA: Recopila un conjunto de entornos simulados y juegos con dinámicas estocásticas y define métricas de calibración probabilística, cobertura de futuros posibles, divergencia entre distribuciones predichas y observadas, y utilidad de las predicciones para planificación y toma de decisiones; se evalúan world models de última generación entrenados con datos diversos. RESULTADOS: El benchmark muestra que varios modelos de vanguardia optimizan la exactitud media pero presentan calibración deficiente de la incertidumbre, revelando una brecha clara y cuantificable hacia el modelado de mundo correctamente alineado; la batería de métricas permite comparar modelos de forma fiable y reproducible. RELEVANCIA: Establece métricas de veracidad y calibración para modelos de mundo, esenciales para agentes y planificadores que razonan bajo incertidumbre, y complementa los benchmarks de razonamiento y agentes con una referencia evaluable para la comunidad.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies