Ir al contenido principalSaltar al contenido

QQWorld: Regularización de modelos de mundo mediante matching de cuantiles | Técnica estadística para mejorar la robustez de agentes de IA | Optimización de distribuciones latentes en modelos predictivos de mundo

QQWorldQuantile-Quantile MatchingWorld Modelsregularización de modelosreinforcement learningaprendizaje por refuerzoestabilidad de entrenamiento

Abstract

PROBLEMA: Los modelos de mundo en aprendizaje por refuerzo a menudo sufren de "colapso representacional" o sobreajuste a la dinámica de entrenamiento, lo que limita su capacidad de planificación en entornos nuevos. SOLUCIÓN: El paper propone QQWorld, una técnica que utiliza el emparejamiento Cuantil-Cuantil (Q-Q matching) para regularizar las distribuciones del espacio latente del modelo de mundo, forzándolo a seguir distribuciones estadísticas más robustas. METODOLOGÍA: Implementan una pérdida de regularización basada en la estadística de cuantiles que alinea la distribución predicha con una distribución objetivo sin las inestabilidades de las métricas de divergencia tradicionales. RESULTADOS: QQWorld mejora la eficiencia de la muestra en un 40% en benchmarks de control continuo y robótica, mostrando una estabilidad superior frente a variaciones en la observación. RELEVANCIA: Clave para el desarrollo de agentes autónomos que deben operar en entornos físicos con alta incertidumbre y ruido sensorial.

Más info: Política de Cookies