Ir al contenido principalSaltar al contenido

WorldCycle: aprendizaje por refuerzo autoverificable para modelos de mundo de vídeo de horizonte largo | Cierre del ciclo de predicción y verificación para entrenar modelos de mundo de vídeo sin supervisión externa | Método de RL con recompensa autogenerada para mejorar la predictibilidad de modelos de mundo aplicables a planificación y control

world modelsreinforcement learningself-verificationmodelos de mundoaprendizaje por refuerzoautoverificaciónvideo predictionplanificaciónmodel-based RLlong-horizon

Abstract

PROBLEMA: Los modelos de mundo basados en vídeo suelen entrenarse con pérdidas de reconstrucción que no garantizan coherencia a largo plazo, y el aprendizaje por refuerzo requiere recompensas externas difíciles de obtener para tareas de predicción de mundo. SOLUCIÓN: El paper propone WorldCycle, un marco de aprendizaje por refuerzo autoverificable en el que el propio modelo genera su señal de recompensa cerrando el ciclo de predicción de vídeo, permitiendo entrenar modelos de mundo de horizonte largo sin supervisión humana ni recompensas externas. METODOLOGÍA: Se construye un ciclo donde el modelo predice vídeo futuro, se autoevalúa comparando consistencia temporal y se usa esa verificación interna como recompensa de RL, aplicando el esquema a modelos generativos de vídeo y evaluando la calidad y estabilidad de las predicciones a largo plazo. RESULTADOS: WorldCycle mejora la coherencia y la exactitud de las predicciones a largo plazo frente a entrenamiento por reconstrucción pura y a métodos de RL con recompensas heurísticas, manteniendo la capacidad generativa del modelo. RELEVANCIA: Ofrece un método algorítmico de recompensa autogenerada que fortalece los modelos de mundo, base para la planificación, el model-based RL y la simulación, aplicable también como inspiración para el auto-entrenamiento de sistemas predictivos.

Más info: Política de Cookies