Wonder: Video World Model Done Better | Wonder: Una mejora sustancial en los modelos de mundo basados en vídeo | Desarrollo de modelos de predicción de vídeo con alta consistencia física para agentes autónomos
Abstract
PROBLEMA: Los modelos de mundo basados en vídeo suelen sufrir de falta de consistencia física y temporal a largo plazo, dificultando su uso para simulaciones realistas de toma de decisiones en agentes. SOLUCIÓN: Se presenta 'Wonder', un modelo de mundo de vídeo optimizado que utiliza arquitecturas de difusión mejoradas para garantizar una mayor fidelidad en la transición de estados. Se enfoca en la capacidad del modelo para 'entender' las reglas del entorno que genera. METODOLOGÍA: Utiliza una arquitectura latente de alta capacidad entrenada en diversos datasets de interacción física. Introduce un nuevo mecanismo de atención espacio-temporal que prioriza la causalidad en el movimiento. RESULTADOS: Wonder supera a los modelos previos en benchmarks de realismo visual y, fundamentalmente, en la coherencia de las trayectorias predichas sobre horizontes temporales extendidos. RELEVANCIA: Imprescindible para el desarrollo de agentes que operan en entornos físicos reales o simulados, permitiendo simulaciones 'sim-to-real' más precisas.