Memoria direccionable para modelos de mundo de video | Cómo dotar a los modelos de mundo de memoria a largo plazo recuperable para predicciones coherentes | Memoria explícita que permite a los modelos de mundo recordar y reutilizar información pasada en generación y predicción de video
Abstract
PROBLEMA: los modelos de mundo de video se enfrentan a la limitación de memoria de contexto a corto plazo, degradando su capacidad para mantener coherencia temporal y reutilizar información relevante en escenarios largos o interacciones prolongadas. SOLUCIÓN: el paper introduce un mecanismo de memoria direccionable (addressable memory) para modelos de mundo de video que permite almacenar, indexar y recuperar representaciones del pasado de forma explícita, de modo que el modelo puede consultar su memoria cuando lo necesita para mejorar la predicción y generación coherente de secuencias. METODOLOGÍA: se integran módulos de escritura y lectura de memoria con claves de direccionamiento dentro de un modelo de mundo de video, se entrenan en datos secuenciales largos y se evalúan escenarios que exigen memoria a largo plazo, comparando contra arquitecturas con solo atención a corto plazo. RESULTADOS: la memoria direccionable mejora la coherencia temporal y el rendimiento predictivo en secuencias largas y reduce la necesidad de reconstruir información recurrente, superando a las líneas base sin memoria explícita en métricas de fidelidad y consistencia de video. RELEVANCIA: aporta un mecanismo de memoria a largo plazo transferible a world models y agentes que operan en entornos interactivos, un elemento clave para simulación coherente, modelado de mundo persistente y robótica con horizonte temporal largo.