Extrapolación nativa de video largo mediante Self Gradient Forcing | Cómo generar secuencias de video extensas y coherentes con modelos de difusión | Técnica para evitar la degradación temporal en videos generados por inteligencia artificial
Abstract
PROBLEMA: La generación de video de larga duración mediante modelos de difusión sufre frecuentemente de falta de coherencia temporal y degradación visual a medida que aumenta la duración, limitando la utilidad práctica para contenidos extensos. SOLUCIÓN: El paper introduce 'Self Gradient Forcing', una técnica nativa para la extrapolación de video que guía el proceso de generación manteniendo la integridad de las estructuras aprendidas originalmente sin requerir un reentrenamiento masivo. METODOLOGÍA: Utilizan un mecanismo de retroalimentación de gradiente propio que penaliza las desviaciones del flujo latente esperado durante la extrapolación, aplicado sobre arquitecturas de difusión de video de última generación. RESULTADOS: Los experimentos demuestran que el método permite generar videos significativamente más largos que los límites predeterminados de los modelos base, manteniendo una calidad visual constante y reduciendo los artefactos de repetición. RELEVANCIA: Es fundamental para sistemas que requieren simulación de mundo y generación de contenido visual coherente para agentes o entretenimiento.