LiveTalk: Difusión de vídeo interactiva multimodal en tiempo real mediante destilación on-policy mejorada
El paper introduce LiveTalk, un sistema de generación de vídeo interactivo multimodal en tiempo real basado en una destilación on-policy mejorada para modelos de difusión. Aborda los problemas de latencia en la desruido simultáneo de frames con atención bidireccional, haciendo el modelo autoregresivo y eficiente para condicionamientos multimodales como texto, imagen y audio. Mejora el método Self Forcing para eliminar artefactos visuales y reducir el coste de inferencia en 20 veces respecto a baselines. Integra modelos de lenguaje de audio y técnicas como Anchor-Heavy Identity Sinks para avatares interactivos de larga duración. LiveTalk supera a Sora2 y Veo3 en coherencia multigiro y calidad, habilitando interacciones humano-IA en tiempo real.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.