Ir al contenido principalSaltar al contenido
Hugging Face

LiveTalk: Difusión de vídeo interactiva multimodal en tiempo real mediante destilación on-policy mejorada

El paper introduce LiveTalk, un sistema de generación de vídeo interactivo multimodal en tiempo real basado en una destilación on-policy mejorada para modelos de difusión. Aborda los problemas de latencia en la desruido simultáneo de frames con atención bidireccional, haciendo el modelo autoregresivo y eficiente para condicionamientos multimodales como texto, imagen y audio. Mejora el método Self Forcing para eliminar artefactos visuales y reducir el coste de inferencia en 20 veces respecto a baselines. Integra modelos de lenguaje de audio y técnicas como Anchor-Heavy Identity Sinks para avatares interactivos de larga duración. LiveTalk supera a Sora2 y Veo3 en coherencia multigiro y calidad, habilitando interacciones humano-IA en tiempo real.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

LiveTalkdestilación on-policydifusión de videogeneración multimodalavatar interactivotiempo realSelf Forcing
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies