TAVR: genera tu avatar parlante a partir de una referencia de vídeo
HeyGen Research y la Universidad Tecnológica de Nanyang (NTU) presentan TAVR, un método aceptado en SIGGRAPH Asia 2026 que sustituye las referencias de avatar basadas en una única fotografía por clips de vídeo cortos. El sistema permite la generación entre escenas diferentes con una preservación de la identidad significativamente mejor, gracias a una estrategia de entrenamiento en tres etapas que salva la brecha entre la escena de referencia y la escena objetivo. En un nuevo punto de referencia de escenas cruzadas, TAVR obtiene la mejor similitud de identidad y una puntuación de calidad global de 16.42 frente al 14.13 del siguiente mejor método. La arquitectura se apoya en el backbone de difusión de vídeo Wan2.1-T2V-14B e incorpora módulos de atención y selección de tokens para inyectar señales de identidad temporales. Este avance habilita directamente el producto de avatares con referencia de vídeo de HeyGen, permitiendo crear avatares digitales de alta fidelidad desde breves clips grabados por uno mismo.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.