Ir al contenido principalSaltar al contenido
Hugging Face

TransVLM: detección de cualquier transición de plano con modelos de lenguaje y visión

HeyGen Research y la Universidad de Melbourne han presentado TransVLM, un modelo de lenguaje y visión aceptado en ECCV 2026 que reformula la detección de cortes de plano como detección de transiciones completas (STD), identificando segmentos temporales con inicio y fin en lugar de puntos aislados. El modelo fusiona flujo óptico con fotogramas en color dentro de un modelo de lenguaje y visión para detectar todo tipo de transiciones: cortes, fundidos y efectos especiales. TransVLM alcanza un 78,3 % de F1 segmental en datos públicos y un 89,5 % en datos sintéticos, superando a métodos previos como AutoShot. Incluye un motor de datos que genera 233.000 vídeos sintéticos con 690.000 transiciones y un pipeline de inferencia por ventanas deslizantes para vídeos de longitud arbitraria. Esta tecnología es relevante porque una detección imprecisa de transiciones corrompe tareas posteriores como la búsqueda de vídeo, el subtitulado y, sobre todo, la generación de vídeo por IA.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

TransVLMdetección de transiciones de planomodelos de lenguaje y visiónflujo ópticoanálisis de vídeoHeyGenECCV 2026
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies