Ir al contenido principalSaltar al contenido
Hugging Face

easytranscriber: Reconocimiento del habla con marcas de tiempo precisas en el ecosistema de Hugging Face

KBLab, de la Biblioteca Nacional de Suecia, ha lanzado easytranscriber, una biblioteca de reconocimiento automático del habla (ASR) diseñada para transcripciones eficientes y escalables con marcas de tiempo precisas a nivel de palabra. Esta herramienta supera a WhisperX en velocidad, ofreciendo mejoras del 35% al 102% según el hardware, gracias a optimizaciones como alineación forzada acelerada por GPU, carga paralela de datos y normalización de texto flexible. Se integra perfectamente en el ecosistema de Hugging Face, soportando backends como ctranslate2 y transformers. La biblioteca facilita la transcripción masiva de archivos de audio de archivo, como millones de horas de grabaciones de radio, haciendo las colecciones audiovisuales buscables. Incluye además easysearch, una interfaz de búsqueda ligera con reproducción sincronizada.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

easytranscriberKBLabWhisperXreconocimiento del hablamarcas de tiempoalineación forzadaHugging Face
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies