Transcripción extremadamente rápida y precisa con Granite Speech 5.0 Turbo CTC
Hugging Face anuncia el lanzamiento de dos nuevos modelos de speech recognition en la familia Granite Speech: granite-speech-5.0-470m-turboctc y su variante nc, con 470 millones de parámetros, diseñados para ofrecer una precisión alta junto con una velocidad sin precedentes — más de 12 600 RTFx en GPU H200, permitiendo transcribir más de 3,5 horas de audio en un segundo mediante inferencia por lotes. Ambos modelos son de código abierto (licencia Apache 2.0 y CC-BY-NC-SA-4.0) y alcanzan un error de word error rate (WER) del 5,00 % y 4,85 % respectivamente en conjuntos de prueba públicos. La arquitectura es basada en encoder-only, utilizando bloques Conformer, atención por chunks y pérdida CTC, lo que reduce la huella de memoria y acelera la inferencia para tareas de voz a texto en dispositivos perimetrales. La variedad nc incorpora datos adicionales y permite un rendimiento ligeramente superior en la mayoría de las pruebas, con una desventaja en el nuevo conjunto de ganancias chunked. Se incluyen modelos sintéticos y datos naturales, y los modelos están disponibles directamente en la biblioteca Transformers para su integración.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.