Ir al contenido principalSaltar al contenido
Hugging Face

Transcripción extremadamente rápida y precisa con Granite Speech 5.0 Turbo CTC

IBM Granite ha anunciado el lanzamiento de dos nuevos modelos de reconocimiento de voz en inglés: granite-speech-5.0-470m-turboctc y granite-speech-5.0-470m-turboctc-nc. Se trata de modelos compactos de solo 470 millones de parámetros que combinan una gran precisión con una velocidad sin precedentes, superando los 12.600 RTFx en una GPU NVIDIA H200, lo que permite transcribir más de 3,5 horas de audio en un solo segundo mediante inferencia por lotes. Ambos modelos utilizan una arquitectura de solo codificador con bloques Conformer y pérdida CTC, ofreciendo hasta 20 veces más rendimiento que los modelos Granite Speech anteriores. La principal diferencia es que la variante -nc, con licencia CC-BY-NC-SA-4.0, se entrena con datos adicionales, mientras que la otra versión, licenciada como Apache 2.0, ofrece uso comercial. Los modelos destacan en las tablas de clasificación OpenASR y FFASR por su equilibrio entre rapidez y precisión, y son ideales para tareas de transcripción en dispositivos de borde.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

IBM Granitereconocimiento de voztranscripciónmodelos de lenguajeGranite Speech 5.0Apache 2.0código abierto
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies