Ir al contenido principalSaltar al contenido
Hugging Face

IBM presenta Granite Speech 5.0 Turbo CTC, modelos de reconocimiento de voz ultrarrápidos y precisos

IBM ha anunciado el lanzamiento de dos nuevos modelos de reconocimiento de voz de su familia Granite Speech: Granite Speech 5.0 Turbo CTC, unos compactos modelos de 470 millones de parámetros que combinan una gran precisión con una velocidad sin precedentes, superando los 12.600 RTFx en una GPU NVIDIA H200. Esto significa que pueden transcribir más de 3,5 horas de voz en un segundo mediante inferencia por lotes. Diseñados con una arquitectura de solo encoder, ofrecen un rendimiento competitivo en los conjuntos de pruebas públicos del líder OpenASR, con una tasa de error agregada del 4,85% para la versión no comercial y del 5,00% para el modelo con licencia Apache 2.0. Están orientados a tareas de voz a texto en dispositivos de borde e incorporan una arquitectura basada en bloques Conformer con pérdida CTC y un subsampling temporal en tres etapas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

IBM GraniteGranite Speech 5.0reconocimiento de voztranscripción automáticamodelo ASRCTCcódigo abierto
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies