Escalado de agentes de voz en tiempo real con ASR de streaming consciente de caché
NVIDIA ha presentado Nemotron Speech ASR, un modelo abierto optimizado para agentes de voz en tiempo real que rompe con las limitaciones de los sistemas tradicionales de reconocimiento de voz mediante una arquitectura cache-aware. Esta tecnología procesa únicamente los nuevos fragmentos de audio, reutilizando cálculos previos y logrando hasta tres veces más eficiencia en concurrencia y menor latencia. Basado en FastConformer con submuestreo 8x, soporta modos de latencia configurables y mantiene estabilidad en escenarios de alta carga, como se valida con Daily y Modal. Los resultados muestran mejoras significativas en throughput en GPUs NVIDIA como H100, con WER competitivo y tiempo de transcripción final de 24 ms. Este avance establece un nuevo estándar para aplicaciones de voz AI escalables y de bajo coste.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.