Un nuevo marco para la evaluación de agentes de voz (EVA)
ServiceNow-AI introduce EVA, un marco de evaluación de extremo a extremo para agentes de voz conversacionales que mide simultáneamente la precisión (EVA-A) y la experiencia conversacional (EVA-X). Utiliza una arquitectura bot-to-bot con simulador de usuario, agente de voz, ejecutor de herramientas, validadores y suite de métricas. Se lanza con un dataset inicial de 50 escenarios en el sector aéreo, cubriendo rebookings, cancelaciones y más. Los resultados en 20 sistemas revelan un tradeoff consistente entre precisión en tareas y calidad de experiencia. EVA se publica con código abierto, dataset en Hugging Face y un sitio web con demo y resultados preliminares.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.