Arabic TTS Arena: Clasificando modelos de voz como el ajedrez clasifica a los grandes maestros
Navid AI ha presentado Arabic TTS Arena, la primera plataforma abierta y comunitaria para clasificar modelos de síntesis de voz (TTS) en árabe mediante un sistema de rating Elo inspirado en el ajedrez. Los usuarios comparan audios generados por dos modelos aleatorios y ciegos, votando por el mejor, lo que genera un leaderboard dinámico. El sistema utiliza el modelo Bradley-Terry para calcular ratings precisos y está implementado con código abierto en Hugging Face Spaces. El artículo detalla su funcionamiento matemático y propone el 'TTS Triangle' para mejorar TTS árabe, enfatizando identidades de voz específicas y instrucciones en lenguaje natural en lugar de etiquetas de dialecto o emoción. Esta iniciativa es relevante por la diversidad dialectal del árabe y la necesidad de evaluaciones basadas en preferencias humanas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.