Ir al contenido principalSaltar al contenido
Hugging Face

Arabic TTS Arena: Clasificando modelos de voz como el ajedrez clasifica a los grandes maestros

Navid AI ha presentado Arabic TTS Arena, la primera plataforma abierta y comunitaria para clasificar modelos de síntesis de voz (TTS) en árabe mediante un sistema de rating Elo inspirado en el ajedrez. Los usuarios comparan audios generados por dos modelos aleatorios y ciegos, votando por el mejor, lo que genera un leaderboard dinámico. El sistema utiliza el modelo Bradley-Terry para calcular ratings precisos y está implementado con código abierto en Hugging Face Spaces. El artículo detalla su funcionamiento matemático y propone el 'TTS Triangle' para mejorar TTS árabe, enfatizando identidades de voz específicas y instrucciones en lenguaje natural en lugar de etiquetas de dialecto o emoción. Esta iniciativa es relevante por la diversidad dialectal del árabe y la necesidad de evaluaciones basadas en preferencias humanas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Arabic TTS ArenaNavid AIsíntesis de voz áraberating EloBradley-TerryTTS TriangleHugging Face
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies