Ir al contenido principalSaltar al contenido
Hugging Face

Arabic TTS Arena: Clasificando modelos de voz como el ajedrez clasifica a los grandes maestros

Navid AI ha presentado Arabic TTS Arena, la primera plataforma abierta y comunitaria para clasificar modelos de síntesis de voz (TTS) en árabe mediante un sistema de votación similar al rating Elo del ajedrez. Los usuarios escuchan muestras generadas por dos modelos aleatorios con el mismo texto árabe y votan por la mejor, generando un leaderboard basado en preferencias humanas. El artículo explica el funcionamiento técnico, basado en el modelo Bradley-Terry, y propone el 'TTS Triangle' para mejorar el TTS árabe, integrando contenido, identidad de voz específica y estilo de entrega mediante instrucciones en lenguaje natural. Esto aborda la diversidad dialectal del árabe, superando limitaciones de etiquetas de país o emociones discretas. La arena está abierta a nuevos modelos vía GitHub.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Arabic TTS ArenaNavid AIsíntesis de voz áraberating EloBradley-TerryTTS Triangledialectos árabes
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies