ATE-2: Embeddings de texto armenio de vanguardia y el benchmark ArmBench-TextEmbed
Metric-AI ha lanzado ATE-2, nuevos modelos de embeddings de texto para armenio que alcanzan el estado del arte en tareas como RAG y búsqueda semántica. Desafían el paradigma de necesitar grandes datasets al demostrar que solo 10.000 pares sintéticos ruidosos bastan para obtener mejoras del 11-12% en el benchmark ArmBench-TextEmbed, superando incluso a modelos entrenados con 1 millón de ejemplos. Los modelos manejan tanto armenio nativo como transliterado, superando a competidores como Gemini-embedding-001 y OpenAI text-embed-3-large. Se open-sourcing los modelos base y large, el benchmark estandarizado y el dataset de entrenamiento. Este avance democratiza los embeddings para lenguajes de bajos recursos.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.