Ir al contenido principalSaltar al contenido
Hugging Face

ATE-2: Embeddings de texto armenio de vanguardia y el benchmark ArmBench-TextEmbed

Metric-AI ha lanzado ATE-2, nuevos modelos de embeddings de texto para armenio que alcanzan el estado del arte en tareas como RAG y búsqueda semántica. Desafían el paradigma de necesitar grandes datasets al demostrar que solo 10.000 pares sintéticos ruidosos bastan para obtener mejoras del 11-12% en el benchmark ArmBench-TextEmbed, superando incluso a modelos entrenados con 1 millón de ejemplos. Los modelos manejan tanto armenio nativo como transliterado, superando a competidores como Gemini-embedding-001 y OpenAI text-embed-3-large. Se open-sourcing los modelos base y large, el benchmark estandarizado y el dataset de entrenamiento. Este avance democratiza los embeddings para lenguajes de bajos recursos.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

ATE-2Metric-AIArmBench-TextEmbedembeddings de textoarmeniolenguajes de bajos recursosNLP
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies