Cómo construimos un modelo de resaltado semántico para ahorrar costes de tokens en RAG
Zilliz ha desarrollado y open-sourced un modelo bilingüe de resaltado semántico que identifica y resalta oraciones relevantes en documentos recuperados para sistemas RAG, reduciendo el coste de tokens en un 70-80% al eliminar ruido irrelevante. Basado en BGE-M3 Reranker v2, este modelo encoder-only de 0.6B parámetros soporta inglés y chino con una ventana de contexto de 8192 tokens y alcanza rendimiento state-of-the-art en benchmarks. Se entrenó con casi 5 millones de muestras generadas por anotación LLM con razonamiento, superando a modelos como Provence y OpenSearch. El modelo y datos de entrenamiento están disponibles en Hugging Face bajo licencia MIT, facilitando su uso comercial y mejorando la calidad y depurabilidad de respuestas en RAG y agentes IA.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.