BM25 domina a gran escala: Estudio de escalado de paradigmas RAG | Comparativa de eficiencia entre recuperación clásica y vectorial | Por qué la búsqueda por palabras clave sigue siendo superior en sistemas RAG masivos
Abstract
PROBLEMA: Existe una tendencia generalizada a preferir la recuperación vectorial (densa) sobre métodos clásicos como BM25 (dispersa) sin una justificación clara de su rendimiento a escalas masivas de datos. SOLUCIÓN: Este estudio de escalado analiza exhaustivamente cuándo y por qué BM25 sigue siendo competitivo o incluso superior a los sistemas de recuperación basados en embeddings en arquitecturas RAG. METODOLOGÍA: Los autores evalúan múltiples paradigmas de recuperación en diversos tamaños de corpus (hasta billones de tokens) y miden la precisión de la respuesta final del LLM. RESULTADOS: Los resultados revelan que BM25 'gana' en escenarios de gran escala donde el matching exacto de términos técnicos y entidades es crucial, mientras que los modelos densos sufren de ruido en espacios vectoriales saturados. RELEVANCIA: Obliga a reconsiderar la arquitectura de los sistemas RAG comerciales, sugiriendo que los enfoques híbridos o puramente dispersos son más eficientes y precisos de lo que se creía anteriormente.