BM25 gana a gran escala: Un estudio sobre paradigmas de generación aumentada por recuperación | Evaluación de la eficiencia de búsqueda léxica vs vectorial en RAG masivo | Por qué los métodos tradicionales de recuperación siguen dominando la escala industrial de IA
Abstract
PROBLEMA: La tendencia actual en RAG favorece la recuperación densa (vectorial), pero no existen estudios exhaustivos que analicen si esta ventaja se mantiene al escalar a volúmenes de datos masivos frente a métodos clásicos. SOLUCIÓN: Este paper presenta un estudio de escalabilidad que demuestra que el algoritmo BM25 (léxico) sigue siendo extremadamente competitivo e incluso superior en ciertos escenarios de gran escala. METODOLOGÍA: Realizaron pruebas de rendimiento en diversos benchmarks de recuperación comparando métodos densos, escasos e híbridos bajo diferentes dimensiones de datos y parámetros de escala. RESULTADOS: BM25 muestra una robustez sorprendente y un costo-beneficio superior al manejar documentos fuera de dominio o terminología técnica muy específica en escalas de terabytes. RELEVANCIA: Este estudio obliga a reevaluar la arquitectura de producción de sistemas RAG, sugiriendo que la simplicidad del léxico es a menudo subestimada en favor de implementaciones vectoriales más complejas y costosas.