Detección de envenenamiento en RAG mediante colapso de atención a nivel de documento | Cómo detectar documentos maliciosos que manipulan las respuestas de un sistema de recuperación aumentada | Defensa ligera contra inyección de contexto y ataques a pipelines RAG sin entrenamiento adicional
Abstract
PROBLEMA: los sistemas de Retrieval-Augmented Generation (RAG) son vulnerables a documentos envenenados: un atacante puede inyectar texto en la base de conocimiento recuperada para forzar respuestas incorrectas, sesgadas o maliciosas, y los métodos de detección existentes requieren modelos auxiliares, anotaciones o entrenamiento adicional. SOLUCIÓN: el paper presenta un método para detectar envenenamiento en RAG a partir del colapso de atención a nivel de documento (document-level attention collapse): cuando un documento manipulador domina anormalmente la atención del LLM, puede identificarse de forma barata y sin entrenamiento extra. METODOLOGÍA: se analizan los pesos de atención que el modelo asigna a cada documento recuperado durante la generación y se extraen firmas de colapso (concentración extrema, picos anómalos, distribución aplastada); el detector se evalúa frente a distintos tipos de ataques de envenenamiento —inyección, contradicción y jailbreak por contexto— en tareas de QA y razonamiento. RESULTADOS: el enfoque detecta documentos envenenados con alta precisión y bajo coste computacional, supera en robustez a heurísticas basadas únicamente en contenido y actúa como señal temprana de manipulación sin perturbar el flujo normal de generación. RELEVANCIA: proporciona una defensa ligera y portable para cualquier pipeline RAG, incluidos los sistemas de curaduría y recuperación semántica, y abre una línea de investigación sobre señales de atención como indicadores de integridad del contexto.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.