Ir al contenido principalSaltar al contenido

Detección de envenenamiento en RAG mediante colapso de atención a nivel de documento | Cómo detectar documentos maliciosos que manipulan las respuestas de un sistema de recuperación aumentada | Defensa ligera contra inyección de contexto y ataques a pipelines RAG sin entrenamiento adicional

RAG poisoningenvenenamiento de RAGattention collapsecolapso de atenciónretrieval-augmented generationseguridad en RAGinyección de contextodetección de ataquesrobustez de generaciónintegridad del contexto

Abstract

PROBLEMA: los sistemas de Retrieval-Augmented Generation (RAG) son vulnerables a documentos envenenados: un atacante puede inyectar texto en la base de conocimiento recuperada para forzar respuestas incorrectas, sesgadas o maliciosas, y los métodos de detección existentes requieren modelos auxiliares, anotaciones o entrenamiento adicional. SOLUCIÓN: el paper presenta un método para detectar envenenamiento en RAG a partir del colapso de atención a nivel de documento (document-level attention collapse): cuando un documento manipulador domina anormalmente la atención del LLM, puede identificarse de forma barata y sin entrenamiento extra. METODOLOGÍA: se analizan los pesos de atención que el modelo asigna a cada documento recuperado durante la generación y se extraen firmas de colapso (concentración extrema, picos anómalos, distribución aplastada); el detector se evalúa frente a distintos tipos de ataques de envenenamiento —inyección, contradicción y jailbreak por contexto— en tareas de QA y razonamiento. RESULTADOS: el enfoque detecta documentos envenenados con alta precisión y bajo coste computacional, supera en robustez a heurísticas basadas únicamente en contenido y actúa como señal temprana de manipulación sin perturbar el flujo normal de generación. RELEVANCIA: proporciona una defensa ligera y portable para cualquier pipeline RAG, incluidos los sistemas de curaduría y recuperación semántica, y abre una línea de investigación sobre señales de atención como indicadores de integridad del contexto.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies