Ir al contenido principalSaltar al contenido

Agent Against Agent: sistema agéntico para red teaming automático de inyección de prompts | Automatización de ataques de prompt injection mediante agentes adversarios que se atacan entre sí | Herramienta de seguridad para generar y detectar vulnerabilidades de inyección en aplicaciones basadas en LLMs

prompt injectionred teamingagentic securityinyección de promptsseguridad de LLMsagentes adversariosadversarialrobustezautomatizaciónvulnerabilidades

Abstract

PROBLEMA: La inyección de prompts es una de las amenazas de seguridad más serias para los LLMs, pero generar de forma manual casos de ataque diversos y efectivos es costoso y poco escalable. SOLUCIÓN: El paper presenta Agent Against Agent, un sistema agéntico que automatiza el red teaming de inyección de prompts haciendo que agentes adversarios generen y evalúen ataques de forma autónoma y recursiva. METODOLOGÍA: Se implementa una arquitectura donde agentes atacantes diseñan payloads de inyección, agentes defensores intentan neutralizarlos y un bucle de feedback iterativo refina los ataques más efectivos, probando el sistema sobre múltiples LLMs y configuraciones de aplicación. RESULTADOS: El sistema descubre y cataloga clases de inyección novedosas y más efectivas que los conjuntos de ataques estáticos previos, y demuestra la viabilidad del red teaming autónomo para endurecer aplicaciones LLM. RELEVANCIA: Aporta un pipeline agéntico de seguridad que mejora la robustez de cualquier aplicación LLM frente a inyección de prompts, un requisito crítico para el despliegue seguro de asistentes y agentes en producción.

Más info: Política de Cookies