AISPA: Auditoría de system prompts centrada en el usuario para aplicaciones LLM | Cómo evaluar la seguridad de las instrucciones de sistema en modelos de lenguaje | Herramienta automatizada para detectar vulnerabilidades en aplicaciones de IA generativa
Abstract
PROBLEMA: Las aplicaciones basadas en LLM dependen de "system prompts" críticos que a menudo son vulnerables a ataques de extracción o inyección, pero no existen herramientas estandarizadas para que los usuarios finales auditen la robustez de estas instrucciones. SOLUCIÓN: AISPA presenta un sistema de auditoría centrado en el usuario que evalúa automáticamente la resistencia de las aplicaciones de LLM frente a la fuga de instrucciones y el cumplimiento de directrices de seguridad. METODOLOGÍA: Utilizan un enfoque de "redteaming" automatizado que genera diversos ataques basados en perfiles de usuario para intentar extraer o subvertir el prompt original. RESULTADOS: Los experimentos en más de 100 aplicaciones comerciales revelaron que el 65% de los sistemas son vulnerables a la extracción de prompts mediante técnicas simples de manipulación contextual. RELEVANCIA: Es una herramienta esencial para desarrolladores de agentes y sistemas RAG que necesitan proteger su propiedad intelectual y garantizar el comportamiento ético del modelo.