Ir al contenido principalSaltar al contenido
Xataka

El "prompt injection" tiene su propio contraataque: inyectar falsas instrucciones también a los hackers

Una investigación de la firma de ciberseguridad Tracebit demuestra que es posible detener ataques de agentes de IA mediante una técnica denominada "context bombing". Consiste en colocar textos diseñados para activar los mecanismos de rechazo de los modelos de IA junto a la información que el atacante busca robar. Esta técnica ha logrado reducir significativamente la tasa de éxito de los ataques, pasando del 57% al 5% en acceso de administrador. Aprovecha las limitaciones internas de los modelos de lenguaje, que se niegan a tratar ciertos temas, lo que dificulta su corrección por parte de los atacantes.

prompt injectionTracebitcontext bombingciberseguridadIAinteligencia artificialhackers
Leer noticia original