El "prompt injection" tiene su propio contraataque, inyectar falsas instrucciones también a los hackers
Investigadores de ciberseguridad han desarrollado una nueva técnica llamada "context bombing" para detener ataques de "prompt injection" en sistemas de inteligencia artificial. Esta técnica consiste en insertar texto con referencias a temas prohibidos para el modelo de IA cerca de las credenciales que los atacantes buscan robar. Al leer el texto, el modelo activa sus mecanismos de seguridad y detiene el ataque, aprovechando restricciones de diseño inherentes a los LLM. Se ha probado con éxito en modelos como Opus 4.8 y Gemini 3.1 Pro, reduciendo significativamente la tasa de éxito de los ataques. No se considera una solución definitiva, pero mejora la capacidad de defensa contra el "prompt injection".
prompt injectionciberseguridadinteligencia artificialIAcontext bombingTracebitataque a IA
Leer noticia original