Inyección de contexto criptográfico
Un ataque de inyección rápida que oculta sus instrucciones detrás del cifrado para que los filtros solo vean galimatías y luego permite que el modelo las descifre por sí mismo.
La inyección rápida ordinaria oculta instrucciones en una página web y espera que el modelo las obedezca. Las defensas detectan una buena parte escaneando el texto entrante en busca de cualquier cosa que parezca un comando. La inyección de contexto criptográfico evita el escaneo completo: las instrucciones están cifradas, por lo que el filtro lee caracteres sin sentido y los pasa, y la página también entrega la clave.
La trampa surge cuando el modelo tiene una zona de pruebas de código. Cuando se le pide que le dé sentido al blob, lo descifra y el texto claro que sale se produjo dentro del propio espacio de trabajo del modelo en lugar de llegar desde el sitio web de un extraño. Los sistemas que clasifican el contenido según su origen ahora lo tratan como confiable. Nombrado por Adversa AI en agosto de 2026, es un buen ejemplo de por qué la inyección rápida sigue regresando en nuevas formas.