Iniezione del contesto crittografico
Un attacco di iniezione tempestiva che nasconde le sue istruzioni dietro la crittografia in modo che i filtri vedano solo cose senza senso, quindi lascia che sia il modello stesso a decrittografarle.
La normale prompt injection nasconde le istruzioni in una pagina web e spera che il modello le rispetti. Le difese ne catturano una buona parte scansionando il testo in arrivo alla ricerca di qualsiasi cosa assomigli a un comando. L’iniezione del contesto crittografico elude completamente la scansione: le istruzioni sono crittografate, quindi il filtro legge i caratteri senza significato e li fa passare, e la pagina consegna anche la chiave.
La trappola scatta quando il modello ha una sandbox di codice. Quando gli viene chiesto di dare un senso al blob, lo decrittografa e il testo in chiaro che ne esce è stato prodotto all’interno dello spazio di lavoro del modello anziché arrivare dal sito web di uno sconosciuto. I sistemi che classificano i contenuti in base alla provenienza ora li considerano affidabili. Nominato da Adversa AI nell’agosto 2026, è un buon esempio del motivo per cui l’iniezione rapida continua a ripresentarsi in nuove forme.