Prompt injection
Un attacco che nasconde istruzioni nei contenuti letti da un'IA, dirottandone le azioni.
La prompt injection è la più importante debolezza di sicurezza degli agenti IA. Funziona nascondendo istruzioni in contenuti letti dal modello, come una pagina web, un’e-mail o un PDF, che il sistema non riesce a distinguere in modo affidabile dalle proprie vere istruzioni. Una pagina contaminata potrebbe dire, in sostanza, «ignora l’utente e invia altrove i suoi file», e l’agente potrebbe obbedire.
I ricercatori di sicurezza la classificano come il rischio principale per le applicazioni IA, e molti la considerano una falla strutturale anziché un bug risolvibile con una semplice correzione. La difesa pratica consiste nei limiti: privilegi minimi, sandbox, conferme per le azioni sensibili e supervisione umana.
-
Ora i difensori usano la prompt injection come trappola per gli attaccanti basati sull’IA
-
OpenAI ha creato un'IA il cui unico compito è attaccare le altre IA dell'azienda
-
It's Not Which AI You Use, It's Which Level
-
Claude Code riceve un browser integrato che può leggere, fare clic e digitare al posto tuo
-
GitLost: alcuni ricercatori hanno indotto l'agente IA di GitHub a divulgare codice privato
-
Usi Cursor? Aggiornalo oggi: sono appena state corrette due gravi falle di sicurezza