Il testo invisibile in un'e-mail ha ingannato un riepilogatore AI in tutte e 10 le esecuzioni
Forcepoint ha nascosto le istruzioni in un'e-mail utilizzando testo bianco con dimensione del carattere pari a zero. Il lettore non ha visto nulla di insolito. Il riepilogo AI riportava ogni volta una fattura falsa da 46.200 euro e una scadenza falsa.
I ricercatori di sicurezza di Forcepoint hanno creato un piccolo riepilogo e-mail AI, il tipo di strumento che si trova nella tua casella di posta e ti fornisce una versione su due righe di un messaggio lungo. Quindi gli hanno inviato un’e-mail con le istruzioni nascoste all’interno. Il lettore ha visto un normale sollecito di fattura. L’intelligenza artificiale ha letto qualcos’altro e ha prodotto un riepilogo con l’importo sbagliato, la scadenza sbagliata e un nome mancante. In dieci corse su dieci.
Il trucco è quasi noiosamente semplice. L’aggressore ha racchiuso un paragrafo di semplici istruzioni in inglese in HTML con lo stile font-size:0px; colore:#ffffff; altezza della linea: 0. Testo bianco, altezza zero, invisibile in Outlook. Ma lo stile influisce solo su ciò che vedono i tuoi occhi. Il testo grezzo viaggia ancora con il messaggio e il riassunto è stato alimentato con il testo grezzo. Dei 1.009 caratteri passati al modello, 537 erano visibili all’uomo e 472 erano l’iniezione nascosta.
I risultati sono stati misurati correttamente, con i criteri di superamento e di fallimento scritti prima dell’inizio delle corse. L’e-mail pulita ha prodotto il riepilogo corretto tutte e dieci le volte. L’e-mail inserita dieci volte su dieci menzionava un importo di fattura falsa di 46.200 euro e una scadenza falsa del 3 settembre, lasciando ogni volta la scadenza reale e il nome del contatto reale. Le istruzioni nascoste dicevano inoltre al modello di non menzionare l’avviso, e lui obbedì: nessun riassunto lasciava intendere che qualcosa fosse stato manomesso. Il riepilogo è stato eseguito su claude-haiku-4-5 e Forcepoint si aspetta lo stesso risultato da qualsiasi modello in una pipeline costruito in modo approssimativo.
Cosa sta realmente succedendo qui: si tratta di prompt injection indiretta, un problema menzionato da Simon Willison nel 2022 e che si trova in cima all’elenco dei rischi OWASP per i modelli linguistici. Un modello linguistico non ha un modo affidabile per distinguere tra “contenuto che dovrei riassumere” e “istruzioni che dovrei seguire”. Vede solo un lungo blocco di testo. Quando incolli un’e-mail, una pagina Web o un PDF in un modello, tutto ciò che è scritto al suo interno ottiene un voto su ciò che il modello farà successivamente. Forcepoint ha deliberatamente creato la versione più vulnerabile possibile, senza guardrail, senza separazione tra le intestazioni e il corpo dell’e-mail e un prompt di sistema a una riga. Questo è lo scopo dell’esperimento: mostra cosa succede quando nessuno ci pensa, il che descrive molte funzionalità di intelligenza artificiale costruite rapidamente.
Che cosa significa per te: se utilizzi una funzionalità di riepilogo AI per le email, considera il riepilogo come una comodità, non come un record. Prima di pagare una fattura, concordare una scadenza o inoltrare qualcosa, apri il messaggio originale e leggi tu stesso i numeri. Quella singola abitudine sconfigge l’intero attacco. Se si creano questi strumenti, le soluzioni sono note: passare al modello solo il testo effettivamente mostrato all’utente, mantenere le intestazioni e il corpo separati, contrassegnare tutto ciò che viene recuperato dall’esterno come non attendibile e non consentire mai a un riepilogo di eseguire azioni su una casella di posta. Vale la pena sapere che si trattava di un messaggio, un modello, dieci corse a temperatura zero, quindi è una dimostrazione chiara piuttosto che una misurazione di quanto sia comune l’attacco in natura. Forcepoint ha trovato separatamente carichi utili di iniezione reali, quindi non è nemmeno ipotetico.
Fonti
- Un payload HTML invisibile ha preso il controllo silenziosamente di ogni esecuzione del riepilogo e-mail, Forcepoint X-Labs
- I suggerimenti nascosti ingannano l’intelligenza artificiale trasformandoli in falsi riepiloghi di posta elettronica, lettura oscura
- Attacchi di iniezione tempestiva contro GPT-3, Simon Willison
Fonti: https://www.forcepoint.com/blog/x-labs/html-payload-hijacks-email-summarizer
80 artisti britannici chiedono una cosa: la proprietà legale della propria voce
Attori e musicisti tra cui Hugh Bonneville e Nicola Coughlan vogliono che la voce venga aggiunta ai diritti statutari nel Regno Unito, come già avviene con un nome o un'immagine. La campagna cita il 28% degli adulti del Regno Unito presi di mira da truffe di clonazione vocale.