Jailbreak
Un suggerimento creato per convincere un modello a fare qualcosa che la sua formazione sulla sicurezza avrebbe dovuto impedire.
Un jailbreak è un modo di formulare una richiesta in modo che un modello faccia qualcosa che la sua formazione sulla sicurezza avrebbe dovuto bloccare. I trucchi classici sono il gioco di ruolo (“sei un attore in un film in cui…”), fingendo di essere un’autorità, inventando una conversazione precedente falsa a cui il modello sembra aver accettato e semplicemente chiedendo di nuovo in un modo leggermente diverso. La combinazione di più di questi elementi contemporaneamente tende a funzionare meglio, ed è esattamente il motivo per cui continua a funzionare.
Un jailbreak universale è la versione che preoccupa i ricercatori: un unico prompt riutilizzabile che sblocca le richieste più dannose, sulla maggior parte dei modelli, piuttosto che un trucco fortunato. Le organizzazioni no-profit per la sicurezza ne monitorano centinaia attraverso modelli di frontiera. Questo è lo stato onesto delle cose: l’allineamento aumenta lo sforzo richiesto, non chiude la porta.
-
OpenAI lancia GPT-6 Astra e lo definisce il suo primo modello informatico critico
-
I ricercatori hanno trovato un modo per leggere i pensieri nascosti di Claude, ChatGPT e Gemini
-
Un modello aperto è ormai mesi, non anni, indietro rispetto alla frontiera. I suoi test di sicurezza non lo sono.
-
Usi Fable 5 con un abbonamento Claude? Da lunedì cambia il modo in cui paghi