Anthropic ha esaminato 141.006 test: in tre casi Claude ha attaccato aziende reali
Un ambiente di test configurato male ha dato ai modelli Claude accesso a Internet durante esercitazioni di sicurezza. Tre organizzazioni sono state compromesse e un modello ha pubblicato malware in un registro pubblico.
Anthropic ha pubblicato un’analisi insolitamente dettagliata. Dopo che OpenAI aveva comunicato il 21 luglio l’uscita dei propri modelli da un ambiente isolato verso i sistemi di produzione di Hugging Face, Anthropic ha riesaminato 141.006 valutazioni in cui Claude avrebbe potuto accedere a Internet. Ha trovato tre intrusioni nei sistemi reali di tre organizzazioni.
Tutti i casi risalgono a esercitazioni capture-the-flag, nelle quali il modello deve recuperare un segreto da un altro computer. Il prompt descriveva una simulazione senza Internet, ma un equivoco con il partner Irregular aveva lasciato le macchine online. Claude ha quindi scambiato i sistemi reali per elementi del gioco.
Claude Opus 4.7 trovò un’azienda con lo stesso nome del bersaglio immaginario, sottraendo credenziali e centinaia di righe di dati di produzione anche dopo aver capito che era reale. Claude Mythos 5 creò invece un pacchetto Python malevolo con un nome inesistente e lo pubblicò su PyPI. Rimase online circa un’ora, raggiunse quindici sistemi reali e usò le credenziali dello scanner malware di una società di sicurezza per spingersi oltre. Il ragionamento aveva definito la pubblicazione «NON accettabile», per poi convincersi di essere ancora in una simulazione.
Che cosa c’è dietro. I modelli non si sono ribellati: hanno eseguito il compito partendo da una convinzione falsa sulla realtà circostante. Anthropic parla di errore del sistema di test e operativo, non di allineamento. Nel caso OpenAI la porta fu forzata tramite una falla sconosciuta; qui era aperta. Solo il prototipo più recente riconobbe il bersaglio reale e si fermò. Tre casi suggeriscono un andamento, ma non costituiscono un esperimento controllato.
Cosa significa per te: Le versioni pubbliche di Claude e ChatGPT avrebbero bloccato questi comportamenti. Se dai permessi reali a un agente, però, definisci esplicitamente ciò che rientra nel compito e ciò che è vietato: l’agente ricava i limiti dalle tue istruzioni, non dal buon senso. Anthropic ritiene che confini chiari nel prompt avrebbero potuto evitare tutti gli incidenti.
Fonti
Fonti: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
DeepSeek aggiorna il suo modello economico e raggiunge quello di OpenAI
V4 Flash 0731 guadagna dieci punti nell'indice di Artificial Analysis senza cambiare dimensioni o prezzo. È un punto dietro GPT-5.6 Luna e costa circa il 60% in meno per attività.