Anthropic allenta il filtro biologico di Claude Fable 5, riducendo le domande bloccate dell'85%.
Fable 5 è stato lanciato con quasi tutte le domande di biologia bloccate. Un classificatore di sicurezza riqualificato ora lascia passare le domande quotidiane sulla salute e sullo studio, riducendo i fallback legati alla biologia di circa l’85%. La virologia professionale e la progettazione dei farmaci restano bloccate.
Se hai mai chiesto a Claude Fable 5 di aiutarti a leggere il risultato di un esame del sangue e hai ottenuto una risposta notevolmente più debole di quanto ti aspettavi, ecco perché. Anthropic ha dichiarato giovedì di aver riqualificato il sistema di sicurezza che esamina le questioni di biologia e che il cambiamento riduce i “ripieghi” legati alla biologia di circa l’85% su tutti i suoi prodotti.
Un fallback è ciò che accade quando Fable 5, il modello più capace dell’azienda, decide che una richiesta tocca un’area sensibile e la passa invece silenziosamente a Opus 5. Opus 5 è un modello forte, ma non ha le capacità biologiche di Fable, quindi la risposta che ottieni è diversa da quella che avevi chiesto. Anthropic afferma che il numero totale di fallback di ogni tipo dovrebbe ora diminuire di circa il 67% su Claude.ai, del 55% su Cowork, del 17% su Claude Code e del 7% sulla piattaforma Claude.
Il gatekeeper qui è un classificatore di sicurezza: un sistema di intelligenza artificiale più piccolo e più veloce il cui unico compito è esaminare una richiesta e decidere se rientra in una categoria protetta. Anthropic ha riscritto il regolamento seguito dal classificatore, lo ha fatto revisionare da esperti interni ed esterni, ha generato nuovi esempi di formazione e ha riqualificato l’oggetto. Il risultato è un confine che si trova in un luogo più sensato. Ora arrivano le domande quotidiane sulla salute, le spiegazioni dei sintomi e la biologia scolastica. La virologia, la tossicologia e la progettazione molecolare continuano a non farlo.
Innanzitutto perché il filtro era così aggressivo
Anthropic è sincero nel dire che l’ambientazione originale era deliberatamente schietta. Le sue stesse valutazioni delle capacità hanno rilevato che Fable 5 potrebbe fornire a un attore malintenzionato un aiuto significativo verso un’arma biologica, che è il tipo di rischio a cui non si può tornare indietro dopo il fatto. Quindi l’azienda ha spedito il modello con quasi tutta la biologia bloccata, ha accettato che gli utenti legittimi sarebbero rimasti intrappolati nella rete e in seguito ha continuato a lavorare sul classificatore. L’alternativa era trattenere l’intero modello per settimane o mesi.
La parte difficile è che la biologia si oppone davvero alle linee pulite. Anthropic fa un bell’esempio: sviluppare un vaccino vivo significa far crescere proprio lo stesso agente patogeno che stai cercando di fermare. Il captopril, un farmaco per la pressione sanguigna, è nato isolando la parte tossica del veleno di serpente. Il lavoro utile e quello pericoloso spesso sembrano identici dall’esterno e le persone che agiscono in malafede sanno come travestirsi l’uno dall’altro.
Un giusto avvertimento: i falsi positivi non sono scomparsi. Anthropic afferma che alcune richieste a basso rischio faranno comunque scattare il classificatore, di proposito, come margine di sicurezza. E Fable rimane inutilizzabile per la ricerca biologica professionale o lo sviluppo di farmaci finché l’azienda non costruisce quelli che chiama percorsi di accesso affidabili.
Cosa significa per te: se usi Fable 5 e rimbalzi sulle domande di biologia, riprova. L’interpretazione dei risultati di laboratorio, la comprensione dei sintomi e l’apprendimento generale ora dovrebbero funzionare in modo molto più fluido. Se sei un professionista delle scienze della vita, il segnale utile è diverso: la porta è ancora chiusa per te, ma Anthropic ha ora detto pubblicamente che il piano è aprirla. E per tutti gli altri, questo è uno sguardo chiaro al compromesso che ogni azienda di intelligenza artificiale sta facendo in silenzio, tra bloccare troppo e bloccare troppo poco.
Fonti
Fonti: https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
ChatGPT riduce il limite giornaliero per gli utenti gratuiti e passa a un modello predefinito più accurato
OpenAI sta rimuovendo il limite alle chat di testo per gli account ChatGPT gratuiti, rendendo GPT-5.6 Luna l'impostazione predefinita per tutti e offrendo agli abbonati Plus e Pro uno slider che controlla quanto pensa il modello.