Due laboratori di benchmark hanno misurato GPT-6 Astra e sono giunti a conclusioni opposte
Epoch AI colloca Astra chiaramente al primo posto in 50 test. Artificial Analysis lo valuta al livello del suo predecessore e dietro Claude Fable 5.1. L'unico numero che entrambe le parti trovano notevole è su ARC-AGI-3.
Una settimana dopo che OpenAI ha spedito GPT-6 Astra, due laboratori di valutazione indipendenti hanno pubblicato i punteggi complessivi e non sono d’accordo. Epoch AI, che raccoglie più di 50 benchmark individuali, classifica Astra al primo posto su 267 modelli con 169 punti. L’analisi artificiale, che mette alla prova la conoscenza, la codifica e la comprensione del testo, gli assegna 61 punti, esattamente allo stesso livello del suo predecessore GPT-5.6 Sol e dietro Claude Fable 5.1 a 66.
Entrambi sono abiti attenti e ben considerati. Semplicemente non misurano la stessa cosa e i dettagli sottostanti spiegano il perché. I numeri individuali di Epoch mostrano Astra leader in matematica, conoscenza ed enigmi. Fable 5.1 detiene il punteggio massimo in quasi tutti i test di codifica. Epoch ha finora registrato un solo punteggio di codifica per Astra, in un percorso con sforzo di ragionamento medio. Quindi i due numeri principali sono in gran parte una questione di cosa è stato ponderato.
Alcuni dati concreti dallo stesso rapporto: il tasso di allucinazioni di Astra nel test AA-Omniscience scende dal 92 al 51%, ma perde circa 80 punti Elo nel GDPval-AA v2 e scivola sul supporto bancario e sul ragionamento a lungo contesto. Costa due volte e mezzo di più per unità di testo rispetto a Sol, ma nelle attività di codifica eguaglia il punteggio di Claude Fable 5 a meno della metà del costo per attività, perché utilizza circa un terzo dei passaggi.
Cosa c’è dietro tutto questo?
Il risultato di cui tutti parlano è ARC-AGI-3, che cala un modello in piccoli mondi di gioco sconosciuti e non spiega nulla. Deve elaborare le regole provando le cose. Astra ha ottenuto il 62,7% nel test neutro, contro il 7,8% di Sol e il 30,2% di Claude Opus 5. Più sorprendente del punteggio è l’efficienza: nel 96% dei livelli, Astra ha avuto bisogno di meno mosse rispetto al tester umano medio che ha risolto quel livello.
Ci è arrivato inventando la propria stenografia, una notazione simile all’algebra per registrare oggetti, coordinate e piani, perché tutto ciò che non scrive nei propri appunti lo dimentica. Il fondatore dell’ARC Prize, François Chollet, definisce questa “modellazione simbolica del mondo al volo” e osserva che un comportamento come questo richiedeva un’elaborata impalcatura esterna. Ora è nel modello.
Sono importanti due avvertenze. OpenAI ha riportato il 99,9% dello stesso test utilizzando il proprio cablaggio, e ARC Prize afferma che solo la cifra del 62,7% consente un confronto equo tra i fornitori. Questa è la stessa disputa che ha prodotto l’accattivante risultato Nvidia AVO in agosto. E Chollet è esplicito nel dire che nulla di tutto ciò dimostra l’intelligenza generale: i giochi sono brevi, chiusi e minuscoli rispetto ai compiti reali. Quello che dice è che i progressi sono arrivati circa due volte più velocemente di quanto si aspettasse, e sta spostando le sue previsioni AGI prima del 2030.
Che cosa significa per te: Considera i numeri di riferimento dei singoli titoli come marketing finché non sai cosa contengono. Quando scegli un modello, l’unica classifica che conta è la tua: prendi tre attività che svolgi effettivamente, eseguile su due modelli e confronta. Ci vogliono venti minuti e batte qualsiasi classifica.
Fonti
ChatGPT è tornato a rappresentare il 55,5% del traffico web di Chatbot, ma un anno fa era pari al 73%
I dati di agosto di Similarweb mostrano che ChatGPT riguadagna quota dal 52,7% di tre mesi fa, mentre Gemini scivola al 25,6%. Claude è cresciuto dall'1,9 al 9,3% in un anno. Le app non vengono conteggiate.