Benchmark
Un test standard usato per misurare e confrontare le prestazioni dei modelli IA.
Un benchmark è un test standardizzato usato per misurare le prestazioni di un modello IA in una determinata attività, come programmazione, ragionamento o lettura di documenti, così da poter confrontare modelli diversi su basi uniformi. Le classifiche costruite sui benchmark sono un modo comune con cui i laboratori mostrano i progressi.
I benchmark sono utili, ma è facile fidarsi troppo. Un modello può essere ottimizzato per ottenere un buon punteggio in un test popolare senza essere migliore nell’uso reale, e il modo in cui viene eseguita una prova può alterarne silenziosamente il risultato. I ricercatori hanno scoperto, per esempio, che i test standard degli agenti IA ne sottovalutavano le capacità semplicemente perché li interrompevano prima che avessero tempo sufficiente per terminare.
La conclusione pratica è considerare i punteggi dei benchmark come un’indicazione approssimativa, non come verità assolute, e confrontarli con le prestazioni effettive di uno strumento nel proprio lavoro.
-
Gemini 3.8 Flash di Google mantiene il vecchio prezzo e porta un Cyber Twin
-
OpenAI lancia GPT-6 Astra e lo definisce il suo primo modello informatico critico
-
K2 Horizon fornisce sei modelli aperti e con essi i dati di addestramento
-
Il livello di modello più economico di Meta costa 21 volte meno e si addestra secondo le tue richieste
-
DeepSeek apre un modello da 305 miliardi di parametri che finalmente può vedere
-
Debian vota per consentire i contributi assistiti dall'intelligenza artificiale, in modo limitato
-
LAION pubblica 10 milioni di ore di video per la ricerca sull'intelligenza artificiale aperta
-
Il co-scienziato AI di DeepMind ora gestisce l'attrezzatura del laboratorio e i medici umani sono rimasti meno impressionati rispetto ai benchmark
-
Google esclude il proprio modello dalle domande del test
-
Il nuovo modello di trascrizione di Google ripulisce i tuoi ums e i tuoi cambiamenti mentali
-
Il GLM-5.3-Flash di Z.ai si avvicina all'Opus a un decimo del prezzo
-
OpenAI ha costruito il proprio chip e i primi benchmark sono buoni
-
Il prossimo modello aperto di Alibaba è un'anteprima di Qwen 4
-
La nuova Agentic Search di Mistral consente all'intelligenza artificiale di leggere effettivamente i tuoi documenti
-
Un bot di supporto è passato dal risolvere un quarto dei ticket a risolverne la metà, senza un modello migliore
-
Questo modello aperto è diventato così bravo a trovare bug che il suo stesso creatore non lo ha ancora rilasciato
-
Le competenze migliorano gli agenti IA fornendo loro una lista di controllo, non fatti. E smettono di funzionare a 100 voci
-
Il modello economico di DeepSeek ora può vedere e supera l'Opus 4.8 con due test visivi
-
Lo stesso modello ha ottenuto un punteggio del 30% da solo e del 100% all'interno del sistema di agenti di Nvidia
-
È apparso un modello di classe Frontiera senza nome ed è gratuito fino alla prossima settimana
-
Il pioniere dell'apprendimento per rinforzo Rich Sutton definisce i dati sintetici un grosso errore
-
Uno spin-off di Oxford ha venduto ad Anthropic chip per 250 milioni di dollari che ancora non esistono
-
Fornisci al modello di frontiera solo una bibliografia e chiedi l'idea. Ci arriva dal 3 al 15 per cento delle volte
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Google spegne oggi tre modelli Imagen 4
-
1.221 volontari hanno puntato agenti IA su 2.200 articoli scientifici. Quasi un quarto non ha retto
-
I modelli stanno peggiorando apposta sui fatti?
-
Qwen3.8-27B è disponibile e funziona su una sola scheda grafica da gioco
-
Deepseek ha ceduto il suo software agente e aumentato i prezzi delle API lo stesso giorno
-
Il miglior modello sul mercato è quello che le aziende non acquistano
-
Gemini 3.7 Flash di Google è migliore nel codice e costa la metà
-
La nuova modalità ultraveloce di OpenAI esegue il suo modello migliore 14 volte più velocemente
-
Quel consiglio su quale lingua è migliore per i codici AI? Cade a pezzi nel lavoro reale
-
Il creatore di Redis ha realizzato un modello video cinese su un Mac. Gli europei non hanno la licenza per usarlo
-
Il nuovo modello gratuito di Nvidia non è il più intelligente. È semplicemente molto, molto veloce
-
Meta ha messo un modello 30B sul tuo laptop e Zuckerberg ha utilizzato il lancio per combattere
-
Stesso modello, quattro strumenti diversi, tre volte il prezzo: una prova di quanto ti costa l'involucro
-
Il nuovo modello di Alibaba ottiene punteggi più alti e indovina di più: il tasso di allucinazioni passa dal 23 al 40%
-
Meta fornisce Muse Code, un agente di codifica che continua a funzionare dopo un arresto anomalo
-
Un modello aperto è ormai mesi, non anni, indietro rispetto alla frontiera. I suoi test di sicurezza non lo sono.
-
Mistral ha rilasciato un filtro di sicurezza gratuito che descrivi in un inglese semplice e si adatta a una scheda grafica
-
Karpathy ha trasformato un paragrafo di Tolkien in una scena 3D per dieci dollari e l'ha definito un vibe check
-
Il nuovo spot pubblicitario di Alibaba su Qwen afferma che l’intelligenza artificiale prenderà il tuo lavoro e lo fa sembrare una vacanza
-
Qwen3.8-Max di Alibaba ha impiegato 16 giorni a scrivere uno strumento da solo e i pesi verranno resi pubblici la prossima settimana
-
Gli agenti dell'intelligenza artificiale hanno realizzato software di ricerca 60 volte più veloci e si sbagliavano in modi che nessuno si accorse per settimane
-
OpenAI ora risponde alla propria linea di assistenza con un agente IA e vende il sistema che lo rende possibile
-
Con un solo prompt si costruiscono giochi 3D giocabili, e non sembrano più blocchi colorati
-
AMD ha addestrato un modello completamente aperto sui propri chip, ma senza licenza commerciale
-
DeepSeek aggiorna il suo modello economico e raggiunge quello di OpenAI
-
Il nuovo cervello robotico di Google DeepMind vuole controllare bracci da tavolo e umanoidi
-
OpenAI e Anthropic litigano su un benchmark, ma la disputa conta più dei punteggi
-
Microsoft smette di inseguire i modelli di frontiera e punta su piccoli specialisti
-
I nuovi modelli di trascrizione OpenAI sono più veloci e costano il 25% in meno, ma non sono i più precisi
-
Oltre 1.200 dipendenti dei laboratori di IA chiedono a Washington un freno che ancora non esiste
-
Il nuovo rilevatore di Pangram promette un errore ogni 24.000 documenti. È un dato da esaminare con attenzione
-
Anthropic: Claude ha scoperto due vere debolezze negli algoritmi crittografici
-
Hugging Face ricostruisce l’intera intrusione compiuta da un agente di IA
-
Abbiamo eseguito un’IA locale su un processore economico di sei anni fa. Ecco cosa riesce davvero a fare.
-
Il nuovo modello di sicurezza di Microsoft è piccolo per scelta, ed è questo l’aspetto interessante
-
Un addestramento da 500 dollari fa superare a un modello 9B tutti i modelli di punta in un compito ripetitivo
-
Cursor ha ricostruito SQLite con uno sciame di agenti, e i modelli economici hanno fatto quasi tutto
-
METR propone un nuovo modo per chiedere se un agente IA costa davvero meno di una persona
-
Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura
-
Sakana sostiene che il suo router ora superi persino un modello che non utilizza
-
Opus 5 di Anthropic è più piccolo ed economico, ma supera il fratello maggiore
-
DeepSeek V4 diventa completamente stabile e i vecchi modelli si spengono oggi
-
OpenAI dice che uno dei suoi modelli di test è evaso e ha violato Hugging Face
-
La nuova IA per immagini di Alibaba sa disegnare un’intera pagina di giornale, con tanto di testo minuscolo leggibile
-
I prossimi chip IA di Nvidia ricaverebbero dieci volte più lavoro dalla stessa energia
-
Kimi K3 è diventato troppo popolare: Moonshot sospende i nuovi abbonamenti
-
Un nuovo benchmark medico chiede se l'IA sa quando non sa
-
OpenAI ha sospeso il suo miglior modello perché continuava a uscire dalla propria gabbia di prova
-
Gli Stati Uniti vogliono esaminare per 30 giorni i nuovi modelli di frontiera prima del lancio: cosa significa davvero
-
Kimi K3: un modello scaricabile gratuitamente che quasi tiene il passo con i grandi nomi
-
Un modello di IA capace che sta nel tuo telefono e funziona interamente offline
-
Hassabis di DeepMind vuole un arbitro per l'IA, sul modello dell'autorità di vigilanza di Wall Street
-
Soofi S: la Germania ha ora un modello di IA aperto in testa alle classifiche open source
-
Arrivano i dati indipendenti: Muse Spark 1.1 di Meta offre un rapporto qualità-prezzo notevole
-
OpenAI afferma che GPT-5.6 Sol ha addestrato il proprio fratello minore
-
Perché Databricks ha scelto un modello open source cinese come motore quotidiano per la programmazione
-
GPT-5.6 Sol quasi eguaglia il miglior modello di IA a un terzo del prezzo
-
Meta entra nella guerra dei prezzi dell'IA con Muse Spark 1.1 e la sua prima API per sviluppatori
-
OpenAI afferma che un terzo di un diffuso test di programmazione per l'IA è difettoso
-
La risposta di Anthropic al prezzo di Fable 5: lasciare che gestisca modelli più economici
-
Grok 4.5 arriva a un terzo del prezzo, e questo potrebbe contare più dei benchmark
-
Mistral entra nella robotica: basta una videocamera per guidare un robot
-
La nuova modalità vocale di ChatGPT può ascoltare e parlare contemporaneamente
-
I modelli GPT-5.6 di OpenAI diventano pubblici questo giovedì
-
Microsoft sostituisce in sordina OpenAI e Anthropic in Copilot per ridurre i costi
-
È uscita la grande pagella annuale sull'IA di Stanford e il divario di fiducia aumenta
-
Il nuovo modello gratuito di Mistral trova veri bug dimostrando che il codice è corretto
-
Gli agenti di ricerca IA non falliscono nella ricerca: falliscono perché non ti fanno domande
-
“Unlimited OCR” di Baidu legge documenti di 40 pagine in una volta sola, imparando a dimenticare
-
I ricercatori hanno affidato una startup ai modelli IA per 500 giorni. Quasi tutti sono falliti.
-
Questo strumento open source nasconde il testo nelle immagini per ridurre fino al 70% il costo di Claude
-
Quello strumento IA che sei mesi fa aveva «fallito»? Forse gli serviva soltanto più tempo
-
MiniMax M3: un modello IA di fascia alta che puoi scaricare ed eseguire personalmente