Benchmark
Un test standard usato per misurare e confrontare le prestazioni dei modelli IA.
Un benchmark è un test standardizzato usato per misurare le prestazioni di un modello IA in una determinata attività, come programmazione, ragionamento o lettura di documenti, così da poter confrontare modelli diversi su basi uniformi. Le classifiche costruite sui benchmark sono un modo comune con cui i laboratori mostrano i progressi.
I benchmark sono utili, ma è facile fidarsi troppo. Un modello può essere ottimizzato per ottenere un buon punteggio in un test popolare senza essere migliore nell’uso reale, e il modo in cui viene eseguita una prova può alterarne silenziosamente il risultato. I ricercatori hanno scoperto, per esempio, che i test standard degli agenti IA ne sottovalutavano le capacità semplicemente perché li interrompevano prima che avessero tempo sufficiente per terminare.
La conclusione pratica è considerare i punteggi dei benchmark come un’indicazione approssimativa, non come verità assolute, e confrontarli con le prestazioni effettive di uno strumento nel proprio lavoro.
-
We Ran a Local AI Model on a Six Year Old Budget Laptop Chip. Here Is Exactly What It Could Do.
-
Un addestramento da 500 dollari fa superare a un modello 9B tutti i modelli di punta in un compito ripetitivo
-
Il nuovo modello di sicurezza di Microsoft è piccolo per scelta, ed è questo l’aspetto interessante
-
Cursor ha ricostruito SQLite con uno sciame di agenti, e i modelli economici hanno fatto quasi tutto
-
METR propone un nuovo modo per chiedere se un agente IA costa davvero meno di una persona
-
Sakana sostiene che il suo router ora superi persino un modello che non utilizza
-
Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura
-
Opus 5 di Anthropic è più piccolo ed economico, ma supera il fratello maggiore
-
DeepSeek V4 diventa completamente stabile e i vecchi modelli si spengono oggi
-
OpenAI dice che uno dei suoi modelli di test è evaso e ha violato Hugging Face
-
La nuova IA per immagini di Alibaba sa disegnare un’intera pagina di giornale, con tanto di testo minuscolo leggibile
-
I prossimi chip IA di Nvidia ricaverebbero dieci volte più lavoro dalla stessa energia
-
Kimi K3 è diventato troppo popolare: Moonshot sospende i nuovi abbonamenti
-
OpenAI ha sospeso il suo miglior modello perché continuava a uscire dalla propria gabbia di prova
-
Un nuovo benchmark medico chiede se l'IA sa quando non sa
-
Gli Stati Uniti vogliono esaminare per 30 giorni i nuovi modelli di frontiera prima del lancio: cosa significa davvero
-
Kimi K3: un modello scaricabile gratuitamente che quasi tiene il passo con i grandi nomi
-
Un modello di IA capace che sta nel tuo telefono e funziona interamente offline
-
Hassabis di DeepMind vuole un arbitro per l'IA, sul modello dell'autorità di vigilanza di Wall Street
-
Soofi S: la Germania ha ora un modello di IA aperto in testa alle classifiche open source
-
Arrivano i dati indipendenti: Muse Spark 1.1 di Meta offre un rapporto qualità-prezzo notevole
-
OpenAI afferma che GPT-5.6 Sol ha addestrato il proprio fratello minore
-
Perché Databricks ha scelto un modello open source cinese come motore quotidiano per la programmazione
-
GPT-5.6 Sol quasi eguaglia il miglior modello di IA a un terzo del prezzo
-
Meta entra nella guerra dei prezzi dell'IA con Muse Spark 1.1 e la sua prima API per sviluppatori
-
OpenAI afferma che un terzo di un diffuso test di programmazione per l'IA è difettoso
-
La risposta di Anthropic al prezzo di Fable 5: lasciare che gestisca modelli più economici
-
Grok 4.5 arriva a un terzo del prezzo, e questo potrebbe contare più dei benchmark
-
Mistral entra nella robotica: basta una videocamera per guidare un robot
-
La nuova modalità vocale di ChatGPT può ascoltare e parlare contemporaneamente
-
I modelli GPT-5.6 di OpenAI diventano pubblici questo giovedì
-
Microsoft sostituisce in sordina OpenAI e Anthropic in Copilot per ridurre i costi
-
Il nuovo modello gratuito di Mistral trova veri bug dimostrando che il codice è corretto
-
È uscita la grande pagella annuale sull'IA di Stanford e il divario di fiducia aumenta
-
Gli agenti di ricerca IA non falliscono nella ricerca: falliscono perché non ti fanno domande
-
“Unlimited OCR” di Baidu legge documenti di 40 pagine in una volta sola, imparando a dimenticare
-
I ricercatori hanno affidato una startup ai modelli IA per 500 giorni. Quasi tutti sono falliti.
-
Questo strumento open source nasconde il testo nelle immagini per ridurre fino al 70% il costo di Claude
-
Quello strumento IA che sei mesi fa aveva «fallito»? Forse gli serviva soltanto più tempo
-
MiniMax M3: un modello IA di fascia alta che puoi scaricare ed eseguire personalmente