Contaminazione dei parametri di riferimento
Quando le domande di un test sono trapelate nei dati di addestramento di un modello, un punteggio elevato riflette la memoria piuttosto che l'abilità.
I benchmark dovrebbero misurare ciò che un modello può realizzare. La contaminazione è ciò che accade quando le risposte erano sempre presenti nei dati di addestramento, quindi il modello riconosce la domanda invece di risolverla. Poiché i modelli vengono addestrati su enormi porzioni del web pubblico e poiché i benchmark vengono pubblicati sul web pubblico, ciò accade costantemente ed è spesso impossibile da dimostrare a posteriori.
L’effetto pratico è un’inflazione del punteggio che assomiglia a un progresso. Uno studio del 2026 su 60 benchmark ha rilevato che quasi la metà mostrava segni di saturazione, il che significa che i punteggi si erano raggruppati vicino ai vertici in un modo che non separava più i modelli forti da quelli deboli. La soluzione è un design resistente alla contaminazione: utilizzare materiale pubblicato dopo il termine dell’addestramento, eliminare i dettagli identificativi che consentirebbero a un modello di riconoscere la fonte e congelare ogni caso di test. Il benchmark Reconstruction, pubblicato nell’agosto 2026, è un esempio lampante e i modelli di frontiera hanno ottenuto punteggi molto più bassi rispetto a test comparabili con input più ricchi.