CourionAI
IT
Newsletter
← Glossario Termine

Contaminazione dei parametri di riferimento

Quando le domande di un test sono trapelate nei dati di addestramento di un modello, un punteggio elevato riflette la memoria piuttosto che l'abilità.

I benchmark dovrebbero misurare ciò che un modello può realizzare. La contaminazione è ciò che accade quando le risposte erano sempre presenti nei dati di addestramento, quindi il modello riconosce la domanda invece di risolverla. Poiché i modelli vengono addestrati su enormi porzioni del web pubblico e poiché i benchmark vengono pubblicati sul web pubblico, ciò accade costantemente ed è spesso impossibile da dimostrare a posteriori.

L’effetto pratico è un’inflazione del punteggio che assomiglia a un progresso. Uno studio del 2026 su 60 benchmark ha rilevato che quasi la metà mostrava segni di saturazione, il che significa che i punteggi si erano raggruppati vicino ai vertici in un modo che non separava più i modelli forti da quelli deboli. La soluzione è un design resistente alla contaminazione: utilizzare materiale pubblicato dopo il termine dell’addestramento, eliminare i dettagli identificativi che consentirebbero a un modello di riconoscere la fonte e congelare ogni caso di test. Il benchmark Reconstruction, pubblicato nell’agosto 2026, è un esempio lampante e i modelli di frontiera hanno ottenuto punteggi molto più bassi rispetto a test comparabili con input più ricchi.