SimpleQA
Un benchmark che pone ai modelli brevi domande fattuali con una sola risposta corretta, molto più difficile per loro di quanto sembri.
SimpleQA fa esattamente ciò che promette il nome: pone a un modello domande fattuali brevi e inequivocabili e verifica la risposta. Nessun rompicapo di ragionamento, codice o saggio. Soltanto domande come chi ha fatto cosa e in quale anno.
I modelli sono sorprendentemente scarsi. A metà 2026 i punteggi migliori erano intorno al 53%, ottenuti da modelli capaci di superare quasi interamente competizioni matematiche di livello olimpico. Il divario è il punto centrale. Un modello linguistico conserva i fatti come effetto secondario dell’apprendimento della previsione del testo, non come tabella di consultazione; inserire più ragionamento in un modello piccolo tende a ridurre il ricordo fattuale. È l’argomento principale per il retrieval: fornire al modello il documento fonte anziché fidarsi della sua memoria.