CourionAI
IT
Newsletter
← Glossario Termine

AA-Omniscience

Un benchmark che premia un modello quando dice 'non lo so' invece di inventarsi una risposta.

La maggior parte dei benchmark chiede solo se una risposta era corretta. AA-Omniscience, gestito dalla società di analisi Artificial Analysis, chiede anche cosa fa un modello quando non ne ha idea. Le risposte sbagliate date con sicurezza vengono penalizzate, mentre ammettere onestamente di non sapere viene premiato: un modello può quindi migliorare il proprio punteggio senza imparare un solo fatto nuovo, semplicemente tirando a indovinare di meno.

È uno dei numeri più utili se vi affidate all’IA per ricerche o per qualsiasi cosa fattuale. Un modello può sapere molto ed essere comunque un pessimo assistente di ricerca, se riempie ogni lacuna con qualcosa di plausibile. I tassi di allucinazione di questo benchmark vi dicono quale tipo di errore state comprando.