← Glossario Termine
GPQA
Un difficile benchmark di domande scientifiche per esperti, usato per verificare il ragionamento dell’IA.
GPQA raccoglie domande scientifiche di livello avanzato, difficili perfino per gli specialisti e non risolvibili con una semplice ricerca sul Web. I laboratori lo usano per misurare quanto un modello ragioni davvero invece di limitarsi a ricordare fatti.
Un punteggio GPQA elevato segnala la capacità di affrontare materiale specialistico impegnativo. Come ogni benchmark, misura però un’abilità ristretta e non va interpretato come intelligenza generale.
Citato in
-
Il nuovo modello di Sakana non è un modello, è un dispatcher per altri modelli
-
Il laboratorio di Mira Murati riduce il modello a meno di un terzo e perde un solo punto
-
Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura
-
La nuova modalità vocale di ChatGPT può ascoltare e parlare contemporaneamente