← Glossaire Terme
GPQA
Un benchmark difficile composé de questions scientifiques de niveau expert pour tester le raisonnement des IA.
GPQA rassemble des questions scientifiques de niveau universitaire supérieur, conçues pour être réellement difficiles même pour des spécialistes et impossibles à résoudre par une simple recherche web. Les laboratoires s’en servent pour distinguer le raisonnement d’un modèle du simple rappel de faits.
Un score GPQA élevé indique qu’un modèle peut traiter des contenus experts exigeants. Comme toujours avec les benchmarks, il mesure une aptitude étroite et ne doit pas être confondu avec l’intelligence générale.
Mentionné dans
-
Le laboratoire de Mira Murati réduit son modèle aux trois dixièmes de sa taille et ne perd qu’un point
-
Un modèle ouvert allemand avait des réponses de test dans ses données d’entraînement, et c’est grâce à son ouverture que nous le savons
-
Le nouveau mode vocal de ChatGPT peut écouter et parler en même temps