CourionAI
FR
Newsletter
← Glossaire Terme

SimpleQA

Un benchmark qui pose aux modèles de courtes questions factuelles à réponse unique, beaucoup plus difficile pour eux qu'il n'y paraît.

SimpleQA fait exactement ce que son nom annonce : il pose à un modèle des questions factuelles courtes et sans ambiguïté, puis vérifie la réponse. Aucun problème de raisonnement, aucun code, aucune dissertation. Seulement des questions du type qui a fait quoi et en quelle année.

Les modèles y sont étonnamment mauvais. À la mi-2026, les meilleurs scores tournaient autour de 53 %, pour des modèles pourtant capables de presque réussir intégralement des concours de mathématiques de niveau olympique. Cet écart est précisément l’intérêt du test. Un modèle de langage stocke les faits comme un effet secondaire de son apprentissage de la prédiction du texte, pas comme une table de consultation ; concentrer davantage de raisonnement dans un modèle plus petit tend à réduire la mémoire factuelle. C’est l’argument central en faveur de la recherche documentaire : fournir le document source au modèle plutôt que faire confiance à ses souvenirs.