CourionAI
FR
Newsletter
← Glossaire Terme

Benchmark

Un test standard utilisé pour mesurer et comparer les performances de modèles d'IA.

Un benchmark est un test standardisé qui mesure les performances d’un modèle d’IA sur une tâche donnée, programmation, raisonnement, lecture de documents, etc., afin de comparer plusieurs modèles sur un pied d’égalité. Les classements construits à partir de ces tests sont une façon courante pour les laboratoires d’afficher leurs progrès.

Les benchmarks sont utiles mais on leur fait facilement trop confiance. Un modèle peut être optimisé pour réussir un test populaire sans être meilleur en pratique, et la manière d’exécuter le test peut discrètement fausser le résultat. Des chercheurs ont par exemple constaté que des tests standards d’agents IA les sous-estimaient simplement en les arrêtant avant qu’ils aient eu assez de temps pour finir.

La leçon pratique : considérez les chiffres comme un signal approximatif, pas comme une vérité absolue, et confrontez-les aux performances de l’outil sur votre propre travail.