CourionAI
FR
Newsletter
← Glossaire Terme

SWE-Bench

Un test très répandu qui mesure la capacité des modèles d'IA à corriger de véritables bugs logiciels.

SWE-Bench est un benchmark qui évalue si une IA peut résoudre de vrais problèmes issus de véritables projets logiciels, et non des exercices artificiels. Ses scores sont les chiffres les plus souvent cités dans les annonces de modèles de programmation. La variante plus difficile SWE-Bench Pro est apparue lorsque les modèles ont commencé à atteindre les limites du test original.

Les benchmarks sont imparfaits et les modèles peuvent être optimisés pour le test, mais SWE-Bench reste l’indicateur honnête le plus rapide des capacités en programmation.