← Glossaire Terme
SWE-Bench
Un test très répandu qui mesure la capacité des modèles d'IA à corriger de véritables bugs logiciels.
SWE-Bench est un benchmark qui évalue si une IA peut résoudre de vrais problèmes issus de véritables projets logiciels, et non des exercices artificiels. Ses scores sont les chiffres les plus souvent cités dans les annonces de modèles de programmation. La variante plus difficile SWE-Bench Pro est apparue lorsque les modèles ont commencé à atteindre les limites du test original.
Les benchmarks sont imparfaits et les modèles peuvent être optimisés pour le test, mais SWE-Bench reste l’indicateur honnête le plus rapide des capacités en programmation.
Mentionné dans
-
Pourquoi Databricks vient d’adopter un modèle chinois open source comme moteur de programmation au quotidien
-
Selon OpenAI, un tiers d’un test de programmation populaire pour l’IA est défectueux
-
La réponse d’Anthropic au prix de Fable 5 : lui confier la gestion de modèles moins chers
-
MiniMax M3 : un modèle d’IA haut de gamme que vous pouvez télécharger et exécuter vous-même