CourionAI
FR
Newsletter
← Glossaire Terme

DeepSWE

Un benchmark qui teste si un modèle peut mener à bien une longue tâche d'ingénierie logicielle jusqu'à un résultat fonctionnel.

DeepSWE teste quelque chose de plus étroit et de plus utile que « peut-il écrire du code ». Il mesure si un modèle peut entreprendre une tâche logicielle réelle, qui nécessite de nombreuses étapes sur plusieurs fichiers, et la terminer sans perdre le fil à mi-chemin. Lire le code existant, déterminer ce qu’il faut changer, effectuer la modification, exécuter les tests, réparer ce qui a cassé.

Cette endurance est ce qui sépare une saisie semi-automatique utile de quelque chose auquel vous pouvez confier une tâche et dont vous pouvez vous éloigner, c’est pourquoi les scores ont augmenté si fortement entre les générations de modèles. Une mise en garde qui s’applique à tous les tests de codage : ils s’exécutent sur des problèmes sélectionnés dans des référentiels bien rangés, et votre base de code ne l’est ni l’un ni l’autre.