DeepSWE
Un benchmark qui teste si un modèle peut mener à bien une longue tâche d'ingénierie logicielle jusqu'à un résultat fonctionnel.
DeepSWE teste quelque chose de plus étroit et de plus utile que « peut-il écrire du code ». Il mesure si un modèle peut entreprendre une tâche logicielle réelle, qui nécessite de nombreuses étapes sur plusieurs fichiers, et la terminer sans perdre le fil à mi-chemin. Lire le code existant, déterminer ce qu’il faut changer, effectuer la modification, exécuter les tests, réparer ce qui a cassé.
Cette endurance est ce qui sépare une saisie semi-automatique utile de quelque chose auquel vous pouvez confier une tâche et dont vous pouvez vous éloigner, c’est pourquoi les scores ont augmenté si fortement entre les générations de modèles. Une mise en garde qui s’applique à tous les tests de codage : ils s’exécutent sur des problèmes sélectionnés dans des référentiels bien rangés, et votre base de code ne l’est ni l’un ni l’autre.
-
Grok 4.7 réfléchit plus longtemps pour le même prix et remporte un benchmark étrange
-
Le nouveau modèle de Sakana n'est pas un modèle, c'est un répartiteur pour d'autres modèles
-
Le Flash Gemini 3.8 de Google conserve l'ancien prix et apporte un Cyber Twin
-
DeepSeek ouvre un modèle de 305 milliards de paramètres qui permet enfin de voir
-
Le GLM-5.3-Flash de Z.ai se rapproche d'Opus à un dixième du prix
-
Un modèle de classe Frontier est apparu sans nom et il est gratuit jusqu'à la semaine prochaine
-
GLM-5.3 est devenu bien meilleur pour attaquer des logiciels, alors Z.ai retarde ses poids
-
Le Flash Gemini 3.7 de Google est meilleur en termes de code et coûte deux fois moins cher
-
Grok 4.5 arrive pour un tiers du prix, et cela pourrait compter davantage que les évaluations