CWE-Bench
Un benchmark externe géré par Collinear qui mesure dans quelle mesure les modèles d'IA peuvent écrire des correctifs corrects pour les vulnérabilités logicielles connues.
Trouver une faille de sécurité et la corriger sont des compétences différentes, et CWE-Bench teste la seconde. Les modèles reçoivent du code vulnérable et sont notés pour savoir si le correctif qu’ils écrivent comble réellement le trou sans rien casser d’autre. Les résultats sont généralement cités comme pass@1, ce qui signifie que le partage a été correctement corrigé dès la première tentative.
Il est devenu une référence commune en 2026 car les laboratoires ont commencé à commercialiser des modèles spécifiquement destinés aux défenseurs. Google a rapporté 47,2 % pour Gemini 3.8 Flash Cyber, proche des 47,8 % du modèle frontière leader, mais à un coût par tentative bien inférieur, ce qui est le genre de compromis que le benchmark est bon à exposer.