CWE-Bench
Ein von Collinear durchgeführter externer Benchmark, der misst, wie gut KI-Modelle korrekte Patches für bekannte Software-Schwachstellen schreiben können.
Eine Sicherheitslücke zu finden und zu beheben sind verschiedene Fähigkeiten, und CWE-Bench testet die zweite. Modelle erhalten anfälligen Code und werden danach bewertet, ob der von ihnen geschriebene Patch die Lücke tatsächlich schließt, ohne etwas anderes zu beschädigen. Ergebnisse werden normalerweise als pass@1 angegeben, was bedeutet, dass der Anteil beim ersten Versuch korrekt behoben wurde.
Im Jahr 2026 ist es zu einem allgemeinen Bezugspunkt geworden, da Labore mit der Auslieferung von Modellen begonnen haben, die speziell auf Verteidiger ausgerichtet sind. Google meldete 47,2 % für Gemini 3.8 Flash Cyber, was nahe an den 47,8 % des führenden Frontier-Modells liegt, aber bei viel geringeren Kosten pro Versuch, was der Kompromiss ist, den der Benchmark gut aufdecken kann.