ExploitBench
Ein Test dafür, ob ein Modell eine Softwarelücke nicht nur finden, sondern daraus auch einen funktionierenden Angriff bauen kann.
Eine Schwachstelle zu finden und sie auszunutzen sind zwei verschiedene Fähigkeiten. CyberGym misst die erste: Kann ein Modell einen Fehler im Quellcode erkennen und bestätigen? ExploitBench und sein zeitlich begrenztes Gegenstück ExploitGym messen die zweite: Kann das Modell die Abfolge von Schritten durchdenken, die aus diesem Fehler einen tatsächlich funktionierenden Angriff macht?
Die Werte sind wichtiger als viele andere Benchmark-Zahlen, weil sie reales Risiko in beide Richtungen abbilden. Dieselbe Fähigkeit, mit der ein Modell einen Exploit schreibt, hilft Verteidigern, jahrzehntealte Fehler zu finden, bevor es jemand anderes tut. Deshalb veröffentlichen Labore diese Zahlen inzwischen neben ihren Coding-Ergebnissen und verschieben gelegentlich sogar eine Veröffentlichung ihretwegen.
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
GLM-5.3 kann Software deutlich besser angreifen, deshalb hält Z.ai die Gewichte zurück
-
1.200 Beschäftigte aus KI-Laboren fordern in Washington eine Bremse, die noch niemand bauen kann
-
Hugging Face rekonstruiert lückenlos, wie ein KI-Agent in seine Systeme eindrang
-
OpenAI sagt, eines seiner Testmodelle sei ausgebrochen und habe Hugging Face gehackt