DeepSWE
Ein Benchmark, der testet, ob ein Modell eine lange Softwareentwicklungsaufgabe zu einem funktionierenden Ergebnis führen kann.
DeepSWE testet etwas, das enger und nützlicher ist als „Kann es Code schreiben“. Es misst, ob ein Modell eine echte Softwareaufgabe, die viele Schritte über mehrere Dateien hinweg erfordert, bewältigen und beenden kann, ohne den Thread auf halbem Weg zu verlieren. Den vorhandenen Code lesen, herausfinden, was geändert werden muss, die Änderung vornehmen, die Tests ausführen und das Problem beheben.
Diese Ausdauer ist es, die eine hilfreiche automatische Vervollständigung von etwas unterscheidet, dem man eine Aufgabe überlassen und von dem man dann weggehen kann, weshalb die Bewertungen dafür zwischen den Modellgenerationen so stark schwanken. Eine Einschränkung, die für alle Codierungsbenchmarks gilt: Sie laufen auf kuratierten Problemen in aufgeräumten Repositorys, und Ihre Codebasis ist keines von beidem.
-
Grok 4.7 denkt länger für das gleiche Geld und gewinnt einen ungeraden Benchmark
-
Sakanas neues Model ist kein Model, sondern ein Dispatcher für andere Models
-
Googles Gemini 3.8 Flash behält den alten Preis und bringt einen Cyber Twin mit
-
DeepSeek eröffnet ein 305-Milliarden-Parameter-Modell, das endlich sehen kann
-
Der GLM-5.3-Flash von Z.ai kommt zu einem Zehntel des Preises in die Nähe von Opus
-
Ein Modell der Frontier-Klasse ist ohne Namen aufgetaucht und bis nächste Woche kostenlos erhältlich
-
GLM-5.3 kann Software deutlich besser angreifen, deshalb hält Z.ai die Gewichte zurück
-
Googles Gemini 3.7 Flash ist besser im Code und kostet halb so viel
-
Grok 4.5 kommt zum Drittel des Preises, und das könnte wichtiger sein als Benchmarks