← Glossar Begriff
SWE-Bench
Ein verbreiteter Test dafür, wie gut KI-Modelle echte Softwarefehler beheben.
SWE-Bench ist ein Benchmark, der misst, ob eine KI reale Probleme aus echten Softwareprojekten lösen kann, keine künstlichen Rätsel. Ergebnisse dieses Tests gehören zu den meistzitierten Zahlen bei jeder Veröffentlichung eines Programmiermodells. Als Modelle den ursprünglichen Test zunehmend ausreizten, kam die schwierigere Variante SWE-Bench Pro hinzu.
Benchmarks sind unvollkommen und Modelle können gezielt auf einen Test optimiert werden. Dennoch bleibt SWE-Bench das schnellste ehrliche Signal für Programmierfähigkeiten.
Erwähnt in
-
Warum Databricks ausgerechnet ein chinesisches Open-Source-Modell zu seiner täglichen Programmier-Engine macht
-
OpenAI zufolge ist ein Drittel eines beliebten KI-Programmiertests fehlerhaft
-
Anthropics Antwort auf den Preis von Fable 5: Das Modell soll günstigere Modelle steuern
-
MiniMax M3: Ein Spitzenmodell der KI, das du herunterladen und selbst betreiben kannst