CourionAI
DE
Newsletter
← Glossar Begriff

SWE-Bench

Ein verbreiteter Test dafür, wie gut KI-Modelle echte Softwarefehler beheben.

SWE-Bench ist ein Benchmark, der misst, ob eine KI reale Probleme aus echten Softwareprojekten lösen kann, keine künstlichen Rätsel. Ergebnisse dieses Tests gehören zu den meistzitierten Zahlen bei jeder Veröffentlichung eines Programmiermodells. Als Modelle den ursprünglichen Test zunehmend ausreizten, kam die schwierigere Variante SWE-Bench Pro hinzu.

Benchmarks sind unvollkommen und Modelle können gezielt auf einen Test optimiert werden. Dennoch bleibt SWE-Bench das schnellste ehrliche Signal für Programmierfähigkeiten.