CourionAI
DE
Newsletter
← Glossar Begriff

DeepSWE

Ein Benchmark, der testet, ob ein Modell eine lange Softwareentwicklungsaufgabe zu einem funktionierenden Ergebnis führen kann.

DeepSWE testet etwas, das enger und nützlicher ist als „Kann es Code schreiben“. Es misst, ob ein Modell eine echte Softwareaufgabe, die viele Schritte über mehrere Dateien hinweg erfordert, bewältigen und beenden kann, ohne den Thread auf halbem Weg zu verlieren. Den vorhandenen Code lesen, herausfinden, was geändert werden muss, die Änderung vornehmen, die Tests ausführen und das Problem beheben.

Diese Ausdauer ist es, die eine hilfreiche automatische Vervollständigung von etwas unterscheidet, dem man eine Aufgabe überlassen und von dem man dann weggehen kann, weshalb die Bewertungen dafür zwischen den Modellgenerationen so stark schwanken. Eine Einschränkung, die für alle Codierungsbenchmarks gilt: Sie laufen auf kuratierten Problemen in aufgeräumten Repositorys, und Ihre Codebasis ist keines von beidem.