Terminal-Bench
Ein Test dafür, ob ein KI-Modell über eine Kommandozeile echte Arbeit erledigen kann.
Terminal-Bench setzt ein Modell vor ein Terminal, also das Textfenster, in dem Entwickler Befehle ausführen, und gibt ihm Aufgaben, die nur als erledigt zählen, wenn der Rechner am Ende den richtigen Zustand erreicht. Etwas installieren, einen fehlerhaften Build reparieren oder eine Testsammlung zum Bestehen bringen. Für eine plausibel klingende Antwort gibt es keine Teilpunkte.
Deshalb taucht der Wert in nahezu jeder Ankündigung eines Agenten auf. Chat-Benchmarks belohnen gute Texte über eine Aufgabe. Dieser Test belohnt ihre tatsächliche Erledigung über viele Schritte hinweg, ohne dass ein Mensch ständig korrigiert. Die Werte sind 2026 schnell gestiegen. Sie sind ein brauchbarer Anhaltspunkt dafür, wie viel unbeaufsichtigte Arbeit einem Assistenten zugetraut werden kann.
-
GLM-5.3 kann Software deutlich besser angreifen, deshalb hält Z.ai die Gewichte zurück
-
Qwen3.8-27B ist da und läuft auf einer einzigen Gaming-Grafikkarte
-
Meta gab seinem KI-Agenten einen zweiten Agenten, dessen einzige Aufgabe das Erinnern ist
-
Ein kleines offenes Coding-Modell schlägt zehnmal größere Konkurrenten, und du kannst es selbst ausführen
-
Grok 4.5 kommt zum Drittel des Preises, und das könnte wichtiger sein als Benchmarks