CourionAI
DE
Newsletter
← Glossar Begriff

Terminal-Bench

Ein Test dafür, ob ein KI-Modell über eine Kommandozeile echte Arbeit erledigen kann.

Terminal-Bench setzt ein Modell vor ein Terminal, also das Textfenster, in dem Entwickler Befehle ausführen, und gibt ihm Aufgaben, die nur als erledigt zählen, wenn der Rechner am Ende den richtigen Zustand erreicht. Etwas installieren, einen fehlerhaften Build reparieren oder eine Testsammlung zum Bestehen bringen. Für eine plausibel klingende Antwort gibt es keine Teilpunkte.

Deshalb taucht der Wert in nahezu jeder Ankündigung eines Agenten auf. Chat-Benchmarks belohnen gute Texte über eine Aufgabe. Dieser Test belohnt ihre tatsächliche Erledigung über viele Schritte hinweg, ohne dass ein Mensch ständig korrigiert. Die Werte sind 2026 schnell gestiegen. Sie sind ein brauchbarer Anhaltspunkt dafür, wie viel unbeaufsichtigte Arbeit einem Assistenten zugetraut werden kann.