CourionAI
DE
Newsletter
← Glossar Begriff

Benchmark

Ein standardisierter Test, mit dem die Leistung von KI-Modellen gemessen und verglichen wird.

Ein Benchmark ist ein standardisierter Test, der misst, wie gut ein KI-Modell eine bestimmte Aufgabe bewältigt, etwa Programmieren, logisches Denken oder das Lesen von Dokumenten. Dadurch lassen sich verschiedene Modelle unter gleichen Bedingungen vergleichen. Ranglisten auf Basis solcher Benchmarks sind ein gängiges Mittel, mit dem Labore ihre Fortschritte präsentieren.

Benchmarks sind nützlich, aber man vertraut ihnen leicht zu sehr. Ein Modell kann gezielt für ein gutes Ergebnis in einem beliebten Test optimiert werden, ohne im praktischen Einsatz besser zu sein. Auch die Testdurchführung kann das Ergebnis unbemerkt verzerren. Forschende stellten beispielsweise fest, dass Standardtests für KI-Agenten deren Fähigkeiten allein deshalb unterschätzten, weil sie abgebrochen wurden, bevor die Agenten genügend Zeit zur Lösung hatten.

Die praktische Lehre: Betrachte Benchmark-Zahlen als grobes Signal und nicht als unumstößliche Wahrheit. Entscheidend ist, wie sich ein Werkzeug bei deiner eigenen Arbeit schlägt.