Benchmark
Ein standardisierter Test, mit dem die Leistung von KI-Modellen gemessen und verglichen wird.
Ein Benchmark ist ein standardisierter Test, der misst, wie gut ein KI-Modell eine bestimmte Aufgabe bewältigt, etwa Programmieren, logisches Denken oder das Lesen von Dokumenten. Dadurch lassen sich verschiedene Modelle unter gleichen Bedingungen vergleichen. Ranglisten auf Basis solcher Benchmarks sind ein gängiges Mittel, mit dem Labore ihre Fortschritte präsentieren.
Benchmarks sind nützlich, aber man vertraut ihnen leicht zu sehr. Ein Modell kann gezielt für ein gutes Ergebnis in einem beliebten Test optimiert werden, ohne im praktischen Einsatz besser zu sein. Auch die Testdurchführung kann das Ergebnis unbemerkt verzerren. Forschende stellten beispielsweise fest, dass Standardtests für KI-Agenten deren Fähigkeiten allein deshalb unterschätzten, weil sie abgebrochen wurden, bevor die Agenten genügend Zeit zur Lösung hatten.
Die praktische Lehre: Betrachte Benchmark-Zahlen als grobes Signal und nicht als unumstößliche Wahrheit. Entscheidend ist, wie sich ein Werkzeug bei deiner eigenen Arbeit schlägt.
-
We Ran a Local AI Model on a Six Year Old Budget Laptop Chip. Here Is Exactly What It Could Do.
-
Ein Training für 500 Dollar: So schlägt ein 9B-Modell die Spitzenmodelle bei einer eintönigen Aufgabe
-
Microsofts neues Sicherheitsmodell ist absichtlich klein – genau das macht es interessant
-
Cursor baute SQLite mit einem Agentenschwarm nach, und günstige Modelle erledigten den Großteil
-
METR fragt neu, ob ein KI-Agent tatsächlich günstiger ist als ein Mensch
-
Sakana sagt, sein Modell-Router schlägt jetzt ein Modell, das er gar nicht nutzt
-
Ein offenes deutsches Modell hatte Testantworten in den Trainingsdaten, und dank Offenheit wissen wir es
-
Anthropics Opus 5 ist kleiner und günstiger, und schlägt trotzdem sein größeres Geschwistermodell
-
DeepSeek V4 ist vollständig stabil, die alten Modelle werden heute abgeschaltet
-
OpenAI sagt, eines seiner Testmodelle sei ausgebrochen und habe Hugging Face gehackt
-
Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift
-
Nvidias nächste KI-Chips holen Berichten zufolge zehnmal mehr Arbeit aus derselben Energie
-
Kimi K3 wurde zu beliebt: Moonshot pausiert neue Abonnements
-
OpenAI pausierte sein bestes Modell, weil es wiederholt aus seinem eigenen Testkäfig ausbrach
-
Ein neuer medizinischer Benchmark fragt, ob KI weiß, wann sie etwas nicht weiß
-
Die USA wollen neue Spitzenmodelle 30 Tage lang prüfen, bevor sie starten, was das tatsächlich bedeutet
-
Kimi K3: Ein kostenlos herunterladbares Modell, das fast mit den großen Namen mithält
-
Ein leistungsfähiges KI-Modell, das auf dein Smartphone passt und vollständig offline läuft
-
DeepMinds Hassabis will einen KI-Schiedsrichter nach Vorbild der Wall-Street-Aufsicht
-
Soofi S: Deutschland hat nun ein offenes KI-Modell, das die Open-Source-Charts anführt
-
Unabhängige Zahlen liegen vor: Metas Muse Spark 1.1 ist eine ernsthafte Preis-Leistungs-Wahl
-
OpenAI sagt, GPT-5.6 Sol habe seinen eigenen kleineren Bruder trainiert
-
GPT-5.6 Sol erreicht beinahe das beste KI-Modell, für ein Drittel des Preises
-
Meta steigt mit Muse Spark 1.1 und seiner ersten Entwickler-API in den KI-Preiskampf ein
-
OpenAI zufolge ist ein Drittel eines beliebten KI-Programmiertests fehlerhaft
-
Anthropics Antwort auf den Preis von Fable 5: Das Modell soll günstigere Modelle steuern
-
Grok 4.5 kommt zum Drittel des Preises, und das könnte wichtiger sein als Benchmarks
-
Mistral steigt in die Robotik ein: Eine Kamera reicht, um einen Roboter zu steuern
-
ChatGPTs neuer Sprachmodus kann gleichzeitig zuhören und sprechen
-
OpenAIs GPT-5.6-Modelle starten diesen Donnerstag öffentlich
-
Microsoft ersetzt OpenAI und Anthropic in Copilot stillschweigend, um Kosten zu senken
-
Mistrals kostenloses neues Modell findet echte Fehler, indem es die Korrektheit von Code beweist
-
Stanfords großes jährliches KI-Zeugnis ist da, und die Vertrauenslücke wächst
-
KI-Rechercheagenten scheitern nicht an der Suche, sondern daran, dir Fragen zu stellen
-
Baidus „Unlimited OCR“ liest 40-seitige Dokumente in einem Durchgang, indem es zu vergessen lernt
-
Forscher ließen KI-Modelle 500 Tage lang ein Start-up führen. Die meisten gingen pleite.
-
Dieses Open-Source-Werkzeug versteckt Text in Bildern und senkt Claudes Kosten um bis zu 70 Prozent
-
Das KI-Werkzeug, das vor sechs Monaten „gescheitert“ ist? Vielleicht brauchte es einfach mehr Zeit
-
MiniMax M3: Ein Spitzenmodell der KI, das du herunterladen und selbst betreiben kannst