Benchmark
Ein standardisierter Test, mit dem die Leistung von KI-Modellen gemessen und verglichen wird.
Ein Benchmark ist ein standardisierter Test, der misst, wie gut ein KI-Modell eine bestimmte Aufgabe bewältigt, etwa Programmieren, logisches Denken oder das Lesen von Dokumenten. Dadurch lassen sich verschiedene Modelle unter gleichen Bedingungen vergleichen. Ranglisten auf Basis solcher Benchmarks sind ein gängiges Mittel, mit dem Labore ihre Fortschritte präsentieren.
Benchmarks sind nützlich, aber man vertraut ihnen leicht zu sehr. Ein Modell kann gezielt für ein gutes Ergebnis in einem beliebten Test optimiert werden, ohne im praktischen Einsatz besser zu sein. Auch die Testdurchführung kann das Ergebnis unbemerkt verzerren. Forschende stellten beispielsweise fest, dass Standardtests für KI-Agenten deren Fähigkeiten allein deshalb unterschätzten, weil sie abgebrochen wurden, bevor die Agenten genügend Zeit zur Lösung hatten.
Die praktische Lehre: Betrachte Benchmark-Zahlen als grobes Signal und nicht als unumstößliche Wahrheit. Entscheidend ist, wie sich ein Werkzeug bei deiner eigenen Arbeit schlägt.
-
Googles Gemini 3.8 Flash behält den alten Preis und bringt einen Cyber Twin mit
-
OpenAI liefert GPT-6 Astra aus und nennt es sein erstes kritisches Cyber-Modell
-
K2 Horizon liefert sechs offene Modelle und die dazugehörigen Trainingsdaten aus
-
Die günstigste Modellstufe von Meta kostet 21-mal weniger und reagiert auf Ihre Vorgaben
-
DeepSeek eröffnet ein 305-Milliarden-Parameter-Modell, das endlich sehen kann
-
Debian stimmt mit knapper Mehrheit für die Zulassung KI-gestützter Beiträge
-
Mit WikiSkill von Google können KI-Agenten ein Wiki über ihre eigenen Fehler führen
-
LAION veröffentlicht 10 Millionen Stunden Video für Open AI Research
-
Tencent Open-Sources Hy4, ein 770-Milliarden-Parameter-Modell, das für die Büroarbeit entwickelt wurde
-
Der KI-Co-Wissenschaftler von DeepMind leitet jetzt die Laborausrüstung, und die menschlichen Ärzte waren weniger beeindruckt als die Benchmarks
-
Google sperrt sein eigenes Modell aus den Testfragen aus
-
Das neue Transkriptionsmodell von Google bereinigt Ihre Ums und Ihre Meinungsveränderungen
-
Granite 4.2 von IBM ist kostenlos, klein genug, um lokal ausgeführt zu werden, und darauf ausgelegt, zuerst zu denken
-
Der GLM-5.3-Flash von Z.ai kommt zu einem Zehntel des Preises in die Nähe von Opus
-
OpenAI hat seinen eigenen Chip gebaut und die ersten Benchmarks sind gut
-
Alibabas nächstes offenes Modell ist eine Vorschau auf Qwen 4
-
Die neue Agentensuche von Mistral ermöglicht es der KI, Ihre Dokumente tatsächlich zu lesen
-
Ein Support-Bot löste von der Lösung eines Viertels der Tickets die Hälfte der Tickets, ohne ein besseres Modell
-
Dieses offene Modell ist so gut darin, Fehler zu finden, dass sein eigener Hersteller es noch nicht veröffentlicht
-
Fähigkeiten machen KI-Agenten besser, indem sie ihnen eine Checkliste und keine Fakten geben. Und bei 100 Einträgen hören sie auf zu funktionieren
-
Das günstige Modell von DeepSeek kann jetzt sehen und übertrifft Opus 4.8 bei zwei visuellen Tests
-
Das gleiche Modell erreichte allein 30 Prozent und innerhalb des Agentensystems von Nvidia 100 Prozent
-
Ein Modell der Frontier-Klasse ist ohne Namen aufgetaucht und bis nächste Woche kostenlos erhältlich
-
Rich Sutton, Pionier des Reinforcement Learning, bezeichnet synthetische Daten als großen Fehler
-
Die FDA hat 1.357 KI-Medizinprodukte zugelassen. Bei drei wurde getestet, ob es den Patienten besser ging
-
Ein Oxford-Spinout verkaufte Anthropic-Chips im Wert von 250 Millionen Dollar, die es noch nicht gibt
-
Geben Sie einem Grenzmodell nur eine Bibliographie und fragen Sie nach der Idee. Es kommt in 3 bis 15 Prozent der Fälle dort an
-
OpenAI hat sein Flaggschiffmodell auf die Hälfte des Preises reduziert, und der Grund dafür ist, dass es auf einer Bestenliste steht
-
Ein legales KI-Unternehmen baute sein eigenes Modell auf und begann mit einem offenen chinesischen Modell
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Google schaltet heute drei Imagen-4-Modelle ab
-
1.221 Freiwillige ließen KI-Agenten 2.200 Forschungsarbeiten prüfen. Fast ein Viertel hielt nicht stand
-
Werden Modelle mit Absicht schlechter bei Fakten?
-
Grok 4.6 erscheint zwei Tage nach dem Start in GitHub Copilot
-
Qwen3.8-27B ist da und läuft auf einer einzigen Gaming-Grafikkarte
-
Deepseek verschenkte am selben Tag seine Agentensoftware und erhöhte die API-Preise
-
Das beste Modell auf dem Markt ist das, das die Unternehmen nicht kaufen
-
Googles Gemini 3.7 Flash ist besser im Code und kostet halb so viel
-
Ling 3.0 Flash ist das intelligenteste offene Modell seiner Größe und hat aufgehört, Dinge zu erfinden
-
Der neue Ultrafast-Modus von OpenAI führt sein bestes Modell 14-mal schneller aus
-
Dieser Rat, in welcher Sprache KI-Codes am besten sind? Bei echter Arbeit scheitert es
-
Der Erfinder von Redis hat ein chinesisches Videomodell erstellt, das auf einem Mac läuft. Europäer haben keine Lizenz zur Nutzung
-
Nvidias neues kostenloses Modell ist nicht das intelligenteste. Es ist einfach sehr, sehr schnell
-
Meta hat ein 30B-Modell auf Ihren Laptop geladen und Zuckerberg nutzte die Markteinführung, um einen Kampf anzuzetteln
-
Das neue Sturmmodell von DeepMind verschafft Meteorologen einen zusätzlichen Tag, und niemand weiß so recht, warum es funktioniert
-
Das neue Bildmodell von xAI belegt den zweiten Platz in der Arena-Rangliste und bietet Bearbeitung im Photoshop-Stil für Grok
-
Gleiches Modell, vier verschiedene Werkzeuge, dreimal so viel: Ein Test, was Sie der Wickler kostet
-
Alibabas neuestes Modell schneidet besser ab und vermutet mehr: Halluzinationsrate steigt von 23 auf 40 Prozent
-
Meta liefert Muse Code, einen Codierungsagenten, der nach einem Absturz weiter funktioniert
-
Ein offenes Modell liegt nun Monate, nicht Jahre, hinter der Grenze zurück. Die Sicherheitsprüfung erfolgt nicht.
-
Mistral hat einen kostenlosen Sicherheitsfilter herausgebracht, den Sie im Klartext beschreiben und der auf eine Grafikkarte passt
-
Karpathy verwandelte einen Absatz von Tolkien für zehn Dollar in eine 3D-Szene und nannte es einen Vibe Check
-
In der neuen Qwen-Werbung von Alibaba heißt es, dass KI Ihnen den Job wegnehmen wird, und lässt es wie einen Urlaub klingen
-
Alibabas Qwen3.8-Max hat 16 Tage damit verbracht, ein eigenes Tool zu schreiben, und die Gewichte werden nächste Woche veröffentlicht
-
KI-Agenten machten Forschungssoftware 60-mal schneller und lagen selbstbewusst in einer Weise falsch, die wochenlang niemand bemerkte
-
Mit einem einzigen Prompt entstehen spielbare 3D-Games, und sie sehen nicht mehr wie Bauklötze aus
-
DeepSeek verbessert sein günstiges Modell und zieht mit OpenAIs Budgetmodell gleich
-
Google DeepMinds neues Robotergehirn soll vom Tischarm bis zum Humanoiden alles steuern
-
OpenAI und Anthropic streiten über einen Benchmark – und der Streit sagt mehr aus als die Punktzahlen
-
Microsoft will nicht länger dem größten KI-Modell nachjagen, sondern kleine Spezialisten bauen
-
OpenAIs neue Transkriptionsmodelle sind schneller und 25 Prozent günstiger – aber nicht am genauesten
-
1.200 Beschäftigte aus KI-Laboren fordern in Washington eine Bremse, die noch niemand bauen kann
-
Pangrams neuer Detektor soll sich nur bei einem von 24.000 Dokumenten irren. Die Zahl verdient einen genaueren Blick
-
Hugging Face rekonstruiert lückenlos, wie ein KI-Agent in seine Systeme eindrang
-
Wir haben lokale KI auf einem sechs Jahre alten Billig-Laptop getestet. Das konnte sie wirklich.
-
Microsofts neues Sicherheitsmodell ist absichtlich klein, genau das macht es interessant
-
Ein Training für 500 Dollar: So schlägt ein 9B-Modell die Spitzenmodelle bei einer eintönigen Aufgabe
-
Cursor baute SQLite mit einem Agentenschwarm nach, und günstige Modelle erledigten den Großteil
-
METR fragt neu, ob ein KI-Agent tatsächlich günstiger ist als ein Mensch
-
Ein offenes deutsches Modell hatte Testantworten in den Trainingsdaten, und dank Offenheit wissen wir es
-
Sakana sagt, sein Modell-Router schlägt jetzt ein Modell, das er gar nicht nutzt
-
Anthropics Opus 5 ist kleiner und günstiger, und schlägt trotzdem sein größeres Geschwistermodell
-
DeepSeek V4 ist vollständig stabil, die alten Modelle werden heute abgeschaltet
-
OpenAI sagt, eines seiner Testmodelle sei ausgebrochen und habe Hugging Face gehackt
-
Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift
-
Nvidias nächste KI-Chips holen Berichten zufolge zehnmal mehr Arbeit aus derselben Energie
-
Kimi K3 wurde zu beliebt: Moonshot pausiert neue Abonnements
-
Ein neuer medizinischer Benchmark fragt, ob KI weiß, wann sie etwas nicht weiß
-
OpenAI pausierte sein bestes Modell, weil es wiederholt aus seinem eigenen Testkäfig ausbrach
-
Die USA wollen neue Spitzenmodelle 30 Tage lang prüfen, bevor sie starten, was das tatsächlich bedeutet
-
Kimi K3: Ein kostenlos herunterladbares Modell, das fast mit den großen Namen mithält
-
Ein leistungsfähiges KI-Modell, das auf dein Smartphone passt und vollständig offline läuft
-
DeepMinds Hassabis will einen KI-Schiedsrichter nach Vorbild der Wall-Street-Aufsicht
-
Soofi S: Deutschland hat nun ein offenes KI-Modell, das die Open-Source-Charts anführt
-
Unabhängige Zahlen liegen vor: Metas Muse Spark 1.1 ist eine ernsthafte Preis-Leistungs-Wahl
-
OpenAI sagt, GPT-5.6 Sol habe seinen eigenen kleineren Bruder trainiert
-
GPT-5.6 Sol erreicht beinahe das beste KI-Modell, für ein Drittel des Preises
-
Meta steigt mit Muse Spark 1.1 und seiner ersten Entwickler-API in den KI-Preiskampf ein
-
OpenAI zufolge ist ein Drittel eines beliebten KI-Programmiertests fehlerhaft
-
Anthropics Antwort auf den Preis von Fable 5: Das Modell soll günstigere Modelle steuern
-
Grok 4.5 kommt zum Drittel des Preises, und das könnte wichtiger sein als Benchmarks
-
Mistral steigt in die Robotik ein: Eine Kamera reicht, um einen Roboter zu steuern
-
ChatGPTs neuer Sprachmodus kann gleichzeitig zuhören und sprechen
-
OpenAIs GPT-5.6-Modelle starten diesen Donnerstag öffentlich
-
Microsoft ersetzt OpenAI und Anthropic in Copilot stillschweigend, um Kosten zu senken
-
Stanfords großes jährliches KI-Zeugnis ist da, und die Vertrauenslücke wächst
-
Mistrals kostenloses neues Modell findet echte Fehler, indem es die Korrektheit von Code beweist
-
KI-Rechercheagenten scheitern nicht an der Suche, sondern daran, dir Fragen zu stellen
-
Baidus „Unlimited OCR“ liest 40-seitige Dokumente in einem Durchgang, indem es zu vergessen lernt
-
Forscher ließen KI-Modelle 500 Tage lang ein Start-up führen. Die meisten gingen pleite.
-
Dieses Open-Source-Werkzeug versteckt Text in Bildern und senkt Claudes Kosten um bis zu 70 Prozent
-
Das KI-Werkzeug, das vor sechs Monaten „gescheitert“ ist? Vielleicht brauchte es einfach mehr Zeit
-
MiniMax M3: Ein Spitzenmodell der KI, das du herunterladen und selbst betreiben kannst