← Glossar Begriff
Humanity's Last Exam
Ein bewusst extrem schwieriger Benchmark mit Expertenfragen aus vielen Fachgebieten.
Humanity’s Last Exam enthält Fragen von Fachleuten aus Dutzenden Disziplinen, die so schwierig ausgewählt wurden, dass Spitzenmodelle die meisten falsch beantworten. Er entstand, weil ältere Benchmarks bei Werten über 90 Prozent kaum noch Unterschiede zeigten.
Mitte 2026 liegen starke Modelle dort noch bei rund 30 Prozent. Genau das ist beabsichtigt: Gemessen wird die verbleibende Lücke. Wie jeder einzelne Benchmark erfasst HLE nur einen engen Fähigkeitsausschnitt und ist kein allgemeiner Intelligenzwert.
Erwähnt in
-
Qwen3.8-27B ist da und läuft auf einer einzigen Gaming-Grafikkarte
-
Ein Klimaforscher protokollierte acht Wochen lang den Einsatz von KI-Agenten. Pro Eingabeaufforderung wurde 600-mal mehr Strom verbraucht als bei einer Chat-Nachricht
-
Mira Muratis Labor schrumpft sein Modell auf ein Viertel und verliert nur einen Punkt
-
So beantwortet ein 100-seitiges PDF deine Fragen, und so prüfst du, ob die Antworten erfunden sind
-
Einstieg in KI, Teil 1: Eine ehrliche Karte für deine erste Woche
-
Einstieg in KI, Teil 2: So wählst du deinen ersten Assistenten
-
Einstieg in KI, Teil 3: Sieben kleine Aufgaben, die dir fast alles beibringen
-
Einstieg in KI, Teil 5: Vergiss magische Prompts, Kontext ist alles
-
Von Light bis Ultra: Die sieben Denkgeschwindigkeiten von GPT-5.6 verstehen
-
OpenAI sagt, GPT-5.6 Sol habe seinen eigenen kleineren Bruder trainiert
-
Anthropic kann jetzt Claudes inneren Monolog lesen, das ist die Jacobian Lens
-
Googles Stromverbrauch stieg in einem Jahr um 37 Prozent, der Grund ist KI