SimpleQA
Ein Benchmark, der Modellen kurze Sachfragen mit genau einer richtigen Antwort stellt und für sie viel schwieriger ist, als es klingt.
SimpleQA macht genau das, was der Name verspricht: Der Test stellt einem Modell kurze, eindeutige Sachfragen und prüft, ob die Antwort stimmt. Keine Denkrätsel, kein Code, keine Aufsätze. Nur Fragen dazu, wer was in welchem Jahr getan hat.
Modelle sind darin erstaunlich schlecht. Mitte 2026 lagen die besten Werte bei ungefähr 53 Prozent, obwohl dieselben Modelle Mathematikwettbewerbe auf Olympiadeniveau fast vollständig lösen können. Genau diese Lücke ist der Punkt. Ein Sprachmodell speichert Fakten als Nebenwirkung des Trainings zur Textvorhersage, nicht als Nachschlagetabelle. Mehr Denkfähigkeit in ein kleineres Modell zu packen, verdrängt tendenziell das Faktenwissen. Das ist das wichtigste Argument für Retrieval: Man gibt dem Modell das Quelldokument, statt seinem Gedächtnis zu vertrauen.