← Glossar Begriff
GPQA
Ein schwieriger Benchmark mit naturwissenschaftlichen Fragen auf Expertenniveau, der das Schlussfolgern von KI prüft.
GPQA besteht aus naturwissenschaftlichen Fragen auf Hochschulniveau, die selbst für Fachleute wirklich schwierig und nicht durch eine einfache Websuche zu beantworten sind. Labore messen damit, wie gut ein Modell tatsächlich schlussfolgert, statt nur Fakten abzurufen.
Ein hoher GPQA-Wert ist ein Hinweis darauf, dass ein Modell anspruchsvolles Fachmaterial bewältigen kann. Wie jeder Benchmark misst er jedoch nur einen engen Ausschnitt und darf nicht mit allgemeiner Intelligenz gleichgesetzt werden.
Erwähnt in
-
Sakanas neues Model ist kein Model, sondern ein Dispatcher für andere Models
-
Mira Muratis Labor schrumpft sein Modell auf ein Viertel und verliert nur einen Punkt
-
Ein offenes deutsches Modell hatte Testantworten in den Trainingsdaten, und dank Offenheit wissen wir es
-
ChatGPTs neuer Sprachmodus kann gleichzeitig zuhören und sprechen