CourionAI
DE
Newsletter
← Alle News
benchmark 3 Min. Lesezeit

Zwei Benchmark-Labore haben GPT-6 Astra gemessen und sind zu gegensätzlichen Schlussfolgerungen gekommen

Epoch AI platziert Astra in 50 Tests klar auf dem ersten Platz. Artificial Analysis bewertet es auf Augenhöhe mit seinem Vorgänger und hinter Claude Fable 5.1. Die einzige Zahl, die beide Seiten bemerkenswert finden, ist ARC-AGI-3.

Zwei identische Waagen, die denselben achtzackigen Stern wiegen und in entgegengesetzte Richtungen kippen

Eine Woche nach der Auslieferung von GPT-6 Astra durch OpenAI haben zwei unabhängige Bewertungslabore Gesamtbewertungen dafür veröffentlicht, und sie sind anderer Meinung. Epoch AI, das mehr als 50 einzelne Benchmarks zusammenfasst, belegt Astra mit 169 Punkten den ersten Platz von 267 Modellen. Artificial Analysis, das Wissen, Codierung und Textverständnis testet, erreicht 61 Punkte und liegt damit genau auf dem Niveau seines Vorgängers GPT-5.6 Sol und hinter Claude Fable 5.1 mit 66.

Beides sind sorgfältige, angesehene Outfits. Sie messen einfach nicht das Gleiche, und die Details unten erklären, warum. Die einzelnen Zahlen von Epoch zeigen, dass Astra in den Bereichen Mathematik, Wissen und Rätsel führend ist. Fable 5.1 erhält in fast jedem Codierungstest die Bestnote. Epoch hat bisher nur einen Codierungs-Score für Astra aufgezeichnet, und zwar aus einem Lauf mit mittlerem Argumentationsaufwand. Die beiden Schlagzeilen sind also weitgehend eine Frage der Gewichtung.

Ein paar konkrete Zahlen aus derselben Berichterstattung: Astras Halluzinationsrate beim AA-Omniscience-Test sinkt von 92 auf 51 Prozent, aber es verliert etwa 80 Elo-Punkte bei GDPval-AA v2 und rutscht bei Bankunterstützung und Long-Context-Argumentation ab. Es kostet zweieinhalb Mal mehr pro Texteinheit als Sol, erreicht jedoch bei Codierungsaufgaben die Punktzahl von Claude Fable 5 bei weniger als der Hälfte der Kosten pro Aufgabe, da es etwa ein Drittel der Schritte verwendet.

Was steckt dahinter

Das Ergebnis, über das alle reden, ist ARC-AGI-3, das ein Modell in unbekannte kleine Spielwelten entführt und nichts erklärt. Es muss die Regeln erarbeiten, indem es Dinge ausprobiert. Astra erreichte im neutralen Testmodus 62,7 Prozent, gegenüber 7,8 Prozent für Sol und 30,2 Prozent für Claude Opus 5. Auffälliger als die Punktzahl ist die Effizienz: In 96 Prozent der Levels benötigte Astra weniger Züge als der durchschnittliche menschliche Tester, der dieses Level löste.

Es gelangte dorthin, indem es seine eigene Kurzschrift erfand, eine algebraähnliche Notation zum Aufzeichnen von Objekten, Koordinaten und Plänen, denn alles, was es nicht in seine eigenen Notizen schreibt, vergisst es. Der Gründer des ARC-Preises, François Chollet, nennt dies „symbolische Weltmodellierung im Handumdrehen“ und weist darauf hin, dass für ein solches Verhalten früher ein ausgeklügeltes externes Gerüst erforderlich war. Jetzt ist es im Modell.

Zwei Vorbehalte sind wichtig. OpenAI berichtete bei demselben Test mit seinem eigenen System von 99,9 Prozent, und ARC Prize sagt, dass nur der Wert von 62,7 Prozent einen fairen Vergleich zwischen Anbietern ermöglicht. Dies ist derselbe Streit, der im August zu dem auffälligen Nvidia AVO-Ergebnis führte. Und Chollet weist ausdrücklich darauf hin, dass nichts davon ein Beweis für allgemeine Intelligenz ist: Die Spiele sind kurz, geschlossen und im Vergleich zu echten Aufgaben winzig. Er sagt jedoch, dass die Fortschritte etwa doppelt so schnell erfolgten wie erwartet, und er verschiebt seine AGI-Prognose früher als 2030.

Was das für Sie bedeutet: Behandeln Sie einzelne Schlagzeilen-Benchmark-Zahlen als Marketing, bis Sie wissen, was darin enthalten ist. Wenn Sie ein Modell auswählen, ist das einzige Ranking, das zählt, Ihr eigenes: Nehmen Sie drei Aufgaben, die Sie tatsächlich erledigen, führen Sie sie an zwei Modellen aus und vergleichen Sie sie. Das dauert zwanzig Minuten und übertrifft jede Bestenliste.

Quellen

Quellen: https://the-decoder.com/benchmarks-disagree-on-gpt-6-astra-but-its-human-beating-efficiency-on-arc-agi-3-pulls-chollets-agi-forecast-forward/

Nächster Artikel

ChatGPT macht wieder 55,5 Prozent des Chatbot-Webverkehrs aus, aber vor einem Jahr waren es noch 73 Prozent

Die August-Zahlen von Similarweb zeigen, dass ChatGPT seinen Anteil von 52,7 Prozent vor drei Monaten zurückgewinnt, während Gemini auf 25,6 Prozent zurückfällt. Claude wuchs innerhalb eines Jahres von 1,9 auf 9,3 Prozent. Apps werden nicht gezählt.

Vier überlappende Sprechblasen unterschiedlicher Größe, eine dominant und drei schrumpfend, gedruckt als konzentrische Ringe