ARC-AGI-3
Ein Rätselbenchmark, der prüft, ob ein Modell Regeln erschließen kann, die es zuvor nie gesehen hat.
ARC-AGI-3 ist die dritte Generation eines Tests der ARC Prize Foundation und soll sich nicht auswendig lernen lassen. Bei einfachen Rasterrätseln muss die Regel aus wenigen Beispielen abgeleitet werden, die Trainingsdaten nicht ähneln. Menschen lösen sie recht leicht, Modelle lange Zeit nicht.
2026 stiegen die Werte deutlich. Sie hängen jedoch stark vom Harness ab: Dasselbe Modell erzielte mit unterschiedlichen Testgerüsten 7,8 und 38,3 Prozent. ARC Prize verlangt deshalb einen Standardaufbau, während Labore über mögliche Nachteile streiten. Die Ergebnisse zeigen echten Fortschritt, eignen sich aber schlecht für die genaue Rangfolge zweier Modelle.
-
Zwei Benchmark-Labore haben GPT-6 Astra gemessen und sind zu gegensätzlichen Schlussfolgerungen gekommen
-
Google sperrt sein eigenes Modell aus den Testfragen aus
-
Das gleiche Modell erreichte allein 30 Prozent und innerhalb des Agentensystems von Nvidia 100 Prozent
-
OpenAI und Anthropic streiten über einen Benchmark – und der Streit sagt mehr aus als die Punktzahlen