ARC-AGI-3
Ein Rätselbenchmark, der prüft, ob ein Modell Regeln erschließen kann, die es zuvor nie gesehen hat.
ARC-AGI-3 ist die dritte Generation eines Tests der ARC Prize Foundation und soll sich nicht auswendig lernen lassen. Bei einfachen Rasterrätseln muss die Regel aus wenigen Beispielen abgeleitet werden, die Trainingsdaten nicht ähneln. Menschen lösen sie recht leicht, Modelle lange Zeit nicht.
2026 stiegen die Werte deutlich. Sie hängen jedoch stark vom Harness ab: Dasselbe Modell erzielte mit unterschiedlichen Testgerüsten 7,8 und 38,3 Prozent. ARC Prize verlangt deshalb einen Standardaufbau, während Labore über mögliche Nachteile streiten. Die Ergebnisse zeigen echten Fortschritt, eignen sich aber schlecht für die genaue Rangfolge zweier Modelle.