RHAE
Die Bewertungsmetrik hinter ARC-AGI-3, die nicht nur misst, ob ein Agent ein Level gelöst hat, sondern auch, wie viele Züge er im Vergleich zu einem Menschen benötigt.
Die meisten Benchmarks stellen eine einfache Frage: Hat das Modell alles richtig gemacht? RHAE, die Abkürzung für Relative Human Action Efficiency, fügt noch eine zweite Frage hinzu: Wie viel Mühe hat es gekostet? Es vergleicht die Anzahl der Aktionen, die ein Agent auf einem Level ausführte, mit der Anzahl der Aktionen, die ein menschlicher Spieler zum ersten Mal benötigte, und aggregierte diese dann für jedes Level und jede Umgebung im Test.
Der Grund dafür ist, dass rohe Gewalt für eine Maschine billig ist. Ein Agent kann fast jedes kleine Spiel gewinnen, indem er Tausende von Dingen aufs Geratewohl ausprobiert, und ein „Bestanden oder Nicht bestanden“-Score würde dies gerne als Erfolg bezeichnen. Bei RHAE ist dies nicht der Fall, was es zu einem besseren Ersatz für das macht, was die Leute eigentlich von einem Agenten wollen: an einen sinnvollen Ort gelangen, ohne einen Nachmittag lang in Sackgassen zu rechnen.