RHAE
La métrique de notation derrière ARC-AGI-3, qui mesure non seulement si un agent a résolu un niveau, mais aussi combien de mouvements il a nécessaires par rapport à un humain.
La plupart des benchmarks posent une question simple : le modèle a-t-il répondu correctement ? RHAE, abréviation de Relative Human Action Efficiency, en ajoute une deuxième : combien de mouvements cela a-t-il fallu ? Il compare le nombre d’actions qu’un agent a effectuées à un niveau par rapport à ce dont un joueur humain novice avait besoin, puis les agrège pour chaque niveau et environnement du test.
La raison pour laquelle c’est important est que la force brute est peu coûteuse pour une machine. Un agent peut gagner presque n’importe quel petit jeu en essayant des milliers de choses au hasard, et un score de réussite ou d’échec qualifierait volontiers cela de succès. RHAE ne le fait pas, ce qui en fait un meilleur indicateur de ce que les gens attendent réellement d’un agent : se rendre dans un endroit raisonnable sans passer un après-midi de calcul dans des impasses.