CourionAI
IT
Newsletter
← Glossario Termine

RHAE

La metrica del punteggio dietro ARC-AGI-3, che misura non solo se un agente ha risolto un livello ma quante mosse ha avuto bisogno rispetto a un essere umano.

La maggior parte dei benchmark pone una semplice domanda: il modello ha funzionato correttamente? RHAE, abbreviazione di Relative Human Action Efficiency, ne aggiunge una seconda: quanto lavoro ci è voluto? Confronta il numero di azioni spese da un agente su un livello con quelle necessarie a un giocatore umano per la prima volta, quindi lo aggrega su ogni livello e ambiente nel test.

Il motivo per cui questo è importante è che la forza bruta è economica per una macchina. Un agente può vincere quasi ogni piccolo gioco provando migliaia di cose a caso, e un punteggio superato o fallito lo definirebbe felicemente un successo. RHAE no, il che lo rende un proxy migliore per ciò che le persone realmente vogliono da un agente: arrivare in qualcosa di sensato senza sprecare un pomeriggio di calcolo in vicoli ciechi.