CourionAI
IT
Newsletter
← Tutte le notizie
research 2 min di lettura

METR propone un nuovo modo per chiedere se un agente IA costa davvero meno di una persona

Il laboratorio propone l’orizzonte di spesa: il budget oltre il quale una persona diventa più conveniente di un agente sulla stessa ottimizzazione. Nel primo test, l’incrocio era tra zero e 3.000 dollari.

Illustrazione risografica di due curve che si incrociano su una griglia tenue sopra una fila di monete impilate

La maggior parte dei benchmark risponde sì o no: il modello ha risolto il compito? METR, laboratorio non profit che valuta modelli di frontiera per i grandi laboratori, propone una metrica per una domanda più utile: a quale budget una persona diventa l’acquisto migliore? La chiama orizzonte di spesa ed è l’importo al quale il miglioramento prodotto da un agente equivale a quello ottenuto da una persona con lo stesso denaro.

Il caso è NanoGPT speedrun, una competizione comunitaria per addestrare un piccolo modello il più rapidamente possibile. È adatta perché gli esseri umani l’hanno già ottimizzata molto. METR ha misurato prima il costo del progresso umano: ogni punto percentuale aggiuntivo richiede circa 2.500 dollari di lavoro. Poi ha eseguito agenti e tracciato il punteggio rispetto alla spesa. Dopo oltre 10.000 dollari, stima l’orizzonte tra zero e 3.000 dollari. In parole semplici: su questo problema gli agenti competono con le persone per piccoli budget; le persone passano avanti quando la spesa diventa seria.

Conta meno il risultato della forma della misura. I benchmark esistenti indicano spesso superato o fallito contro una persona che ha lavorato otto o quaranta ore, perdendo informazioni e richiedendo molte prove per distinguere due modelli. Una curva continua tra punteggio e dollari è statisticamente più precisa, include il calcolo consumato dall’agente e può concentrarsi su problemi già ottimizzati invece che su esercizi. METR chiarisce i limiti: un solo problema, prove preliminari e stima approssimativa dei costi umani. Un singolo orizzonte non è un verdetto sulla capacità di ricerca dell’IA.

Cosa significa per te: Se sei stanco di punteggi incomprensibili, questa metrica si può ragionare perché è espressa in denaro. Se usi agenti nel lavoro, la lezione pratica è che offrono spesso ottimo valore all’inizio e peggiorano quando il problema diventa profondo e costoso. Pianificare il budget così è più utile che considerarli sempre più economici. Aspettati che i laboratori pubblichino curve invece di singoli punteggi: una volta misurato il costo con chiarezza, è difficile tornare indietro.

Fonti

Fonti: https://metr.org/blog/2026-07-21-expenditure-horizon/

Articolo successivo

Nvidia potrebbe garantire 250 miliardi di dollari perché OpenAI affitti un data center

Secondo il Wall Street Journal, Nvidia discute una garanzia di circa 250 miliardi per un campus da 10 gigawatt in Ohio che OpenAI affitterebbe. Che un venditore di chip garantisca l’affitto del cliente è insolito e mostra chi porta il rischio del boom.

Illustrazione risografica di un’immensa sala server bassa sostenuta da un’enorme struttura di acciaio, con torri di raffreddamento in lontananza