CourionAI
IT
Newsletter
← Tutte le notizie
benchmarks 3 min di lettura

Karpathy ha trasformato un paragrafo di Tolkien in una scena 3D per dieci dollari e l'ha definito un vibe check

Andrej Karpathy ha dato a Claude Opus 5 l'apertura de Il Signore degli Anelli e ha ottenuto 5.500 righe di codice browser 3D funzionante in due ore. Sta attento a dire che questo non è un benchmark, che è la parte più utile della storia.

Una catena montuosa di carta in miniatura che si innalza da un libro aperto su una scrivania, illuminata da un'unica piccola lampada da palcoscenico, con una manovella e una lente d'ingrandimento accanto

Andrej Karpathy ha consegnato a Claude Opus 5 un singolo paragrafo dall’apertura de Il Signore degli Anelli e ha chiesto una scena 3D. Due ore e circa un milione di token dopo, per un valore di circa dieci dollari, il modello ha prodotto 5.500 righe di codice che rendono la scena in Three.js, una libreria JavaScript per la grafica 3D che viene eseguita in un normale browser. Ha pubblicato la fonte in modo che altri possano riprodurla e modificarla. Eleven Labs ha fornito l’audio. Il modello ha posizionato e animato tutto il resto da solo.

La ragione dichiarata da Karpathy per fare questo è che i vecchi test informali sono logori. Il più noto è il test del pellicano di Simon Willison, che chiede a un modello di disegnare un SVG di un pellicano in sella a una bicicletta. Il soggetto è stato scelto perché è abbastanza assurdo che non ne esista un’immagine completa nei dati di addestramento, quindi il modello deve comporlo. Tale richiesta è stata più o meno risolta. Prima di ciò, Microsoft aveva fatto disegnare a GPT-4 un unicorno in TikZ nel suo documento Sparks of AGI del 2023 e aveva indicato il risultato come prova del ragionamento spaziale, in un momento in cui GPT-4 aveva sempre visto solo testo.

Un difetto è emerso immediatamente. Il modello non può guardare la propria uscita video. Ha controllato il suo lavoro tramite screenshot fissi, motivo per cui parti dell’animazione sono risultate errate. Karpathy definisce il tutto rozzo ma divertente e sottolinea che nessuno costruirebbe manualmente un mondo in questo modo, mentre con un modello non costa quasi nulla. Vede un percorso verso mondi di gioco generati su richiesta, in cui entri come personaggio secondario.

Cosa c’è dietro? Esistono due modi per misurare un modello e rispondono a domande diverse. Un benchmark è un insieme fisso di attività con risposte corrette note, quindi i punteggi possono essere confrontati tra modelli e nel tempo. Il suo punto debole è che una volta che un benchmark è pubblico, si diffonde nei dati di addestramento e i laboratori lo ottimizzano, quindi un punteggio elevato smette di avere il significato che aveva in passato. Un vibe check è l’opposto: una persona dà al modello qualcosa di strano e guarda cosa ritorna. Non può essere paragonato, non può essere valutato, ed è banalmente scelto con cura, dal momento che non si vedono mai i quattro tentativi falliti. Ciò che rileva è una cosa che i benchmark non riescono a cogliere, vale a dire se un modello può tenere insieme un compito lungo e sottospecificato senza cadere a pezzi. Karpathy è esplicito nel dire che si tratta di un vibe check e non di un benchmark, e che l’onestà vale più della demo.

Cosa significa per te: trattalo come una lezione di lettura piuttosto che come un prodotto. Quando vedi un’impressionante demo di intelligenza artificiale, le domande utili sono quanti tentativi sono stati necessari, chi ha scelto l’attività e se potresti rieseguirla tu stesso. Karpathy, pubblicando il codice, supera l’ultimo test, che è più di quanto riesce a gestire la maggior parte delle demo. La conclusione pratica per chiunque utilizzi questi strumenti quotidianamente è la modalità di fallimento: il modello ha sbagliato cose proprio laddove non riusciva a vedere il risultato del proprio lavoro. Questa è la regola generale. Laddove un modello non può controllare il suo output, controllalo tu stesso.

Fonti

Fonti: https://karpathy.ai/lotr-movie/

Articolo successivo

MiniMax ha rilasciato i pesi per il suo modello video H3 e un modello aperto ora è in cima alla classifica video per la prima volta

MiniMax ha pubblicato i pesi per H3, un modello video da 33 miliardi di parametri che gestisce insieme testo, immagini, video e audio. L'analisi artificiale lo colloca al primo posto nell'editing video. Due componenti sono rimasti chiusi e la licenza ha un limite alle entrate.

Un caveau di una banca aperto con una lunga striscia di pellicola che si srotola su un banco da lavoro, mentre due piccole scatole con lucchetto restano chiuse su uno scaffale all'interno