CourionAI
IT
Newsletter
← Tutte le notizie
nvidia 3 min di lettura

Il nuovo rack di Nvidia è 10x, 30x o 67x migliore, a seconda di chi conta

Nuovi numeri per Vera Rubin NVL72 sono arrivati ​​questa settimana da Nvidia e da SemiAnalysis, e i moltiplicatori variano notevolmente. Lo spread non è disonestà, è una lezione su come vengono costruite le pretese di efficienza.

Tre righelli di diverse lunghezze e scale appoggiati allo stesso alto blocco

Questa settimana sono arrivati ​​nuovi dati sulle prestazioni di Vera Rubin NVL72 di Nvidia, il sistema di dimensioni rack che gestirà gran parte dell’intelligenza artificiale mondiale nei prossimi due anni. Nvidia afferma che offre fino a 30 volte il throughput per megawatt del GB300 NVL72 che sostituisce e un costo per milione di token fino a 35 volte inferiore, misurato su un carico di lavoro di codifica agentico costruito su DeepSeek V4-Pro. Gli analisti di SemiAnalysis hanno pubblicato il proprio sguardo sullo stesso hardware con il titolo di prestazioni 67 volte migliori per dollaro. A luglio, CoreWeave ha misurato 10 volte i token per megawatt rispetto a un vecchio rack Blackwell su un modello diverso. L’amministratore delegato di Nvidia ne ha già parlato 3 volte in pubblico.

La produttività per megawatt è il numero che conta di più in questo momento, perché i data center AI sono limitati dall’elettricità disponibile piuttosto che dal denaro o dallo spazio. Dieci, trenta e sessantasette sono numeri molto diversi e nessuno di loro è una bugia. Differiscono perché ciascuno viene misurato in un ambiente diverso. La cifra 30x di Nvidia si applica a 160 token al secondo per utente, ovvero la velocità sperimentata da ogni singolo utente o agente mentre il modello funziona. Spingi l’obiettivo di reattività verso l’alto o verso il basso e il rapporto si sposta, a volte molto, perché un chip che può servire molti utenti lenti contemporaneamente si comporta in modo diverso da uno a cui viene chiesto di servire pochi utenti molto veloci. CoreWeave ha effettuato un confronto con una generazione precedente, su un modello diverso, a luglio. E i numeri di Nvidia sono stati misurati da Nvidia, su una suite di benchmark di SemiAnalysis, con la revisione di SemiAnalysis ancora in sospeso.

Cosa c’è dietro tutto questo?

C’è un’utile abitudine sepolta qui. Quando una richiesta di hardware o modello arriva come un singolo moltiplicatore, tre domande di solito la riducono a qualcosa di significativo: rispetto a cosa, in quale contesto e misurata da chi. In questo caso, rispetto alla generazione immediatamente precedente, ci sono due passi indietro, a cui mira la reattività, sia da parte del venditore che da parte di un estraneo. Il miglioramento di fondo è reale, tutti coloro che hanno misurato questo hardware concordano sul fatto che il guadagno è ampio e che per i fornitori di intelligenza artificiale si traduce direttamente in un’inferenza più economica, ovvero il costo di gestione per rispondere alle domande. Semplicemente non si traduce in un numero.

Cosa significa per te: Indirettamente, questo è il motivo per cui il prezzo dell’intelligenza artificiale continua a scendere. L’hardware che produce molte volte più testo per unità di elettricità è il motivo principale per cui una richiesta che due anni fa costava centesimi ora costa frazioni di un centesimo e che si traduce in ciò che si paga per un abbonamento o una chiamata API. Direttamente, la cosa trasferibile è l’abitudine. La prossima volta che una pagina di prodotto ti dice che qualcosa è “10 volte più veloce”, chiedi rispetto a cosa, con quale impostazione e chi lo ha misurato. Quella singola domanda separa un miglioramento reale da un grafico ben scelto in quasi tutti gli annunci sull’intelligenza artificiale che leggerai quest’anno.

Fonti

Fonti: https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

Articolo successivo

L'azienda dietro i modelli GLM ha appena raccolto 5 miliardi di dollari in un giorno

Z.AI, già Zhipu, ha raccolto circa 5 miliardi di dollari attraverso un collocamento di azioni a sconto e obbligazioni convertibili zero coupon. Il 60% è destinato alla prossima generazione di modelli GLM e ai computer per addestrarli.

Una fontana arcuata di monete che si riversa in un ampio contenitore già traboccante