Il nuovo modello gratuito di Nvidia non è il più intelligente. È semplicemente molto, molto veloce
Nemotron 3.5 Lightning corrisponde al gpt-oss-120b di OpenAI sui punteggi di intelligenza con un quarto dei parametri e produce circa 670 token al secondo, il più veloce nel suo gruppo di confronto.
Martedì Nvidia ha rilasciato Nemotron 3.5 Lightning, un modello open-weight che puoi scaricare ed eseguire da solo. Non sta cercando di essere il modello più intelligente nella stanza. Sta cercando di essere il più veloce e in questo senso attualmente vince la sua classe.
I numeri, tramite il sito di benchmarking indipendente Artificial Analysis: Lightning ottiene 24 punti nel loro Intelligence Index, un salto di nove punti rispetto al suo predecessore ed esattamente allo stesso livello del gpt-oss-120b di OpenAI, un modello circa quattro volte le sue dimensioni. Il punto in cui si allontana è la velocità. Lightning produce quasi 670 token al secondo, che è il throughput più alto misurato nell’intero confronto e quasi due volte più veloce del Gemini 3.5 Flash-Lite di Google a 386. Un tipico task di benchmark impiega circa mezzo minuto. Qwen3.6 35B A3B necessita di circa 3,5 minuti per lo stesso lavoro e Gemma 4 31B circa 5,8.
Il trucco è nell’architettura. Il fulmine ha 31,6 miliardi di parametri in totale, ma solo 3,6 miliardi di essi sono attivati per ogni passaggio. I parametri sono i numeri regolabili che un modello apprende durante l’addestramento e questa progettazione “mixture of experts” significa che il modello trasporta una grande quantità di conoscenza pagando solo il costo di calcolo di un piccolo modello ogni volta che risponde. Gestisce solo testo, legge fino a un milione di token di contesto contemporaneamente e viene fornito con la permissiva licenza OpenMDW-1.1.
Cosa c’è dietro
Nvidia discute questo caso da oltre un anno. In un articolo ampiamente discusso, i suoi ricercatori hanno affermato che modelli con 10 miliardi di parametri potrebbero gestire la maggior parte dei carichi di lavoro degli agenti allo stesso modo di modelli da dieci a trenta volte più grandi, a una frazione del costo. Finora Lightning è il prodotto più chiaro costruito su questo argomento. E i benchmark dell’agente lo confermano: su GDPval-AA v2 raggiunge un punteggio Elo di 824, battendo sia gpt-oss-120b a 800 che il più grande Nemotron 3 Super di Nvidia a 698.
Un giusto avvertimento, però. Esistono piccoli modelli più intelligenti. Qwen3.6 35B A3B ottiene un punteggio di 32 e Muse Glimmer di Meta 35, entrambi ben davanti ai 24 di Lightning. I modelli proprietari sono ancora più avanti. Lightning è progettato per un solo compito: compiere tanti piccoli passi in modo rapido ed economico, che è esattamente ciò che fa tutto il giorno un agente di intelligenza artificiale che svolge un lungo compito.
Cosa significa per te: Se non hai mai eseguito un modello personalmente, oggi non cambia nulla e va bene. Se stai già sperimentando, vale la pena dare un’occhiata, perché la velocità è ciò che rende gli agenti utilizzabili anziché lenti. I pesi sono su Hugging Face e diversi fornitori tra cui DeepInfra, Fireworks, Nebius e CoreWeave lo offrono già se preferisci non ospitarlo tu stesso. Ma non aspettatevi che ragioni come un frontier model. Non è a questo che serve.
Fonti
I ricercatori hanno trovato un modo per leggere i pensieri nascosti di Claude, ChatGPT e Gemini
Un articolo pubblicato su rubato-pensieri.com mostra come i blocchi di ragionamento crittografati dei modelli di frontiera potrebbero essere riprodotti in modelli fratelli più deboli e decodificati. Tutti e tre i fornitori hanno ora risolto il problema.