Alibaba vuole un modello da dieci trilioni di parametri e i propri chip per addestrarlo
Alla conferenza di Apsara, il CEO Eddie Wu ha affermato che Alibaba sta pianificando un successore di Qwen da 5 a 10 trilioni di parametri e ha presentato il chip Zhenwu V900, che secondo la società triplica le prestazioni del suo predecessore.
Alla conferenza annuale Apsara di Alibaba Cloud a Hangzhou, l’amministratore delegato Eddie Wu ha presentato un piano diviso in due metà che hanno senso solo insieme. Il primo è un modello: un successore di Qwen con parametri compresi tra 5 e 10 trilioni, contro i circa 2,4 trilioni dell’attuale ammiraglia, quindi da due a quattro volte più grande. Qwen 4 è già in fase di addestramento, con Qwen 4.5 e Qwen 5 che puntano a quella scala. La seconda metà è l’hardware per eseguirlo. Alibaba ha presentato Zhenwu V900, un acceleratore AI della sua unità chip interna T-Head, che secondo l’azienda fornisce tre volte la potenza di elaborazione del suo predecessore, l’M890, e può essere collegato in cluster fino a 500.000 unità. La produzione di massa è prevista per il primo trimestre del 2027. Wu ha inoltre impegnato Alibaba Cloud a 20 gigawatt di capacità dei data center entro il 2032, estendendo una spesa triennale per l’intelligenza artificiale precedentemente annunciata di 53 miliardi di dollari. Le azioni di Hong Kong sono aumentate.
Cosa c’è dietro tutto questo?
I parametri sono i numeri regolabili all’interno di un modello, gli elementi che l’addestramento sintonizza, e un numero maggiore di essi generalmente significa una maggiore capacità di memorizzare e combinare modelli. Il rapporto con l’effettiva utilità è molto più vago di quanto suggerisca il numero del titolo, e la maggior parte dei laboratori ha trascorso gli ultimi due anni a ottenere di più dai modelli piuttosto che limitarsi a costruirne di più grandi. Quindi un salto a 10 trilioni è meglio letto come una dichiarazione di intenti sull’informatica, non come una promessa sulla qualità.
Il chip è l’annuncio più consequenziale. I controlli sulle esportazioni statunitensi hanno limitato i componenti Nvidia che le aziende cinesi possono acquistare e la risposta dell’industria cinese è stata quella di costruire alternative nazionali. Un obiettivo di cluster di 500.000 carte è il numero che conta lì, perché l’addestramento su scala di frontiera non riguarda tanto la velocità di ogni singolo chip quanto la possibilità di farne funzionare centinaia di migliaia come un’unica macchina senza che il tutto fallisca. Non è noto se il V900 funzioni effettivamente: le prestazioni dichiarate sono di Alibaba, non esiste un benchmarking indipendente e il componente non entrerà nella produzione di massa per altri due trimestri. La cifra dei 20 gigawatt è quella da tenere d’occhio, perché è l’elettricità, e non il silicio, a diventare il vero vincolo per questo settore.
Cosa significa per te: Niente che noterai quest’anno. Il motivo per prestare attenzione è che la famiglia Qwen è da dove provengono molti dei modelli scaricabili gratuitamente, quindi i piani di calcolo di Alibaba alla fine modellano ciò che chiunque può eseguire senza pagare un abbonamento. C’è anche un punto più tranquillo qui su come funzionano questi annunci. Un modello che non esiste, un chip che non è in produzione e una realizzazione che terminerà nel 2032 sono tutti piani reali e nessuno di questi è un prodotto. Vale la pena conservare le notizie della roadmap e le notizie spedite in diverse cartelle mentali.
Fonti
- Reuters tramite Investing.com: Alibaba progetta un modello di intelligenza artificiale con da 5.000 a 10.000 miliardi di parametri e svela un nuovo chip
- CNBC: le azioni Alibaba salgono con il nuovo chip AI e svelati i piani di costruzione del data center
- US News: Alibaba progetta un modello di intelligenza artificiale con da 5 a 10 trilioni di parametri
Un modello da 125 miliardi di parametri su una normale scheda grafica
Tim Dettmers ha presentato in anteprima la settimana open source del suo laboratorio: un framework di inferenza che esegue Qwen 3.8 Flash Next su una singola GPU da 24 GB, DeepSeek V4.1 su un MacBook e una tecnica di compattazione che, secondo lui, dimezza i costi degli agenti.