Il GLM-5.3-Flash di Z.ai si avvicina all'Opus a un decimo del prezzo
Un modello open-weight da 320 miliardi di parametri con una finestra di contesto da un milione di token, rilasciato con licenza MIT a 0,15 dollari per milione di token di input. Prima è rimasta una settimana nelle classifiche sotto falso nome.
Il laboratorio cinese Z.ai ha rilasciato GLM-5.3-Flash, il modello di codifica più economico mai spedito e il primo della famiglia GLM-5 a gestire immagini e video in modo nativo anziché tramite un convertitore integrato. I pesi sono su Hugging Face con una licenza MIT, che è permissiva quanto lo sono le licenze software, e la versione ospitata costa $ 0,15 per milione di token di input e $ 0,50 per milione di token di output.
Le specifiche: 320 miliardi di parametri totali con 18 miliardi attivi per token e una finestra di contesto di 1.048.576 token. I parametri sono i numeri interni che un modello apprende durante l’addestramento; un token è grosso modo un frammento di parola; la finestra di contesto è la quantità di testo che il modello può tenere a mente in una volta, e un milione di token è comodamente un lungo romanzo o una base di codice molto grande. Il divario tra 320 miliardi archiviati e 18 miliardi utilizzati è un disegno misto di esperti, in cui il modello mantiene molte sottoreti specializzate e risveglia solo una manciata rilevante per ciascuna parte di testo.
Sui benchmark, Z.ai riporta 84,3 su Terminal-Bench 2.1 contro 85,0 di Claude Opus 4.8 e 87,4 di GPT-5.6 Terra, e 63,4 su DeepSWE v1.1 contro 46,2 di GLM-5.2. Test indipendenti di Artificial Analysis gli hanno assegnato un punteggio di 57 nel loro indice di intelligenza, ben al di sopra della media di 27 per modelli open-weight di dimensioni comparabili, sebbene sia lento con 48,7 token di output al secondo e notevolmente prolisso. La visione è il punto debole: è dietro al Gemini 3.7 Flash nei benchmark delle immagini.
Cosa sta succedendo qui: il modello ha trascorso la sua prima settimana funzionando in modo anonimo come “Ox Alpha” su OpenCode e OpenRouter, che è un modo ormai comune per ottenere reazioni oneste prima che il marchio entri in azione. Più interessante è dove è stato eseguito. Z.ai afferma che l’intera anteprima è stata pubblicata su chip AI cinesi prodotti a livello nazionale, con un motore di servizio personalizzato che riporta un miglioramento end-to-end triplo. Questa è la parte che vale la pena guardare. La storia del controllo delle esportazioni ha sempre presupposto che i laboratori cinesi abbiano un collo di bottiglia sull’hardware Nvidia, e questo è un laboratorio che afferma di aver spedito un modello quasi di frontiera senza di esso. Tratta l’affermazione come riportata anziché verificata e ricorda che tutti i numeri di riferimento principali sono quelli di Z.ai con configurazioni per test che differiscono.
Cosa significa per te: se usi l’intelligenza artificiale attraverso una finestra di chat, l’effetto pratico è una pressione al ribasso sui prezzi ovunque, che alla fine ti raggiunge. Se paghi per l’accesso all’API, questo è davvero economico per la qualità: circa $ 0,045 per attività al livello scontato. Se speravi di eseguirlo a casa, temperalo. Il checkpoint FP8 predefinito è di circa 306 GiB prima della memoria di cui il modello ha bisogno durante l’esecuzione e l’attuale percorso di servizio richiede chip Nvidia Hopper o più recenti, quindi questo è un modello a otto nodi GPU piuttosto che uno desktop. Per la maggior parte delle persone l’API è la porta realistica e la licenza aperta è importante soprattutto perché significa che nessuno potrà portarti via il modello in seguito.
Fonti
Google ha creato un minuscolo modello di intelligenza artificiale che legge le tracce di glucosio
GlucoFM ha 720.000 parametri, circa un milionesimo delle dimensioni di un modello di chat, e batte i rivali più grandi nell'individuare modelli metabolici nei dati del monitoraggio continuo del glucosio.