Il prossimo modello aperto di Alibaba è un'anteprima di Qwen 4
Qwen3.8-Flash-Next è un modello open-weight da 125 miliardi di parametri che ne utilizza solo sei miliardi per parola. Arriva oggi ed è costruito sull'architettura alla base della prossima famiglia Qwen 4.
Alibaba ha inserito un timer per il conto alla rovescia sulla sua piattaforma ModelScope il 25 agosto per Qwen3.8-Flash-Next, un nuovo modello a peso aperto rilasciato oggi, 26 agosto. Peso aperto significa che i file del modello stessi vengono pubblicati, in modo che chiunque possa scaricarli ed eseguirli anziché raggiungere il modello solo attraverso un’interfaccia a pagamento. La parte interessante non è il modello ma ciò che prevede: Alibaba afferma che è costruito sull’architettura della famiglia Qwen 4 di prossima generazione.
Le specifiche riportate, raccolte dalla comunità dall’elenco ModelScope prima del rilascio: circa 125 miliardi di parametri totali più circa 51 miliardi in un componente di incorporamento N-gram separato, con solo circa 6 miliardi di parametri attivi per ogni dato token. I parametri sono i numeri interni che un modello apprende durante l’addestramento e un token è più o meno una parola o un frammento di parola. Questo divario tra 125 miliardi archiviati e 6 miliardi utilizzati è la caratteristica distintiva di un progetto misto di esperti, in cui il modello mantiene molte sottoreti specializzate e risveglia solo le poche rilevanti per ogni parte di testo. Il modello è multimodale, nel senso che gestisce immagini e testo, e secondo quanto riferito introduce due modifiche architettoniche con i nomi inutili di architettura ibrida GDN e Qwen Sparse Attention. I team di tooling, incluso Unsloth, hanno preparato il supporto day-zero e sono previste sia una versione standard che una versione FP8, essendo FP8 un formato numerico compresso che dimezza all’incirca l’utilizzo della memoria.
Che cosa sta realmente succedendo qui: il trucco della combinazione di esperti è il motivo per cui un modello così grande merita l’attenzione di chiunque al di fuori di un data center. L’esecuzione di un modello denso da 125 miliardi di parametri richiede hardware serio; gestirne uno che attiva solo 6 miliardi alla volta è molto più vicino a ciò che un desktop ben attrezzato può gestire, pur mantenendo l’ampiezza della conoscenza che deriva dalle dimensioni reali. Questa è la stessa scommessa che quasi tutti i laboratori stanno facendo. Rilasciare un’anteprima di un’architettura inedita come pesi aperti è anche una strategia deliberata piuttosto che una generosità: fa sì che l’ecosistema di strumenti open source, le persone che scrivono il software che rende i modelli effettivamente eseguibili, lavorino sul supporto di Qwen 4 prima che Qwen 4 esista.
Cosa significa per te: se usi l’intelligenza artificiale attraverso una finestra di chat, questo non cambia nulla oggi, anche se alimenta la tendenza generale del miglioramento delle opzioni gratuite. Se esegui modelli sul tuo computer, questa è la versione da tenere d’occhio questa settimana, con l’onesto avvertimento che tutte le specifiche di cui sopra provengono da una pagina teaser e da un’analisi della community piuttosto che da una scheda modello pubblicata, e che il supporto iniziale in strumenti come Ollama e LM Studio di solito richiede alcuni giorni per stabilizzarsi. Attendi i primi risultati dei benchmark indipendenti prima di riorganizzare la tua configurazione attorno ad essi.
Fonti
I dati sull’occupazione di Stanford rivelano che il divario tra i giovani lavoratori continua ad ampliarsi
L’aggiornamento di agosto del documento sulle Canarie nel Coal Mine colloca l’occupazione dei giovani tra i 22 e i 25 anni in posti di lavoro esposti all’intelligenza artificiale del 19% al di sotto dei loro coetanei, rispetto al 13%. I lavoratori più anziani non mostrano tale divario.