Qwen3.8-Max di Alibaba ha impiegato 16 giorni a scrivere uno strumento da solo e i pesi verranno resi pubblici la prossima settimana
Alibaba ha pubblicato dettagli completi e benchmark per Qwen3.8-Max, un modello da 2,4 trilioni di parametri creato per attività che durano giorni. Cinque casi di studio riguardano la codifica autonoma, la riproduzione su carta, la progettazione di chip e un anno simulato di vendita al dettaglio online.
Alibaba ha tracciato il quadro completo di Qwen3.8-Max, il modello di punta presentato in anteprima a metà luglio, e questa volta arrivano i numeri e i case study. Il modello ha 2,4 trilioni di parametri totali con 95 miliardi attivi per query e il team afferma che i pesi aumenteranno su Hugging Face e ModelScope la prossima settimana. Ciò lo renderebbe il primo modello della classe Qwen-Max che puoi scaricare ed eseguire da solo.
Il tono non è risposte migliori a singole domande. È ciò che nel settore viene definito lavoro a lungo orizzonte, ovvero attività che durano giorni e si susseguono attraverso centinaia di passaggi. Alibaba ha pubblicato cinque casi di studio per chiarire il punto. Nel primo, il modello ha impiegato 16 giorni per creare uno strumento da riga di comando chiamato oh-my-cli: ha trasformato le richieste degli utenti in arrivo in problemi GitHub, le ha assegnate a se stesso, ha scritto il codice, ha eseguito i test e ha ripetuto. Al 30 luglio aveva registrato 265 commit, 127 richieste pull e 151 problemi senza che nessuno toccasse la tastiera. In un altro, dato solo un documento di ricerca e nessun codice iniziale, ha riprodotto tutti e sei i risultati del documento in circa 125 ore di calcolo, quindi ha testato 18 idee proprie e ha battuto il metodo originale su un benchmark di matematica di 2,7 punti.
Altre due esecuzioni di pianificazione dei test anziché di codifica. Quando è stato chiesto di progettare un circuito crittografico, il modello è partito da un progetto funzionante ma eccessivo utilizzando 8.298 porte logiche, gli elementi di commutazione di base su un chip, ed è arrivato a 678 in circa 500 iterazioni. Dopo il passaggio di un layout automatizzato, l’area fisica si è ridotta dell’81%. In una simulazione di un intero anno fiscale di vendita al dettaglio online, basata su dati anonimi di Taobao e Tmall, si è iniziato con 100.000 yuan, si è negoziato con i fornitori in un linguaggio semplice, si sono gestiti resi e tifoni, si sono individuati truffatori nascosti nel pool di fornitori e si è concluso con 416.252 yuan.
Cosa c’è dietro a tutto ciò. Alibaba attribuisce il merito del salto di qualità al modo in cui ha eseguito l’apprendimento per rinforzo, la fase di formazione in cui un modello viene premiato per i buoni risultati piuttosto che per le risposte corrette. Invece di esercitarsi su singole attività, si è esercitato in circa 4.000 ambienti diversi coprendo flussi di lavoro di più giorni, cartelle di progetti nidificati e diversi framework di agenti. Il suo indice di punteggio interno su dieci benchmark è aumentato da 0,474 a 0,725, per poi scendere leggermente oltre quel punto. Vale la pena mantenere le aspettative con i piedi per terra: tutti questi numeri sono autoportati da corse interne, nessuno al di fuori dell’azienda li ha verificati e un modello che quadruplica il denaro virtuale in una simulazione non ha gestito un vero e proprio negozio. Anche il contesto competitivo conta. Il Kimi K3 di Moonshot ha aperto i battenti il 27 luglio e test indipendenti hanno confermato le sue affermazioni.
Cosa significa per te: niente oggi, a meno che non noleggi la GPU a ore. Un modello da 2,4 trilioni di parametri non è qualcosa che puoi eseguire su un laptop, quindi in pratica la maggior parte delle persone lo potrà soddisfare tramite un servizio ospitato. Ciò che è veramente utile è la scelta della compatibilità: Qwen3.8-Max parla sia i formati API di OpenAI che di Anthropic, quindi si inserisce in Claude Code, Codex e strumenti simili modificando un’impostazione. Se paghi già per gettone per un agente che svolge lavori lunghi, questa è una vera leva di prezzo che vale la pena testare una volta che i pesi arrivano. In caso contrario, il segnale da trarre è che i campi aperti e quelli chiusi sono ormai più o meno a un passo di distanza anziché a una generazione.
Fonti
Due gruppi di ricerca hanno risolto lo stesso problema aperto con lo stesso modello di intelligenza artificiale, a tre ore di distanza
Uno studente di dottorato del MIT e due professori hanno risolto indipendentemente la stessa domanda sulla crittografia quantistica utilizzando GPT-5.6 Sol Ultra e hanno pubblicato i loro documenti su arXiv entro tre ore l'uno dall'altro. Ciò solleva una domanda imbarazzante su cosa significhi oggi la scoperta indipendente.