AMD ha addestrato un modello completamente aperto sui propri chip, ma senza licenza commerciale
Instella-MoE-16B-A3B conta 16 miliardi di parametri, ma ne attiva soltanto 2,8 miliardi per token. AMD ha pubblicato pesi, dati e codice; i pesi restano però riservati alla ricerca.
AMD ha pubblicato Instella-MoE-16B-A3B, un modello linguistico addestrato da zero sui propri acceleratori Instinct MI300X e MI325X. Il dato chiave è la suddivisione: 16 miliardi di parametri complessivi, ma solo circa 2,8 miliardi attivi per ogni parola elaborata.
È il principio dei modelli mixture-of-experts: ogni input viene indirizzato soltanto ad alcuni sottosistemi specializzati, offrendo le conoscenze di un modello grande con costi di esecuzione vicini a quelli di uno più piccolo. AMD dichiara una media di 76,7 nei propri benchmark, davanti a Moonlight-16B-A3B (76,2) e OLMo-3-7B (70,1); la versione di ragionamento “Think” arriva a 73,22 dopo il post-training. Una variante con gating della multi-head latent attention e il sistema FarSkip-Collective avrebbero accelerato l’addestramento del 12,7% e ridotto del 39,2% il tempo al primo token. AMD ha reso pubblici i pesi di ogni fase, le miscele di dati, la configurazione e il codice di inferenza. Resta un limite decisivo: i pesi hanno licenza ResearchRAIL e sono destinati solo a ricerca e uso accademico, mentre il codice di training è MIT. Non è quindi un modello da inserire direttamente in un prodotto.
Cosa c’è dietro. Il vantaggio di Nvidia non dipende solo dal silicio, ma anche da CUDA e da anni di procedure di addestramento sviluppate per il suo ecosistema. AMD non può colmare questo divario con una scheda tecnica: deve dimostrare pubblicamente che un modello competitivo può essere addestrato dall’inizio alla fine su hardware AMD e con ROCm. Checkpoint intermedi e miscele di dati parlano soprattutto ai ricercatori, che influenzano l’hardware supportato dagli strumenti futuri. La licenza per la sola ricerca chiarisce l’obiettivo: conquistare credibilità, non vendere subito questo modello.
Cosa significa per te: probabilmente non userai Instella direttamente. L’effetto indiretto è più importante: un secondo fornitore credibile di hardware per l’addestramento è il modo più realistico per aumentare la concorrenza e ridurre i prezzi dell’IA. Per chi studia o fa ricerca, poter esaminare ogni fase del training e non soltanto i pesi finali è invece un’opportunità rara.
Fonti
Fonti: https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
Il numero di chip per l'IA nel mondo raddoppia all'incirca ogni nove mesi
Epoch AI stima circa 20 milioni di chip per l'IA oggi nei data center e quasi 200 milioni entro fine 2028. È il numero che spiega gran parte di ciò che accadrà nei prossimi anni.