Secondo quanto riferito, ByteDance, proprietario di TikTok, sta formando il modello di intelligenza artificiale più grande mai realizzato in Cina
Tre addetti ai lavori hanno riferito al Financial Times che ByteDance ha un modello con un massimo di diecimila miliardi di parametri in pre-allenamento, tre volte più grande di Kimi K3.
ByteDance, la società dietro TikTok, sta addestrando un modello di intelligenza artificiale con un massimo di dieci trilioni di parametri, secondo un rapporto del Financial Times che cita tre persone che hanno familiarità con il lavoro. Se il numero fosse valido, sarebbe circa tre volte più grande del Kimi K3 di Moonshot, attualmente il modello cinese più grande, e collocherebbe ByteDance nella stessa classe di peso del Mythos 5 di Anthropic, che secondo le stime del settore si colloca intorno agli otto trilioni. Anthropic non ha mai pubblicato i propri dati.
I parametri sono i numeri regolabili all’interno di un modello, le impostazioni che regola durante l’addestramento per codificare ciò che ha imparato. Più parametri significano più spazio per memorizzare i modelli, quindi il conteggio è un indicatore approssimativo della capacità. Ruvido è la parola chiave. La qualità dei dati, il metodo di addestramento e la durata dei treni modello contano almeno altrettanto, e il settore ha ripetutamente visto modelli più piccoli e meglio addestrati battere quelli più grandi e sciatti. Il trattamento dei parametri conta nello stesso modo in cui tratteresti le dimensioni del motore di un’auto: informativo, non decisivo.
Secondo quanto riferito, il modello è in fase di pre-addestramento, la prima e più impegnativa fase di calcolo, in cui lavora su enormi quantità di testo prima che avvenga qualsiasi messa a punto. Questa fase dura in genere dai tre ai sei mesi, quindi il rilascio sarebbe ancora lontano. Una fonte ha aggiunto un dettaglio degno di nota: ByteDance ha evitato la distillazione per oltre un anno. Distillare significa addestrare il tuo modello sui risultati del modello di qualcun altro, una scorciatoia che ti offre una qualità decente a buon mercato ed è diventata un punto dolente tra i laboratori. Scegliere di non usarlo è un’affermazione sul fare correttamente la cosa costosa, sebbene sia un’affermazione proveniente da una fonte anonima piuttosto che un fatto pubblicato.
Il quadro più ampio è un ritorno della scala grezza come leva competitiva. Secondo quanto riferito, il fondatore Zhang Yiming ha detto al team Seed di ByteDance, composto da 2.000 persone, di puntare a capacità di modello leader a livello mondiale nel lungo termine. Elon Musk afferma che xAI sta addestrando varianti di Grok a sei e dieci trilioni di parametri sul suo cluster Colossus 2. Dopo un paio d’anni in cui l’efficienza e la formazione intelligente erano la moda, diversi laboratori scommettono ancora una volta che il più grande, a costi enormi, vince ancora.
Cosa significa per te: per ora, niente di pratico. Questo modello non esiste come prodotto, potrebbe non essere mai rilasciato al di fuori della Cina e, se lo fosse, si troverebbe ad affrontare problemi di esportazione e regolamentazione nell’UE. Ciò che serve è la calibrazione. La prossima volta che leggerete che un modello ha un numero di parametri allettanti, ora saprete che il numero descrive la capacità, non la qualità, e che la domanda interessante è su cosa è stato addestrato e come. Se segui i modelli a peso aperto, tieni comunque d’occhio questo: ByteDance ha già rilasciato open weights in precedenza e un laboratorio cinese con dieci trilioni di parametri ripristinerebbe le aspettative per tutti.
Fonti
Fonti: https://www.ft.com/content/9b8383b1-a28d-4940-8c4e-2f0cd21556ef
Uno sviluppatore OpenAI afferma che questo sarebbe il momento giusto per ripulire le password esposte
L’avvertimento è schietto: qualsiasi cosa sensibile seduta in pubblico su GitHub o Pastebin verrà trovata molto più velocemente, perché i modelli sono abbastanza economici da poter essere cercati ovunque contemporaneamente.