Mixture of Experts
Un modello di progettazione in cui solo una piccola parte della rete viene eseguita per ogni richiesta, mantenendo i modelli di grandi dimensioni economici da utilizzare.
In un modello misto di esperti, la rete è suddivisa in molte sottoreti e un router ne seleziona solo alcune per ogni dato input. Ecco perché questi modelli vengono quotati con due numeri, ad esempio 284 miliardi di parametri totali e 13 miliardi attivi: il primo è quanto è grande il modello, il secondo è quanto di esso effettivamente esegue ogni volta.
L’effetto pratico è che si ottiene la conoscenza di un modello molto grande a un costo di esercizio più vicino a quello di uno piccolo. Quasi tutti i modelli aperti recenti, da DeepSeek a Inkling di Thinking Machines, sono costruiti in questo modo. Il compromesso era la memoria, dal momento che dovevi comunque caricare il tutto anche se ne usavi solo una parte. Runtime come Swiftlet ora eliminano questo problema trasmettendo in streaming gli esperti inutilizzati dal disco on demand.
-
I modelli stanno peggiorando apposta sui fatti?
-
Il nuovo modello gratuito di Nvidia non è il più intelligente. È semplicemente molto, molto veloce
-
Un modello da 80 miliardi di parametri ora funziona su un normale Mac con 4,3 GB di memoria e uno da 35 miliardi su un iPhone
-
AMD ha addestrato un modello completamente aperto sui propri chip, ma senza licenza commerciale
-
Il laboratorio di Mira Murati riduce il modello a meno di un terzo e perde un solo punto
-
I pesi di Kimi K3 sono finalmente pubblici: occupano 1,4 terabyte
-
Ollama rende silenziosamente i Mac più adatti ai modelli aperti
-
DeepSeek V4 diventa completamente stabile e i vecchi modelli si spengono oggi
-
Un piccolo modello aperto per programmare ha appena battuto rivali dieci volte più grandi, e puoi eseguirlo tu stesso
-
Il nuovo laboratorio di Mira Murati pubblica il suo primo modello, progettato per essere personalizzato
-
Soofi S: la Germania ha ora un modello di IA aperto in testa alle classifiche open source