Distillazione
Addestrare un modello più piccolo sulle risposte di uno grande, così che ne copi il comportamento a basso costo.
Costruire un modello di punta da zero costa una fortuna. La distillazione è la scorciatoia: si prende un modello esistente e costoso, gli si pongono enormi quantità di domande e si addestra un nuovo modello più piccolo sulle sue risposte. Il modello piccolo non vede mai i dati di addestramento originali né i pesi, solo gli output, ma ne assorbe una quantità sorprendente di comportamento. Il risultato è un modello molto più economico da costruire e da far girare, a costo di un po’ di qualità.
Fatta all’interno di una stessa azienda è prassi normale, ed è così che nascono la maggior parte dei modelli piccoli e veloci che usate. Fatta fra aziende diverse diventa subito controversa, perché consente a un laboratorio di assorbire il costoso lavoro di un rivale attraverso l’interfaccia pubblica. Oggi quasi tutti i fornitori la vietano nelle condizioni d’uso, diversi hanno accusato i concorrenti di praticarla comunque, e i laboratori che la evitano tendono a dirlo ad alta voce.
-
I ricercatori hanno trovato un modo per leggere i pensieri nascosti di Claude, ChatGPT e Gemini
-
Google ha trasformato un modello finito in uno molto più veloce e ha pubblicato la ricetta
-
Secondo quanto riferito, ByteDance, proprietario di TikTok, sta formando il modello di intelligenza artificiale più grande mai realizzato in Cina
-
I pesi di Kimi K3 sono finalmente pubblici: occupano 1,4 terabyte
-
Nadella: l'IA si paga due volte, prima con il denaro e poi con le proprie conoscenze
-
Dove finisce la rete, inizia la piccola IA: modelli minuscoli salvano vite offline