Inferenza
L'esecuzione di un modello IA addestrato per ottenere una risposta, distinta dall'addestramento iniziale.
L’inferenza è l’atto di usare un modello IA addestrato, fornendogli un prompt e ottenendo una risposta. È distinta dall’addestramento, il processo unico e molto più costoso con cui vengono creati inizialmente i pesi del modello.
La distinzione aiuta a comprendere i costi dell’IA. Addestrare un modello di frontiera può richiedere mesi di lavoro e un’enorme potenza di calcolo, ma quel costo viene sostenuto una volta sola. L’inferenza si paga ogni volta che qualcuno usa il modello: per questo i fornitori la misurano, di solito per token, e per questo sono tanto importanti i miglioramenti di efficienza che la rendono più rapida o economica.
È anche il motivo per cui eseguire localmente modelli più piccoli è pratico: persino un buon portatile può gestire l’inferenza per molte attività, anche se non avrebbe mai potuto addestrare da sé il modello.
-
AMD e Cerebras collaborano per far arrivare più velocemente le risposte dell’IA
-
I prossimi chip IA di Nvidia ricaverebbero dieci volte più lavoro dalla stessa energia
-
Kimi K3 è diventato troppo popolare: Moonshot sospende i nuovi abbonamenti
-
DeepSeek cerca nuovi miliardi poche settimane dopo il primo round: l'IA economica costa cara
-
DeepSeek progetta un proprio chip per l'IA e raccoglie per la prima volta capitali esterni