CourionAI
IT
Newsletter
← Glossario Termine

FP8

Un modo compatto per memorizzare i numeri di un modello utilizzando otto bit ciascuno, che dimezza l'utilizzo della memoria rispetto al vecchio standard a 16 bit.

Ogni peso in un modello è un numero e puoi scegliere quanti bit spendere su ciascuno di essi. Per anni il valore predefinito era 16 bit. FP8 ne usa otto, il che significa che lo stesso modello occupa metà della memoria e si muove attraverso il chip circa due volte più velocemente, a scapito di un po’ di precisione.

I chip moderni hanno hardware costruito appositamente per FP8, motivo per cui i modelli aperti più recenti come quelli di DeepSeek vengono spesso spediti direttamente in questo formato anziché essere compressi successivamente. Il problema è la compatibilità: non tutte le schede e non tutti i framework di servizio gestiscono tutte le varianti FP8, e questa discrepanza è una ragione comune per cui un modello che funziona bene su una GPU rifiuta di avviarsi su un’altra.