CourionAI
IT
Newsletter
← Glossario Termine

Quantizzazione

Rimpicciolire un modello memorizzando i suoi numeri in modo meno preciso, in modo che si adatti a hardware più piccolo con un piccolo costo in termini di qualità.

Un modello è, sotto, una grande pila di numeri. Per impostazione predefinita, questi numeri vengono memorizzati in modo abbastanza preciso, il che è accurato ma pesante: un modello che necessita di 120 gigabyte alla massima precisione non entrerà in un normale computer. La quantizzazione arrotonda questi numeri su una scala più grossolana, quindi ognuno occupa meno spazio. Lo stesso modello potrebbe quindi funzionare in 40 gigabyte o anche 12, a seconda di quanto lontano si arriva.

Il compromesso è la qualità e di solito è inferiore a quanto le persone si aspettano. Una quantizzazione moderata spesso non costa quasi nulla di misurabile, mentre una quantizzazione aggressiva inizia a manifestarsi come risposte più sciatte. Questa è l’unica tecnica che rende pratico l’esecuzione di modelli aperti sulla tua macchina, motivo per cui le versioni quantizzate della community di modelli di grandi dimensioni appaiono su Hugging Face entro pochi giorni dal rilascio.