Quantizzazione
Rimpicciolire un modello memorizzando i suoi numeri in modo meno preciso, in modo che si adatti a hardware più piccolo con un piccolo costo in termini di qualità.
Un modello è, sotto, una grande pila di numeri. Per impostazione predefinita, questi numeri vengono memorizzati in modo abbastanza preciso, il che è accurato ma pesante: un modello che necessita di 120 gigabyte alla massima precisione non entrerà in un normale computer. La quantizzazione arrotonda questi numeri su una scala più grossolana, quindi ognuno occupa meno spazio. Lo stesso modello potrebbe quindi funzionare in 40 gigabyte o anche 12, a seconda di quanto lontano si arriva.
Il compromesso è la qualità e di solito è inferiore a quanto le persone si aspettano. Una quantizzazione moderata spesso non costa quasi nulla di misurabile, mentre una quantizzazione aggressiva inizia a manifestarsi come risposte più sciatte. Questa è l’unica tecnica che rende pratico l’esecuzione di modelli aperti sulla tua macchina, motivo per cui le versioni quantizzate della community di modelli di grandi dimensioni appaiono su Hugging Face entro pochi giorni dal rilascio.
-
Abbiamo eseguito un’IA locale su un processore economico di sei anni fa. Ecco cosa riesce davvero a fare.
-
Ollama rende silenziosamente i Mac più adatti ai modelli aperti
-
Il più grande modello di IA gratuito mai realizzato arriva il 27 luglio. Ecco cosa significa davvero «pesi aperti»
-
Un modello di IA capace che sta nel tuo telefono e funziona interamente offline