GGUF
Il formato file standard per l'esecuzione di modelli AI sul proprio computer, che racchiude il modello e le relative impostazioni in un unico file.
GGUF è il formato che incontrerai entro circa cinque minuti dal tentativo di eseguire un modello sul tuo computer. Raggruppa tutto ciò di cui llama.cpp ha bisogno in un unico file: i numeri del modello, il vocabolario e le impostazioni che descrivono come usarlo. Scarica un file, punta il programma su di esso e avrai un modello funzionante, non è richiesto alcun ambiente Python.
La maggior parte dei file GGUF che vedi sono quantizzati, il che significa che i numeri del modello sono stati memorizzati con meno precisione per ridurre il file. Nomi come Q4_K_M ti dicono quanto sia aggressiva quella compressione. I numeri più bassi indicano un file più piccolo e più veloce e risposte leggermente peggiori, e Q4 è il solito punto debole. Un modello da 30 miliardi di parametri che necessita di 60 GB con la massima precisione spesso rientra sotto i 20 GB come GGUF Q4.