Quantification
Réduire un modèle en stockant ses numéros avec moins de précision, afin qu'il s'adapte à du matériel plus petit à un faible coût en qualité.
Un modèle est, en dessous, une très grande pile de chiffres. Par défaut, ces chiffres sont stockés de manière assez précise, ce qui est précis mais lourd : un modèle qui nécessite 120 Go en pleine précision ne tiendra pas sur un ordinateur normal. La quantification arrondit ces nombres à une échelle plus grossière, de sorte que chacun prend moins de place. Le même modèle pourrait alors fonctionner en 40 gigaoctets, voire 12, selon la distance parcourue.
Le compromis est la qualité, et elle est généralement inférieure à ce que les gens attendent. Une quantification légère ne coûte souvent presque rien de mesurable, tandis qu’une quantification agressive commence à apparaître comme des réponses plus bâclées. C’est la seule technique qui rend pratique l’exécution de modèles ouverts sur votre propre machine, c’est pourquoi des versions quantifiées communautaires de grands modèles apparaissent sur Hugging Face quelques jours après une sortie.
-
Nous avons fait tourner une IA locale sur un processeur d’entrée de gamme vieux de six ans. Voici ce qu’elle sait vraiment faire.
-
Ollama améliore discrètement l’exécution des modèles ouverts sur Mac
-
Le plus grand modèle d’IA gratuit à ce jour arrive le 27 juillet. Mais que signifie vraiment « poids ouverts » ?
-
Un modèle d’IA performant qui tient sur votre téléphone et fonctionne entièrement hors ligne