CourionAI
FR
Newsletter
← Glossaire Terme

FP8

Une manière compacte de stocker les numéros d'un modèle en utilisant huit bits chacun, ce qui réduit de moitié l'utilisation de la mémoire par rapport à l'ancienne norme 16 bits.

Chaque poids d’un modèle est un nombre et vous pouvez choisir le nombre de bits à dépenser pour chacun. Pendant des années, la valeur par défaut était de 16 bits. FP8 en utilise huit, ce qui signifie que le même modèle prend la moitié de la mémoire et se déplace dans la puce environ deux fois plus vite, au prix d’un peu de précision.

Les puces modernes ont un matériel spécialement conçu pour FP8, c’est pourquoi les modèles ouverts les plus récents tels que celui de DeepSeek sont souvent expédiés directement dans ce format plutôt que d’être compressés par la suite. Le problème est la compatibilité : toutes les cartes et tous les frameworks de service ne gèrent pas toutes les variantes du FP8, et cette inadéquation est une raison courante pour laquelle un modèle qui fonctionne correctement sur un GPU refuse de démarrer sur un autre.