paramètres actifs
La partie des paramètres d'un modèle réellement activée pour chaque mot produit, bien plus petite que le total dans une architecture à mélange d'experts.
Les paramètres sont les nombres ajustables à l’intérieur d’un modèle, et les tailles affichées les comptent tous. Les paramètres actifs ne désignent que ceux réellement utilisés pour un mot donné. Dans un modèle dense, les deux nombres sont identiques. Dans un mélange d’experts, où le modèle est divisé en sections spécialisées et où un routeur en choisit quelques-unes pour chaque token, ils diffèrent fortement : un modèle annoncé à 400 milliards de paramètres peut n’en activer que 30 milliards à la fois.
Cette distinction compte pour deux raisons pratiques. Le coût et la vitesse suivent le nombre actif, puisqu’il correspond aux calculs réellement effectués ; les mélanges d’experts peuvent donc être beaucoup moins chers à exécuter que leur taille totale ne le suggère. La mémoire, elle, suit le total, car tous les paramètres doivent être chargés quelque part, même si la plupart restent inactifs. C’est le piège lorsque l’on veut en faire tourner un chez soi : un modèle peut être assez rapide sans pour autant tenir en mémoire.
-
Les modèles deviennent-ils volontairement moins bons en faits ?
-
Ling 3.0 Flash est le modèle ouvert le plus intelligent de sa taille, et il a arrêté d'inventer des choses
-
Alibaba présente Qwen3.8 Max et promet de donner les poids
-
Le nouveau modèle gratuit de Mistral trouve de vrais bugs en prouvant que le code est correct