CourionAI
FR
Newsletter
← Glossaire Terme

Mélange d’experts

Une conception de modèle dans laquelle seule une petite partie du réseau s'exécute pour chaque requête, ce qui permet de conserver les grands modèles peu coûteux à utiliser.

Dans un modèle mixte d’experts, le réseau est divisé en plusieurs sous-réseaux et un routeur n’en sélectionne que quelques-uns pour une entrée donnée. C’est pourquoi ces modèles sont cités avec deux chiffres, par exemple 284 milliards de paramètres totaux et 13 milliards actifs : le premier est la taille du modèle, le second est la quantité qu’il exécute réellement à chaque fois.

L’effet pratique est que vous obtenez la connaissance d’un très grand modèle à un coût plus proche du coût de fonctionnement d’un petit. Presque tous les modèles ouverts récents, de DeepSeek à Inkling de Thinking Machines, sont construits de cette façon. Auparavant, le compromis était la mémoire, car vous deviez toujours charger le tout même si vous n’en utilisiez qu’une partie. Les environnements d’exécution tels que Swiftlet réduisent désormais ce problème en diffusant à la demande les experts inutilisés à partir du disque.