modèle dense
Un modèle qui utilise tous ses paramètres pour chaque mot produit, contrairement à un mélange d'experts.
Dans un modèle dense, tous les paramètres, les nombres ajustables appris pendant l’entraînement, participent à la génération de chaque mot. L’autre approche est le mélange d’experts, où seule une petite partie du modèle s’active pour chaque mot, ce qui le rend beaucoup plus rapide par rapport à sa taille totale.
Le compromis est simple. Les modèles denses offrent souvent une qualité supérieure à ce que suggère leur nombre de paramètres. Les mélanges d’experts offrent davantage de vitesse et utilisent moins de mémoire active pour leur taille totale. Pour un modèle exécuté sur votre ordinateur, un petit modèle dense donne souvent de meilleures réponses qu’un modèle clairsemé nominalement plus grand, mais il prend plus de temps.