CourionAI
FR
Newsletter
← Glossaire Terme

prédiction multi-token

Une technique d'accélération où un modèle prédit plusieurs mots à la fois plutôt qu'un seul.

Les modèles de langage produisent normalement un token, environ trois quarts d’un mot, regardent ce qu’ils viennent d’écrire puis génèrent le suivant. La prédiction multi-token leur permet de proposer une courte série de tokens d’un coup, puis de les vérifier ensemble. Quand les propositions sont correctes, plusieurs mots sont obtenus pour presque le coût d’un seul.

Pour exécuter un modèle chez soi, c’est l’un des principaux leviers de vitesse, souvent la différence entre un assistant lent et réactif sur la même carte graphique. Cette méthode est proche du décodage spéculatif, qui confie les propositions à un petit modèle auxiliaire.