CourionAI
FR
Newsletter
← Glossaire Terme

Décodage spéculatif

Une méthode d'accélération dans laquelle un petit modèle prédit le texte et un modèle plus grand le vérifie.

Les modèles de langage écrivent généralement des jetons un par un. Dans le décodage spéculatif, un petit modèle rapide devine plusieurs jetons à l’avance ; le gros vérifie la pile d’un seul coup. Les suggestions correctes demeurent ; les erreurs sont corrigées par le grand modèle.

Tester coûte moins cher que produire. Cela rend les réponses plus rapides sans modifier la sortie du grand modèle. Le processus contribue à la baisse des prix de l’IA en arrière-plan : il n’est visible que par une facture plus petite et un curseur qui clignote moins longtemps.