CourionAI
IT
Newsletter
← Glossario Termine

previsione multi-token

Una tecnica di velocità in cui il modello prevede più parole insieme invece di una alla volta.

I modelli linguistici producono normalmente un token, circa tre quarti di parola, guardano ciò che hanno scritto e generano il successivo. La previsione multi-token propone una breve serie e la verifica insieme. Se le ipotesi reggono, si ottengono più parole quasi al prezzo di una.

Per eseguire un modello a casa è una delle leve principali sulla velocità e può rendere lo stesso hardware molto più reattivo. È vicina alla decodifica speculativa, che usa un piccolo modello ausiliario per proporre i token.