← Glossario Termine
previsione multi-token
Una tecnica di velocità in cui il modello prevede più parole insieme invece di una alla volta.
I modelli linguistici producono normalmente un token, circa tre quarti di parola, guardano ciò che hanno scritto e generano il successivo. La previsione multi-token propone una breve serie e la verifica insieme. Se le ipotesi reggono, si ottengono più parole quasi al prezzo di una.
Per eseguire un modello a casa è una delle leve principali sulla velocità e può rendere lo stesso hardware molto più reattivo. È vicina alla decodifica speculativa, che usa un piccolo modello ausiliario per proporre i token.
Citato in