← Glossario Termine
Decodifica speculativa
Un metodo di accelerazione in cui un modello piccolo prevede il testo e un modello più grande lo verifica.
I modelli linguistici di solito scrivono i token uno alla volta. Nella decodifica speculativa, un modello piccolo e veloce indovina diversi token in anticipo; quello grande controlla lo stack tutto in una volta. Rimangono suggerimenti corretti; quelli errati vengono corretti dal modello grande.
Testare è più economico che produrre. Ciò rende le risposte più rapide senza modificare l’output del modello di grandi dimensioni. Il processo contribuisce alla caduta dei prezzi dell’IA in background: è visibile solo in una fattura più piccola e in un cursore che lampeggia per meno tempo.
Citato in