CourionAI
DE
Newsletter
← Glossar Begriff

Multi-Token-Vorhersage

Ein Verfahren zur Beschleunigung, bei dem ein Modell mehrere Wörter auf einmal vorhersagt, statt sie einzeln zu erzeugen.

Sprachmodelle erzeugen normalerweise ein Token, also ungefähr drei Viertel eines Wortes, betrachten das Geschriebene und erzeugen dann das nächste. Bei der Multi-Token-Vorhersage schlägt das Modell mehrere Tokens auf einmal vor und prüft sie anschließend gemeinsam. Stimmen die Vorschläge, erhältst du mehrere Wörter beinahe zum Preis eines einzelnen.

Wer ein Modell zu Hause betreibt, findet hier einen der größten Hebel für Geschwindigkeit. Auf derselben Grafikkarte kann das den Unterschied zwischen einem zähen und einem reaktionsschnellen Assistenten ausmachen. Eng verwandt ist die spekulative Dekodierung, bei der ein kleines Hilfsmodell die Vorschläge erzeugt.