CourionAI
DE
Newsletter
← Glossar Begriff

Spekulative Dekodierung

Ein Beschleunigungsverfahren, bei dem ein kleines Modell Text vorhersagt und ein größeres ihn prüft.

Sprachmodelle schreiben normalerweise Token nacheinander. Bei spekulativer Dekodierung rät ein kleines, schnelles Modell mehrere Tokens voraus; das große prüft den Stapel auf einmal. Richtige Vorschläge bleiben, bei falschen korrigiert das große Modell.

Prüfen ist billiger als Erzeugen. Antworten werden dadurch schneller, ohne dass sich die Ausgabe des großen Modells ändert. Das Verfahren trägt im Hintergrund zu fallenden KI-Preisen bei: sichtbar wird es nur an einer kleineren Rechnung und einem weniger lange blinkenden Cursor.