Prompt Caching
Den unveränderlichen Teil eines Gesprächs zwischenspeichern, damit das Modell nicht jede Runde den vollen Preis fürs Wiederlesen zahlt.
Modelle haben zwischen den Schritten kein Gedächtnis. Jedes Mal, wenn Sie eine Nachricht senden, wird das ganze bisherige Gespräch erneut hineingegeben, denn nur so weiß das Modell, worum es ging. In einer langen Sitzung heißt das, denselben Text immer wieder zu lesen. Prompt Caching legt diesen wiederkehrenden Block auf der Anbieterseite ab, sodass er günstig nachgeladen statt neu verarbeitet wird. Zwischengespeicherte Tokens kosten meist nur einen Bruchteil frischer.
Für Agenten ist das enorm wichtig, denn sie arbeiten in vielen kleinen Schritten und lesen ihren angesammelten Kontext bei jedem erneut. In einem gemessenen Beispiel waren 96 Prozent aller Tokens, die ein Agent über acht Wochen verarbeitete, Cache-Lesevorgänge, und der Text, den der Nutzer tatsächlich sah, lag unter einem halben Prozent. Wenn Sie also eine gewaltige Tokenzahl an einem Agenten hängen sehen, ist das größtenteils das System, das sich selbst daran erinnert, was es gerade tat, und kein neues Denken.