CourionAI
IT
Newsletter
← Glossario Termine

Caching dei prompt

Conservare la parte invariabile di una conversazione perché il modello non paghi il prezzo pieno per rileggerla a ogni turno.

I modelli non hanno memoria fra un passaggio e l’altro. Ogni volta che inviate un messaggio, l’intera conversazione precedente viene reimmessa, perché è l’unico modo in cui il modello sa di cosa stavate parlando. In una sessione lunga significa rileggere lo stesso testo più e più volte. Il caching dei prompt conserva quel blocco ripetuto dal lato del fornitore, così può essere ricaricato a poco prezzo invece di essere rielaborato da zero. I token in cache costano di solito una frazione di quelli nuovi.

La cosa conta moltissimo per gli agenti, che lavorano in tanti piccoli passaggi e a ognuno rileggono il contesto accumulato. In un caso misurato, il 96 per cento di tutti i token elaborati da un agente in otto settimane erano letture dalla cache, e il testo che l’utente ha effettivamente visto stava sotto il mezzo per cento. Quindi quando vedete un conteggio enorme di token attaccato a un agente, per la maggior parte è il sistema che ricorda a se stesso cosa stava facendo, non pensiero nuovo.