CourionAI
FR
Newsletter
← Glossaire Terme

Mise en cache de prompts

Conserver la partie invariable d'une conversation pour que le modèle ne paie pas le plein tarif à chaque relecture.

Les modèles n’ont pas de mémoire d’une étape à l’autre. Chaque fois que vous envoyez un message, toute la conversation précédente est réinjectée, car c’est le seul moyen pour le modèle de savoir de quoi vous parliez. Dans une longue session, cela revient à relire le même texte encore et encore. La mise en cache de prompts conserve ce bloc répété côté fournisseur pour pouvoir le recharger à bas coût au lieu de le traiter à neuf. Les tokens en cache coûtent généralement une fraction des tokens frais.

C’est déterminant pour les agents, qui travaillent par nombreuses petites étapes et relisent à chacune leur contexte accumulé. Dans un cas mesuré, 96 pour cent de tous les tokens traités par un agent sur huit semaines étaient des lectures de cache, et le texte réellement vu par l’utilisateur représentait moins d’un demi pour cent. Quand vous voyez un décompte de tokens gigantesque attaché à un agent, l’essentiel est donc le système qui se rappelle à lui-même ce qu’il était en train de faire, et non de la réflexion nouvelle.