CourionAI
ES
Boletín
← Glosario Término

Caché de prompts

Guardar la parte invariable de una conversación para que el modelo no pague el precio completo por releerla en cada turno.

Los modelos no tienen memoria entre pasos. Cada vez que usted envía un mensaje, toda la conversación previa se vuelve a introducir, porque es la única forma de que el modelo sepa de qué hablaban. En una sesión larga eso implica releer el mismo texto una y otra vez. La caché de prompts guarda ese bloque repetido en el lado del proveedor para poder cargarlo barato en vez de procesarlo desde cero. Los tokens en caché suelen costar una fracción de los nuevos.

Esto importa enormemente para los agentes, que trabajan en muchos pasos pequeños y releen su contexto acumulado en cada uno. En un ejemplo medido, el 96 por ciento de todos los tokens que un agente procesó durante ocho semanas fueron lecturas de caché, y el texto que el usuario vio realmente quedó por debajo del medio por ciento. Así que cuando vea una cifra enorme de tokens asociada a un agente, la mayor parte es el sistema recordándose a sí mismo qué estaba haciendo, no pensamiento nuevo.