El prompt caching guarda el bloque de contexto que se repite entre peticiones —instrucciones, ejemplos, un documento base— y te lo cobra una sola vez en lugar de en cada petición. En las cargas con mucho contexto repetido, el ahorro en esos tokens llega al 50-90 %. Es de las palancas más baratas de implementar y no toca la calidad de las respuestas.
Es la segunda de las 7 palancas para reducir la factura de OpenAI y una de las que mejor relación ahorro/esfuerzo tiene.
De un vistazo
| Qué cachea | El contexto estable: system prompt, instrucciones, ejemplos, documentos base |
| Ahorro típico | 50-90 % sobre los tokens cacheados |
| Esfuerzo | Bajo: marcar el bloque estable y reutilizarlo |
| Cuándo compensa | Peticiones que repiten el mismo contexto largo |
Cómo funciona
La primera petición procesa el contexto entero y lo guarda en caché durante una ventana corta. Las peticiones siguientes que empiezan por el mismo bloque no vuelven a pagar el procesado de esa parte: reutilizan lo cacheado y solo pagan lo nuevo. Cuanto más grande y estable es el bloque que reutilizas, más compensa.
Cuánto ahorra de verdad
El ahorro se aplica solo a los tokens cacheados, no a toda la factura. Si tu system prompt y tus ejemplos ocupan 3.000 tokens y se repiten en cada petición, esos 3.000 pasan a costar una fracción a partir de la segunda petición. En volumen alto es el descuento que más rápido se nota sin cambiar nada del modelo ni de la salida.
Cuándo compensa (y cuándo no)
Compensa cuando el mismo contexto se repite entre peticiones: asistentes con un system prompt largo, RAG con un documento base fijo, clasificación con muchos ejemplos. No aporta nada si cada petición lleva un contexto distinto, porque no hay nada que reutilizar.
Cómo activarlo
Separa lo estable de lo variable: pon primero el bloque que se repite (instrucciones, ejemplos, documento) y al final lo que cambia en cada petición. Así el prefijo cacheable es lo más largo posible. Consulta la documentación de tu proveedor para marcar el bloque; el cambio suele ser de minutos.
Ponle número
Antes de tocar nada, mide de dónde sale tu gasto. Pon tus tokens de contexto y tu volumen en la calculadora de coste de tokens y compáralo con lo que pagarías reutilizando el bloque estable: verás el ahorro mensual antes de implementarlo. Todo esto forma parte del coste por tarea que mide e-ficient.
Preguntas frecuentes
¿Cuánto ahorra el prompt caching? En los tokens de contexto que se repiten entre peticiones, el ahorro llega al 50-90 %. Cuanto más grande y estable es el bloque que reutilizas, más compensa.
¿Afecta a la calidad de las respuestas? No. El modelo recibe exactamente el mismo contexto; solo cambia cómo se cobra el procesado de la parte repetida.
¿En qué se diferencia del RAG? El caching abarata el contexto que ya envías; el RAG reduce cuánto contexto necesitas enviar. Se combinan bien.
En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción y te decimos cuánto ahorrarías con cada palanca a tu volumen real. La primera auditoría es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.