Aprendiendo IA

Caché de prompts: el precio que de verdad importa

El 22 de septiembre de 2026 Anthropic rebajó un 60 % lo que cobra Claude Opus 5.5 por leer de su caché de prompts, y el mismo día OpenAI presentó una caché nueva para GPT-6. Según Anthropic, esas lecturas son ya la mayor parte de la factura cuando la IA programa o encadena tareas. Qué es la caché, qué la rompe y cómo medir con la API cuántas veces acierta la tuya.

Caricatura en un obrador: un pastelero corpulento y sonriente corta galletas en forma de estrella de una sola masa extendida y las estrellas salen volando en fila hacia el horno de leña; a su lado, un aprendiz asustado señala la única galleta deforme de su bandeja, junto a una pila de monedas derramadas.
📷 Imagen generada con IA

En resumen

  • El 22 de septiembre de 2026, Anthropic fijó la lectura de caché de Claude Opus 5.5 en 0,20 $ por millón de tokens, un 60 % menos que en Opus 5, según la propia empresa.
  • El mismo día, OpenAI presentó una caché para GPT-6 con más aciertos por defecto, descuentos de hasta el 90 % y una ventana de reutilización de 30 minutos.
  • La caché solo funciona si cada petición empieza exactamente igual que la anterior: basta cambiar una coma al principio para perder el descuento.
  • Las dos API devuelven en cada respuesta cuánto se leyó y cuánto se escribió en caché, así que el acierto se puede medir en cinco minutos.

Lo que más se repite es lo que menos cuesta

Una conversación larga con un asistente, o un programa que llama a un modelo cien veces seguidas, repite casi todo en cada petición: las mismas instrucciones, las mismas herramientas, los mismos documentos y el historial que va creciendo. Lo nuevo suele ser una línea al final.

Sin caché, el modelo vuelve a leer todo eso cada vez y se cobra cada vez. Con caché, lo lee una vez, lo guarda un rato y después solo lee lo que ha cambiado. Ese «un rato» y ese «solo si empieza igual» son las dos reglas que hay que dominar.

Todo se cobra por tokens

Escribir y leer en caché, respecto a la entrada normal
Proveedor Escribir en caché Leer de caché
Anthropic 1,25 veces (caché de 5 minutos); 2 veces (caché de 1 hora) 0,1 veces en general; 0,05 en Opus 5.5; 0,025 en Fable 5.1 y Mythos 5.1
OpenAI (GPT-5.6 y posteriores) 1,25 veces 0,1 veces
Documentación oficial de Anthropic y guía de OpenAI.

La caché añade dos precios más a la factura de entrada. Escribir en caché, que es lo que pasa la primera vez que se manda un principio nuevo, cuesta algo más que la entrada normal. Leer de caché, que es lo que pasa las veces siguientes, cuesta una fracción.

Los dos proveedores lo expresan como un multiplicador sobre el precio de la entrada normal, y la tabla recoge los suyos.

Anthropic y OpenAI movieron ficha el mismo día

Lo que cuesta cada cosa (por millón de tokens)
Modelo Entrada normal Lectura de caché Lectura como % de la entrada
Claude Opus 5.5 4 $ 0,20 $ 5 %
Claude Opus 5 5 $ 0,50 $ 10 %
GPT-6 Sol 2 $ 10 %
GPT-6 Luna 0,10 $ 10 %
Precios publicados por Anthropic y OpenAI el 22-09-2026. OpenAI da el descuento en porcentaje: hasta el 90 % sobre los tokens de entrada que salen de la caché.

El 22 de septiembre, Anthropic —la empresa que desarrolla Claude— presentó Claude Opus 5.5 y bajó su lectura de caché a 0,20 $ por millón, el 5 % de su entrada normal. En el anuncio escribió que las lecturas de caché son «la mayor parte del coste del trabajo agéntico y de programación». Es la afirmación de quien vende el modelo, no una medición independiente, pero explica por qué la rebaja se anuncia como noticia.

Ese mismo día, OpenAI —la empresa que desarrolla GPT— publicó «Better prompt caching for GPT-6»: una caché que acierta más sin configurar nada, un panel para ver el uso de la caché y una herramienta de diagnóstico que explica por qué una petición no acertó en la caché. OpenAI cita a GitHub, la plataforma de desarrollo de software propiedad de Microsoft, socio e inversor de OpenAI, que asegura que en los últimos meses esas mejoras han reducido en «más de un 50 %» la proporción de tokens que tiene que procesar desde cero, sobre miles de millones de peticiones.

Leer más: Anthropic — Introducing Claude Opus 5.5 ↗

La caché solo reconoce lo que empieza igual

La regla la escribe OpenAI en su guía sin rodeos: para reutilizar la caché tiene que coincidir el prefijo entero. No vale «parecido» ni «casi igual». Cambiar cualquier cosa antes del punto donde acaba lo guardado invalida todo lo que va detrás.

De ahí sale la costumbre que más rinde: poner primero lo fijo y al final lo que cambia. Instrucciones, herramientas y documentos de referencia, arriba y quietos; la pregunta del usuario y los datos del día, abajo. Las dos guías lo advierten: una fecha con la hora al principio de las instrucciones, que parece inofensiva, rompe la caché en cada petición.

Escribir cuesta un poco más; leer, mucho menos

Diez peticiones con el mismo prefijo
Sin caché: 10veces el precio de un prefijo Sin caché 10veces el precio de un prefijo Con caché (1 escritura + 9 lecturas): 2,2veces el precio de un prefijo Con caché (1 escritura + 9 lecturas) 2,2veces el precio de un prefijo
Ver los datos en tabla
Sin cachéCon caché (1 escritura + 9 lecturas)
Coste 10veces el precio de un prefijo2,2veces el precio de un prefijo
Cálculo de OpenAI para GPT-5.6 y posteriores.

Como escribir cuesta más que no usar caché, la cuenta solo sale si el mismo principio se lee varias veces. OpenAI hace el cálculo en su guía: escribir un prefijo y reutilizarlo una sola vez ya cuesta menos que mandarlo dos veces sin caché, y la diferencia se dispara en cuanto se repite.

El gráfico recoge su ejemplo de diez peticiones con el mismo principio. Cuánto ahorra cada cual depende de cuánto repita su carga de trabajo: una petición suelta no ahorra nada y, si se escribe en caché, paga un 25 % más; un agente que da muchos pasos sobre el mismo contexto ahorra mucho.

Leer más: OpenAI — Prompt caching guide ↗

Se marca dónde acaba lo reutilizable

En Anthropic, el punto de corte se marca con el campo cache_control en el bloque donde termina lo fijo, y se admiten hasta cuatro. También hay un modo automático que lleva el punto al último bloque de la petición.

En OpenAI hay dos modos: el implícito, en el que decide OpenAI, y el explícito, que usa prompt_cache_breakpoint y admite hasta cuatro escrituras por petición. Para empezar basta el modo automático o el implícito; los puntos a mano sirven cuando hay varias capas fijas.

La caché caduca y tiene un mínimo

Mínimo para cachear y vida de la caché
Modelos Mínimo para cachear Cuánto dura
Claude Opus 5.5, Opus 5 y Fable 5.1 512 tokens 5 minutos, o 1 hora pagando más
Claude Opus 4.8 y Sonnet 5 1.024 tokens 5 minutos, o 1 hora pagando más
Claude Haiku 4.5 4.096 tokens 5 minutos, o 1 hora pagando más
GPT-5.6 y posteriores 1.024 tokens Ventana de 30 minutos en GPT-6
Documentación de Anthropic y OpenAI y anuncio de OpenAI del 22-09-2026.

En Anthropic la caché vive cinco minutos por defecto y se renueva sin coste cada vez que se lee; se puede pedir que dure una hora, y entonces la escritura cuesta el doble de la entrada normal. OpenAI da con GPT-6 una ventana de 30 minutos para reutilizar prefijos compartidos, según su anuncio del 22 de septiembre.

La otra condición es el tamaño. Por debajo de un mínimo no se cachea nada, y lo delicado es que no sale ningún error: la petición funciona, solo que a precio completo. El mínimo cambia según el modelo.

Leer más: Anthropic — Prompt caching (documentación) ↗

Lo que rompe la caché sin avisar

OpenAI enumera lo que tumba un acierto: cambiar el modelo, las herramientas, los ajustes o el texto del principio. Su herramienta de diagnóstico lo señala con la misma claridad. En su ejemplo aparece un fallo de tipo «cache_miss» con el motivo «tools_changed»: 5.629 tokens procesados desde cero porque cambiaron las herramientas.

Sus consejos son concretos. Mantener estables las definiciones de herramientas, su esquema y su orden. En vez de quitar una herramienta, limitarla con allowed_tools o con tool_choice: none. Añadir las instrucciones nuevas al final, con mensajes de desarrollador, en lugar de reescribir las de arriba. En GPT-6, además, se puede cambiar el esfuerzo de razonamiento sin perder la caché con un configuration_update.

En Anthropic, cambiar el ajuste de esfuerzo invalida la caché de los mensajes, salvo si el modelo admite esfuerzo por mensaje y el cambio va en un mensaje de sistema dentro de la conversación. Y OpenAI ofrece precalentar la caché: preparar el contexto conocido antes de que llegue la primera pregunta, para que ni siquiera esa espere.

Leer más: OpenAI — Better prompt caching for GPT-6 ↗

Ejercicio: mide tus aciertos de caché

Paso 1. Prepara una petición con un principio largo: unas instrucciones y un documento pegado, por encima del mínimo de tu modelo. Mándala dos veces seguidas, sin tocar nada, dentro del tiempo de vida de la caché.

Paso 2. Lee el bloque usage de las dos respuestas. En Anthropic mira tres campos: cache_creation_input_tokens, lo escrito en caché; cache_read_input_tokens, lo leído de caché; e input_tokens, lo que va detrás del último punto de corte. En OpenAI, usage.input_tokens_details.cached_tokens y usage.input_tokens_details.cache_write_tokens. La primera respuesta debería traer escritura y la segunda, lectura.

Paso 3. Si en Anthropic los dos campos de caché salen a cero, no se cacheó nada; lo más probable es que no llegaras al mínimo. Alarga el documento y repite.

Paso 4. Cambia una coma en la primera frase de las instrucciones y manda otra vez. La lectura de caché desaparece: el prefijo ya no coincide y se escribe de nuevo. Es la forma más rápida de interiorizar la regla.

Paso 5. Calcula tu tasa de acierto y multiplica cada tipo de token por su precio de la tabla. Ten en cuenta que, en los modelos anteriores a GPT-5.6, OpenAI redondea cached_tokens hacia abajo al múltiplo de 128 más cercano; en GPT-5.6 y posteriores da la cifra exacta.

Conclusión

Durante mucho tiempo, comparar modelos era comparar el precio de entrada y el de salida. Con agentes que releen el mismo contexto decenas de veces, la lectura de caché puede pesar más en la factura que la entrada y la salida (Anthropic sostiene que ya es la mayor parte del coste), y el 22 de septiembre Anthropic y OpenAI movieron ficha a la vez: la primera con una rebaja y la segunda con herramientas para medirla. El ahorro no llega solo: depende de ordenar las peticiones con lo fijo arriba, de no tocar lo que ya está guardado y de comprobar en cada respuesta que el acierto está ahí. Lo que cada uno ahorre dependerá de su carga; saberlo cuesta un ejercicio de cinco pasos.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuación natural

    Aprende IA a tu ritmo con nuestros cursos gratuitos.

    En nuestra plataforma de aprendizaje TAKU podrás acceder a este y muchos otros cursos de manera totalmente gratuita.

    APRENDER CON TAKU

    ← Volver al blog