Aprenent IA

Memòria cau de prompts: el preu que de debò compta

El 22 de setembre de 2026 Anthropic va abaixar un 60 % el que cobra Claude Opus 5.5 per llegir de la memòria cau de prompts (prompt caching), i el mateix dia OpenAI en va presentar una de nova per a GPT-6. Segons Anthropic, aquestes lectures ja són la major part de la factura quan la IA programa o encadena tasques. Què és la memòria cau, què la trenca i com mesurar amb l'API quantes vegades encerta la teva.

Caricatura en un obrador: un pastisser corpulent i somrient talla galetes en forma d'estrella d'una sola massa estesa i les estrelles surten volant en filera cap al forn de llenya; al seu costat, un aprenent espantat assenyala l'única galeta deforme de la seva safata, al costat d'una pila de monedes vessades.
📷 Imatge generada amb IA

En resum

  • El 22 de setembre de 2026, Anthropic va fixar la lectura de memòria cau (cache read) de Claude Opus 5.5 en 0,20 $ per milió de tokens, un 60 % menys que a Opus 5, segons la mateixa empresa.
  • El mateix dia, OpenAI va presentar una memòria cau per a GPT-6 amb més encerts per defecte, descomptes de fins al 90 % i una finestra de reutilització de 30 minuts.
  • La memòria cau només funciona si cada petició comença exactament igual que l'anterior: n'hi ha prou de canviar una coma al principi per perdre el descompte.
  • Totes dues API retornen en cada resposta quant s'ha llegit i quant s'ha escrit a la memòria cau, de manera que l'encert es pot mesurar en cinc minuts.

El que més es repeteix és el que menys costa

Una conversa llarga amb un assistent, o un programa que crida un model cent vegades seguides, repeteix gairebé tot en cada petició: les mateixes instruccions, les mateixes eines, els mateixos documents i l'historial, que va creixent. El que és nou sol ser una línia al final.

Sense memòria cau, el model torna a llegir tot això cada vegada i es cobra cada vegada. Amb memòria cau, ho llegeix una vegada, ho desa una estona i després només llegeix el que ha canviat. Aquesta «una estona» i aquest «només si comença igual» són les dues regles que cal dominar.

Tot es cobra per tokens

Escriure i llegir a la memòria cau, respecte a l'entrada normal
Proveïdor Escriure a la memòria cau Llegir de la memòria cau
Anthropic 1,25 vegades (memòria cau de 5 minuts); 2 vegades (memòria cau d'1 hora) 0,1 vegades en general; 0,05 a Opus 5.5; 0,025 a Fable 5.1 i Mythos 5.1
OpenAI (GPT-5.6 i posteriors) 1,25 vegades 0,1 vegades
Documentació oficial d'Anthropic i guia d'OpenAI.

La memòria cau afegeix dos preus més a la factura d'entrada. Escriure a la memòria cau, que és el que passa la primera vegada que s'envia un principi nou, costa una mica més que l'entrada normal. Llegir de la memòria cau, que és el que passa les vegades següents, en costa una fracció.

Els dos proveïdors ho expressen com un multiplicador sobre el preu de l'entrada normal, i la taula recull els de cadascun.

Anthropic i OpenAI van moure fitxa el mateix dia

El que costa cada cosa (per milió de tokens)
Model Entrada normal Lectura de memòria cau Lectura com a % de l'entrada
Claude Opus 5.5 4 $ 0,20 $ 5 %
Claude Opus 5 5 $ 0,50 $ 10 %
GPT-6 Sol 2 $ 10 %
GPT-6 Luna 0,10 $ 10 %
Preus publicats per Anthropic i OpenAI el 22-09-2026. OpenAI dona el descompte en percentatge: fins al 90 % sobre els tokens d'entrada que surten de la memòria cau.

El 22 de setembre, Anthropic —l'empresa que desenvolupa Claude— va presentar Claude Opus 5.5 i va abaixar-ne la lectura de memòria cau a 0,20 $ per milió, el 5 % de la seva entrada normal. A l'anunci va escriure que les lectures de memòria cau són «la major part del cost de la feina agèntica i de programació». És l'afirmació de qui ven el model, no pas una mesura independent, però explica per què la rebaixa s'anuncia com a notícia.

Aquell mateix dia, OpenAI —l'empresa que desenvolupa GPT— va publicar «Better prompt caching for GPT-6»: una memòria cau que encerta més sense configurar res, un tauler per veure'n l'ús i una eina de diagnòstic que explica per què una petició no hi ha encertat. OpenAI cita GitHub, la plataforma de desenvolupament de programari propietat de Microsoft, soci i inversor d'OpenAI, que assegura que en els últims mesos aquestes millores han reduït en «més d'un 50 %» la proporció de tokens que ha de processar des de zero, sobre milers de milions de peticions.

Llegir-ne més: Anthropic — Introducing Claude Opus 5.5 ↗

La memòria cau només reconeix el que comença igual

La regla l'escriu OpenAI a la seva guia sense embuts: per reutilitzar la memòria cau ha de coincidir el prefix sencer. No val «semblant» ni «gairebé igual». Canviar qualsevol cosa abans del punt on acaba el que s'ha desat invalida tot el que ve darrere.

D'aquí surt el costum que més rendeix: posar primer el que és fix i al final el que canvia. Instruccions, eines i documents de referència, a dalt i quiets; la pregunta de l'usuari i les dades del dia, a baix. Totes dues guies ho adverteixen: una data amb l'hora al principi de les instruccions, que sembla innòcua, trenca la memòria cau en cada petició.

Escriure costa una mica més; llegir, molt menys

Deu peticions amb el mateix prefix
Sense memòria cau: 10vegades el preu d'un prefix Sense memòria cau 10vegades el preu d'un prefix Amb memòria cau (1 escriptura + 9 lectures): 2,2vegades el preu d'un prefix Amb memòria cau (1 escriptura + 9 lectures) 2,2vegades el preu d'un prefix
Ver los datos en tabla
Sense memòria cauAmb memòria cau (1 escriptura + 9 lectures)
Cost 10vegades el preu d'un prefix2,2vegades el preu d'un prefix
Càlcul d'OpenAI per a GPT-5.6 i posteriors.

Com que escriure costa més que no fer servir la memòria cau, el compte només surt si el mateix principi es llegeix diverses vegades. OpenAI fa el càlcul a la seva guia: escriure un prefix i reutilitzar-lo una sola vegada ja costa menys que enviar-lo dues vegades sense memòria cau, i la diferència es dispara tan bon punt es repeteix.

El gràfic recull el seu exemple de deu peticions amb el mateix principi. Quant estalvia cadascú depèn de quant repeteixi la seva càrrega de treball: una petició solta no estalvia res i, si s'escriu a la memòria cau, paga un 25 % més; un agent que fa molts passos sobre el mateix context estalvia molt.

Llegir-ne més: OpenAI — Prompt caching guide ↗

Es marca on acaba el que es pot reutilitzar

A Anthropic, el punt de tall es marca amb el camp cache_control al bloc on acaba el que és fix, i se n'admeten fins a quatre. També hi ha un mode automàtic que porta el punt a l'últim bloc de la petició.

A OpenAI hi ha dos modes: l'implícit, en què decideix OpenAI, i l'explícit, que fa servir prompt_cache_breakpoint i admet fins a quatre escriptures per petició. Per començar n'hi ha prou amb el mode automàtic o l'implícit; els punts a mà serveixen quan hi ha diverses capes fixes.

La memòria cau caduca i té un mínim

Mínim per desar a la memòria cau i vida de la memòria cau
Models Mínim per desar a la memòria cau Quant dura
Claude Opus 5.5, Opus 5 i Fable 5.1 512 tokens 5 minuts, o 1 hora pagant més
Claude Opus 4.8 i Sonnet 5 1.024 tokens 5 minuts, o 1 hora pagant més
Claude Haiku 4.5 4.096 tokens 5 minuts, o 1 hora pagant més
GPT-5.6 i posteriors 1.024 tokens Finestra de 30 minuts a GPT-6
Documentació d'Anthropic i d'OpenAI i anunci d'OpenAI del 22-09-2026.

A Anthropic la memòria cau viu cinc minuts per defecte i es renova sense cost cada vegada que es llegeix; es pot demanar que duri una hora, i aleshores l'escriptura costa el doble de l'entrada normal. OpenAI dona amb GPT-6 una finestra de 30 minuts per reutilitzar prefixos compartits, segons el seu anunci del 22 de setembre.

L'altra condició és la mida. Per sota d'un mínim no es desa res a la memòria cau, i el que és delicat és que no surt cap error: la petició funciona, només que a preu complet. El mínim canvia segons el model.

Llegir-ne més: Anthropic — Prompt caching (documentació) ↗

El que trenca la memòria cau sense avisar

OpenAI enumera el que fa caure un encert: canviar el model, les eines, els paràmetres o el text del principi. La seva eina de diagnòstic ho assenyala amb la mateixa claredat. En el seu exemple apareix una fallada de tipus «cache_miss» amb el motiu «tools_changed»: 5.629 tokens processats des de zero perquè havien canviat les eines.

Els seus consells són concrets. Mantenir estables les definicions de les eines, el seu esquema i el seu ordre. En comptes de treure una eina, limitar-la amb allowed_tools o amb tool_choice: none. Afegir les instruccions noves al final, amb missatges de desenvolupador, en lloc de reescriure les de dalt. A GPT-6, a més, es pot canviar l'esforç de raonament sense perdre la memòria cau amb un configuration_update.

A Anthropic, canviar el paràmetre d'esforç invalida la memòria cau dels missatges, tret que el model admeti esforç per missatge i el canvi vagi en un missatge de sistema dins de la conversa. I OpenAI ofereix preescalfar la memòria cau: preparar el context conegut abans que arribi la primera pregunta, perquè ni tan sols aquesta hagi d'esperar.

Llegir-ne més: OpenAI — Better prompt caching for GPT-6 ↗

Exercici: mesura els teus encerts de memòria cau

Pas 1. Prepara una petició amb un principi llarg: unes instruccions i un document enganxat, per sobre del mínim del teu model. Envia-la dues vegades seguides, sense tocar res, dins del temps de vida de la memòria cau.

Pas 2. Llegeix el bloc usage de les dues respostes. A Anthropic mira tres camps: cache_creation_input_tokens, el que s'ha escrit a la memòria cau; cache_read_input_tokens, el que s'ha llegit de la memòria cau; i input_tokens, el que ve darrere de l'últim punt de tall. A OpenAI, usage.input_tokens_details.cached_tokens i usage.input_tokens_details.cache_write_tokens. La primera resposta hauria de portar escriptura i la segona, lectura.

Pas 3. Si a Anthropic els dos camps de memòria cau surten a zero, no s'ha desat res; el més probable és que no arribessis al mínim. Allarga el document i torna-ho a provar.

Pas 4. Canvia una coma a la primera frase de les instruccions i torna a enviar-la. La lectura de memòria cau desapareix: el prefix ja no coincideix i s'escriu de nou. És la manera més ràpida d'interioritzar la regla.

Pas 5. Calcula la teva taxa d'encert i multiplica cada tipus de token pel seu preu de la taula. Tingues en compte que, en els models anteriors a GPT-5.6, OpenAI arrodoneix cached_tokens a la baixa fins al múltiple de 128 més proper; a GPT-5.6 i posteriors dona la xifra exacta.

Conclusió

Durant molt de temps, comparar models era comparar el preu d'entrada i el de sortida. Amb agents que rellegeixen el mateix context desenes de vegades, la lectura de memòria cau pot pesar més a la factura que l'entrada i la sortida (Anthropic sosté que ja és la major part del cost), i el 22 de setembre Anthropic i OpenAI van moure fitxa alhora: la primera amb una rebaixa i la segona amb eines per mesurar-la. L'estalvi no arriba sol: depèn d'ordenar les peticions amb el que és fix a dalt, de no tocar el que ja està desat i de comprovar en cada resposta que l'encert hi és. El que estalviï cadascú dependrà de la seva càrrega; saber-ho costa un exercici de cinc passos.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuació natural

    Aprèn IA al teu ritme amb els nostres cursos gratuïts.

    A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.

    APRENDRE AMB TAKU

    ← Torna al blog