Aprenent IA
Cost per tasca: la tarifa per token enganya
Dos models poden cobrar el mateix per token i, en acabar la mateixa feina, costar deu vegades més l'un que l'altre. La diferència no és la tarifa: és quants tokens gasta cadascun i quantes vegades torna a llegir el que ja havia llegit. Aquest curs breu ensenya a trobar la xifra que de debò es paga, a fer-ne el compte a mà i a desconfiar-ne.
En resum
- La tarifa per token és un preu unitari: diu què costa cada tros de text que entra i surt, no què costa acabar un encàrrec.
- Artificial Analysis mesura tres models amb la mateixa tarifa —2 dòlars el milió de tokens d'entrada i 10 el milió de sortida— i el seu cost per tasca va de 0,72 a 7,67 dòlars.
- Un quart cobra el doble per token i surt més barat per tasca que el més car dels tres: la llista de preus no ordena la factura.
- Els diners se'n van sobretot en l'entrada: en el model més car, el 58 % de la factura és rellegir un context que ja s'havia llegit.
- I el cost per tasca d'un rànquing és la mitjana de les seves tasques, no de les de cadascú.
El token és la unitat que es factura, i no és la paraula
La tarifa d'un model cap en dos números: tant per milió de tokens d'entrada i tant per milió de sortida. És la primera xifra que publica qualsevol proveïdor i la primera que es compara, perquè és l'única que s'entén sense fer res.
Val la pena fer la conversió una vegada i no haver de dubtar-ne més. A 10 dòlars per milió de tokens de sortida, cent mil tokens costen 1 dòlar: tokens dividits per un milió, multiplicats per la tarifa.
I aquí hi ha la trampa de tot preu unitari: diu què val cada unitat i no quantes en calen. Un producte a meitat de preu surt més car si cal comprar-ne el triple.
El que es paga no és la tarifa: és la tasca sencera
Un encàrrec de debò no és una crida al model: en són moltes. Llegeix l'enunciat, consulta fitxers, escriu, prova el que ha escrit, veu que falla i ho arregla. Cada pas és un torn, i cada torn es factura a part.
Per això el cost per tasca és la xifra que paga qui fa servir el model de debò. Comparar tarifes és comparar el preu del quilo de farina; el cost per tasca és el preu del pa.
Qui posa aquestes xifres i amb quines proves
La distinció importa perquè un cost per tasca no s'estima des de fora: cal executar les feines i pagar la factura. Qui publica la xifra és qui ha passat la bateria, i la xifra val per a aquesta bateria.
La taula és la lliçó sencera: la mateixa tarifa i deu vegades de diferència
| Model (ajust mesurat) | Entrada $/milió | Sortida $/milió | Tokens de sortida per tasca | Cost per tasca |
|---|---|---|---|---|
| GPT-6.1 Sol («max») | 2 | 10 | 38.128 | 0,72 $ |
| Gemini 4 Argon («high») | 2 | 10 | 61.558 | 1,99 $ |
| Claude Sonnet 5.5 («max with fallback») | 2 | 10 | 197.430 | 7,67 $ |
| Claude Opus 5.5 («max with fallback») | 4 | 20 | 119.166 | 5,98 $ |
Hi ha dues coses a mirar en aquesta taula, i no són la columna del preu. La primera: les tres files de dalt cobren exactament el mateix per token, 2 i 10 dòlars per milió, i el seu cost per tasca va de 0,72 a 7,67 dòlars. Deu vegades i mitja, amb una tarifa idèntica.
La segona: la quarta fila cobra el doble per token i tot i això surt més barata per tasca que la tercera, 5,98 davant dels 7,67 dòlars. La llista de preus no ordena la factura.
El mateix model canvia de lloc segons el comandament: Claude Sonnet 5.5 baixa de 7,67 a 2,75 dòlars per tasca només passant de «max» a «xhigh», i el seu índex d'intel·ligència cau de 56 a 52.
El compte de dues línies, fet davant del lector
| Model (ajust mesurat) | Cost per tasca | Entrada, total | Entrada sense memòria cau | Lectura de memòria cau | Escriptura de memòria cau | Sortida |
|---|---|---|---|---|---|---|
| GPT-6.1 Sol («max») | 0,72 | 0,34 | 0,04 | 0,12 | 0,18 | 0,38 |
| Gemini 4 Argon («high») | 1,99 | 1,37 | 0,08 | 0,32 | 0,98 | 0,62 |
| Claude Sonnet 5.5 («max with fallback») | 7,67 | 5,69 | 0,05 | 4,41 | 1,23 | 1,97 |
| Claude Opus 5.5 («max with fallback») | 5,98 | 3,60 | 0,10 | 2,42 | 1,07 | 2,38 |
Primera línia, d'on surt la factura. El que es paga per una crida són els tokens d'entrada pel preu d'entrada, més els tokens de sortida pel preu de sortida. Però una tasca agèntica no és una crida: són molts torns, i a cada torn el model torna a llegir el que ja hi havia —les instruccions, els fitxers, el que ell mateix havia escrit abans—. Aquesta relectura es paga com a entrada, torn a torn.
Segona línia, per què la tarifa no decideix. A igualtat de tarifa, el que mou el total és quants tokens calen. Claude Sonnet 5.5 a «max» gasta de mitjana 197.430 tokens de sortida per tasca; a 10 dòlars el milió, això són 1,97 dòlars. I 1,97 és justament el que dona la columna de sortida de Sonnet 5.5 en el desglossament de més amunt: el compte quadra.
Però el cost per tasca mesurat és 7,67 dòlars. Els altres 5,69 els posa l'entrada, i el desglossament diu de què: 4,41 són lectura de memòria cau —rellegir context que el model ja havia vist—, 1,23 l'escriptura d'aquesta memòria cau, que és el que costa desar aquest context la primera vegada per rellegir-lo barat després, i només 0,05 dòlars són entrada nova. Dit de la manera que importa: el 58 % de la factura de Sonnet 5.5 a «max» és tornar a llegir el mateix torn rere torn.
El contrast és a la primera fila. En GPT-6.1 Sol a «max», la lectura de memòria cau són 0,12 dòlars de 0,72: un 17 % de la factura, davant del 58 % de Sonnet 5.5. Mateixa tarifa per token i un repartiment completament diferent. El model car no és car pel que escriu: és car pel que torna a llegir.
I val la pena saber d'on surt aquest repartiment, perquè buscar-lo és part de la lliçó: Artificial Analysis no el mostra a la fitxa —allà es veu el total— sinó en les dades que carrega la mateixa pàgina, on les parts reconstrueixen el total al cèntim.
Bona part d'aquesta sortida és el model pensant per a ell mateix
Dels 197.430 tokens de sortida que Claude Sonnet 5.5 gasta de mitjana per tasca a «max», 146.633 són de raonament i 50.797 de resposta: l'usuari llegeix una quarta part del que paga.
En el model més barat el raonament hi pesa una mica menys, però continua sent la major part: GPT-6.1 Sol a «max» gasta 25.190 tokens de raonament i 12.938 de resposta. El que més separa aquests dos models no és en què es gasten els tokens, és quants en necessiten.
D'aquí surt la decisió pràctica: abaixar l'esforç retalla la factura perquè retalla aquests tokens, i retalla el resultat. No és un ajust tècnic, és un intercanvi.
La relectura és el que més engreixa la factura i el que més s'abarateix
Les tarifes de memòria cau les publica cada proveïdor i són molt diferents entre elles. Google va anunciar el 30 de setembre de 2026, en presentar Gemini 4 Argon, un 95 % de descompte sobre el preu d'entrada per als tokens que vinguin de la memòria cau. Anthropic —l'empresa que ven Claude— cobra la lectura de memòria cau de Sonnet 5.5 i d'Opus 5.5 a 0,20 dòlars el milió.
Amb això es tanca el cercle: el que engreixa la factura és la relectura de cada torn, i el que l'aprima és que es cobri barata.
I no depèn només del proveïdor: depèn de la forma de la feina. Una tasca que arrossega el mateix context vint torns aprofita la memòria cau; vint tasques curtes, no.
Quatre comprovacions abans de triar, i un advertiment
La primera, buscar el cost per tasca i no només el preu per milió. Una comparativa que només porta tarifes no diu res del que costa acabar una feina.
La segona, mirar a quin nivell d'esforç està mesurat cada model. El salt de 7,67 a 2,75 dòlars de Sonnet 5.5 entre dos nivells és més gran que la distància entre models diferents.
La tercera, comprovar si la tarifa és promocional. Els 2 i 10 dòlars de Gemini 4 Argon són un preu d'estrena i Google ja ha publicat a quant pujarà després: 4 i 20. Qui munti els seus comptes sobre el preu d'avui els veurà duplicar-se sense canviar res.
La quarta és l'advertiment, i és el que cal endur-se: el cost per tasca d'un rànquing és la mitjana de les seves tasques, no de les de cadascú. Resumeix una bateria concreta, amb les seves llargades, les seves eines i els seus reintents. I el desglossament hi afegeix una raó més: el repartiment entre entrada i sortida depèn del tot de la forma de la tasca, així que una mitjana aliena no diu quina part de la factura pròpia serà relectura. La comprovació definitiva és passar deu encàrrecs reals de la feina pròpia per dos models i mirar la factura del proveïdor.
Conclusió
La tarifa per token és un preu unitari i, com tots, diu la meitat: què val cada unitat i mai quantes en calen. En la taula d'avui, el que cobra el doble per token no és el més car per tasca, i els tres que cobren el mateix se separen per deu. I el desglossament diu en què es van gastar els diners: el 58 % de la factura del més car és context rellegit. La xifra que cal buscar és el cost per tasca; la que cal calcular, el de les tasques pròpies.
Fonts primàries
- Artificial Analysis — Model leaderboard (consultat el 02-10-2026) ↗
- Artificial Analysis — Gemini 4 Argon, fitxa del model (consultada el 02-10-2026) ↗
- Google — «Gemini 4 Argon: our next era of frontier intelligence» (30-09-2026) ↗
- AI Informator — Sol i Sonnet, empatats a 2 i 10 dòlars ↗
- AI Informator — Gemini 4 Argon: el model que Google encara no ven ↗
La continuació natural
Aprèn IA al teu ritme amb els nostres cursos gratuïts.
A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.
APRENDRE AMB TAKU
Comentaris