Aprendiendo IA
Coste por tarea: por qué la tarifa por token engaña
Dos modelos pueden cobrar lo mismo por token y costar diez veces más uno que otro al acabar el mismo trabajo. La diferencia no está en la tarifa: está en cuántos tokens gasta cada uno y en cuántas veces vuelve a leer lo que ya había leído. Este curso breve enseña a localizar la cifra que de verdad se paga, a hacer la cuenta a mano y a desconfiar de ella.
En resumen
- La tarifa por token es un precio unitario: dice lo que cuesta cada trozo de texto que entra y sale, no lo que cuesta terminar un encargo.
- Artificial Analysis mide tres modelos con la misma tarifa —2 dólares el millón de tokens de entrada y 10 el millón de salida— y su coste por tarea va de 0,72 a 7,67 dólares.
- Un cuarto cobra el doble por token y sale más barato por tarea que el más caro de los tres: la lista de precios no ordena la factura.
- El dinero se va sobre todo por la entrada: en el modelo más caro, el 58 % de la factura es releer un contexto que ya se había leído.
- Y el coste por tarea de un ranking es la media de sus tareas, no de las de cada uno.
Un token es la unidad que se factura, y no es la palabra
La tarifa de un modelo cabe en dos números: tanto por millón de tokens de entrada y tanto por millón de salida. Es la primera cifra que publica cualquier proveedor y la primera que se compara, porque es la única que se entiende sin hacer nada.
Conviene hacer la conversión una vez y no volver a dudar. A 10 dólares por millón de tokens de salida, cien mil tokens cuestan 1 dólar: tokens dividido por un millón, multiplicado por la tarifa.
Y ahí está la trampa de todo precio unitario: dice lo que vale cada unidad y no cuántas hacen falta. Un producto a mitad de precio sale más caro si hay que comprar el triple.
Lo que se paga no es la tarifa: es la tarea entera
Un encargo de verdad no es una llamada al modelo: son muchas. Lee el enunciado, consulta ficheros, escribe, prueba lo que ha escrito, ve que falla y lo arregla. Cada paso es un turno, y cada turno se factura aparte.
Por eso el coste por tarea es la cifra que paga quien usa el modelo de verdad. Comparar tarifas es comparar el precio del kilo de harina; el coste por tarea es el precio del pan.
Quién pone esas cifras y con qué pruebas
La distinción importa porque un coste por tarea no se estima desde fuera: hay que ejecutar los trabajos y pagar la factura. Quien publica la cifra es quien ha pasado la batería, y la cifra vale para esa batería.
La tabla es la lección entera: la misma tarifa y diez veces de diferencia
| Modelo (ajuste medido) | Entrada $/millón | Salida $/millón | Tokens de salida por tarea | Coste por tarea |
|---|---|---|---|---|
| GPT-6.1 Sol («max») | 2 | 10 | 38.128 | 0,72 $ |
| Gemini 4 Argon («high») | 2 | 10 | 61.558 | 1,99 $ |
| Claude Sonnet 5.5 («max with fallback») | 2 | 10 | 197.430 | 7,67 $ |
| Claude Opus 5.5 («max with fallback») | 4 | 20 | 119.166 | 5,98 $ |
Hay dos cosas que mirar en esa tabla, y no son la columna del precio. La primera: las tres filas de arriba cobran exactamente lo mismo por token, 2 y 10 dólares por millón, y su coste por tarea va de 0,72 a 7,67 dólares. Diez veces y media, a tarifa idéntica.
La segunda: la cuarta fila cobra el doble por token y aun así sale más barata por tarea que la tercera, 5,98 frente a 7,67 dólares. La lista de precios no ordena la factura.
El mismo modelo cambia de sitio según el mando: Claude Sonnet 5.5 baja de 7,67 a 2,75 dólares por tarea con solo pasar de «max» a «xhigh», y su índice de inteligencia cae de 56 a 52.
La cuenta de dos líneas, hecha delante del lector
| Modelo (ajuste medido) | Coste por tarea | Entrada, total | Entrada sin caché | Lectura de caché | Escritura de caché | Salida |
|---|---|---|---|---|---|---|
| GPT-6.1 Sol («max») | 0,72 | 0,34 | 0,04 | 0,12 | 0,18 | 0,38 |
| Gemini 4 Argon («high») | 1,99 | 1,37 | 0,08 | 0,32 | 0,98 | 0,62 |
| Claude Sonnet 5.5 («max with fallback») | 7,67 | 5,69 | 0,05 | 4,41 | 1,23 | 1,97 |
| Claude Opus 5.5 («max with fallback») | 5,98 | 3,60 | 0,10 | 2,42 | 1,07 | 2,38 |
Primera línea, de dónde sale la factura. Lo que se paga por una llamada es tokens de entrada por precio de entrada, más tokens de salida por precio de salida. Pero una tarea agéntica no es una llamada: son muchos turnos, y en cada turno el modelo vuelve a leer lo que ya había —las instrucciones, los ficheros, lo que él mismo escribió antes—. Esa relectura se paga como entrada, turno a turno.
Segunda línea, por qué la tarifa no decide. A igual tarifa, lo que mueve el total es cuántos tokens hacen falta. Claude Sonnet 5.5 a «max» gasta de media 197.430 tokens de salida por tarea; a 10 dólares el millón, eso son 1,97 dólares. Y 1,97 es justo lo que da la columna de salida de Sonnet 5.5 en el desglose de aquí arriba: la cuenta cuadra.
Pero el coste por tarea medido es 7,67 dólares. Los otros 5,69 los pone la entrada, y el desglose dice de qué: 4,41 son lectura de caché —releer contexto que el modelo ya había visto—, 1,23 la escritura de esa caché, que es lo que cuesta guardar ese contexto la primera vez para releerlo barato después, y solo 0,05 dólares son entrada nueva. Dicho de la forma que importa: el 58 % de la factura de Sonnet 5.5 a «max» es volver a leer lo mismo turno tras turno.
El contraste está en la primera fila. En GPT-6.1 Sol a «max» la lectura de caché son 0,12 dólares de 0,72: un 17 % de la factura, frente al 58 % de Sonnet 5.5. Misma tarifa por token y un reparto completamente distinto. El modelo caro no es caro por lo que escribe: es caro por lo que vuelve a leer.
Y conviene saber de dónde sale ese reparto, porque buscarlo es parte de la lección: Artificial Analysis no lo muestra en su ficha —ahí se ve el total— sino en los datos que carga la propia página, donde las partes reconstruyen el total al céntimo.
Buena parte de esa salida es el modelo pensando para sí mismo
De los 197.430 tokens de salida que Claude Sonnet 5.5 gasta de media por tarea a «max», 146.633 son de razonamiento y 50.797 de respuesta: el usuario lee una cuarta parte de lo que paga.
En el modelo más barato el razonamiento pesa algo menos, pero sigue siendo la mayor parte: GPT-6.1 Sol a «max» gasta 25.190 tokens de razonamiento y 12.938 de respuesta. Lo que más separa a estos dos modelos no es en qué se gastan los tokens, es cuántos necesitan.
De ahí sale la decisión práctica: bajar el esfuerzo recorta la factura porque recorta esos tokens, y recorta el resultado. No es un ajuste técnico, es un intercambio.
La relectura es lo que más engorda la factura y lo que más se abarata
Las tarifas de caché las publica cada proveedor y son muy distintas entre sí. Google anunció el 30 de septiembre de 2026, al presentar Gemini 4 Argon, un 95 % de descuento sobre el precio de entrada para los tokens que vengan de caché. Anthropic —la empresa que vende Claude— cobra la lectura de caché de Sonnet 5.5 y de Opus 5.5 a 0,20 dólares el millón.
Con eso se cierra el círculo: lo que engorda la factura es la relectura de cada turno, y lo que la adelgaza es que se cobre barata.
Y no depende solo del proveedor: depende de la forma del trabajo. Una tarea que arrastra el mismo contexto veinte turnos aprovecha la caché; veinte tareas cortas, no.
Cuatro comprobaciones antes de elegir, y una advertencia
La primera, buscar el coste por tarea y no solo el precio por millón. Una comparativa que solo trae tarifas no dice nada de lo que cuesta acabar un trabajo.
La segunda, mirar a qué nivel de esfuerzo está medido cada modelo. El salto de 7,67 a 2,75 dólares de Sonnet 5.5 entre dos niveles es mayor que la distancia entre modelos distintos.
La tercera, comprobar si la tarifa es promocional. Los 2 y 10 dólares de Gemini 4 Argon son un precio de estreno y Google ya ha publicado a cuánto se irá después: 4 y 20. Quien monte sus cuentas sobre el precio de hoy las verá duplicarse sin cambiar nada.
La cuarta es la advertencia, y es la que hay que llevarse: el coste por tarea de un ranking es la media de sus tareas, no de las de cada uno. Resume una batería concreta, con sus longitudes, sus herramientas y sus reintentos. Y el desglose añade una razón más: el reparto entre entrada y salida depende por completo de la forma de la tarea, así que una media ajena no dice qué parte de la factura propia será relectura. La comprobación definitiva es pasar diez encargos reales del trabajo propio por dos modelos y mirar la factura del proveedor.
Conclusión
La tarifa por token es un precio unitario y, como todos, dice la mitad: lo que vale cada unidad y nunca cuántas hacen falta. En la tabla de hoy, el que cobra el doble por token no es el más caro por tarea, y los tres que cobran lo mismo se separan por diez. Y el desglose dice en qué se fue el dinero: el 58 % de la factura del más caro es contexto releído. La cifra que hay que buscar es el coste por tarea; la que hay que calcular, el de las tareas propias.
Fuentes primarias
- Artificial Analysis — Model leaderboard (consultado el 02-10-2026) ↗
- Artificial Analysis — Gemini 4 Argon, ficha del modelo (consultada el 02-10-2026) ↗
- Google — «Gemini 4 Argon: our next era of frontier intelligence» (30-09-2026) ↗
- AI Informator — Sol y Sonnet: Empate a 2 y 10 dólares ↗
- AI Informator — Gemini 4 Argon: el modelo que Google aún no vende ↗
La continuación natural
Aprende IA a tu ritmo con nuestros cursos gratuitos.
En nuestra plataforma de aprendizaje TAKU podrás acceder a este y muchos otros cursos de manera totalmente gratuita.
APRENDER CON TAKU
Comentarios