Bloggartiklarna publiceras på spanska och katalanska.

Aprendiendo IA

Coste por tarea: por qué la tarifa por token engaña

Dos modelos pueden cobrar lo mismo por token y costar diez veces más uno que otro al acabar el mismo trabajo. La diferencia no está en la tarifa: está en cuántos tokens gasta cada uno y en cuántas veces vuelve a leer lo que ya había leído. Este curso breve enseña a localizar la cifra que de verdad se paga, a hacer la cuenta a mano y a desconfiar de ella.

Viñeta: primer plano del salpicadero de un taxi. Una mano agarra el volante y, empotrado en el salpicadero, un taxímetro de carcasa clara lleva pintada una onda carmín y, en relieve sobre la propia carcasa, el destello de Anthropic; debajo, una ventanilla con los rodillos del importe. Por el parabrisas se ve la misma calle recorrida en bucle, con las rodadas dibujando lazos sobre el asfalto, y una pegatina en blanco pegada al cristal.
📷 Imagen generada con IA

En resumen

  • La tarifa por token es un precio unitario: dice lo que cuesta cada trozo de texto que entra y sale, no lo que cuesta terminar un encargo.
  • Artificial Analysis mide tres modelos con la misma tarifa —2 dólares el millón de tokens de entrada y 10 el millón de salida— y su coste por tarea va de 0,72 a 7,67 dólares.
  • Un cuarto cobra el doble por token y sale más barato por tarea que el más caro de los tres: la lista de precios no ordena la factura.
  • El dinero se va sobre todo por la entrada: en el modelo más caro, el 58 % de la factura es releer un contexto que ya se había leído.
  • Y el coste por tarea de un ranking es la media de sus tareas, no de las de cada uno.

Un token es la unidad que se factura, y no es la palabra

La tarifa de un modelo cabe en dos números: tanto por millón de tokens de entrada y tanto por millón de salida. Es la primera cifra que publica cualquier proveedor y la primera que se compara, porque es la única que se entiende sin hacer nada.

Conviene hacer la conversión una vez y no volver a dudar. A 10 dólares por millón de tokens de salida, cien mil tokens cuestan 1 dólar: tokens dividido por un millón, multiplicado por la tarifa.

Y ahí está la trampa de todo precio unitario: dice lo que vale cada unidad y no cuántas hacen falta. Un producto a mitad de precio sale más caro si hay que comprar el triple.

Lo que se paga no es la tarifa: es la tarea entera

Un encargo de verdad no es una llamada al modelo: son muchas. Lee el enunciado, consulta ficheros, escribe, prueba lo que ha escrito, ve que falla y lo arregla. Cada paso es un turno, y cada turno se factura aparte.

Por eso el coste por tarea es la cifra que paga quien usa el modelo de verdad. Comparar tarifas es comparar el precio del kilo de harina; el coste por tarea es el precio del pan.

Quién pone esas cifras y con qué pruebas

La distinción importa porque un coste por tarea no se estima desde fuera: hay que ejecutar los trabajos y pagar la factura. Quien publica la cifra es quien ha pasado la batería, y la cifra vale para esa batería.

La tabla es la lección entera: la misma tarifa y diez veces de diferencia

Lo que cobran por token y lo que acaban costando
Modelo (ajuste medido) Entrada $/millón Salida $/millón Tokens de salida por tarea Coste por tarea
GPT-6.1 Sol («max») 2 10 38.128 0,72 $
Gemini 4 Argon («high») 2 10 61.558 1,99 $
Claude Sonnet 5.5 («max with fallback») 2 10 197.430 7,67 $
Claude Opus 5.5 («max with fallback») 4 20 119.166 5,98 $
Mide Artificial Analysis con sus propias pruebas; cifras consultadas el 2 de octubre de 2026. El ajuste de esfuerzo es distinto en cada fila y así lo publica el sitio. La tarifa de Gemini 4 Argon es su precio de estreno: Google ha anunciado que, al acabar ese periodo, pasará a 4 dólares el millón de entrada y 20 el millón de salida. La ficha del sitio muestra el total del coste por tarea y no su reparto; el desglose va en los datos que carga la propia página y se detalla más abajo.

Hay dos cosas que mirar en esa tabla, y no son la columna del precio. La primera: las tres filas de arriba cobran exactamente lo mismo por token, 2 y 10 dólares por millón, y su coste por tarea va de 0,72 a 7,67 dólares. Diez veces y media, a tarifa idéntica.

La segunda: la cuarta fila cobra el doble por token y aun así sale más barata por tarea que la tercera, 5,98 frente a 7,67 dólares. La lista de precios no ordena la factura.

El mismo modelo cambia de sitio según el mando: Claude Sonnet 5.5 baja de 7,67 a 2,75 dólares por tarea con solo pasar de «max» a «xhigh», y su índice de inteligencia cae de 56 a 52.

La cuenta de dos líneas, hecha delante del lector

De qué está hecha cada factura, en dólares por tarea
Modelo (ajuste medido) Coste por tarea Entrada, total Entrada sin caché Lectura de caché Escritura de caché Salida
GPT-6.1 Sol («max») 0,72 0,34 0,04 0,12 0,18 0,38
Gemini 4 Argon («high») 1,99 1,37 0,08 0,32 0,98 0,62
Claude Sonnet 5.5 («max with fallback») 7,67 5,69 0,05 4,41 1,23 1,97
Claude Opus 5.5 («max with fallback») 5,98 3,60 0,10 2,42 1,07 2,38
Reparto del coste por tarea, en dólares, según las cifras de Artificial Analysis consultadas el 2 de octubre de 2026. El sitio no muestra este reparto en su ficha: va en los datos que sirve con la propia página. Los ajustes de esfuerzo y el orden de las filas son los de la tabla anterior. Las partes suman el total: entrada más salida da el coste por tarea, y la entrada sin caché, la lectura de caché y la escritura de caché dan la entrada. Están redondeadas a dos decimales, así que alguna suma a mano puede desviarse un céntimo.

Primera línea, de dónde sale la factura. Lo que se paga por una llamada es tokens de entrada por precio de entrada, más tokens de salida por precio de salida. Pero una tarea agéntica no es una llamada: son muchos turnos, y en cada turno el modelo vuelve a leer lo que ya había —las instrucciones, los ficheros, lo que él mismo escribió antes—. Esa relectura se paga como entrada, turno a turno.

Segunda línea, por qué la tarifa no decide. A igual tarifa, lo que mueve el total es cuántos tokens hacen falta. Claude Sonnet 5.5 a «max» gasta de media 197.430 tokens de salida por tarea; a 10 dólares el millón, eso son 1,97 dólares. Y 1,97 es justo lo que da la columna de salida de Sonnet 5.5 en el desglose de aquí arriba: la cuenta cuadra.

Pero el coste por tarea medido es 7,67 dólares. Los otros 5,69 los pone la entrada, y el desglose dice de qué: 4,41 son lectura de caché —releer contexto que el modelo ya había visto—, 1,23 la escritura de esa caché, que es lo que cuesta guardar ese contexto la primera vez para releerlo barato después, y solo 0,05 dólares son entrada nueva. Dicho de la forma que importa: el 58 % de la factura de Sonnet 5.5 a «max» es volver a leer lo mismo turno tras turno.

El contraste está en la primera fila. En GPT-6.1 Sol a «max» la lectura de caché son 0,12 dólares de 0,72: un 17 % de la factura, frente al 58 % de Sonnet 5.5. Misma tarifa por token y un reparto completamente distinto. El modelo caro no es caro por lo que escribe: es caro por lo que vuelve a leer.

Y conviene saber de dónde sale ese reparto, porque buscarlo es parte de la lección: Artificial Analysis no lo muestra en su ficha —ahí se ve el total— sino en los datos que carga la propia página, donde las partes reconstruyen el total al céntimo.

Buena parte de esa salida es el modelo pensando para sí mismo

De los 197.430 tokens de salida que Claude Sonnet 5.5 gasta de media por tarea a «max», 146.633 son de razonamiento y 50.797 de respuesta: el usuario lee una cuarta parte de lo que paga.

En el modelo más barato el razonamiento pesa algo menos, pero sigue siendo la mayor parte: GPT-6.1 Sol a «max» gasta 25.190 tokens de razonamiento y 12.938 de respuesta. Lo que más separa a estos dos modelos no es en qué se gastan los tokens, es cuántos necesitan.

De ahí sale la decisión práctica: bajar el esfuerzo recorta la factura porque recorta esos tokens, y recorta el resultado. No es un ajuste técnico, es un intercambio.

La relectura es lo que más engorda la factura y lo que más se abarata

Las tarifas de caché las publica cada proveedor y son muy distintas entre sí. Google anunció el 30 de septiembre de 2026, al presentar Gemini 4 Argon, un 95 % de descuento sobre el precio de entrada para los tokens que vengan de caché. Anthropic —la empresa que vende Claude— cobra la lectura de caché de Sonnet 5.5 y de Opus 5.5 a 0,20 dólares el millón.

Con eso se cierra el círculo: lo que engorda la factura es la relectura de cada turno, y lo que la adelgaza es que se cobre barata.

Y no depende solo del proveedor: depende de la forma del trabajo. Una tarea que arrastra el mismo contexto veinte turnos aprovecha la caché; veinte tareas cortas, no.

Cuatro comprobaciones antes de elegir, y una advertencia

La primera, buscar el coste por tarea y no solo el precio por millón. Una comparativa que solo trae tarifas no dice nada de lo que cuesta acabar un trabajo.

La segunda, mirar a qué nivel de esfuerzo está medido cada modelo. El salto de 7,67 a 2,75 dólares de Sonnet 5.5 entre dos niveles es mayor que la distancia entre modelos distintos.

La tercera, comprobar si la tarifa es promocional. Los 2 y 10 dólares de Gemini 4 Argon son un precio de estreno y Google ya ha publicado a cuánto se irá después: 4 y 20. Quien monte sus cuentas sobre el precio de hoy las verá duplicarse sin cambiar nada.

La cuarta es la advertencia, y es la que hay que llevarse: el coste por tarea de un ranking es la media de sus tareas, no de las de cada uno. Resume una batería concreta, con sus longitudes, sus herramientas y sus reintentos. Y el desglose añade una razón más: el reparto entre entrada y salida depende por completo de la forma de la tarea, así que una media ajena no dice qué parte de la factura propia será relectura. La comprobación definitiva es pasar diez encargos reales del trabajo propio por dos modelos y mirar la factura del proveedor.

Conclusión

La tarifa por token es un precio unitario y, como todos, dice la mitad: lo que vale cada unidad y nunca cuántas hacen falta. En la tabla de hoy, el que cobra el doble por token no es el más caro por tarea, y los tres que cobran lo mismo se separan por diez. Y el desglose dice en qué se fue el dinero: el 58 % de la factura del más caro es contexto releído. La cifra que hay que buscar es el coste por tarea; la que hay que calcular, el de las tareas propias.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuación natural

    Aprende IA a tu ritmo con nuestros cursos gratuitos.

    En nuestra plataforma de aprendizaje TAKU podrás acceder a este y muchos otros cursos de manera totalmente gratuita.

    APRENDER CON TAKU

    ← Volver al blog