Bloggartiklarna publiceras på spanska och katalanska.

Infraestructura

Prime Intellect: ahora vende la respuesta, no solo la máquina

Prime Intellect presentó el 2 de octubre de 2026 Prime Inference, su propio servicio para responder con modelos de pesos abiertos, y lo acompañó de un paquete de mejoras internas con cifras redondas: la espera mediana en la cola baja de 550 a 110 milisegundos y la memoria de contexto crece en torno a un 50 %. Todas esas cifras las mide y las publica la propia empresa, que es quien cobra por el servicio, y ninguna tiene auditoría externa. De precios, nada: no los publica.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Viñeta: en una sala de vistas, el mismo hombre aparece dos veces. A la izquierda, encaramado tras el estrado, viste toga negra, sostiene el mazo y sonríe con los ojos entornados. A la derecha, más abajo y dentro del estrado de testigos, la misma cara exacta, de traje, lee en voz alta de una tarjeta en blanco. El frente del estrado y el pasamanos del banquillo llevan el ojo verde de Nvidia.
📷 Imagen generada con IA

En resumen

  • Prime Intellect —empresa estadounidense con sede en San Francisco, fundada en 2023, que alquila computación distribuida y entrena modelos de pesos abiertos— anunció Prime Inference el 2 de octubre de 2026.
  • Dice sostener 66 sesiones por grupo de prefill a 101 tokens por segundo y usuario, sacar 100 tokens de salida por segundo y GPU y procesar casi un billón de tokens al día, un millón de millones.
  • Separar el prefill de la decodificación recorta casi un 40 % la latencia p90 entre tokens, y el nuevo planificador baja en torno a un 20 % el tiempo mediano hasta el primer token.
  • Todas las cifras de rendimiento son propias y sin auditoría externa. Las dos únicas referencias a terceros las cita la propia empresa: el puesto de su punto de acceso entre los más rápidos de GLM-5.3 en OpenRouter y una mención a AgentX, de SemiAnalysis.
  • No publica precios. Según la información publicada sobre su última ronda, Nvidia Ventures figura entre sus inversores, y todas las pruebas están hechas sobre hardware GB200 de Nvidia.

De alquilar la máquina a vender la respuesta

Prime Intellect es una empresa estadounidense con sede en San Francisco, fundada en 2023, que alquila computación distribuida y entrena modelos de pesos abiertos. Según la información publicada sobre sus rondas, cerró una serie A de 130 millones de dólares liderada por Radical Ventures que la valoró en 1.000 millones, con Nvidia Ventures, Intel Capital y Dell Technologies Capital entre los participantes; antes había levantado 15 millones con Founders Fund al frente, en febrero de 2025, y una ronda semilla de 5,5 millones en abril de 2024, codirigida por CoinFund y Distributed Global.

El 2 de octubre de 2026 presentó Prime Inference y con ello se cambió de oficio: ya no alquila solo la máquina para que otro monte el servicio encima, sino que vende directamente la respuesta. Corre sobre Blackwell de Nvidia, con los GB200 NVL72 como banco de pruebas, y la empresa dice que pasará a Vera Rubin cuando llegue esa generación. El volumen que declara hoy es de casi un billón de tokens cada día, un millón de millones.

La decisión de diseño que ordena todo lo demás es partir en dos el trabajo de responder y repartirlo entre grupos de máquinas distintos.

Partir el trabajo en dos y poner orden en la cola

Hecho el reparto, Prime Intellect dice sostener 66 sesiones a la vez por cada grupo de máquinas dedicado al prefill, a 101 tokens por segundo y usuario, y 100 tokens de salida por segundo y GPU en la parte que escribe. El efecto que destaca no es la media, sino la regularidad: la latencia p90 entre un token y el siguiente —el retraso que no superan 90 de cada 100 veces— baja casi un 40 % al separar las dos fases. Es la diferencia entre una respuesta que avanza a ritmo constante y una que se atasca cada pocas palabras.

El otro frente es el planificador, la pieza que decide qué petición entra en qué máquina y cuándo. Con el nuevo, la espera mediana en la cola pasa de 550 a 110 milisegundos y el tiempo mediano hasta el primer token cae en torno a un 20 %. Estos dos porcentajes van sueltos a propósito: la empresa no publica los valores absolutos de los que salen, así que no se pueden rehacer ni poner al lado de un antes.

El resto es memoria, cables y núcleos

Lo que Prime Intellect dice que ha mejorado
Qué se mide Antes Después
Espera mediana en la cola 550 milisegundos 110 milisegundos
Tokens en caché KV por decodificador 1,09 millones 1,63 millones
Transferencia media por NVLink 146 milisegundos 78 milisegundos
Núcleo de atención sobre GB200 13,7 microsegundos (FP8) 12,0 microsegundos (NVFP4)
Todas las cifras las mide y las publica Prime Intellect, que vende el servicio; no hay auditoría independiente de ninguna de ellas. La empresa no publica precios. Nvidia Ventures figura entre sus inversores y las pruebas están hechas sobre hardware GB200 de Nvidia.

La caché se guarda comprimida en NVFP4, un formato de coma flotante que guarda cada número en cuatro bits, y con eso caben 1,63 millones de tokens cacheados por decodificador en lugar de 1,09 millones: en torno a un 50 % más sin cambiar de tarjeta.

Las otras dos mejoras son fontanería fina. Cambiando la disposición de los datos en memoria, el tiempo medio de transferencia por NVLink —el enlace interno que conecta las GPU entre sí— baja de 146 a 78 milisegundos. Y el núcleo de atención reescrito para GB200 resuelve su parte en 12,0 microsegundos en NVFP4, frente a 13,7 en FP8 y 17,7 en la variante por etapas del propio NVFP4: son diferencias de microsegundos, pero se pagan en cada token que se genera.

Las cuatro mejoras, juntas, son el expediente con el que la empresa sostiene que su servicio aguanta conversaciones largas y muchos usuarios a la vez.

Las cifras las pone quien vende el servicio

Todo lo anterior lo ha medido y lo ha publicado Prime Intellect, y Prime Intellect es quien cobra por el servicio. No hay auditoría ni medición independiente de ninguna de esas cifras: ni de los tokens por segundo, ni de las colas, ni de la caché, ni de los núcleos. Son resultados de banco de pruebas propio, con la configuración que elige la casa y sobre el hardware que elige la casa.

Hay, eso sí, dos referencias a terceros en el anuncio, y conviene saber qué miden. Una es de velocidad y disponibilidad en el mercado: la empresa sitúa su punto de acceso para GLM-5.3 —el modelo de pesos abiertos de la china Z.ai— entre los más rápidos de GLM-5.3 en OpenRouter, el listado donde varios proveedores ofrecen el mismo modelo y se comparan entre sí, con un 100 % de disponibilidad desde que lo lanzó, el 22 de septiembre. La otra es una mención a AgentX, de SemiAnalysis —consultora de análisis del sector de los semiconductores—, que reproduce sesiones de agente de varios turnos. Las dos las cita la propia empresa y ninguna audita los números de arriba.

Y falta el precio. Prime Intellect no publica tarifas de Prime Inference, así que no hay manera de saber qué cuesta cada uno de esos tokens por segundo. Queda una coincidencia por declarar: según la información publicada sobre su última ronda, Nvidia Ventures figura entre sus inversores, y todas las mediciones están hechas sobre hardware GB200 de Nvidia, de modo que quien pone el banco de pruebas y quien pone parte del dinero son la misma casa.

Conclusión

Prime Inference es un movimiento de negocio antes que un anuncio técnico: quien alquilaba la máquina pasa a vender lo que la máquina produce, y lo hace enseñando la fontanería en vez del catálogo. Lo que cuenta —colas más cortas, más contexto en memoria, transferencias a la mitad— es exactamente el trabajo que separa un servicio de inferencia que aguanta de uno que se cae a la tercera conversación larga. El expediente, en cambio, está incompleto mientras no lo mida nadie de fuera y no haya una tarifa al lado: sin esas dos cosas hay un informe bien documentado por su autor, no un servicio que se pueda juzgar.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog