Infraestructura

Prime Intellect: ara ven la resposta, no només la màquina

Prime Intellect va presentar el 2 d'octubre de 2026 Prime Inference, el seu propi servei d'inferència per a models de pesos oberts, i el va acompanyar d'un paquet de millores internes amb xifres rodones: la mediana d'espera a la cua baixa de 550 a 110 mil·lisegons i la memòria de context creix al voltant d'un 50 %. Totes aquestes xifres les mesura i les publica la mateixa empresa, que és qui cobra pel servei, i cap no té auditoria externa. De preus, res: no en publica.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Vinyeta: en una sala de vistes, el mateix home hi apareix dues vegades. A l'esquerra, enfilat darrere l'estrada, duu toga negra, sosté el martell i somriu amb els ulls mig aclucats. A la dreta, més avall i dins l'estrada dels testimonis, la mateixa cara exacta, amb vestit, llegeix en veu alta d'una targeta en blanc. El frontal de l'estrada i el passamà de la banqueta duen l'ull verd de Nvidia.
📷 Imatge generada amb IA

En resum

  • Prime Intellect —empresa estatunidenca amb seu a San Francisco, fundada el 2023, que lloga còmput distribuït i entrena models de pesos oberts— va anunciar Prime Inference el 2 d'octubre de 2026.
  • Diu que sosté 66 sessions per grup de prefill a 101 tokens per segon i usuari, que treu 100 tokens de sortida per segon i GPU i que processa gairebé un bilió de tokens al dia, un milió de milions.
  • Separar el prefill de la descodificació retalla gairebé un 40 % la latència p90 entre tokens, i el nou planificador baixa al voltant d'un 20 % la mediana del temps fins al primer token.
  • Totes les xifres de rendiment són pròpies i sense auditoria externa. Les dues úniques referències a tercers les cita la mateixa empresa: el lloc del seu punt d'accés entre els més ràpids de GLM-5.3 a OpenRouter i una menció a AgentX, de SemiAnalysis.
  • No publica preus. Segons la informació publicada sobre la seva última ronda, Nvidia Ventures figura entre els seus inversors, i totes les proves estan fetes sobre maquinari GB200 de Nvidia.

De llogar la màquina a vendre la resposta

Prime Intellect és una empresa estatunidenca amb seu a San Francisco, fundada el 2023, que lloga còmput distribuït i entrena models de pesos oberts. Segons la informació publicada sobre les seves rondes, va tancar una sèrie A de 130 milions de dòlars liderada per Radical Ventures que la va valorar en 1.000 milions, amb Nvidia Ventures, Intel Capital i Dell Technologies Capital entre els participants; abans havia aixecat 15 milions amb Founders Fund al capdavant, el febrer de 2025, i una ronda llavor de 5,5 milions l'abril de 2024, codirigida per CoinFund i Distributed Global.

El 2 d'octubre de 2026 va presentar Prime Inference i amb això va canviar d'ofici: ja no lloga només la màquina perquè un altre hi munti el servei a sobre, sinó que ven directament la resposta. Corre sobre Blackwell de Nvidia, amb els GB200 NVL72 com a banc de proves, i l'empresa diu que passarà a Vera Rubin quan arribi aquesta generació. El volum que declara avui és de gairebé un bilió de tokens cada dia, un milió de milions.

La decisió de disseny que ordena tota la resta és partir en dos la feina de respondre i repartir-la entre grups de màquines diferents.

Partir la feina en dos i posar ordre a la cua

Fet el repartiment, Prime Intellect diu que sosté 66 sessions alhora per cada grup de màquines dedicat al prefill, a 101 tokens per segon i usuari, i 100 tokens de sortida per segon i GPU a la part que escriu. L'efecte que destaca no és la mitjana, sinó la regularitat: la latència p90 entre un token i el següent —el retard que no superen 90 de cada 100 vegades— baixa gairebé un 40 % en separar les dues fases. És la diferència entre una resposta que avança a ritme constant i una que s'encalla cada poques paraules.

L'altre front és el planificador, la peça que decideix quina petició entra a quina màquina i quan. Amb el nou, la mediana d'espera a la cua passa de 550 a 110 mil·lisegons i la mediana del temps fins al primer token cau al voltant d'un 20 %. Aquests dos percentatges van solts a propòsit: l'empresa no publica els valors absoluts d'on surten, així que no es poden refer ni posar al costat d'un abans.

La resta és memòria, cables i nuclis

El que Prime Intellect diu que ha millorat
Què es mesura Abans Després
Mediana d'espera a la cua 550 mil·lisegons 110 mil·lisegons
Tokens en memòria cau KV per descodificador 1,09 milions 1,63 milions
Transferència mitjana per NVLink 146 mil·lisegons 78 mil·lisegons
Nucli d'atenció sobre GB200 13,7 microsegons (FP8) 12,0 microsegons (NVFP4)
Totes les xifres les mesura i les publica Prime Intellect, que ven el servei; no hi ha auditoria independent de cap d'elles. L'empresa no publica preus. Nvidia Ventures figura entre els seus inversors i les proves estan fetes sobre maquinari GB200 de Nvidia.

La memòria cau es desa comprimida en NVFP4, un format de coma flotant que guarda cada nombre en quatre bits, i amb això hi caben 1,63 milions de tokens en memòria cau per descodificador en lloc d'1,09 milions: al voltant d'un 50 % més sense canviar de targeta.

Les altres dues millores són fontaneria fina. Canviant la disposició de les dades a la memòria, el temps mitjà de transferència per NVLink —l'enllaç intern que connecta les GPU entre si— baixa de 146 a 78 mil·lisegons. I el nucli d'atenció reescrit per al GB200 resol la seva part en 12,0 microsegons en NVFP4, davant dels 13,7 en FP8 i els 17,7 en la variant per etapes del mateix NVFP4: són diferències de microsegons, però es paguen a cada token que es genera.

Les quatre millores, juntes, són l'expedient amb què l'empresa sosté que el seu servei aguanta converses llargues i molts usuaris alhora.

Les xifres les posa qui ven el servei

Tot l'anterior l'ha mesurat i l'ha publicat Prime Intellect, i Prime Intellect és qui cobra pel servei. No hi ha auditoria ni mesurament independent de cap d'aquestes xifres: ni dels tokens per segon, ni de les cues, ni de la memòria cau, ni dels nuclis. Són resultats de banc de proves propi, amb la configuració que tria la casa i sobre el maquinari que tria la casa.

Hi ha, això sí, dues referències a tercers a l'anunci, i convé saber què mesuren. Una és de velocitat i disponibilitat al mercat: l'empresa situa el seu punt d'accés per a GLM-5.3 —el model de pesos oberts de la xinesa Z.ai— entre els més ràpids de GLM-5.3 a OpenRouter, el llistat on diversos proveïdors ofereixen el mateix model i es comparen entre si, amb un 100 % de disponibilitat des que el va llançar, el 22 de setembre. L'altra és una menció a AgentX, de SemiAnalysis —consultora d'anàlisi del sector dels semiconductors—, que reprodueix sessions d'agent de diversos torns. Totes dues les cita la mateixa empresa i cap no audita els números de dalt.

I falta el preu. Prime Intellect no publica tarifes de Prime Inference, així que no hi ha manera de saber què costa cadascun d'aquests tokens per segon. Queda una coincidència per declarar: segons la informació publicada sobre la seva última ronda, Nvidia Ventures figura entre els seus inversors, i tots els mesuraments estan fets sobre maquinari GB200 de Nvidia, de manera que qui posa el banc de proves i qui posa part dels diners són la mateixa casa.

Conclusió

Prime Inference és un moviment de negoci abans que un anunci tècnic: qui llogava la màquina passa a vendre el que la màquina produeix, i ho fa ensenyant la fontaneria en lloc del catàleg. El que explica —cues més curtes, més context a la memòria, transferències a la meitat— és exactament la feina que separa un servei d'inferència que aguanta d'un que cau a la tercera conversa llarga. L'expedient, en canvi, és incomplet mentre no el mesuri ningú de fora i no hi hagi una tarifa al costat: sense aquestes dues coses hi ha un informe ben documentat pel seu autor, no un servei que es pugui jutjar.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog