Infraestructura
Prime Intellect: ara ven la resposta, no només la màquina
Prime Intellect va presentar el 2 d'octubre de 2026 Prime Inference, el seu propi servei d'inferència per a models de pesos oberts, i el va acompanyar d'un paquet de millores internes amb xifres rodones: la mediana d'espera a la cua baixa de 550 a 110 mil·lisegons i la memòria de context creix al voltant d'un 50 %. Totes aquestes xifres les mesura i les publica la mateixa empresa, que és qui cobra pel servei, i cap no té auditoria externa. De preus, res: no en publica.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Prime Intellect —empresa estatunidenca amb seu a San Francisco, fundada el 2023, que lloga còmput distribuït i entrena models de pesos oberts— va anunciar Prime Inference el 2 d'octubre de 2026.
- Diu que sosté 66 sessions per grup de prefill a 101 tokens per segon i usuari, que treu 100 tokens de sortida per segon i GPU i que processa gairebé un bilió de tokens al dia, un milió de milions.
- Separar el prefill de la descodificació retalla gairebé un 40 % la latència p90 entre tokens, i el nou planificador baixa al voltant d'un 20 % la mediana del temps fins al primer token.
- Totes les xifres de rendiment són pròpies i sense auditoria externa. Les dues úniques referències a tercers les cita la mateixa empresa: el lloc del seu punt d'accés entre els més ràpids de GLM-5.3 a OpenRouter i una menció a AgentX, de SemiAnalysis.
- No publica preus. Segons la informació publicada sobre la seva última ronda, Nvidia Ventures figura entre els seus inversors, i totes les proves estan fetes sobre maquinari GB200 de Nvidia.
De llogar la màquina a vendre la resposta
Prime Intellect és una empresa estatunidenca amb seu a San Francisco, fundada el 2023, que lloga còmput distribuït i entrena models de pesos oberts. Segons la informació publicada sobre les seves rondes, va tancar una sèrie A de 130 milions de dòlars liderada per Radical Ventures que la va valorar en 1.000 milions, amb Nvidia Ventures, Intel Capital i Dell Technologies Capital entre els participants; abans havia aixecat 15 milions amb Founders Fund al capdavant, el febrer de 2025, i una ronda llavor de 5,5 milions l'abril de 2024, codirigida per CoinFund i Distributed Global.
El 2 d'octubre de 2026 va presentar Prime Inference i amb això va canviar d'ofici: ja no lloga només la màquina perquè un altre hi munti el servei a sobre, sinó que ven directament la resposta. Corre sobre Blackwell de Nvidia, amb els GB200 NVL72 com a banc de proves, i l'empresa diu que passarà a Vera Rubin quan arribi aquesta generació. El volum que declara avui és de gairebé un bilió de tokens cada dia, un milió de milions.
La decisió de disseny que ordena tota la resta és partir en dos la feina de respondre i repartir-la entre grups de màquines diferents.
Partir la feina en dos i posar ordre a la cua
Fet el repartiment, Prime Intellect diu que sosté 66 sessions alhora per cada grup de màquines dedicat al prefill, a 101 tokens per segon i usuari, i 100 tokens de sortida per segon i GPU a la part que escriu. L'efecte que destaca no és la mitjana, sinó la regularitat: la latència p90 entre un token i el següent —el retard que no superen 90 de cada 100 vegades— baixa gairebé un 40 % en separar les dues fases. És la diferència entre una resposta que avança a ritme constant i una que s'encalla cada poques paraules.
L'altre front és el planificador, la peça que decideix quina petició entra a quina màquina i quan. Amb el nou, la mediana d'espera a la cua passa de 550 a 110 mil·lisegons i la mediana del temps fins al primer token cau al voltant d'un 20 %. Aquests dos percentatges van solts a propòsit: l'empresa no publica els valors absoluts d'on surten, així que no es poden refer ni posar al costat d'un abans.
La resta és memòria, cables i nuclis
| Què es mesura | Abans | Després |
|---|---|---|
| Mediana d'espera a la cua | 550 mil·lisegons | 110 mil·lisegons |
| Tokens en memòria cau KV per descodificador | 1,09 milions | 1,63 milions |
| Transferència mitjana per NVLink | 146 mil·lisegons | 78 mil·lisegons |
| Nucli d'atenció sobre GB200 | 13,7 microsegons (FP8) | 12,0 microsegons (NVFP4) |
La memòria cau es desa comprimida en NVFP4, un format de coma flotant que guarda cada nombre en quatre bits, i amb això hi caben 1,63 milions de tokens en memòria cau per descodificador en lloc d'1,09 milions: al voltant d'un 50 % més sense canviar de targeta.
Les altres dues millores són fontaneria fina. Canviant la disposició de les dades a la memòria, el temps mitjà de transferència per NVLink —l'enllaç intern que connecta les GPU entre si— baixa de 146 a 78 mil·lisegons. I el nucli d'atenció reescrit per al GB200 resol la seva part en 12,0 microsegons en NVFP4, davant dels 13,7 en FP8 i els 17,7 en la variant per etapes del mateix NVFP4: són diferències de microsegons, però es paguen a cada token que es genera.
Les quatre millores, juntes, són l'expedient amb què l'empresa sosté que el seu servei aguanta converses llargues i molts usuaris alhora.
Les xifres les posa qui ven el servei
Tot l'anterior l'ha mesurat i l'ha publicat Prime Intellect, i Prime Intellect és qui cobra pel servei. No hi ha auditoria ni mesurament independent de cap d'aquestes xifres: ni dels tokens per segon, ni de les cues, ni de la memòria cau, ni dels nuclis. Són resultats de banc de proves propi, amb la configuració que tria la casa i sobre el maquinari que tria la casa.
Hi ha, això sí, dues referències a tercers a l'anunci, i convé saber què mesuren. Una és de velocitat i disponibilitat al mercat: l'empresa situa el seu punt d'accés per a GLM-5.3 —el model de pesos oberts de la xinesa Z.ai— entre els més ràpids de GLM-5.3 a OpenRouter, el llistat on diversos proveïdors ofereixen el mateix model i es comparen entre si, amb un 100 % de disponibilitat des que el va llançar, el 22 de setembre. L'altra és una menció a AgentX, de SemiAnalysis —consultora d'anàlisi del sector dels semiconductors—, que reprodueix sessions d'agent de diversos torns. Totes dues les cita la mateixa empresa i cap no audita els números de dalt.
I falta el preu. Prime Intellect no publica tarifes de Prime Inference, així que no hi ha manera de saber què costa cadascun d'aquests tokens per segon. Queda una coincidència per declarar: segons la informació publicada sobre la seva última ronda, Nvidia Ventures figura entre els seus inversors, i tots els mesuraments estan fets sobre maquinari GB200 de Nvidia, de manera que qui posa el banc de proves i qui posa part dels diners són la mateixa casa.
Conclusió
Prime Inference és un moviment de negoci abans que un anunci tècnic: qui llogava la màquina passa a vendre el que la màquina produeix, i ho fa ensenyant la fontaneria en lloc del catàleg. El que explica —cues més curtes, més context a la memòria, transferències a la meitat— és exactament la feina que separa un servei d'inferència que aguanta d'un que cau a la tercera conversa llarga. L'expedient, en canvi, és incomplet mentre no el mesuri ningú de fora i no hi hagi una tarifa al costat: sense aquestes dues coses hi ha un informe ben documentat pel seu autor, no un servei que es pugui jutjar.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentaris