Recerca
Nvidia es treu un 100 % en una prova que canvia segons l'arnès
Nvidia va anunciar el 5 d'octubre de 2026 que AVO, el seu sistema d'agents, arriba al 100 % a ARC-AGI-3, la prova de raonament general que administra ARC Prize. La xifra la comunica la mateixa empresa que ven el sistema, li falta la verificació independent d'ARC Prize i no consta amb quin arnès d'execució es va mesurar. Aquest buit no és cap detall: el setembre de 2026, l'anàlisi independent d'ARC Prize sobre un altre model va donar, en aquesta mateixa prova, entre un 62,7 % i un 99,9 % segons l'entorn d'execució.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Nvidia va publicar el 5 d'octubre de 2026 que AVO, el seu sistema d'agents, arriba al 100 % a ARC-AGI-3, i ho presenta com la demostració d'una arquitectura de propòsit general per a agents autònoms d'horitzó llarg.
- La xifra surt del blog per a desenvolupadors de Nvidia i li falta la verificació independent d'ARC Prize, que és qui administra la prova i qui contrasta els resultats que anuncien els fabricants. Fins que aquesta rèplica no existeixi, el 100 % és una afirmació del fabricant.
- No consta amb quin arnès d'execució es va mesurar, ni en quina variant de la prova, ni quants intents va tenir el sistema, ni quanta computació va costar. Sense l'arnès, la puntuació no es pot comparar amb cap altra.
- La vara de mesurar ja hi era: el setembre de 2026, l'anàlisi independent d'ARC Prize sobre GPT-6 Astra a ARC-AGI-3 Semi-Private va donar, amb el mateix model, un 62,7 % amb l'arnès estàndard i un 99,9 % amb el Provider Adapter harness.
- AVO i GPT-6 Astra són dos sistemes diferents, de dues empreses diferents: les quatre xifres juntes no diuen qui guanya, diuen quant es mou la prova segons l'embolcall.
Un 100 % del qual no consta l'arnès
El 5 d'octubre de 2026, Nvidia va publicar al seu blog per a desenvolupadors que AVO, el seu sistema d'agents, arriba al 100 % a ARC-AGI-3. A més, el titular de l'anunci emmarca el resultat com la demostració d'una arquitectura de propòsit general per a agents autònoms d'horitzó llarg. Això és el que sosté l'empresa: una xifra rodona i una interpretació.
El que no hi ha és la resta. No consta amb quin arnès es va executar la prova, ni en quina variant d'ARC-AGI-3 es va mesurar —la que va fer servir ARC Prize el setembre és la semiprivada—, ni quants intents va tenir el sistema, ni quanta computació va caldre per arribar al 100 %. Aquest buit no és un flanc menor de l'anunci: és exactament el que impedeix comparar-lo.
Una puntuació de referència sense l'arnès amb què es va obtenir s'assembla a un temps de volta sense dir el circuit. No és que sigui falsa. És que no es pot posar al costat de cap altra.
La mateixa prova ja havia donat un 62,7 % i un 99,9 %
Veure les dades en una taula
| Nvidia AVO, arnès no detallat | Provider Adapter harness (GPT-6 Astra) | Arnès propi d'OpenAI (GPT-6 Astra) | Arnès estàndard d'ARC Prize (GPT-6 Astra) | |
|---|---|---|---|---|
| Puntuació | 100% | 99,9% | 98,6% | 62,7% |
El setembre de 2026, ARC Prize va analitzar GPT-6 Astra, el model d'OpenAI, a ARC-AGI-3 Semi-Private. Amb el mateix model i la mateixa prova, el resultat va ser del 62,7 % amb l'arnès estàndard de l'organització —un entorn en què el model decideix quines notes conserva— i del 99,9 % amb el Provider Adapter harness, que preserva l'estat de raonament opac entre una petició i la següent i compacta les converses llargues. L'arnès propi d'OpenAI, construït sobre la seva responses API, es va quedar en el 98,6 %.
Més de trenta-set punts de diferència sense tocar el model. Quan una mateixa prova dona un 62,7 % o un 99,9 % segons l'entorn en què s'executa, la xifra sola ha deixat de ser informació suficient: el que cal saber és quin embolcall se li va posar.
Les quatre xifres apareixen juntes al gràfic, i convé dir per a què. AVO i GPT-6 Astra són dos sistemes diferents, de dues empreses diferents: les barres estan juntes per mostrar la dispersió de la prova, no per declarar un guanyador. El 100 % tampoc no està al mateix nivell que els altres tres valors, perquè és l'únic que no ha passat per cap mesurament independent.
L'arnès més barat va ser el que va treure més nota
| Arnès d'execució | Puntuació | Cost de computació |
|---|---|---|
| Arnès estàndard d'ARC Prize | 62,7 % | 26.000 dòlars |
| Provider Adapter harness | 99,9 % | 19.000 dòlars |
| Arnès propi d'OpenAI (responses API) | 98,6 % | No consta |
L'arnès no canvia només la nota: canvia la factura. El 62,7 % de l'arnès estàndard va costar 26.000 dòlars de computació, i el 99,9 % del Provider Adapter harness, 19.000. Més puntuació per menys diners, amb el mateix model al davant. La diferència era a l'embolcall.
De la mateixa anàlisi surt una dada que resisteix millor la discussió metodològica, i convé posar-la al costat: amb el Provider Adapter harness, Astra va necessitar menys accions que la mediana dels avaluadors humans en el 96 % dels nivells, i un 51,7 % menys d'accions per nivell de mitjana. Això no ho regala cap embolcall generós; parla de com resol.
Per això l'arnès no és un detall d'enginyeria que es pugui ometre en un anunci. És la meitat del resultat, i és la meitat que decideix si la xifra es pot comparar amb la de la setmana passada.
«Nivell frontier» és una afirmació, no un mesurament
Nvidia presenta el 100 % d'AVO com a prova d'una arquitectura de propòsit general de nivell frontier per a agents autònoms d'horitzó llarg. És una descripció de producte i l'empresa té tot el dret de fer-la. El que no és, encara, és un resultat establert.
El que el convertiria en això s'enumera en una línia: que ARC Prize executi la prova i publiqui amb quin arnès, en quina variant, amb quants intents i a quin cost. Mentre això no passi, el 100 % és el que diu el fabricant, i qui mesura és el mateix que ven.
No és cap sospita sobre AVO, que pot ser tan bo com s'anuncia. És l'ordre en què es fan les coses quan la prova mateixa ha demostrat que es mou d'un 62,7 % a un 99,9 % segons l'embolcall: primer el mesurament independent i després el titular.
Conclusió
El 100 % d'AVO pot ser cert i pot ser excel·lent, i la verificació d'ARC Prize ho dirà. El que ja se sap avui és que ARC-AGI-3 no retorna un nombre: retorna un nombre per arnès, i entre el més baix i el més alt dels mesurats amb el mateix model hi ha més de trenta-set punts. Mentre un anunci no digui amb quin embolcall es va mesurar, la pregunta que toca fer a qualsevol xifra rodona no és quina nota va treure, sinó qui li aguantava la llibreta.
Fonts primàries
- Nvidia — «NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents», nota del fabricant (05-10-2026) ↗
- ARC Prize — anàlisi independent de GPT-6 Astra a ARC-AGI-3: 62,7 % amb l'arnès estàndard i 99,9 % amb el Provider Adapter harness (setembre de 2026) ↗
- AI Informator — OpenAI llança GPT-6 Astra i proclama l'era de l'AGI ↗
- AI Informator — KPMG: el secret per guanyar diners amb la IA és avorrit ↗
- AI Informator — Tokens per segon: pregunta sempre entre quants ↗
- AI Informator — GPT-6.1 Astra, castigat sense sortir per ser massa aplicat ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentaris