Blog articles are published in Spanish and Catalan.

Investigación

Nvidia firma un 100 % en una prueba que cambia según el arnés

Nvidia anunció el 5 de octubre de 2026 que AVO, su sistema de agentes, alcanza el 100 % en ARC-AGI-3, la prueba de razonamiento general que administra ARC Prize. La cifra la comunica la propia empresa que vende el sistema, le falta la verificación independiente de ARC Prize y no consta con qué arnés de ejecución se midió. Ese hueco no es un detalle: en septiembre de 2026, el análisis independiente de ARC Prize sobre otro modelo dio en esa misma prueba entre un 62,7 % y un 99,9 % según el entorno de ejecución.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Viñeta: el salón de una casa, con sillón, lámpara y alfombra. En el centro, colgado del marco de una puerta por dos muelles y unas correas, un andador-saltador de bebé; sentado dentro, con piernas y bracitos regordetes de color verde, está el ojo estilizado del logotipo de Nvidia convertido en personaje, con la palabra nVIDIA escrita en la banda del pañal. Levanta con una mano una copa de trofeo en la que se lee 100 y patalea con los pies en el aire, a dos dedos de la alfombra, con líneas de movimiento alrededor. A la derecha, de pie y recortado por el borde, un inspector con chaleco reflectante señala los muelles con el dedo. En la mesa baja de la izquierda, un móvil apoyado graba la escena con el punto rojo de grabación encendido.
📷 Imagen generada con IA

En resumen

  • Nvidia publicó el 5 de octubre de 2026 que AVO, su sistema de agentes, alcanza el 100 % en ARC-AGI-3, y lo presenta como la demostración de una arquitectura de propósito general para agentes autónomos de horizonte largo.
  • La cifra sale del blog para desarrolladores de Nvidia y le falta la verificación independiente de ARC Prize, que es quien administra la prueba y quien contrasta los resultados que reclaman los fabricantes. Hasta que esa réplica exista, el 100 % es una reclamación del fabricante.
  • No consta con qué arnés de ejecución se midió, ni en qué variante de la prueba, ni cuántos intentos tuvo el sistema, ni cuánto cómputo costó. Sin el arnés, la puntuación no se puede comparar con ninguna otra.
  • La vara ya estaba puesta: en septiembre de 2026, el análisis independiente de ARC Prize sobre GPT-6 Astra en ARC-AGI-3 Semi-Private dio, con el mismo modelo, un 62,7 % con el arnés estándar y un 99,9 % con el Provider Adapter harness.
  • AVO y GPT-6 Astra son dos sistemas distintos, de dos empresas distintas: las cuatro cifras juntas no dicen quién gana, dicen cuánto se mueve la prueba según el envoltorio.

Un 100 % del que no consta el arnés

El 5 de octubre de 2026, Nvidia publicó en su blog para desarrolladores que AVO, su sistema de agentes, alcanza el 100 % en ARC-AGI-3. El titular del anuncio enmarca además el resultado como la demostración de una arquitectura de propósito general para agentes autónomos de horizonte largo. Eso es lo que sostiene la empresa: un número redondo y una interpretación.

Lo que no hay es el resto. No consta con qué arnés se ejecutó la prueba, ni en qué variante de ARC-AGI-3 se midió —la que usó ARC Prize en septiembre es la semiprivada—, ni cuántos intentos tuvo el sistema, ni cuánto cómputo hizo falta para llegar al 100 %. Ese hueco no es un flanco menor del anuncio: es exactamente lo que impide compararlo.

Una puntuación de referencia sin el arnés con el que se obtuvo se parece a un tiempo de vuelta sin decir el circuito. No es que sea falsa. Es que no se puede poner al lado de ninguna otra.

La misma prueba ya había dado un 62,7 % y un 99,9 %

La misma prueba, ARC-AGI-3, según el arnés de ejecución
Nvidia AVO, arnés no detallado: 100% Nvidia AVO, arnés no detallado 100% Provider Adapter harness (GPT-6 Astra): 99,9% Provider Adapter harness (GPT-6 Astra) 99,9% Arnés propio de OpenAI (GPT-6 Astra): 98,6% Arnés propio de OpenAI (GPT-6 Astra) 98,6% Arnés estándar de ARC Prize (GPT-6 Astra): 62,7% Arnés estándar de ARC Prize (GPT-6 Astra) 62,7%
Ver los datos en tabla
Nvidia AVO, arnés no detalladoProvider Adapter harness (GPT-6 Astra)Arnés propio de OpenAI (GPT-6 Astra)Arnés estándar de ARC Prize (GPT-6 Astra)
Puntuación 100%99,9%98,6%62,7%
El 100 % lo comunica Nvidia, que vende el sistema, y ARC Prize no lo ha verificado de forma independiente; tampoco consta con qué arnés se midió. Las otras tres cifras son del análisis independiente de ARC Prize sobre GPT-6 Astra en ARC-AGI-3 Semi-Private, de septiembre de 2026, y corresponden a un modelo distinto.

En septiembre de 2026, ARC Prize analizó GPT-6 Astra, el modelo de OpenAI, en ARC-AGI-3 Semi-Private. Con el mismo modelo y la misma prueba, el resultado fue del 62,7 % con el arnés estándar de la organización —un entorno en el que el modelo decide qué notas conserva— y del 99,9 % con el Provider Adapter harness, que preserva el estado de razonamiento opaco entre una petición y la siguiente y compacta las conversaciones largas. El arnés propio de OpenAI, construido sobre su responses API, se quedó en el 98,6 %.

Más de treinta y siete puntos de diferencia sin tocar el modelo. Cuando una misma prueba arroja un 62,7 % o un 99,9 % según el entorno en el que se ejecute, la cifra sola ha dejado de ser información suficiente: lo que hay que saber es qué envoltorio se le puso.

Las cuatro cifras aparecen juntas en el gráfico, y conviene decir para qué. AVO y GPT-6 Astra son dos sistemas distintos, de dos empresas distintas: las barras están juntas para mostrar la dispersión de la prueba, no para declarar un ganador. El 100 % tampoco está al mismo nivel que los otros tres valores, porque es el único que no ha pasado por una medición independiente.

El arnés más barato fue el que sacó más nota

Lo que midió ARC Prize en GPT-6 Astra, arnés por arnés
Arnés de ejecución Puntuación Coste de cómputo
Arnés estándar de ARC Prize 62,7 % 26.000 dólares
Provider Adapter harness 99,9 % 19.000 dólares
Arnés propio de OpenAI (responses API) 98,6 % No consta
Las tres mediciones son del análisis independiente de ARC Prize sobre GPT-6 Astra en ARC-AGI-3 Semi-Private, de septiembre de 2026: el mismo modelo en los tres casos. El 100 % de AVO no figura aquí porque lo comunica Nvidia, que vende el sistema, sin que conste ni el arnés con el que se midió ni el coste de cómputo.

El arnés no cambia solo la nota: cambia la factura. Los 62,7 % del arnés estándar costaron 26.000 dólares de cómputo, y los 99,9 % del Provider Adapter harness, 19.000. Más puntuación por menos dinero, con el mismo modelo delante. La diferencia estaba en el envoltorio.

Del mismo análisis sale un dato que resiste mejor la discusión metodológica, y conviene ponerlo al lado: con el Provider Adapter harness, Astra necesitó menos acciones que la mediana de los evaluadores humanos en el 96 % de los niveles, y un 51,7 % menos de acciones por nivel de media. Eso no lo regala un envoltorio generoso; habla de cómo resuelve.

De ahí que el arnés no sea un detalle de ingeniería que se pueda omitir en un anuncio. Es la mitad del resultado, y es la mitad que decide si el número se puede comparar con el de la semana pasada.

«Nivel frontier» es una afirmación, no una medida

Nvidia presenta el 100 % de AVO como prueba de una arquitectura de propósito general de nivel frontier para agentes autónomos de horizonte largo. Es una descripción de producto y la empresa está en su derecho de hacerla. Lo que no es, todavía, es un resultado establecido.

Lo que lo convertiría en eso se enumera en una línea: que ARC Prize ejecute la prueba y publique con qué arnés, en qué variante, con cuántos intentos y a qué coste. Mientras eso no ocurra, el 100 % es lo que dice el fabricante, y quien mide es el mismo que vende.

No es una sospecha sobre AVO, que puede ser tan bueno como se anuncia. Es el orden en que se hacen las cosas cuando la propia prueba ha demostrado que se mueve de un 62,7 % a un 99,9 % según el envoltorio: primero la medición independiente y después el titular.

Conclusión

El 100 % de AVO puede ser verdad y puede ser excelente, y la verificación de ARC Prize lo dirá. Lo que ya se sabe hoy es que ARC-AGI-3 no devuelve un número: devuelve un número por arnés, y entre el más bajo y el más alto de los medidos con el mismo modelo hay más de treinta y siete puntos. Mientras un anuncio no diga con qué envoltorio se midió, la pregunta que toca hacerle a cualquier cifra redonda no es cuánto sacó, sino quién le sostenía el cuaderno.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog