Modelos

OpenAI lanza GPT-6 Astra y proclama la era de la AGI

OpenAI presentó el 3 de septiembre GPT-6 Astra, su nuevo modelo insignia, con un mensaje inequívoco: "Bienvenidos a la era AGI". La compañía reivindica cifras que rozan la saturación en las pruebas más exigentes del sector y un precio idéntico al de su rival directo, Claude Fable 5.1 de Anthropic. Pero el análisis independiente de ARC Prize ha abierto de inmediato un debate incómodo: la puntuación estrella del modelo varía entre el 62,7% y el 99,9% según cómo se mida.

OpenAI lanza GPT-6 Astra y proclama la era de la AGI
📷 VentureBeat · fuente

En resumen

  • GPT-6 Astra se distribuye desde el 3 de septiembre a un grupo limitado de organizaciones y llegará en los próximos días a ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI y AWS.
  • El precio en la API es de 10 dólares por millón de tokens de entrada y 50 por millón de salida, exactamente el mismo que Claude Fable 5 y 5.1.
  • OpenAI reivindica un 98,6% en ARC-AGI-3, un 99,9% en la versión más difícil de FrontierMath y un 100% en la prueba de aguja en el pajar con contextos de hasta 512K tokens.
  • ARC Prize obtiene entre un 62,7% y un 99,9% en la misma prueba según el entorno de ejecución empleado, lo que cuestiona la comparabilidad directa de las cifras.

Qué ha pasado

OpenAI anunció el 3 de septiembre de 2026 el lanzamiento de GPT-6 Astra, su nuevo modelo insignia, acompañado de un mensaje que la propia compañía difundió sin matices: "Welcome to the AGI era" ("Bienvenidos a la era AGI"), según recogió VentureBeat. La AGI (inteligencia artificial general, por sus siglas en inglés) designa un sistema capaz de igualar o superar el desempeño humano en la mayoría de tareas cognitivas, y hasta ahora ninguna empresa había vinculado tan explícitamente el nombre de un producto comercial a ese umbral. The Information informó el 4 de septiembre de que OpenAI sugiere que el modelo podría estar acercándose efectivamente a ese punto.

El despliegue arrancó de forma escalonada. El mismo día 3 el modelo empezó a distribuirse a un conjunto limitado de organizaciones y, en los días siguientes, debe alcanzar a todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a la interfaz de programación de aplicaciones (API) de OpenAI y a AWS, según documentó el desarrollador e investigador Simon Willison. La etiqueta con la que los desarrolladores podrán invocarlo será gpt-6-astra.

Qué es GPT-6 Astra

Astra es, según la descripción técnica que ha circulado, el primer modelo de la denominada era "Stargate" de OpenAI, entrenado con un bucle de datos internos, es decir, un ciclo en el que el propio sistema genera y reincorpora datos de su funcionamiento al proceso de entrenamiento. Es también el primer modelo calificado internamente como "supermodelo" con bucle ligero de esa generación.

Su precio en la API lo sitúa de forma deliberada en el mismo escalón que la competencia: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, cifras idénticas a las de Claude Fable 5 y 5.1 de Anthropic. Los tokens son las unidades mínimas en que un modelo descompone el texto, aproximadamente fragmentos de palabra. Willison interpreta esa coincidencia como una señal clara: Astra es el competidor directo que OpenAI ha diseñado contra Fable.

La publicación especializada Latent Space, que tuvo acceso anticipado y consumió más de 20.000 millones de tokens con el modelo, lo describe como una nueva clase de sistema capaz de actuar como ingeniero de IA completo: seleccionar y entrenar modelos, etiquetar datos, mantener saturados los pipelines (tuberías de datos), desplegar y depurar sistemas enteros, orquestar subagentes —incluidos agentes que ejecutan otros modelos— y sostener coherencia a lo largo de miles de millones de tokens dentro de un mismo hilo de trabajo. Su estimación de coste operativo es de menos de 6 dólares por hora, calculado sobre 33 tokens por segundo al precio máximo de salida, frente a los 200 a 1.000 dólares diarios que cuesta un ingeniero junior.

Las cifras que OpenAI reivindica

El bloque de resultados que la compañía ha hecho público es, en sus propios términos, extraordinario. En ARC-AGI-3, un benchmark (prueba comparativa estandarizada) publicado en marzo de 2026 que evalúa la capacidad de los agentes para aprender mientras resuelven tareas interactivas desconocidas, OpenAI declara un 98,6%. En la versión más difícil de FrontierMath, un conjunto de problemas matemáticos de nivel investigador, la cifra es del 99,9%, aunque Latent Space registró un 97,6%.

En contexto largo, los resultados apuntan a la resolución de un problema que ha limitado durante años a los grandes modelos de lenguaje: el 100% en la prueba de aguja en el pajar de ocho agujas (eight-needle, que consiste en localizar varios datos concretos escondidos en un texto enorme) con ventanas de 256K a 512K tokens, y un 96,3% entre 512K y un millón de tokens. Para Willison, esto sugiere que OpenAI ha superado uno de los grandes retos pendientes del contexto extenso.

No todos los indicadores acompañan. En el Índice de Inteligencia de la firma de análisis independiente Artificial Analysis, que agrega y pondera múltiples pruebas, Astra empata con GPT-5.6 Sol en 61 puntos, cinco por debajo de Claude Fable 5.1 en su configuración máxima con respaldo, y por detrás de Muse Spark 1.3 de Meta. En agentes de código el balance mejora: a esfuerzo máximo cuesta lo mismo que GPT-5.6 Sol con dos puntos más de índice y, por tarea, menos de la mitad que Claude Fable 5 para el mismo resultado.

El debate de la medición

La controversia más relevante del lanzamiento no es sobre lo que Astra sabe hacer, sino sobre cómo se mide. ARC Prize, la organización independiente que gestiona el conjunto de pruebas ARC-AGI, publicó su propio análisis y obtuvo resultados marcadamente distintos según el harness (arnés de ejecución, es decir, el entorno que envuelve al modelo y gestiona su interacción con la tarea).

Con el harness estándar de ARC Prize —un entorno de ejecución con notas que el modelo decide conservar—, Astra logra un 62,7% en ARC-AGI-3 Semi-Private con un coste de 26.000 dólares de cómputo. Con el llamado Provider Adapter harness, que preserva el estado de razonamiento opaco entre peticiones y compacta las conversaciones largas, la puntuación se dispara al 99,9% por 19.000 dólares. OpenAI, por su parte, publicó el 98,6% empleando su propio harness basado en la responses API. Tres cifras, tres entornos: la comparación no es directa y el resultado depende en gran medida de la infraestructura que rodea al modelo.

Hay, sin embargo, un dato del análisis de ARC Prize que resiste la discusión metodológica. Con el Provider Adapter harness, Astra utilizó menos acciones que la mediana de los evaluadores humanos en el 96% de los niveles, con un 51,7% menos de acciones por nivel de media. Es decir, supera la paridad humana en eficiencia de acciones, un hito que la propia ARC Prize consideraba improbable para un sistema de IA. La organización observó además que el modelo desarrolla una notación algebraica compacta propia y se construye herramientas personalizadas para cada entorno.

Qué significa para el sector

El posicionamiento de precio deja poco margen a la interpretación: OpenAI ha situado Astra euro a euro frente a Claude Fable 5.1, y sostiene que su modelo puntúa por encima de Fable en la mayoría de sus benchmarks internos. El Índice de Inteligencia de Artificial Analysis dice lo contrario. Esa divergencia entre evaluaciones propias y externas es precisamente el terreno en el que se va a librar la competencia comercial de los próximos meses.

La segunda implicación es económica. Si la descripción de Latent Space se sostiene fuera de un entorno de pruebas, un sistema capaz de operar como ingeniero de IA autónomo por menos de 6 dólares la hora reconfigura el cálculo de costes de cualquier equipo técnico. Según esa misma fuente, directivos de OpenAI —Greg y Jakub— afirmaron que "la AGI está aquí" y que Astra es por fin el becario de investigación de IA automatizado que la compañía perseguía.

En seguridad, y como contexto tras el incidente de Hugging Face de julio, Astra alcanza un 100% en ExploitBench frente al 78,5% de GPT-5.6 Sol, y un 42,4% en ExploitGym frente al 30,3% de Sol. Son cifras que sitúan al modelo en un nivel de capacidad ofensiva sin precedentes en un producto comercial y que ya han motivado un escrutinio específico por parte de OpenAI.

Conclusión

GPT-6 Astra llega con la reivindicación más ambiciosa que ha formulado una empresa de IA hasta la fecha y con métricas que, en varios frentes, saturan las pruebas disponibles. Pero el caso de ARC-AGI-3 deja una lección que trasciende este lanzamiento: cuando una misma prueba arroja un 62,7% o un 99,9% según el entorno de ejecución, la cifra por sí sola ha dejado de ser información suficiente. El sector va a necesitar acordar cómo se mide antes de poder discutir seriamente si esto es o no el umbral de la AGI. Mientras tanto, la disponibilidad general en los próximos días permitirá que miles de desarrolladores contrasten las promesas con el uso real, que es la única evaluación que acaba imponiéndose.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    ← Volver al blog