Models

OpenAI llança GPT-6 Astra i proclama l'era de l'AGI

OpenAI va presentar el 3 de setembre GPT-6 Astra, el seu nou model insígnia, amb un missatge inequívoc: "Benvinguts a l'era AGI". La companyia reivindica xifres que freguen la saturació en les proves més exigents del sector i un preu idèntic al del seu rival directe, Claude Fable 5.1 d'Anthropic. Però l'anàlisi independent d'ARC Prize ha obert immediatament un debat incòmode: la puntuació estrella del model varia entre el 62,7% i el 99,9% segons com es mesuri.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

OpenAI llança GPT-6 Astra i proclama l'era de l'AGI
📷 VentureBeat

En resum

  • GPT-6 Astra es distribueix des del 3 de setembre a un grup limitat d'organitzacions i arribarà en els pròxims dies a ChatGPT Plus, Pro, Business i Enterprise, a més de l'API d'OpenAI i AWS.
  • El preu a l'API és de 10 dòlars per milió de tokens d'entrada i 50 per milió de sortida, exactament el mateix que Claude Fable 5 i 5.1.
  • OpenAI reivindica un 98,6% a ARC-AGI-3, un 99,9% a la versió més difícil de FrontierMath i un 100% a la prova de l'agulla al paller amb contextos de fins a 512K tokens.
  • ARC Prize obté entre un 62,7% i un 99,9% a la mateixa prova segons l'entorn d'execució emprat, cosa que qüestiona la comparabilitat directa de les xifres.

Què ha passat

OpenAI va anunciar el 3 de setembre de 2026 el llançament de GPT-6 Astra, el seu nou model insígnia, acompanyat d'un missatge que la mateixa companyia va difondre sense matisos: "Welcome to the AGI era" ("Benvinguts a l'era AGI"), segons va recollir VentureBeat. L'AGI (intel·ligència artificial general, per les seves sigles en anglès) designa un sistema capaç d'igualar o superar el rendiment humà en la majoria de tasques cognitives, i fins ara cap empresa no havia vinculat tan explícitament el nom d'un producte comercial a aquest llindar. The Information va informar el 4 de setembre que OpenAI suggereix que el model podria estar acostant-se efectivament a aquest punt.

El desplegament va arrencar de manera esglaonada. El mateix dia 3 el model va començar a distribuir-se a un conjunt limitat d'organitzacions i, els dies següents, ha d'arribar a tots els usuaris de ChatGPT Plus, Pro, Business i Enterprise, així com a la interfície de programació d'aplicacions (API) d'OpenAI i a AWS, segons va documentar el desenvolupador i investigador Simon Willison. L'etiqueta amb què els desenvolupadors el podran invocar serà gpt-6-astra.

Què és GPT-6 Astra

Astra és, segons la descripció tècnica que ha circulat, el primer model de l'anomenada era "Stargate" d'OpenAI, entrenat amb un bucle de dades internes, és a dir, un cicle en què el mateix sistema genera i reincorpora dades del seu funcionament al procés d'entrenament. És també el primer model qualificat internament com a "supermodel" amb bucle lleuger d'aquesta generació.

El seu preu a l'API el situa deliberadament al mateix esglaó que la competència: 10 dòlars per milió de tokens d'entrada i 50 dòlars per milió de tokens de sortida, xifres idèntiques a les de Claude Fable 5 i 5.1 d'Anthropic. Els tokens són les unitats mínimes en què un model descompon el text, aproximadament fragments de paraula. Willison interpreta aquesta coincidència com un senyal clar: Astra és el competidor directe que OpenAI ha dissenyat contra Fable.

La publicació especialitzada Latent Space, que va tenir accés anticipat i va consumir més de 20.000 milions de tokens amb el model, el descriu com una nova classe de sistema capaç d'actuar com a enginyer d'IA complet: seleccionar i entrenar models, etiquetar dades, mantenir saturats els pipelines (canonades de dades), desplegar i depurar sistemes sencers, orquestrar subagents —inclosos agents que executen altres models— i sostenir coherència al llarg de milers de milions de tokens dins d'un mateix fil de treball. La seva estimació de cost operatiu és de menys de 6 dòlars per hora, calculat sobre 33 tokens per segon al preu màxim de sortida, davant dels 200 a 1.000 dòlars diaris que costa un enginyer júnior.

Les xifres que OpenAI reivindica

El bloc de resultats que la companyia ha fet públic és, en els seus propis termes, extraordinari. A ARC-AGI-3, un benchmark (prova comparativa estandarditzada) publicat el març de 2026 que avalua la capacitat dels agents per aprendre mentre resolen tasques interactives desconegudes, OpenAI declara un 98,6%. A la versió més difícil de FrontierMath, un conjunt de problemes matemàtics de nivell investigador, la xifra és del 99,9%, tot i que Latent Space va registrar un 97,6%.

En context llarg, els resultats apunten a la resolució d'un problema que ha limitat durant anys els grans models de llenguatge: el 100% a la prova de l'agulla al paller de vuit agulles (eight-needle, que consisteix a localitzar diverses dades concretes amagades en un text enorme) amb finestres de 256K a 512K tokens, i un 96,3% entre 512K i un milió de tokens. Per a Willison, això suggereix que OpenAI ha superat un dels grans reptes pendents del context extens.

No tots els indicadors acompanyen. A l'Índex d'Intel·ligència de la firma d'anàlisi independent Artificial Analysis, que agrega i pondera múltiples proves, Astra empata amb GPT-5.6 Sol en 61 punts, cinc per sota de Claude Fable 5.1 en la seva configuració màxima amb suport, i per darrere de Muse Spark 1.3 de Meta. En agents de codi el balanç millora: a esforç màxim costa el mateix que GPT-5.6 Sol amb dos punts més d'índex i, per tasca, menys de la meitat que Claude Fable 5 per al mateix resultat.

El debat del mesurament

Puntuació d'Astra en ARC-AGI-3 Semi-Private segons l'harness
Harness estàndard d'ARC Prize: 62,7% Harness estàndard d'ARC Prize 62,7% Provider Adapter harness: 99,9% Provider Adapter harness 99,9% Harness d'OpenAI (responses API): 98,6% Harness d'OpenAI (responses API) 98,6%
Ver los datos en tabla
Harness estàndard d'ARC PrizeProvider Adapter harnessHarness d'OpenAI (responses API)
Puntuació 62,7%99,9%98,6%
ARC-AGI-3 Semi-Private: Astra segons l'harness d'execució
Harness Puntuació Cost de còmput
Harness estàndard de ARC Prize 62,7% 26.000 dòlars
Provider Adapter harness 99,9% 19.000 dòlars
Harness de OpenAI (responses API) 98,6% —
Tres xifres, tres entorns: la comparació no és directa i el resultat depèn en gran mesura de la infraestructura que envolta el model.

La controvèrsia més rellevant del llançament no és sobre el que Astra sap fer, sinó sobre com es mesura. ARC Prize, l'organització independent que gestiona el conjunt de proves ARC-AGI, va publicar la seva pròpia anàlisi i va obtenir resultats marcadament diferents segons el harness (arnès d'execució, és a dir, l'entorn que envolta el model i gestiona la seva interacció amb la tasca).

Amb el harness estàndard d'ARC Prize —un entorn d'execució amb notes que el model decideix conservar—, Astra assoleix un 62,7% a ARC-AGI-3 Semi-Private amb un cost de 26.000 dòlars de còmput. Amb l'anomenat Provider Adapter harness, que preserva l'estat de raonament opac entre peticions i compacta les converses llargues, la puntuació es dispara al 99,9% per 19.000 dòlars. OpenAI, per la seva banda, va publicar el 98,6% emprant el seu propi harness basat en la responses API. Tres xifres, tres entorns: la comparació no és directa i el resultat depèn en gran mesura de la infraestructura que envolta el model.

Hi ha, tanmateix, una dada de l'anàlisi d'ARC Prize que resisteix la discussió metodològica. Amb el Provider Adapter harness, Astra va utilitzar menys accions que la mediana dels avaluadors humans en el 96% dels nivells, amb un 51,7% menys d'accions per nivell de mitjana. És a dir, supera la paritat humana en eficiència d'accions, una fita que la mateixa ARC Prize considerava improbable per a un sistema d'IA. L'organització va observar a més que el model desenvolupa una notació algebraica compacta pròpia i es construeix eines personalitzades per a cada entorn.

Què significa per al sector

Astra enfront de GPT-5.6 Sol en benchmarks de seguretat ofensiva
Benchmark Astra GPT-5.6 Sol
ExploitBench 100% 78,5%
ExploitGym 42,4% 30,3%
Xifres citades a la secció; el context és l'incident de Hugging Face de juliol.

El posicionament de preu deixa poc marge a la interpretació: OpenAI ha situat Astra euro a euro davant de Claude Fable 5.1, i sosté que el seu model puntua per sobre de Fable en la majoria dels seus benchmarks interns. L'Índex d'Intel·ligència d'Artificial Analysis diu el contrari. Aquesta divergència entre avaluacions pròpies i externes és precisament el terreny en què es lliurarà la competència comercial dels pròxims mesos.

La segona implicació és econòmica. Si la descripció de Latent Space se sosté fora d'un entorn de proves, un sistema capaç d'operar com a enginyer d'IA autònom per menys de 6 dòlars l'hora reconfigura el càlcul de costos de qualsevol equip tècnic. Segons aquesta mateixa font, directius d'OpenAI —Greg i Jakub— van afirmar que "l'AGI és aquí" i que Astra és per fi el becari de recerca d'IA automatitzat que la companyia perseguia.

En seguretat, i com a context després de l'incident de Hugging Face del juliol, Astra assoleix un 100% a ExploitBench davant del 78,5% de GPT-5.6 Sol, i un 42,4% a ExploitGym davant del 30,3% de Sol. Són xifres que situen el model en un nivell de capacitat ofensiva sense precedents en un producte comercial i que ja han motivat un escrutini específic per part d'OpenAI.

Conclusió

GPT-6 Astra arriba amb la reivindicació més ambiciosa que ha formulat una empresa d'IA fins ara i amb mètriques que, en diversos fronts, saturen les proves disponibles. Però el cas d'ARC-AGI-3 deixa una lliçó que transcendeix aquest llançament: quan una mateixa prova dona un 62,7% o un 99,9% segons l'entorn d'execució, la xifra per si sola ha deixat de ser informació suficient. El sector necessitarà acordar com es mesura abans de poder discutir seriosament si això és o no el llindar de l'AGI. Mentrestant, la disponibilitat general en els pròxims dies permetrà que milers de desenvolupadors contrastin les promeses amb l'ús real, que és l'única avaluació que acaba imposant-se.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog