Recerca
La IA resol l'últim problema de FrontierMath i 25 medallistes Fields fan sonar l'alarma
Epoch AI dona per esgotada la prova matemàtica
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Epoch AI declara esgotat el nivell Tier 4 de FrontierMath: tots els seus problemes s'han resolt com a mínim un cop amb alguna IA, i l'últim el va resoldre GPT-6 Astra.
- OpenAI xifra en un 97,6% el resultat d'Astra al Tier 4, davant del 83,0% de GPT-5.6 Sol i el 90,2% de Claude Fable 5; quan el nivell es va estrenar l'11 de juliol del 2025, la millor marca voltava el 5%.
- Vint-i-cinc medallistes Fields, amb Terence Tao i Deng Yu entre els primers signants, denuncien una "severe misalignment" (desalineació greu) entre els objectius de les empreses d'IA i els de la comunitat matemàtica.
- Al nou conjunt FrontierMath Erdos, que exigeix demostracions formalitzades i verificables en Lean, Astra només ha resolt 2 dels 68 problemes.
FrontierMath va néixer perquè la IA no la superés tan de pressa
FrontierMath es va publicar el 7 de novembre del 2024 com a resposta a un problema conegut: els benchmarks (proves de rendiment) matemàtics clàssics, com GSM8K o MATH, ja no permetien distingir els millors models. Epoch AI va reunir més de seixanta matemàtics, entre ells els medallistes Fields Terence Tao, Timothy Gowers i Richard Borcherds, per dissenyar 300 problemes originals mai publicats, repartits en tres nivells de dificultat.
El Tier 1 s'acosta a una olimpíada o a un grau universitari exigent; el Tier 2, a un postgrau avançat, i el Tier 3, a la recerca exploratòria d'un doctorand que tot just comença. A la primera ronda d'avaluació, el model capdavanter no arribava al 2% d'encerts. Tao va dir aleshores que els problemes més difícils eren "extremadament difícils" i que el Tier 3 podia resistir uns quants anys.
El Tier 4 es va afegir com a última muralla i ha durat catorze mesos
Quan els models de raonament van començar a esgotar els tres primers nivells, Epoch AI hi va afegir, el 2025, un quart escaló. El Tier 4 el van dissenyar professors i postdoctorands de matemàtiques: cadascun dedicava unes setmanes a una recerca breu dins la seva especialitat i després comprimia el resultat en un problema de verificació automàtica. Els 50 problemes inicials cobrien anàlisi, teoria de nombres, combinatòria, topologia i geometria algebraica.
El dia de l'estrena només s'havien resolt tres problemes alguna vegada, i aquelles solucions es recolzaven en supòsits correctes però poc justificats. Epoch AI va arribar a escriure al seu web que alguns d'aquells exercicis podrien trigar dècades a caure. Més endavant, OpenAI va detectar més errors dels previstos al banc de problemes; una auditoria independent, amb un garbellat previ amb GPT-5.5 i Claude Opus 4.7 i una revisió humana posterior, va corregir dotze problemes i va eliminar-ne set, de manera que en van quedar 43 a la versió v2 del juny del 2026.
Val la pena precisar què vol dir aquí la saturació. Astra no ha arribat al 100%: segons Epoch AI, "resolt tot" és un recompte acumulat d'intents de models diferents en moments diferents. El que ha fet Astra és resoldre l'única pregunta que continuava sense resposta. Jay Pantone, professor associat de matemàtiques a la Universitat de Marquette i autor d'aquell problema, explica que les IA solien buscar dreceres numèriques i que aquesta vegada el plantejament del model s'assemblava força al seu.
Vint-i-cinc medallistes Fields avisen que la força bruta erosiona la disciplina
El manifest publicat a mathandai.org no demana aturar la IA ni nega els resultats obtinguts. Els signants sostenen que un gran problema obert fa de punt de referència i de far: serveix per mesurar quant entén la humanitat d'un àmbit, i resoldre'l obre anys de feina posterior d'assimilació, simplificació i docència. Resoldre, argumenten, és una eina i un indicador indirecte; la finalitat és la comprensió conceptual.
que els sistemes d'avaluació divergeixen, perquè les empreses
El detonant immediat ha estat la setmana de l'anunci d'OpenAI sobre Navier-Stokes: deu mil agents executant-se durant 88 hores per construir una força externa suau que provoqui una explosió en temps finit, sota els supòsits C i D de l'enunciat del Clay. L'episodi ha esquitxat el matemàtic Tristan Buckmaster, de la Universitat de Nova York, i l'investigador d'Anthropic Levent Alpoge, i ha obert preguntes incòmodes: si un prompt introduït en una eina compta com a material de recerca inèdit, o si té sentit deixar Alpoge fora de la llista d'autors. La conseqüència que més temen els signants és un efecte silenciador: investigadors que deixin de compartir idees a mig fer per por que un model se'ls avanci.
El llistó ja s'ha desplaçat als problemes sense resoldre
FrontierMath no s'ha quedat quieta. A banda dels nivells 1 a 4, el projecte ha incorporat un apartat d'Open Problems (problemes oberts) amb qüestions que la comunitat matemàtica encara no ha resolt, i també FrontierMath Erdos, que formalitza problemes oberts d'Erdos en Lean i obliga el model a escriure una demostració completa que superi la verificació formal. Aquí el resultat d'Astra és molt més modest: 2 problemes de 68.
Aquest contrast resumeix com està realment la qüestió. Astra pot arribar a la resposta correcta en problemes de recerca tancats i verificables automàticament, però produir demostracions formals completes continua sent una altra cosa. Els signants del manifest apunten, a més, una mancança de fons: la IA no demostra capacitat d'exploració cap endavant, és a dir, de percebre el terreny matemàtic i plantejar problemes oberts nous i valuosos.
Conclusió
ja no poden esperar el procediment habitual per dir-ho en veu alta
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios