Seguretat

Un investigador deixa Anthropic i alerta del risc existencial

El dimarts 8 de setembre, Jacob Coxon, investigador de seguretat i alignment (alineament: la disciplina que busca que els sistemes d'IA persegueixin els objectius que els seus creadors pretenen) amb experiència prèvia tant a OpenAI com a Anthropic, va presentar la seva dimissió a aquesta darrera. Aquella mateixa nit va explicar els seus motius a X: sosté que Anthropic i OpenAI estan "jugant amb les nostres vides". El missatge va superar els 70 milions de visualitzacions segons CNBC i el dimecres 9 el van recollir BBC, CNBC, Forbes i la premsa espanyola, entre ella El País i ABC. Recuperem avui el cas perquè s'ha creuat amb un desenvolupament posterior que en canvia la lectura: Anthropic és a punt de comercialitzar la seva sortida a borsa.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

En resum

  • Jacob Coxon va dimitir d'Anthropic el dimarts 8 de setembre i va publicar aquella nit a X que la companyia i OpenAI estan "jugant amb les nostres vides".
  • Coxon xifra en més del 10% la probabilitat que la IA "mati tots els humans" en la propera dècada i afirma que els qui construeixen aquests sistemes "creuen sincerament que podria matar-nos a tots abans del final de la dècada".
  • Anthropic va publicar el mes passat un informe que qualifica de "baix" el risc de descontrol dels seus models, però en va elevar el nivell des de "molt baix".
  • El cas coincideix amb la imminent comercialització de la IPO d'Anthropic, cosa que obre la pregunta de com defensarà aquest missatge davant dels inversors.

Què va dir Coxon i quan ho va dir

La cronologia importa per entendre l'abast del cas. Coxon va dimitir el dimarts 8 de setembre de 2026. Aquella mateixa nit va publicar a X el missatge en què atribuïa la seva sortida al fet que, segons ell, Anthropic i OpenAI estan "jugant amb les nostres vides". En aquell text hi afegia que els qui construeixen aquests sistemes "creuen sincerament que podria matar-nos a tots abans del final de la dècada".

Coxon va quantificar la seva pròpia valoració: situa per damunt del 10% la probabilitat que la IA "mati tots els humans" en la propera dècada. És una estimació personal, expressada en primera persona, no pas una xifra corporativa ni el resultat d'un estudi publicat.

La difusió va ser immediata. Segons CNBC, la publicació va superar els 70 milions de visualitzacions. El dimecres 9 de setembre la van recollir BBC News, CNBC —que va datar la seva peça a les 03:06 EDT i la va actualitzar a les 13:43 EDT—, Forbes i mitjans espanyols com El País i ABC, aquest darrer cap a les 10:50 CET. El perfil de Coxon afegeix pes al missatge: ha treballat als dos laboratoris que assenyala.

L'informe d'Anthropic i el matís que va passar desapercebut

El mes passat Anthropic va publicar un informe en què avalua com a "baix" el risc que els seus models es descontrolin. Llegit aïlladament, és un missatge tranquil·litzador. El detall rellevant és un altre: aquest nivell suposa una pujada respecte de la qualificació anterior, que era "molt baix".

El mateix informe empra la fórmula "risc baix, però amb incertesa substancial" en referir-se a la possibilitat que actors maliciosos facin servir els seus models per desenvolupar armes químiques o biològiques, segons va recollir The Information al seu Briefing del 9 de setembre. La incertesa declarada forma part del text mateix de la companyia.

Convé separar els plans: una cosa és l'avaluació interna de risc que publica un laboratori i una altra l'estimació individual d'un investigador que acaba de dimitir. No són documents equivalents ni tenen el mateix estatus. El que sí que comparteixen és la direcció del moviment: el risc declarat ha pujat, no pas baixat.

El xoc amb la sortida a borsa

Aquí hi ha el desenvolupament que justifica tornar avui sobre el cas. Anthropic és a punt de comercialitzar la seva sortida a borsa (IPO, oferta pública inicial). El procés implica un roadshow: la ronda de presentacions en què els directius exposen la companyia davant d'inversors institucionals.

La pregunta que es planteja al sector, formulada per Martin Peers al Briefing de The Information del 9 de setembre, és com defensarà Anthropic aquest missatge davant dels inversors. La companyia ha construït bona part de la seva identitat pública sobre la seguretat de la IA, i aquest posicionament ara ha de conviure amb un exinvestigador que sosté públicament que el risc és inacceptable.

El context polític tampoc no ajuda que l'assumpte es refredi. La setmana passada, el senador Bernie Sanders va demanar una prohibició del desenvolupament d'IA. Són dues pressions de naturalesa distinta —una de reputacional, l'altra de regulatòria— que conflueixen en el pitjor moment possible des del punt de vista del calendari financer.

Un debat que no és unànime

El cas ha reactivat la discussió sobre les estimacions de p(doom), l'abreviatura amb què al sector es designa la probabilitat subjectiva que cada persona assigna a un desenllaç catastròfic causat per la IA. Els experts consultats per CNBC discrepen sobre la seva utilitat.

El desacord no és sobre si existeix risc, sinó sobre si posar-hi un número aporta res. Els qui defensen la pràctica argumenten que obliga a explicitar creences que altrament quedarien difuses. Els qui la critiquen assenyalen que una xifra sense metodologia al darrere transmet una precisió que no existeix i desplaça el debat cap a l'aritmètica en lloc de cap a les mesures concretes.

Per al lector, la conclusió operativa és modesta: l'estimació de Coxon informa sobre el que pensa Coxon, no sobre el que passarà. El seu valor rau en el context —qui la formula i des d'on—, no en el percentatge.

Conclusió

El cas no aporta dades noves sobre les capacitats dels models, però sí sobre les tensions internes dels laboratoris que els construeixen. Una dimissió amb carta oberta, un informe propi que apuja el nivell de risc i una sortida a borsa imminent són tres fets independents que han coincidit la mateixa setmana. El que queda per veure és si aquesta coincidència altera res del procés: de moment, ni Anthropic no ha modificat públicament el seu calendari ni el debat sobre les estimacions de risc no ha assolit cap consens.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog