Seguretat de la IA

Els tres passos d'Amodei per marcar el ritme de la IA frontier ja tenen el suport de Microsoft

Dario Amodei no es va limitar a advertir: l'assaig que va publicar el 12 de setembre posa damunt la taula tres passos perquè les empreses d'IA frontier es donin temps abans de continuar avançant. En quaranta-vuit hores s'hi han sumat Elon Musk, Sam Altman i, diumenge, Microsoft. De moment, però, només una empresa ha posat per escrit què ofereix.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Ilustración: una figura detiene con la mano el brazo de un metrónomo; el logotipo de Microsoft aparece en el atril.
📷 Imagen generada con IA

En resum

  • Dario Amodei va publicar dissabte 12 de setembre al matí "We Must Pace the Frontier", un assaig de 3.800 paraules que proposa tres passos per ordenar el ritme del desenvolupament.
  • El primer pas, els embedded evaluators, donaria a un equip extern accés continu i equiparable al d'un empleat dins d'una empresa frontier; Anthropic l'assumeix de manera unilateral, sense esperar ningú.
  • Elon Musk i Sam Altman van donar suport al pla el 12 de setembre a X, i Altman va comprometre a més OpenAI a donar aquest mateix accés a avaluadors independents.
  • Satya Nadella s'hi va sumar el 13 de setembre i va anunciar que Microsoft publica el 14 el codi de conducta dels seus models propis MAI i l'obre a consulta pública.
  • A 14 de setembre, només Anthropic ha publicat termes concrets d'accés: llocs de treball, credencials, portàtils d'empresa i dret a publicar.

Un assaig de 3.800 paraules demana donar-se temps, no aturar-se

Dario Amodei va publicar dissabte 12 de setembre al matí "We Must Pace the Frontier", un assaig de 3.800 paraules. La seva tesi és que les empreses que entrenen els models més avançats han de marcar deliberadament el ritme del progrés, i el text no es queda en el diagnòstic: proposa tres passos per fer-ho.

El mateix assaig surt al pas del malentès més previsible. "Pacing does not mean halting model training or technical progress", hi escriu Amodei. El que demana és que les empreses es donin temps per alinear i protegir els seus models, i que després siguin tercers els qui ho confirmin.

La urgència, segons el text, ve dels models nous, que "are more capable of deceiving tests, and thus may appear more aligned while having serious problems that go undetected". Un sistema que sembla alineat quan se l'examina és justament el que una revisió final no detecta.

Llegir-ne més: Dario Amodei — We Must Pace the Frontier ↗

El primer pas instal·la avaluadors externs dins de l'empresa

El primer pas es diu embedded evaluators. Cada empresa frontier es comprometria a donar accés continu i "employee-like" a un equip d'avaluadors externs, és a dir, el mateix nivell d'accés de què disposa un empleat i no pas el d'una auditoria que arriba, mira i se'n va.

Aquest equip verificaria el compliment de les pràctiques de seguretat, notificaria els incidents i avaluaria l'alineació no només dels models acabats, sinó dels processos d'entrenament mateixos. El precedent que cita Amodei són els supervisors que els reguladors bancaris mantenen dins de les entitats que vigilen.

És l'únic dels tres passos que no depèn que ningú més es mogui, i Anthropic l'assumeix de manera unilateral i amb efecte immediat.

Els altres dos passos depenen dels governs

El segon pas, la coordinació democràtica, demana que les empreses frontier dels països democràtics acordin estàndards comuns de seguretat i límits al ritme de progrés no supervisat. Amodei hi admet un obstacle que no pot resoldre tot sol: algunes formes de coordinació entre competidors són jurídicament problemàtiques, i per això reclama el suport del Govern.

El tercer, la coordinació global, consisteix que els governs democràtics intentin coordinar-se amb els autoritaris. L'assaig assumeix d'entrada la dificultat: el problema no és signar, sinó verificar que es compleix allò que s'ha signat.

Amodei sosté que "the most effective method of pacing is via regulation that targets all U.S. frontier AI companies, as that covers even those who are unwilling to cooperate voluntarily", i hi afegeix el problema de calendari: "Unfortunately, passing laws can take time, and AI is advancing very quickly." Mentrestant, demana al Govern dels Estats Units que autoritzi expressament que les empreses "work together to set standards", perquè avui temen represàlies per antimonopoli si ho fan.

Musk, Altman i Nadella van respondre en quaranta-vuit hores

Elon Musk, de xAI, va coincidir amb Amodei aquell mateix 12 de setembre a X. Sam Altman, d'OpenAI, va escriure el mateix dia que "pace the frontier" "has been a primary topic of discussions we've had at OpenAI in recent weeks", i va anar un pas més enllà del suport: va comprometre OpenAI a donar també accés de tipus empleat a avaluadors independents.

El 13 de setembre hi va entrar Microsoft. Satya Nadella va celebrar la recerca, el focus i el "deliberate pacing" que calen perquè l'alineació sigui un objectiu de disseny, i va donar suport de manera expressa a la idea dels embedded evaluators. La seva formulació va ser taxativa: "Any pursuit of superintelligence has to be grounded in the core principle that if the AI we build is not helping humanity and under human control, it's not worth pursuing."

Nadella va anunciar a més una cosa amb data: Microsoft publica el 14 de setembre el codi de conducta dels seus models propis MAI, i l'obre a consulta pública.

Llegir-ne més: Sam Altman a X, 12 de setembre ↗

Només una empresa ha publicat els termes

Com a exemple del tipus d'equip que ocuparia aquest lloc d'avaluador integrat, l'assaig cita METR.

A dia d'avui, però, només Anthropic ha publicat termes concrets d'allò que ofereix: llocs de treball, credencials, portàtils d'empresa i dret a publicar. El compromís d'OpenAI i el suport de Microsoft són, de moment, intenció declarada amb el detall pendent.

La diferència no és menor. Un compromís anunciat per una empresa encara no és una avaluació independent, i sense termes escrits no se sap què podran mirar aquests avaluadors ni què podran explicar després.

Conclusió

En dos dies, el pla ha passat de ser l'assaig d'un directiu a una posició que comparteixen en públic les empreses que entrenen els models frontier més avançats, i el primer dels seus tres passos és l'únic que no necessita el permís de ningú per començar. El que separa el suport del fet són els termes: quant accés, a quina part de l'entrenament i amb quin dret a publicar allò que s'hi trobi. El codi de conducta dels models MAI que Microsoft obre avui a consulta pública és la primera ocasió de comprovar-ho.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog