Ciberseguretat

GLM-5.3: el hacker xinès que tothom es pot baixar

Segons Anthropic, GLM-5.3, el model de pesos oberts de la xinesa Z.ai (Zhipu AI), construeix exploits complets tot sol i les seves proteccions se superen amb tècniques senzilles. Ho afirma a partir de proves simulades pròpies i com a part interessada, perquè ven Claude. Un organisme del Govern dels Estats Units hi coincideix en l'essencial, però el situa uns quatre mesos per darrere dels millors models nord-americans.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Caricatura d'un examinador amb bata marcada ANTHROP\C que, amb una lupa a l'ull i un cronòmetre a la mà, mira espantat com una capsa vermella de ganxos ha obert els cadenats d'un tauler de proves; al fons, una caixa forta embolicada amb cadenes guarda les seves pròpies eines.
📷 Imatge generada amb IA

En resum

  • Anthropic va publicar dimarts 29 de setembre la seva avaluació de GLM-5.3, que Z.ai va llançar el 14 d'agost i els pesos del qual va publicar dues setmanes després.
  • A ExploitBench, GLM-5.3 va aconseguir exploits complets en el 12 % dels intents, a prop de Claude Mythos Preview, que Anthropic només va obrir a defensors de confiança.
  • Segons Anthropic, amb tècniques senzilles les proteccions de GLM-5.3 cedeixen entre el 64 % i el 100 % de les vegades; els models Claude provats, amb les seves salvaguardes, no van cedir mai.
  • No consta que Z.ai hagi respost.

Anthropic dona per superat un llindar

Exploits aconseguits, en % d'intents
  • Explotació de binaris (100 tasques)
  • ExploitBench (41 falles de Chrome)
Explotació de binaris (100 tasques) · Claude Mythos Preview: 6% ExploitBench (41 falles de Chrome) · Claude Mythos Preview: 14% Claude Mythos Preview Explotació de binaris (100 tasques) · GLM-5.3: 4% ExploitBench (41 falles de Chrome) · GLM-5.3: 12% GLM-5.3 Explotació de binaris (100 tasques) · Claude Opus 4.6: 0% ExploitBench (41 falles de Chrome) · Claude Opus 4.6: 0% Claude Opus 4.6 Explotació de binaris (100 tasques) · GLM-5.2: 0% ExploitBench (41 falles de Chrome) · GLM-5.2: 0% GLM-5.2
Veure les dades en una taula
Claude Mythos PreviewGLM-5.3Claude Opus 4.6GLM-5.2
Explotació de binaris (100 tasques) 6%4%0%0%
ExploitBench (41 falles de Chrome) 14%12%0%0%
Proves d'Anthropic; els models Claude, amb les salvaguardes desactivades; a ExploitBench, Opus 4.6 i GLM-5.2 «en el 0 % o a prop».

El laboratori de Claude va publicar dimarts 29 de setembre una anàlisi de GLM-5.3, l'últim model de Z.ai (Zhipu AI), empresa amb seu a la Xina. La seva conclusió: com Claude Mythos Preview, construeix exploits complets de manera autònoma, i és el primer amb aquesta capacitat que arriba al públic sense unes salvaguardes que mereixin aquest nom.

Les proves es van fer en entorns aïllats, contra objectius preparats i sense connexió. A ExploitBench, amb 41 falles conegudes del motor de Chrome, GLM-5.3 va obtenir un exploit funcional en el 12 % dels intents. En una altra prova interna va quedar per sota de Mythos Preview, però els models anteriors, Claude Opus 4.6 i GLM-5.2, no van resoldre cap tasca: «s'ha superat clarament un llindar rellevant», conclou Anthropic.

La diferència és qui el pot fer servir

Anthropic va presentar Claude Mythos Preview fa cinc mesos i, precisament per aquesta capacitat, només el va obrir a través de Project Glasswing, el seu programa d'accés per a defensors de confiança. Els seus models Claude surten amb salvaguardes, i les versions amb menys restriccions es reserven per a usuaris verificats.

GLM-5.3 va seguir el camí contrari: qualsevol el pot descarregar. Aquest és el nucli de l'argument d'Anthropic: la capacitat no és nova; el que és nou és que no hi ha ningú al mig.

Unes proteccions que cedeixen gairebé sempre

GLM-5.3 incorpora algunes proteccions: davant d'una ordre clarament perjudicial i sense res més, s'hi va negar en totes les proves, com la resta de models. El problema, segons Anthropic, és el poc que aguanten: amb tècniques senzilles i conegudes, les seves salvaguardes es van superar entre el 64 % i el 100 % de les vegades en un entorn simulat en què se li demanava atacar sistemes crítics.

L'extrem alt correspon a les versions sotmeses a abliteration, i diversos desenvolupadors en van publicar còpies pocs dies després del llançament. Els models Claude provats, amb les seves salvaguardes, no van executar cap de les tasques perjudicials; els seus pesos no es publiquen, de manera que no es poden retocar.

Washington el veu quatre mesos per darrere

El contrapunt independent va arribar abans. El 17 de setembre, el CAISI va concloure que GLM-5.3 és «el model de pesos oberts més capaç en ciberseguretat publicat fins ara», però que les seves capacitats són «significativament inferiors» a les dels millors models nord-americans: va uns quatre mesos per darrere en el conjunt de les seves proves.

Anthropic diu que els seus resultats coincideixen en allò bàsic, amb un matís. El CAISI va comparar-lo amb models nord-americans amb les salvaguardes desactivades i amb versions que només reben usuaris verificats, a les quals un atacant no arriba. La seva lectura: aquest avantatge de quatre mesos no està a l'abast de qualsevol; GLM-5.3, sí.

Jutge i part, i amb peticions

L'advertiment ve d'un competidor directe, que a més demana coses. Anthropic vol ampliar a més defensors verificats l'accés a les seves capacitats de ciberseguretat, perquè han de tenir models almenys tan bons com els dels seus adversaris, i admet que GLM-5.3 també els pot ser útil. I demana que els governs provin els models prou capaços, inclosos els successors de GLM-5.3.

No és la primera vegada que l'empresa assenyala laboratoris xinesos, i el mateix dimarts el seu conseller delegat, Dario Amodei, va signar a la Casa Blanca un pacte voluntari que demana controls sobre les capacitats dels models en ciberseguretat. Tot el que s'ha descrit va passar en proves: Anthropic no afirma que GLM-5.3 s'hagi fet servir en atacs reals, tot i que creu probable que actors estatals i no estatals ho facin.

Conclusió

Anthropic i el CAISI apunten en la mateixa direcció: un model que qualsevol pot descarregar ja fa, en proves controlades, el que fa cinc mesos només feia un model guardat sota clau. Discrepen sobre quant pesa aquesta distància de quatre mesos. No consta que Z.ai hagi respost, i queda la pregunta de si algú, governs inclosos, provarà el pròxim GLM abans que se'n publiquin els pesos.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog