Ciberseguretat

Anthropic parteix en tres l'accés als seus models amb menys frens

L'empresa va anunciar el dimarts 6 d'octubre de 2026 que parteix el seu Cyber Verification Program en tres nivells —defense access, red team access i specialized access— i que tots els membres passen a usar els models Mythos, els més avançats de la casa. El que reparteix és accés als models Claude amb les salvaguardes reduïdes: amb menys frens dels que normalment impedeixen ajudar en un ciberatac. Les xifres són d'Anthropic mateixa sobre el seu propi programa.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Un sortidor amb l'estrella de Claude aboca un raig en un carretó mentre un recipient petit rep una gota.
📷 Imatge generada amb IA

En resum

  • El 6 d'octubre de 2026 Anthropic va reestructurar en tres nivells el programa d'accés en ciberseguretat i va obrir els models Mythos a tots els membres; abans, només als de Project Glasswing.
  • La prova CyScenarioBench, sobre Claude Opus 5.5, mesura l'efecte del nivell: amb defense access les salvaguardes van bloquejar 46 de les 50 tasques; amb red team access no en van bloquejar cap i el model va completar 34, un encert pràcticament equivalent al que obté sense cap salvaguarda al davant.
  • Project Glasswing deixa de ser un programa a part i esdevé specialized access, el nivell de dalt: els nous membres els aprova Anthropic amb el Govern dels Estats Units, amb criteris que no es publiquen.
  • El detonant és GLM-5.3, de Zhipu AI: Anthropic va trobar la setmana passada que és capaç de ciberatacs autònoms i, amb pesos oberts, qualsevol el pot baixar i modificar.
  • Els recomptes de vulnerabilitats els declara l'empresa sobre la seva pròpia feina; l'únic que ha repassat algú de fora és una mostra, i gairebé res del que s'ha publicat s'ha arribat a explotar.

Aixecar el fre, però només a qui s'ha verificat abans

Anthropic va anunciar el dimarts 6 d'octubre de 2026 que amplia i reestructura els seus programes d'accés en ciberseguretat perquè més equips de defensa puguin usar els models Claude més avançats en la protecció dels seus sistemes. La reorganització té dues peces: una estructura nova en tres nivells i un eixamplament de l'accés als models Mythos, els més avançats de la casa.

El que reparteix aquest programa no és un descompte ni un suport prioritari: és accés als models Claude amb les salvaguardes reduïdes, és a dir, amb menys frens dels que normalment impedirien al model ajudar en un ciberatac. Des de l'anunci, tots els membres del Cyber Verification Program tenen els models Mythos per a certs usos de ciberseguretat; abans, només els de Project Glasswing.

Els models d'ús general de la casa porten salvaguardes conservadores que bloquegen, diu l'empresa, gairebé tota la feina de ciberseguretat, i el programa és l'excepció reglada a això. Les xifres que segueixen són seves, sobre el seu propi programa.

Tres portes, i la de dalt no l'obre només Anthropic

Els tres nivells del programa
Nivell Per a què serveix Qui hi entra
defense access Resposta a incidents, enginyeria inversa de malware i anàlisi i validació de vulnerabilitats Mantenidors de codi obert, universitats i investigadors individuals
red team access Tot l'anterior i, a més, proves de penetració autoritzades —ciberatacs simulats per trobar errors nous— i exercicis d'equip vermell; continuen bloquejant-se en temps real les accions que puguin causar dany físic o una interrupció massiva, com desplegar ransomware Organitzacions verificades del programa: equips vermells interns, equips vermells de governs i empreses de proves de penetració
specialized access El nivell amb menys salvaguardes; autoritza a posar a prova sistemes crítics de seguretat que poden afectar la vida de les persones o alterar mercats, com sistemes de vol o xarxes elèctriques Conjunt limitat d'organitzacions verificades; era Project Glasswing, centrat en infraestructures crítiques i programari
Estructura anunciada el 6 d'octubre de 2026. Anthropic aprova els nous membres del nivell més alt en col·laboració amb el Govern dels Estats Units, amb criteris que no es publiquen.

Els tres nivells van de menys a més permís i conserven els noms en anglès del producte. El més baix, defense access, cobreix feina defensiva: resposta a incidents, enginyeria inversa de malware i anàlisi i validació de vulnerabilitats. Està pensat per a grups que inclouen mantenidors de codi obert, universitats i investigadors individuals.

L'intermedi, red team access, hi afegeix les proves de penetració autoritzades —ciberatacs simulats i amb permís, per descobrir errors nous abans que un atacant— i els exercicis d'equip vermell. Tampoc aquí no desapareix el fre del tot: en aquest nivell continuen bloquejant-se en temps real les accions que podrien causar dany físic o una interrupció massiva, i l'empresa posa com a exemple desplegar ransomware. I el més alt, specialized access, és el que conserva menys salvaguardes i queda reservat a un conjunt limitat d'organitzacions verificades autoritzades a posar a prova sistemes crítics de seguretat que poden afectar la vida de les persones o alterar mercats —sistemes de vol, xarxes elèctriques o les transferències entre bancs—: és l'antic Project Glasswing, que deixa de ser un programa a part per convertir-se en l'esglaó de dalt.

Els membres d'aquest esglaó són organitzacions seleccionades que protegeixen infraestructures crítiques i programari, i els nous els aprova Anthropic en col·laboració amb el Govern dels Estats Units. El programa de trusted access del Govern ha absorbit de fet Glasswing i l'equivalent d'OpenAI, però els criteris amb què avalua els candidats són opacs: qui entra al nivell amb menys frens ho decideix una porta amb un reglament que no es publica.

Deu reptes, cinquanta intents, i el nivell decideix

Les mateixes 50 proves, el mateix model, tres nivells d'accés
  • Proves bloquejades per les salvaguardes
  • Proves completades
Proves bloquejades per les salvaguardes · Sense accés al programa: 50proves de 50 Proves completades · Sense accés al programa: 0proves de 50 Sense accés al programa Proves bloquejades per les salvaguardes · Defense access: 46proves de 50 Proves completades · Defense access: 4proves de 50 Defense access Proves bloquejades per les salvaguardes · Red team access: 0proves de 50 Proves completades · Red team access: 34proves de 50 Red team access
Veure les dades en una taula
Sense accés al programaDefense accessRed team access
Proves bloquejades per les salvaguardes 50proves de 5046proves de 500proves de 50
Proves completades 0proves de 504proves de 5034proves de 50
Prova CyScenarioBench sobre Claude Opus 5.5: deu reptes amb cinc intents cadascun i en cada nivell, amb xifres publicades per Anthropic sobre el seu propi programa. Sense accés al programa, totes quedaven bloquejades ja a la primera petició al model. Passar el filtre no és completar la prova: amb defense access es van completar les quatre que les salvaguardes no van bloquejar, i amb red team access el model va completar 34 de les 50, un encert pràcticament equivalent al 67,6 % que obté sense salvaguardes aplicades.

El programa porta una prova per mesurar què pot fer cada nivell. Es diu CyScenarioBench i es va passar sobre Claude Opus 5.5: deu reptes de ciberseguretat amb cinc intents cadascun —cinquanta proves per nivell—, amb el mateix model al darrere. L'únic que canvia d'una tanda a l'altra és el nivell d'accés amb què es demanen.

Sense accés al programa, el model no arriba a començar-ne cap: «every task was blocked on the first prompt», totes quedaven bloquejades ja a la primera petició al model. Amb defense access, el nivell més baix, les salvaguardes van aturar gairebé tot, i les quatre proves que van deixar passar es van completar. Amb red team access no van aturar res, i a partir d'aquí el model va completar 34 de les 50, un encert pràcticament equivalent al 67,6 % que obté quan no té cap salvaguarda al davant.

Aquí hi ha l'anunci sencer: el que decideix què fa l'eina no és l'eina, és el nivell que t'hagin donat. I convé retenir el que el gràfic no diu: passar el filtre no és treure la tasca endavant.

129.000 errors, i els compta qui els busca

El que el programa diu haver trobat
Què Quantes Període
Vulnerabilitats de programari verificades almenys 129.000 D'abril a juliol de 2026
Vulnerabilitats addicionals per escombratge de codi obert 5.500 D'abril a octubre de 2026
De totes elles, crítiques o de severitat alta més de 33.000 Recompte acumulat fins ara
Vulnerabilitats publicades que s'han explotat de debò 2 de 300 (0,67 %) Anàlisi publicada a finals de setembre de 2026
Les tres primeres files són xifres declarades per Anthropic sobre el seu propi programa, amb finestres de dates i mètodes diferents: no se sumen. L'empresa avisa que el recompte surt d'enquestes a només una part dels socis i que espera que l'impacte real sigui com a mínim cinc vegades més gran. L'última fila és l'únic recompte fet des de fora: l'anàlisi de Patrick Garrity (VulnCheck) sobre les 300 vulnerabilitats acreditades a Anthropic o a Project Glasswing.

L'anunci porta el recompte del que el programa diu haver trobat, i convé llegir-lo sabent d'on surt: són comptes propis, amb finestres de dates i mètodes diferents, i per tant no se sumen.

L'empresa mateixa posa l'avís sobre la xifra que més pesa, la dels errors greus: diu que probablement és una infravaloració, perquè el recompte surt d'enquestes a només una part dels socis, i que espera que l'impacte real sigui com a mínim cinc vegades més gran.

L'únic que ha mirat algú de fora és una mostra. L'investigador Patrick Garrity, de VulnCheck —una empresa nord-americana que ven dades sobre quines vulnerabilitats s'estan explotant, finançada pels fons Sorenson i Ten Eleven Ventures i per In-Q-Tel, la inversora sense ànim de lucre que va crear la CIA el 1999—, va repassar el mes passat les vulnerabilitats que Anthropic o Project Glasswing han fet públiques i va trobar que gairebé cap no s'ha arribat a explotar. Trobar un error i que algú el faci servir són coses diferents.

Això ho ha mogut un model xinès que qualsevol es pot baixar

El canvi no arriba en el buit. La setmana passada Anthropic va trobar que GLM-5.3, el model de Zhipu AI —l'empresa xinesa d'intel·ligència artificial que publica els seus models amb pesos oberts, descarregables i modificables per qualsevol—, és capaç d'executar ciberatacs de manera autònoma, igual que el Mythos original de la casa. Que sigui capaç no vol dir que hagi atacat ningú.

I aquí hi ha el problema que descriu Anthropic: si els pesos són oberts, qualsevol es pot baixar el model i modificar-lo, fins i tot perquè ajudi en un ciberatac. La seva conclusió, de la setmana passada: «a critical threshold in freely accessible capabilities has now been crossed. GLM-5.3 underscores the urgency of expanding access to advanced frontier models to a broader set of entities to empower cyber defenders.» S'ha creuat un llindar crític en les capacitats de lliure accés, i això —diu— subratlla la urgència d'ampliar l'accés als models frontier més avançats a més entitats, per donar capacitat a qui defensa.

Les dates ordenen el moviment. L'11 de setembre de 2026 l'empresa va publicar el seu informe d'amenaces; el 23 de setembre va dir que ampliaria el Cyber Verification Program; el 30 es va publicar la seva troballa que GLM-5.3, amb pesos oberts, era capaç d'executar exploits pel seu compte. La novetat del 6 d'octubre no és el programa, sinó els seus tres esglaons i els números.

Conclusió

Queda un programa que reparteix la mateixa eina amb tres graus de fre, un balanç que gairebé només pot comprovar qui el publica i una verificació del nivell més alt que signen a mitges una empresa i un govern, amb criteris que ningú no publica. La prova deixa clara la resta: el model no canvia, canvia el permís. I el permís es concedeix a porta tancada.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog