Ciberseguridad
Anthropic parte en tres el acceso a sus modelos con menos frenos
La empresa anunció el martes 6 de octubre de 2026 que parte su Cyber Verification Program en tres niveles —defense access, red team access y specialized access— y que todos sus miembros pasan a usar los modelos Mythos, los más avanzados de la casa. Lo que reparte el programa es acceso a los modelos Claude con las salvaguardas reducidas: con menos frenos de los que normalmente impiden ayudar en un ciberataque. Las cifras son de la propia Anthropic sobre su propio programa.
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
En resumen
- El 6 de octubre de 2026 Anthropic reestructuró su programa de acceso en ciberseguridad en tres niveles y abrió los modelos Mythos a todos sus miembros; antes eran solo para Project Glasswing.
- La prueba CyScenarioBench, sobre Claude Opus 5.5, mide el efecto del nivel: con defense access las salvaguardas bloquearon 46 de las 50 tareas; con red team access no bloquearon ninguna y el modelo completó 34, un acierto prácticamente equivalente al que logra sin ninguna salvaguarda delante.
- Project Glasswing deja de ser un programa aparte y pasa a ser specialized access, el nivel de arriba, cuyos nuevos miembros aprueba Anthropic junto al Gobierno de Estados Unidos, con criterios que no se publican.
- El detonante es GLM-5.3, de Zhipu AI: Anthropic encontró la semana pasada que es capaz de ciberataques autónomos y, al tener pesos abiertos, cualquiera puede descargarlo y modificarlo.
- Los recuentos de vulnerabilidades los declara la empresa sobre su propio trabajo; lo único que ha repasado alguien de fuera es una muestra, y casi nada de lo publicado se ha llegado a explotar.
Levantar el freno, pero solo a quien se ha verificado antes
Anthropic anunció el martes 6 de octubre de 2026 que amplía y reestructura sus programas de acceso en ciberseguridad para que más equipos de defensa puedan usar sus modelos Claude más avanzados en la protección de sus sistemas. La reorganización tiene dos piezas: una estructura nueva en tres niveles y un ensanchamiento del acceso a los modelos Mythos, los más avanzados de la casa.
Lo que reparte ese programa no es un descuento ni un soporte prioritario: es acceso a los modelos Claude con las salvaguardas reducidas, es decir, con menos frenos de los que normalmente impedirían al modelo ayudar en un ciberataque. Desde el anuncio, todos los miembros del Cyber Verification Program tienen los modelos Mythos para ciertos usos de ciberseguridad; antes solo los de Project Glasswing.
Los modelos de uso general de la casa llevan salvaguardas conservadoras que bloquean, dice la empresa, casi todo el trabajo de ciberseguridad, y el programa es la excepción reglada a eso. Las cifras que siguen son suyas, sobre su propio programa.
Tres puertas, y la de arriba no la abre solo Anthropic
| Nivel | Para qué sirve | Quién entra |
|---|---|---|
| defense access | Respuesta a incidentes, ingeniería inversa de malware y análisis y validación de vulnerabilidades | Mantenedores de código abierto, universidades e investigadores individuales |
| red team access | Todo lo anterior y, además, pruebas de penetración autorizadas —ciberataques simulados para encontrar fallos nuevos— y ejercicios de equipo rojo; siguen bloqueándose en tiempo real las acciones que puedan causar daño físico o una interrupción masiva, como desplegar ransomware | Organizaciones verificadas del programa: equipos rojos internos, equipos rojos de gobiernos y empresas de pruebas de penetración |
| specialized access | El nivel con menos salvaguardas; autoriza a poner a prueba sistemas críticos de seguridad que pueden afectar a la vida de las personas o alterar mercados, como sistemas de vuelo o redes eléctricas | Conjunto limitado de organizaciones verificadas; era Project Glasswing, centrado en infraestructuras críticas y software |
Los tres niveles van de menos a más permiso y conservan los nombres en inglés del producto. El más bajo, defense access, cubre trabajo defensivo: respuesta a incidentes, ingeniería inversa de malware y análisis y validación de vulnerabilidades. Está pensado para grupos que incluyen mantenedores de código abierto, universidades e investigadores individuales.
El intermedio, red team access, añade las pruebas de penetración autorizadas —ciberataques simulados y con permiso, para descubrir fallos nuevos antes que un atacante— y los ejercicios de equipo rojo. Tampoco ahí desaparece el freno del todo: en ese nivel siguen bloqueándose en tiempo real las acciones que podrían causar daño físico o una interrupción masiva, y la empresa pone como ejemplo desplegar ransomware. Y el más alto, specialized access, es el que menos salvaguardas conserva y queda reservado a un conjunto limitado de organizaciones verificadas autorizadas a poner a prueba sistemas críticos de seguridad que pueden afectar a la vida de las personas o alterar mercados —sistemas de vuelo, redes eléctricas o las transferencias entre bancos—: es el antiguo Project Glasswing, que deja de ser un programa aparte para convertirse en el peldaño de arriba.
Los miembros de ese peldaño son organizaciones seleccionadas que protegen infraestructuras críticas y software, y a los nuevos los aprueba Anthropic en colaboración con el Gobierno de Estados Unidos. El programa de trusted access del Gobierno ha absorbido de hecho a Glasswing y al equivalente de OpenAI, pero los criterios con los que evalúa a los candidatos son opacos: quién entra en el nivel con menos frenos lo decide una puerta cuyo reglamento no está publicado.
Diez retos, cincuenta intentos, y el nivel decide
- Pruebas bloqueadas por las salvaguardas
- Pruebas completadas
Ver los datos en tabla
| Sin acceso al programa | Defense access | Red team access | |
|---|---|---|---|
| Pruebas bloqueadas por las salvaguardas | 50pruebas de 50 | 46pruebas de 50 | 0pruebas de 50 |
| Pruebas completadas | 0pruebas de 50 | 4pruebas de 50 | 34pruebas de 50 |
El programa trae una prueba para medir qué puede hacer cada nivel. Se llama CyScenarioBench y se pasó sobre Claude Opus 5.5: diez retos de ciberseguridad con cinco intentos en cada uno —cincuenta pruebas por nivel—, con el mismo modelo detrás. Lo único que cambia de una tanda a otra es el nivel de acceso con el que se piden.
Sin acceso al programa, el modelo no llega a empezar ninguna: «every task was blocked on the first prompt», todas quedaban bloqueadas ya en la primera petición al modelo. Con defense access, el nivel más bajo, las salvaguardas pararon casi todo, y las cuatro pruebas que dejaron pasar se completaron. Con red team access no pararon nada, y a partir de ahí el modelo completó 34 de las 50, un acierto prácticamente equivalente al 67,6 % que logra cuando no tiene ninguna salvaguarda delante.
Ahí está el anuncio entero: lo que decide qué hace la herramienta no es la herramienta, es el nivel que te hayan dado. Y conviene retener lo que el gráfico no dice: pasar el filtro no es sacar la tarea adelante.
129.000 fallos, y los cuenta quien los busca
| Qué | Cuántas | Periodo |
|---|---|---|
| Vulnerabilidades de software verificadas | al menos 129.000 | Abril a julio de 2026 |
| Vulnerabilidades adicionales por barrido de código abierto | 5.500 | Abril a octubre de 2026 |
| De todas ellas, críticas o de severidad alta | más de 33.000 | Recuento acumulado hasta la fecha |
| Vulnerabilidades publicadas que se han explotado de verdad | 2 de 300 (0,67 %) | Análisis publicado a finales de septiembre de 2026 |
El anuncio viene con el recuento de lo que el programa dice haber encontrado, y conviene leerlo sabiendo de dónde sale: son cuentas propias, con ventanas de fechas y métodos distintos, así que no se suman.
La propia empresa pone el aviso sobre la cifra que más pesa, la de los fallos graves: dice que es probablemente una infravaloración, porque el recuento sale de encuestas a solo una parte de los socios, y que espera que el impacto real sea al menos cinco veces mayor.
Lo único que ha mirado alguien de fuera es una muestra. El investigador Patrick Garrity, de VulnCheck —una empresa estadounidense que vende datos sobre qué vulnerabilidades se están explotando, financiada por los fondos Sorenson y Ten Eleven Ventures y por In-Q-Tel, la inversora sin ánimo de lucro que creó la CIA en 1999—, repasó el mes pasado las vulnerabilidades que Anthropic o Project Glasswing han hecho públicas y encontró que casi ninguna se ha llegado a explotar. Encontrar un fallo y que alguien lo use son cosas distintas.
Lo que ha movido esto es un modelo chino que cualquiera puede descargar
El cambio no llega en el vacío. La semana pasada Anthropic encontró que GLM-5.3, el modelo de Zhipu AI —la empresa china de inteligencia artificial que publica sus modelos con pesos abiertos, descargables y modificables por cualquiera—, es capaz de ejecutar ciberataques de forma autónoma, igual que el Mythos original de la casa. Que sea capaz no significa que haya atacado a nadie.
Y ahí está el problema que describe Anthropic: si los pesos son abiertos, cualquiera puede bajarse el modelo y modificarlo, incluso para que ayude en un ciberataque. Su conclusión, de la semana pasada: «a critical threshold in freely accessible capabilities has now been crossed. GLM-5.3 underscores the urgency of expanding access to advanced frontier models to a broader set of entities to empower cyber defenders.» Se ha cruzado un umbral crítico en las capacidades de libre acceso, y eso —dice— subraya la urgencia de ampliar el acceso a los modelos frontier más avanzados a más entidades, para dar capacidad a quien defiende.
Las fechas ordenan el movimiento. El 11 de septiembre de 2026 la empresa publicó su informe de amenazas; el 23 de septiembre dijo que ampliaría el Cyber Verification Program; el 30 se publicó su hallazgo de que GLM-5.3, con pesos abiertos, era capaz de ejecutar exploits por su cuenta. Lo nuevo del 6 de octubre no es el programa, sino sus tres peldaños y los números.
Conclusión
Queda un programa que reparte la misma herramienta con tres grados de freno, un balance que casi solo puede comprobar quien lo publica y una verificación del nivel más alto que firman a medias una empresa y un gobierno, con criterios que nadie publica. La prueba deja claro lo demás: el modelo no cambia, cambia el permiso. Y el permiso se concede a puerta cerrada.
Fuentes primarias
- The Hacker News — Anthropic expands Claude access for vetted cyber teams as Glasswing finds 129,000 flaws (07-10-2026) ↗
- The Information — Anthropic expands cyberdefenders' access to top models (07-10-2026) ↗
- Anthropic — Expanding the Cyber Verification Program (06-10-2026) ↗
- AI Informator — Anthropic encuentra que GLM-5.3 ejecuta exploits de forma autónoma ↗
- AI Informator — el informe de amenazas de Anthropic ↗
- AI Informator — apex-flash-1 y GLM-5.3 con licencia MIT ↗
- AI Informator — Opus 5.5 y GPT-6 Sol, la guerra de precios ↗
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
Comentarios