Ciberseguridad

Anthropic parte en tres el acceso a sus modelos con menos frenos

La empresa anunció el martes 6 de octubre de 2026 que parte su Cyber Verification Program en tres niveles —defense access, red team access y specialized access— y que todos sus miembros pasan a usar los modelos Mythos, los más avanzados de la casa. Lo que reparte el programa es acceso a los modelos Claude con las salvaguardas reducidas: con menos frenos de los que normalmente impiden ayudar en un ciberataque. Las cifras son de la propia Anthropic sobre su propio programa.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Un surtidor con la estrella de Claude vierte un chorro en una carretilla mientras un pequeño recipiente recibe una gota.
📷 Imagen generada con IA

En resumen

  • El 6 de octubre de 2026 Anthropic reestructuró su programa de acceso en ciberseguridad en tres niveles y abrió los modelos Mythos a todos sus miembros; antes eran solo para Project Glasswing.
  • La prueba CyScenarioBench, sobre Claude Opus 5.5, mide el efecto del nivel: con defense access las salvaguardas bloquearon 46 de las 50 tareas; con red team access no bloquearon ninguna y el modelo completó 34, un acierto prácticamente equivalente al que logra sin ninguna salvaguarda delante.
  • Project Glasswing deja de ser un programa aparte y pasa a ser specialized access, el nivel de arriba, cuyos nuevos miembros aprueba Anthropic junto al Gobierno de Estados Unidos, con criterios que no se publican.
  • El detonante es GLM-5.3, de Zhipu AI: Anthropic encontró la semana pasada que es capaz de ciberataques autónomos y, al tener pesos abiertos, cualquiera puede descargarlo y modificarlo.
  • Los recuentos de vulnerabilidades los declara la empresa sobre su propio trabajo; lo único que ha repasado alguien de fuera es una muestra, y casi nada de lo publicado se ha llegado a explotar.

Levantar el freno, pero solo a quien se ha verificado antes

Anthropic anunció el martes 6 de octubre de 2026 que amplía y reestructura sus programas de acceso en ciberseguridad para que más equipos de defensa puedan usar sus modelos Claude más avanzados en la protección de sus sistemas. La reorganización tiene dos piezas: una estructura nueva en tres niveles y un ensanchamiento del acceso a los modelos Mythos, los más avanzados de la casa.

Lo que reparte ese programa no es un descuento ni un soporte prioritario: es acceso a los modelos Claude con las salvaguardas reducidas, es decir, con menos frenos de los que normalmente impedirían al modelo ayudar en un ciberataque. Desde el anuncio, todos los miembros del Cyber Verification Program tienen los modelos Mythos para ciertos usos de ciberseguridad; antes solo los de Project Glasswing.

Los modelos de uso general de la casa llevan salvaguardas conservadoras que bloquean, dice la empresa, casi todo el trabajo de ciberseguridad, y el programa es la excepción reglada a eso. Las cifras que siguen son suyas, sobre su propio programa.

Tres puertas, y la de arriba no la abre solo Anthropic

Los tres niveles del programa
Nivel Para qué sirve Quién entra
defense access Respuesta a incidentes, ingeniería inversa de malware y análisis y validación de vulnerabilidades Mantenedores de código abierto, universidades e investigadores individuales
red team access Todo lo anterior y, además, pruebas de penetración autorizadas —ciberataques simulados para encontrar fallos nuevos— y ejercicios de equipo rojo; siguen bloqueándose en tiempo real las acciones que puedan causar daño físico o una interrupción masiva, como desplegar ransomware Organizaciones verificadas del programa: equipos rojos internos, equipos rojos de gobiernos y empresas de pruebas de penetración
specialized access El nivel con menos salvaguardas; autoriza a poner a prueba sistemas críticos de seguridad que pueden afectar a la vida de las personas o alterar mercados, como sistemas de vuelo o redes eléctricas Conjunto limitado de organizaciones verificadas; era Project Glasswing, centrado en infraestructuras críticas y software
Estructura anunciada el 6 de octubre de 2026. Anthropic aprueba a los nuevos miembros del nivel más alto en colaboración con el Gobierno de Estados Unidos, con criterios que no se publican.

Los tres niveles van de menos a más permiso y conservan los nombres en inglés del producto. El más bajo, defense access, cubre trabajo defensivo: respuesta a incidentes, ingeniería inversa de malware y análisis y validación de vulnerabilidades. Está pensado para grupos que incluyen mantenedores de código abierto, universidades e investigadores individuales.

El intermedio, red team access, añade las pruebas de penetración autorizadas —ciberataques simulados y con permiso, para descubrir fallos nuevos antes que un atacante— y los ejercicios de equipo rojo. Tampoco ahí desaparece el freno del todo: en ese nivel siguen bloqueándose en tiempo real las acciones que podrían causar daño físico o una interrupción masiva, y la empresa pone como ejemplo desplegar ransomware. Y el más alto, specialized access, es el que menos salvaguardas conserva y queda reservado a un conjunto limitado de organizaciones verificadas autorizadas a poner a prueba sistemas críticos de seguridad que pueden afectar a la vida de las personas o alterar mercados —sistemas de vuelo, redes eléctricas o las transferencias entre bancos—: es el antiguo Project Glasswing, que deja de ser un programa aparte para convertirse en el peldaño de arriba.

Los miembros de ese peldaño son organizaciones seleccionadas que protegen infraestructuras críticas y software, y a los nuevos los aprueba Anthropic en colaboración con el Gobierno de Estados Unidos. El programa de trusted access del Gobierno ha absorbido de hecho a Glasswing y al equivalente de OpenAI, pero los criterios con los que evalúa a los candidatos son opacos: quién entra en el nivel con menos frenos lo decide una puerta cuyo reglamento no está publicado.

Diez retos, cincuenta intentos, y el nivel decide

Las mismas 50 pruebas, el mismo modelo, tres niveles de acceso
  • Pruebas bloqueadas por las salvaguardas
  • Pruebas completadas
Pruebas bloqueadas por las salvaguardas · Sin acceso al programa: 50pruebas de 50 Pruebas completadas · Sin acceso al programa: 0pruebas de 50 Sin acceso al programa Pruebas bloqueadas por las salvaguardas · Defense access: 46pruebas de 50 Pruebas completadas · Defense access: 4pruebas de 50 Defense access Pruebas bloqueadas por las salvaguardas · Red team access: 0pruebas de 50 Pruebas completadas · Red team access: 34pruebas de 50 Red team access
Ver los datos en tabla
Sin acceso al programaDefense accessRed team access
Pruebas bloqueadas por las salvaguardas 50pruebas de 5046pruebas de 500pruebas de 50
Pruebas completadas 0pruebas de 504pruebas de 5034pruebas de 50
Prueba CyScenarioBench sobre Claude Opus 5.5: diez retos con cinco intentos en cada uno y en cada nivel, con cifras publicadas por Anthropic sobre su propio programa. Sin acceso al programa, todas quedaban bloqueadas ya en la primera petición al modelo. Pasar el filtro no es completar la prueba: con defense access se completaron las cuatro que las salvaguardas no bloquearon, y con red team access el modelo completó 34 de las 50, un acierto prácticamente equivalente al 67,6 % que logra sin salvaguardas aplicadas.

El programa trae una prueba para medir qué puede hacer cada nivel. Se llama CyScenarioBench y se pasó sobre Claude Opus 5.5: diez retos de ciberseguridad con cinco intentos en cada uno —cincuenta pruebas por nivel—, con el mismo modelo detrás. Lo único que cambia de una tanda a otra es el nivel de acceso con el que se piden.

Sin acceso al programa, el modelo no llega a empezar ninguna: «every task was blocked on the first prompt», todas quedaban bloqueadas ya en la primera petición al modelo. Con defense access, el nivel más bajo, las salvaguardas pararon casi todo, y las cuatro pruebas que dejaron pasar se completaron. Con red team access no pararon nada, y a partir de ahí el modelo completó 34 de las 50, un acierto prácticamente equivalente al 67,6 % que logra cuando no tiene ninguna salvaguarda delante.

Ahí está el anuncio entero: lo que decide qué hace la herramienta no es la herramienta, es el nivel que te hayan dado. Y conviene retener lo que el gráfico no dice: pasar el filtro no es sacar la tarea adelante.

129.000 fallos, y los cuenta quien los busca

Lo que dice haber encontrado el programa
Qué Cuántas Periodo
Vulnerabilidades de software verificadas al menos 129.000 Abril a julio de 2026
Vulnerabilidades adicionales por barrido de código abierto 5.500 Abril a octubre de 2026
De todas ellas, críticas o de severidad alta más de 33.000 Recuento acumulado hasta la fecha
Vulnerabilidades publicadas que se han explotado de verdad 2 de 300 (0,67 %) Análisis publicado a finales de septiembre de 2026
Las tres primeras filas son cifras declaradas por Anthropic sobre su propio programa, con ventanas de fechas y métodos distintos: no se suman. La empresa avisa de que el recuento sale de encuestas a solo una parte de los socios y de que espera que el impacto real sea al menos cinco veces mayor. La última fila es el único recuento hecho desde fuera: el análisis de Patrick Garrity (VulnCheck) sobre las 300 vulnerabilidades acreditadas a Anthropic o a Project Glasswing.

El anuncio viene con el recuento de lo que el programa dice haber encontrado, y conviene leerlo sabiendo de dónde sale: son cuentas propias, con ventanas de fechas y métodos distintos, así que no se suman.

La propia empresa pone el aviso sobre la cifra que más pesa, la de los fallos graves: dice que es probablemente una infravaloración, porque el recuento sale de encuestas a solo una parte de los socios, y que espera que el impacto real sea al menos cinco veces mayor.

Lo único que ha mirado alguien de fuera es una muestra. El investigador Patrick Garrity, de VulnCheck —una empresa estadounidense que vende datos sobre qué vulnerabilidades se están explotando, financiada por los fondos Sorenson y Ten Eleven Ventures y por In-Q-Tel, la inversora sin ánimo de lucro que creó la CIA en 1999—, repasó el mes pasado las vulnerabilidades que Anthropic o Project Glasswing han hecho públicas y encontró que casi ninguna se ha llegado a explotar. Encontrar un fallo y que alguien lo use son cosas distintas.

Lo que ha movido esto es un modelo chino que cualquiera puede descargar

El cambio no llega en el vacío. La semana pasada Anthropic encontró que GLM-5.3, el modelo de Zhipu AI —la empresa china de inteligencia artificial que publica sus modelos con pesos abiertos, descargables y modificables por cualquiera—, es capaz de ejecutar ciberataques de forma autónoma, igual que el Mythos original de la casa. Que sea capaz no significa que haya atacado a nadie.

Y ahí está el problema que describe Anthropic: si los pesos son abiertos, cualquiera puede bajarse el modelo y modificarlo, incluso para que ayude en un ciberataque. Su conclusión, de la semana pasada: «a critical threshold in freely accessible capabilities has now been crossed. GLM-5.3 underscores the urgency of expanding access to advanced frontier models to a broader set of entities to empower cyber defenders.» Se ha cruzado un umbral crítico en las capacidades de libre acceso, y eso —dice— subraya la urgencia de ampliar el acceso a los modelos frontier más avanzados a más entidades, para dar capacidad a quien defiende.

Las fechas ordenan el movimiento. El 11 de septiembre de 2026 la empresa publicó su informe de amenazas; el 23 de septiembre dijo que ampliaría el Cyber Verification Program; el 30 se publicó su hallazgo de que GLM-5.3, con pesos abiertos, era capaz de ejecutar exploits por su cuenta. Lo nuevo del 6 de octubre no es el programa, sino sus tres peldaños y los números.

Conclusión

Queda un programa que reparte la misma herramienta con tres grados de freno, un balance que casi solo puede comprobar quien lo publica y una verificación del nivel más alto que firman a medias una empresa y un gobierno, con criterios que nadie publica. La prueba deja claro lo demás: el modelo no cambia, cambia el permiso. Y el permiso se concede a puerta cerrada.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog