Blog articles are published in Spanish and Catalan.

Ciberseguridad

GLM-5.3: el hacker chino que cualquiera se descarga

Anthropic sostiene que GLM-5.3, el modelo de pesos abiertos de la china Z.ai (Zhipu AI), construye exploits completos por su cuenta y que sus frenos se saltan con técnicas sencillas. Lo dice en pruebas simuladas propias y siendo parte interesada, porque vende Claude. Un organismo del Gobierno de Estados Unidos coincide en lo esencial, pero lo sitúa unos cuatro meses por detrás de los mejores modelos estadounidenses.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Caricatura de un examinador con bata marcada ANTHROP\C que, con una lupa en el ojo y un cronómetro en la mano, mira espantado cómo una caja roja de ganzúas ha abierto los candados de un panel de pruebas; al fondo, una caja fuerte envuelta en cadenas guarda sus propias herramientas.
📷 Imagen generada con IA

En resumen

  • Anthropic publicó el martes 29 de septiembre su evaluación de GLM-5.3, que Z.ai lanzó el 14 de agosto y cuyos pesos publicó dos semanas después.
  • En ExploitBench, GLM-5.3 consiguió exploits completos en el 12 % de los intentos, cerca de Claude Mythos Preview, que Anthropic solo abrió a defensores de confianza.
  • Según Anthropic, con técnicas sencillas los frenos de GLM-5.3 ceden entre el 64 % y el 100 % de las veces; los modelos Claude probados, con sus salvaguardas, no cedieron nunca.
  • No consta que Z.ai haya respondido.

Anthropic da por cruzado un umbral

Exploits conseguidos, en % de intentos
  • Explotación de binarios (100 tareas)
  • ExploitBench (41 fallos de Chrome)
Explotación de binarios (100 tareas) · Claude Mythos Preview: 6% ExploitBench (41 fallos de Chrome) · Claude Mythos Preview: 14% Claude Mythos Preview Explotación de binarios (100 tareas) · GLM-5.3: 4% ExploitBench (41 fallos de Chrome) · GLM-5.3: 12% GLM-5.3 Explotación de binarios (100 tareas) · Claude Opus 4.6: 0% ExploitBench (41 fallos de Chrome) · Claude Opus 4.6: 0% Claude Opus 4.6 Explotación de binarios (100 tareas) · GLM-5.2: 0% ExploitBench (41 fallos de Chrome) · GLM-5.2: 0% GLM-5.2
Ver los datos en tabla
Claude Mythos PreviewGLM-5.3Claude Opus 4.6GLM-5.2
Explotación de binarios (100 tareas) 6%4%0%0%
ExploitBench (41 fallos de Chrome) 14%12%0%0%
Pruebas de Anthropic; los modelos Claude, con salvaguardas desactivadas; en ExploitBench, Opus 4.6 y GLM-5.2 «en o cerca de 0 %».

El laboratorio de Claude publicó el martes 29 de septiembre un análisis de GLM-5.3, el último modelo de Z.ai (Zhipu AI), empresa con sede en China. Su conclusión: como Claude Mythos Preview, construye exploits completos de forma autónoma, y es el primero con esa capacidad que llega al público sin salvaguardas que merezcan el nombre.

Las pruebas se hicieron en entornos aislados, contra objetivos preparados y sin conexión. En ExploitBench, con 41 fallos conocidos del motor de Chrome, GLM-5.3 logró un exploit funcional en el 12 % de los intentos. En otra prueba interna quedó por debajo de Mythos Preview, pero los modelos anteriores, Claude Opus 4.6 y GLM-5.2, no resolvieron ninguna tarea: «se ha cruzado claramente un umbral relevante», concluye Anthropic.

La diferencia es quién puede usarlo

Anthropic presentó Claude Mythos Preview hace cinco meses y, por esa misma capacidad, lo abrió solo a través de Project Glasswing, su programa de acceso para defensores de confianza. Sus modelos Claude salen con salvaguardas, y las versiones con menos frenos quedan para usuarios verificados.

GLM-5.3 siguió el camino contrario: cualquiera puede descargarlo. Ese es el centro del argumento de Anthropic: la capacidad no es nueva, lo nuevo es que no hay nadie en medio.

Unos frenos que ceden casi siempre

GLM-5.3 trae algunos frenos: ante una orden claramente dañina y sin más, se negó en todas las pruebas, como los demás modelos. El problema, según Anthropic, es lo poco que aguantan: con técnicas sencillas y conocidas, sus salvaguardas se saltaron entre el 64 % y el 100 % de las veces en un entorno simulado en el que se le pedía atacar sistemas críticos.

El extremo alto corresponde a las versiones sometidas a abliteration, y varios desarrolladores publicaron copias así a los pocos días del lanzamiento. Los modelos Claude probados, con sus salvaguardas, no ejecutaron ninguna de las tareas dañinas; sus pesos no se publican, así que no se pueden retocar.

Washington lo ve cuatro meses por detrás

El contrapunto independiente llegó antes. El 17 de septiembre, el CAISI concluyó que GLM-5.3 es «el modelo de pesos abiertos más capaz en ciberseguridad publicado hasta la fecha», pero que sus capacidades son «significativamente inferiores» a las de los mejores modelos estadounidenses: va unos cuatro meses por detrás en el conjunto de sus pruebas.

Anthropic dice que sus resultados coinciden en lo básico, con un matiz. El CAISI comparó con modelos estadounidenses con las salvaguardas desactivadas y con versiones que solo reciben usuarios verificados, a las que un atacante no llega. Su lectura: esa ventaja de cuatro meses no está en manos de cualquiera; GLM-5.3, sí.

Juez y parte, con peticiones

La advertencia viene de un competidor directo, que además pide cosas. Anthropic quiere ampliar a más defensores verificados el acceso a sus capacidades de ciberseguridad, porque deben tener modelos al menos tan buenos como los de sus adversarios, y admite que GLM-5.3 también puede servirles. Y pide que los gobiernos prueben los modelos suficientemente capaces, incluidos los sucesores de GLM-5.3.

No es la primera vez que la empresa señala a laboratorios chinos, y el mismo martes su consejero delegado, Dario Amodei, firmó en la Casa Blanca un pacto voluntario que pide controles sobre las capacidades de los modelos en ciberseguridad. Todo lo descrito ocurrió en pruebas: Anthropic no afirma que GLM-5.3 se haya usado en ataques reales, aunque cree probable que actores estatales y no estatales lo hagan.

Conclusión

Anthropic y el CAISI apuntan en la misma dirección: un modelo que cualquiera puede descargar ya hace, en pruebas controladas, lo que hace cinco meses solo hacía uno guardado bajo llave. Discrepan en cuánto pesa esa distancia de cuatro meses. Z.ai no consta que haya respondido, y queda la pregunta de si alguien, gobiernos incluidos, probará el próximo GLM antes de que se publiquen sus pesos.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog