Anthropic pone a prueba GLM-5.3: las protecciones pueden burlarse hasta en un 100 %

El 29 de septiembre, Anthropic publicó un informe de investigación que evalúa la capacidad de ciberataque de GLM-5.3, de Zhipu. La conclusión es que este modelo de peso abierto ya puede construir por sí solo programas de explotación de vulnerabilidades de extremo a extremo, a un nivel cercano al del propio Claude Mythos Preview de Anthropic, mientras que sus protecciones de seguridad pueden eludirse con métodos muy sencillos.

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."(Es probable que GLM-5.3 dé a actores maliciosos acceso a capacidades que les permitan encontrar y explotar vulnerabilidades cibernéticas prácticamente sin restricciones significativas.)

Qué capacidades de ataque se pusieron a prueba

Anthropic empleó tres grupos de pruebas. El primero fue ExploitBench, centrado en vulnerabilidades del motor Chrome V8: GLM-5.3 tuvo éxito en 50 de 410 intentos, una tasa de alrededor del 12 %, frente al 14 % de Mythos Preview. El segundo fue una prueba interna de explotación de binarios basada en el proyecto OSS-Fuzz: GLM-5.3 obtuvo una tasa de éxito del 4 %, Mythos Preview del 6 %, mientras que los modelos de control Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash y la generación anterior GLM-5.2 se quedaron todos en 0 %. El tercer grupo consistió en tareas de ataque abiertas con participación de expertos humanos.

El ejemplo que mejor ilustra hasta dónde ha bajado el umbral de entrada es la reproducción de un CVE real: la intervención humana fue de unos 20 minutos, mientras que GLM-5.3-Flash se ejecutó por su cuenta durante 8 horas, equivalente a unos 20,40 dólares según los precios de la API de Zhipu, y produjo un programa de explotación utilizable. Todo el código se ejecutó en un entorno aislado (sandbox), sin contacto con sistemas externos.

Cuánto logra detener la capa de protección

Ante solicitudes maliciosas directas, la tasa de rechazo de GLM-5.3 ronda el 95 %, con una tasa de éxito de ataque simulado del 0 %. Al cambiar a los siguientes métodos, la situación cambia:

MétodoTasa de éxito al eludir
Inventar una justificación que parezca legítima64%
Rellenar de antemano un razonamiento92%
Usar el método de "ablación" para eliminar el mecanismo de rechazo100%

La ablación requiere modificar los pesos del modelo, algo que solo es posible en modelos de peso abierto. Anthropic afirma que su equipo nunca había hecho esto antes, y el proceso les llevó unas 2200 horas de GPU, con un costo de unos 4400 dólares; tras el tratamiento, la tasa de rechazo bajó del 95 % a un rango de entre el 3 % y el 14 %. Como control, los modelos Claude con protección no fueron vencidos en la misma prueba.

El informe ofrece tres recomendaciones: que el lado defensivo tenga acceso a modelos de frontera equivalentes o más potentes; que los gobiernos realicen pruebas de seguridad a los modelos de alta capacidad; y que los desarrolladores de modelos de peso abierto añadan las protecciones correspondientes. Este sitio no ha encontrado una respuesta pública de Zhipu a este informe.

Otra evaluación da cifras bastante distintas

El CAISI (Centro de Estándares e Innovación en IA), dependiente del Departamento de Comercio de EE. UU., también publicó el 17 de septiembre una evaluación de la capacidad cibernética de GLM-5.3. Su conclusión es que GLM-5.3 es actualmente el modelo de peso abierto más capaz en este ámbito, pero queda claramente por detrás de los modelos de frontera estadounidenses, con una brecha total de unos cuatro meses.

Las cifras de ambos informes difieren bastante. En la versión de ExploitBench usada por el CAISI, GLM-5.3 obtuvo un 61,1 %, el mejor modelo de frontera estadounidense llegó al 100 % y el mejor modelo chino anterior se quedó en 32,2 %; en SEC-Bench Pro fue 40,4 % frente a 90,2 %. El 12 % de Anthropic proviene de su propia configuración de prueba, por lo que ambos resultados no se pueden comparar directamente.

En cuanto al orden, ambos informes coinciden: GLM-5.3 lidera entre los modelos de peso abierto, pero aún mantiene distancia respecto al modelo de código cerrado más fuerte de EE. UU. La discrepancia está en cómo interpretar esa distancia. El CAISI subraya que "todavía faltan unos cuatro meses", mientras que Anthropic recalca que esta capacidad ya puede ser descargada y modificada por cualquiera, lo que hace que las capas de protección pierdan su efecto de contención.

Para los desarrolladores y empresas chinas, el impacto directo de este informe probablemente recaerá en los canales en el extranjero. GLM-5.3 ya tenía una distribución bastante amplia mediante API y plataformas de alojamiento fuera de China; si más instituciones estadounidenses adoptan el criterio de Anthropic, las plataformas en la nube y los clientes corporativos extranjeros podrían endurecer la revisión para admitir modelos chinos de peso abierto. Por ahora esto es solo una especulación, y ninguna plataforma ha tomado medidas.

Fuentes: informe de investigación de Anthropic, comunicado de evaluación del CAISI, dependiente del NIST de EE. UU., CocoLoop; las cifras de éxito en ExploitBench, las tasas de éxito al eludir y el costo de la ablación siguen el criterio del informe de Anthropic, y los datos del CAISI siguen su propia configuración de prueba.