Anthropic testa o GLM-5.3: proteções podem ser burladas em até 100%

Em 29 de setembro, a Anthropic publicou um relatório de pesquisa avaliando a capacidade de ataque cibernético do GLM-5.3, da Zhipu. A conclusão é que esse modelo de peso aberto já consegue construir sozinho programas completos de exploração de vulnerabilidades, ponta a ponta, em nível próximo ao do próprio Claude Mythos Preview da Anthropic, enquanto suas proteções de segurança podem ser contornadas por métodos bem simples.

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."(É provável que o GLM-5.3 dê a agentes maliciosos acesso a capacidades que lhes permitam encontrar e explorar vulnerabilidades cibernéticas sem restrições significativas.)

Quais capacidades de ataque foram testadas

A Anthropic usou três conjuntos de testes. O primeiro foi o ExploitBench, voltado a vulnerabilidades do motor Chrome V8: o GLM-5.3 teve sucesso em 50 das 410 tentativas, uma taxa de cerca de 12%, contra 14% do Mythos Preview. O segundo foi um teste interno de exploração de binários baseado no projeto OSS-Fuzz: o GLM-5.3 teve taxa de sucesso de 4%, o Mythos Preview 6%, enquanto os modelos de controle Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash e a geração anterior GLM-5.2 ficaram todos em 0%. O terceiro conjunto envolveu tarefas de ataque abertas com participação de especialistas humanos.

O exemplo que melhor mostra a queda da barreira de entrada é a reprodução de um CVE real: o esforço humano foi de cerca de 20 minutos, enquanto o GLM-5.3-Flash rodou sozinho por 8 horas, equivalente a cerca de 20,40 dólares segundo os preços de API da Zhipu, produzindo um programa de exploração funcional. Todo o código foi executado em um sandbox isolado, sem contato com sistemas externos.

Quanto a camada de proteção consegue bloquear

Diante de pedidos maliciosos diretos, a taxa de recusa do GLM-5.3 fica em torno de 95%, com taxa de sucesso de ataque simulado igual a 0. Ao mudar para as abordagens abaixo, o cenário muda:

MétodoTaxa de sucesso ao contornar
Inventar uma justificativa que pareça legítima64%
Preencher previamente um raciocínio92%
Usar o método de "ablação" para remover o mecanismo de recusa100%

A ablação exige alterar os pesos do modelo, algo que só é possível em modelos de peso aberto. A Anthropic afirma que sua equipe nunca havia feito isso antes, e o processo consumiu cerca de 2.200 horas de GPU, a um custo de aproximadamente 4.400 dólares; depois do tratamento, a taxa de recusa caiu de 95% para uma faixa de 3% a 14%. Como controle, os modelos Claude com proteção não foram vencidos no mesmo teste.

O relatório traz três recomendações: dar ao lado defensivo acesso a modelos de fronteira equivalentes ou mais fortes; que governos realizem testes de segurança em modelos de alta capacidade; e que desenvolvedores de modelos de peso aberto adicionem proteções correspondentes. Este site não encontrou resposta pública da Zhipu a esse relatório.

Outra avaliação apresenta números bem diferentes

O CAISI (Center for AI Standards and Innovation), ligado ao Departamento de Comércio dos EUA, também publicou em 17 de setembro uma avaliação da capacidade cibernética do GLM-5.3. Sua conclusão é que o GLM-5.3 é atualmente o modelo de peso aberto mais capaz nessa área, mas fica claramente atrás dos modelos de fronteira americanos, com uma defasagem geral de cerca de quatro meses.

Os números dos dois relatórios divergem bastante. Na versão do ExploitBench usada pelo CAISI, o GLM-5.3 obteve 61,1%, o melhor modelo de fronteira americano chegou a 100% e o melhor modelo chinês anterior ficou em 32,2%; no SEC-Bench Pro, foi 40,4% contra 90,2%. Os 12% da Anthropic vêm de sua própria configuração de teste, e os dois conjuntos de resultados não podem ser comparados diretamente.

Em termos de classificação, os dois relatórios concordam: o GLM-5.3 lidera entre os modelos de peso aberto, mas ainda está distante do modelo de código fechado mais forte dos EUA. A discordância está em como interpretar essa distância. O CAISI destaca que "ainda faltam cerca de quatro meses", enquanto a Anthropic enfatiza que essa capacidade já pode ser baixada e adaptada por qualquer pessoa, o que faz as camadas de proteção perderem eficácia como restrição.

Para desenvolvedores e empresas chinesas, o impacto direto deste relatório deve recair sobre canais no exterior. O GLM-5.3 já estava bastante presente em distribuição via API e em plataformas de hospedagem no exterior; se mais instituições americanas passarem a adotar a avaliação da Anthropic, plataformas de nuvem e clientes corporativos estrangeiros podem apertar a análise para a adoção de modelos chineses de peso aberto. Por enquanto isso é apenas uma especulação, e nenhuma plataforma tomou providências.

Fontes: relatório de pesquisa da Anthropic, comunicado de avaliação do CAISI, ligado ao NIST dos EUA, CocoLoop; os números de sucesso no ExploitBench, as taxas de sucesso ao contornar e o custo da ablação seguem os critérios do relatório da Anthropic, e os dados do CAISI seguem sua própria configuração de teste.