GLM-5.1 lidera SWE-Bench Pro, treinado inteiramente em Huawei Ascend

Em 7 de abril, a Z.ai (antiga Zhipu AI) lançou o GLM-5.1, com 754B parâmetros, arquitetura MoE e código aberto sob licença MIT.

Resultado de benchmark: SWE-Bench Pro 58,4%, primeiro lugar global. GPT-5.4 tem 57,7%, Claude Opus 4.6 tem 57,3%.

Apenas esse número já é suficiente para gerar buzz — um modelo de código aberto superou dois carros-chefe fechados na dimensão de capacidade de programação. Mas o mais interessante é outro aspecto:

O treinamento deste modelo foi feito inteiramente em chips Huawei Ascend 910B e framework MindSpore, sem nenhuma GPU NVIDIA envolvida.

Parâmetros técnicos do modelo

Primeiro, os indicadores técnicos:

Parâmetro Valor
Total de parâmetros 754B
Parâmetros ativados por vez 40B
Arquitetura MoE + Dynamic Sparse Attention
Janela de contexto 200K tokens
Saída máxima 131072 tokens
Tamanho do arquivo do modelo 1,51 TB (HuggingFace)
Licença MIT

Resultados de alguns benchmarks:

  • SWE-Bench Pro: 58,4% (primeiro lugar global)
  • CyberGym: 68,7%
  • BrowseComp: 68,0%
  • AIME 2026: 95,3%

O SWE-Bench Pro mede a correção de issues reais do GitHub, não conjuntos de dados sintéticos que podem ser facilmente manipulados para obter pontuações altas. Os 58,4% têm valor real.

Agente com capacidade de 8 horas

O GLM-5.1 tem uma capacidade pouco mencionada, mas importante: capacidade de execução autônoma.

A descrição oficial é "execução independente de tarefas por mais de 8 horas, abrangendo centenas de rodadas de operações e milhares de chamadas de ferramentas" — pode trabalhar continuamente por mais de 8 horas, processando centenas de rodadas de tarefas e milhares de chamadas de ferramentas.

A maioria dos modelos em tarefas complexas de agente perde o controle após algumas dezenas de rodadas: a janela de contexto fica cheia, o raciocínio começa a falhar, as chamadas de ferramentas entram em loop. O GLM-5.1 foi claramente otimizado para isso, não apenas contando com uma grande janela de contexto.

Isso é um avanço substancial para a implantação de Agentes em nível empresarial, não apenas uma pontuação de benchmark.

O mais notável: Sem NVIDIA

Hardware de treinamento: Huawei Ascend 910B
Framework de treinamento: Huawei MindSpore

Isso não é um pequeno detalhe.

Por muito tempo, o caminho ideal para treinar modelos de grande escala era quase exclusivamente o CUDA da NVIDIA. H100, H800, A100 — usava-se o que estivesse disponível, e o MindSpore sempre teve uma lacuna significativa em maturidade de engenharia em relação ao PyTorch.

O GLM-5.1 provou que esse caminho é viável: não apenas funcionou, mas treinou um modelo que derrota GPT-5.4 e Claude Opus 4.6.

"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents

O significado político disso é tão grande quanto o técnico. As restrições de exportação de chips de IA dos EUA para a China são agora uma restrição de produção real, não uma ameaça futura. O GLM-5.1 é um resultado experimental: o que as equipes de IA chinesas podem alcançar sob condições de recursos computacionais limitados.

A resposta atualmente é: primeiro lugar global no SWE-Bench Pro, código aberto sob licença MIT, preço de API $1,26/M token.

Comparação de preços

Preços da API GLM-5.1:

  • Entrada: $1,26/M tokens
  • Saída: $3,96/M tokens

Para comparação: Claude Opus 4.6 custa cerca de $15/$75, GPT-5.4 está na mesma faixa.

A capacidade de programação líder global no SWE-Bench Pro a esse preço torna a escolha clara para desenvolvedores de infraestrutura de programação com IA.

Claro, o SWE-Bench Pro não representa todos os cenários. O GLM-5.1 ainda está atrás dos principais modelos fechados em raciocínio matemático e benchmarks gerais, o artigo original não esconde isso. Não é um campeão versátil, mas um modelo especializado que se diferencia na direção Programação + Agente.

Uma tendência digna de nota

No último ano, modelos de código aberto chineses como Z.ai (GLM-5.1), DeepSeek (V3.2) e Kimi K2 alcançaram sucessivamente o topo em vários benchmarks especializados, sob licenças MIT ou Apache, com preços de API que esmagam os concorrentes fechados.

A Meta anunciou fechamento parcial, a OpenAI nunca abriu realmente seus carros-chefe — enquanto as empresas chinesas continuam a publicar os pesos.

Essa configuração era quase inimaginável no início de 2025.

Fonte de referência: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)