Em 7 de abril, a Z.ai (antiga Zhipu AI) lançou o GLM-5.1, com 754B parâmetros, arquitetura MoE e código aberto sob licença MIT.
Resultado de benchmark: SWE-Bench Pro 58,4%, primeiro lugar global. GPT-5.4 tem 57,7%, Claude Opus 4.6 tem 57,3%.
Apenas esse número já é suficiente para gerar buzz — um modelo de código aberto superou dois carros-chefe fechados na dimensão de capacidade de programação. Mas o mais interessante é outro aspecto:
O treinamento deste modelo foi feito inteiramente em chips Huawei Ascend 910B e framework MindSpore, sem nenhuma GPU NVIDIA envolvida.
Parâmetros técnicos do modelo
Primeiro, os indicadores técnicos:
| Parâmetro | Valor |
|---|---|
| Total de parâmetros | 754B |
| Parâmetros ativados por vez | 40B |
| Arquitetura | MoE + Dynamic Sparse Attention |
| Janela de contexto | 200K tokens |
| Saída máxima | 131072 tokens |
| Tamanho do arquivo do modelo | 1,51 TB (HuggingFace) |
| Licença | MIT |
Resultados de alguns benchmarks:
- SWE-Bench Pro: 58,4% (primeiro lugar global)
- CyberGym: 68,7%
- BrowseComp: 68,0%
- AIME 2026: 95,3%
O SWE-Bench Pro mede a correção de issues reais do GitHub, não conjuntos de dados sintéticos que podem ser facilmente manipulados para obter pontuações altas. Os 58,4% têm valor real.
Agente com capacidade de 8 horas
O GLM-5.1 tem uma capacidade pouco mencionada, mas importante: capacidade de execução autônoma.
A descrição oficial é "execução independente de tarefas por mais de 8 horas, abrangendo centenas de rodadas de operações e milhares de chamadas de ferramentas" — pode trabalhar continuamente por mais de 8 horas, processando centenas de rodadas de tarefas e milhares de chamadas de ferramentas.
A maioria dos modelos em tarefas complexas de agente perde o controle após algumas dezenas de rodadas: a janela de contexto fica cheia, o raciocínio começa a falhar, as chamadas de ferramentas entram em loop. O GLM-5.1 foi claramente otimizado para isso, não apenas contando com uma grande janela de contexto.
Isso é um avanço substancial para a implantação de Agentes em nível empresarial, não apenas uma pontuação de benchmark.
O mais notável: Sem NVIDIA
Hardware de treinamento: Huawei Ascend 910B
Framework de treinamento: Huawei MindSpore
Isso não é um pequeno detalhe.
Por muito tempo, o caminho ideal para treinar modelos de grande escala era quase exclusivamente o CUDA da NVIDIA. H100, H800, A100 — usava-se o que estivesse disponível, e o MindSpore sempre teve uma lacuna significativa em maturidade de engenharia em relação ao PyTorch.
O GLM-5.1 provou que esse caminho é viável: não apenas funcionou, mas treinou um modelo que derrota GPT-5.4 e Claude Opus 4.6.
"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents
O significado político disso é tão grande quanto o técnico. As restrições de exportação de chips de IA dos EUA para a China são agora uma restrição de produção real, não uma ameaça futura. O GLM-5.1 é um resultado experimental: o que as equipes de IA chinesas podem alcançar sob condições de recursos computacionais limitados.
A resposta atualmente é: primeiro lugar global no SWE-Bench Pro, código aberto sob licença MIT, preço de API $1,26/M token.
Comparação de preços
Preços da API GLM-5.1:
- Entrada: $1,26/M tokens
- Saída: $3,96/M tokens
Para comparação: Claude Opus 4.6 custa cerca de $15/$75, GPT-5.4 está na mesma faixa.
A capacidade de programação líder global no SWE-Bench Pro a esse preço torna a escolha clara para desenvolvedores de infraestrutura de programação com IA.
Claro, o SWE-Bench Pro não representa todos os cenários. O GLM-5.1 ainda está atrás dos principais modelos fechados em raciocínio matemático e benchmarks gerais, o artigo original não esconde isso. Não é um campeão versátil, mas um modelo especializado que se diferencia na direção Programação + Agente.
Uma tendência digna de nota
No último ano, modelos de código aberto chineses como Z.ai (GLM-5.1), DeepSeek (V3.2) e Kimi K2 alcançaram sucessivamente o topo em vários benchmarks especializados, sob licenças MIT ou Apache, com preços de API que esmagam os concorrentes fechados.
A Meta anunciou fechamento parcial, a OpenAI nunca abriu realmente seus carros-chefe — enquanto as empresas chinesas continuam a publicar os pesos.
Essa configuração era quase inimaginável no início de 2025.
Fonte de referência: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)