Zhipu lança API do GLM-5.3, a US$ 4,4 por milhão de tokens de saída

A Zhipu lançou o GLM-5.3 em 14 de agosto, e a API foi oficialmente aberta para uso por volta de 18 de agosto: US$ 1,40 por milhão de tokens de entrada, US$ 4,40 por milhão de tokens de saída, com janela de contexto de 1 milhão de tokens. No mesmo dia, a organização independente de avaliação Artificial Analysis atribuiu ao modelo um Intelligence Index de 60 pontos, colocando-o em 8º lugar entre os 182 modelos que acompanha; a mediana dos modelos de raciocínio na mesma faixa de preço é de 35 pontos.

A primeira camada dessa notícia é a pontuação; a segunda, só depois, é o preço. Colocando lado a lado alguns modelos de peso aberto ou publicamente acessíveis na mesma rodada de dados da Artificial Analysis: o GLM-5.3 atinge no máximo 59,5 pontos (a página do modelo arredonda e exibe 60), custa US$ 0,68 por tarefa e gera 41.107 tokens de saída por tarefa; o Kimi K3 atinge no máximo 59,7 pontos, custa US$ 0,84 e gera 25.474 tokens; o Qwen 3.8 Max marca 58,1 pontos, custa US$ 1,13 e gera 38.287 tokens; o Grok 4.6 (high) da xAI marca 60,9 pontos, custa US$ 0,84 e gera 21.735 tokens. Em pontuação, o GLM-5.3 fica apenas 0,2 ponto atrás do Kimi K3, praticamente empatado na liderança do grupo de peso aberto; mas, para concluir a mesma tarefa, ele produz cerca de sessenta por cento mais tokens, o que corrói parte da vantagem de preço unitário por causa da "conversa em excesso" — ainda assim, convertendo o custo, os US$ 0,68 por tarefa continuam sendo o menor valor do grupo.

No dia do lançamento, a Zhipu destacou programação e segurança

Nas notas de lançamento de 14 de agosto, a Zhipu define o GLM-5.3 como fruto de um "pós-treinamento extremo" sobre a mesma base do GLM-5.2: o ambiente e a duração do treinamento foram significativamente ampliados, mas o modelo base permaneceu o mesmo. Os resultados divulgados concentram-se em tarefas de programação e de agentes: o Terminal Bench 3.0 subiu de 4,6, no GLM-5.2, para 28,3; o DeepSWE v1.1 subiu de 46,2 para 66,9; o Agents' Last Exam subiu de 23,8 para 28,5; no próprio Z.ai Code Bench (High) da Zhipu, a precisão foi de 31,4%, acima dos 29,5% atribuídos ao Claude Opus. A avaliação interna da empresa afirma que a capacidade de programação melhorou 50% em relação ao GLM-5.2.

"GLM-5.3 is the open-source model with the strongest programming ability."

É assim que a própria Zhipu se posiciona: o modelo com a maior capacidade de programação entre os modelos de código aberto.

Outro ponto destacado separadamente é a capacidade de cibersegurança. A Zhipu afirma que, durante o pós-treinamento, surgiu uma capacidade emergente de segurança "acima do esperado"; na fase de testes de red team, foram encontradas ao todo 2.436 vulnerabilidades. No CyberGym, o resultado foi de 84,5%, próximo ao do Mythos 5 da Anthropic (83,8%); no ExploitBench, foi de 54,4%, nitidamente abaixo dos 78,0% do Mythos 5. Segundo a empresa, a cobertura vai além de software, estendendo-se a protocolos de internet e sistemas robóticos.

Pesos abertos em até duas semanas, com integração inicial a ferramentas de programação

O plano de código aberto prevê a divulgação pública dos pesos no Hugging Face dentro de duas semanas após o lançamento (por volta de 28 de agosto), desde que a avaliação de segurança e o reforço estejam concluídos; os termos da licença ainda não foram divulgados. Até lá, o modelo será oferecido primeiro via API e por um conjunto de ferramentas de programação; entre os parceiros de integração citados pela Zhipu estão ZCode e AutoClaw, além de plataformas de programação de terceiros como TraeWork, WorkBuddy, Qoder e CatPaw.

A discussão no Hacker News em torno dos dados da Artificial Analysis trouxe uma perspectiva complementar dos usuários: alguns desenvolvedores consideram uma vantagem o fato de os tokens de raciocínio do GLM-5.3 serem visíveis, permitindo "interrompê-lo a tempo quando ele começa a se desviar"; outros apontam diretamente que seu consumo de tokens é maior que o do Kimi K3. Para equipes que pagam por token, o preço unitário de US$ 1,4/4,4 precisa ser multiplicado por uma saída mais longa antes de qualquer comparação — olhar só a tabela de preços distorce o quadro.

A conta para desenvolvedores chineses

Colocando esse preço na sequência histórica dos modelos nacionais chineses: quando o GLM-5.2 foi lançado, o discurso era de que sua pontuação em programação se aproximava da de modelos fechados, com preço equivalente a um sexto do GPT-5.5; o GLM-5.3 elevou a pontuação absoluta mais um patamar, mantendo o preço unitário na mesma faixa. Para quem usa a API na China, o verdadeiro ponto de comparação são os preços de API do DeepSeek V4 Pro e do Kimi K3, além dos descontos de horário de pico e vale de cada empresa — em termos de pontuação, o GLM-5.3 já entrou nessa conversa; se isso vai desencadear uma guerra de preços depende dos valores praticados depois que os pesos forem abertos daqui a duas semanas e as plataformas de inferência de terceiros os integrarem.

Fontes: notas de lançamento do GLM-5.3 da Zhipu, página do modelo na Artificial Analysis, CocoLoop, discussão no Hacker News, VentureBeat; verificados os preços de API para entrada/saída, a pontuação e o ranking do Intelligence Index, o custo por tarefa e os critérios de contagem de tokens de saída (ambiente de avaliação unificado da Artificial Analysis), os valores oficiais de benchmark e o cronograma de abertura dos pesos.