Em 26 de agosto, a Zhipu tirou a máscara do Ox Alpha, modelo que rodava de forma anônima havia mais de uma semana no OpenCode e no OpenRouter. Seu nome oficial é GLM-5.3-Flash, e os pesos foram publicados no mesmo dia no HuggingFace, sob licença MIT.
Este é o primeiro membro nativamente multimodal da série GLM-5. O total de parâmetros é de 320 bilhões, mas cada token ativa apenas 18 bilhões; o número de camadas caiu das 92 do GLM-5.3 para 45, e os parâmetros ativos foram reduzidos dos 32 bilhões da geração anterior para 18 bilhões. A economia de computação se reflete diretamente no preço: o valor oficial de tabela é cerca de um décimo do GLM-5.3 e, durante o período promocional por tempo limitado, cai pela metade novamente — o que equivale a aproximadamente um quarenta avos do Claude Opus 4.8. Segundo outro cálculo divulgado pela Z.ai, com o preço promocional, o custo médio para concluir uma tarefa é de 0,045 dólar.
Parâmetros cortados pela metade, a pontuação não caiu junto
No Intelligence Index v4.1.1 da Artificial Analysis, o GLM-5.3-Flash obteve 57 pontos, entrando na faixa dos modelos de ponta globais, no mesmo patamar do Opus 4.8, atualmente o modelo mais popular da Anthropic. As diferenças entre os testes individuais são maiores: o DeepSWE v1.1 subiu dos 46,2 pontos do GLM-5.2 para 63,4; o Terminal-Bench 2.1 marcou 84,3; o Toolathlon Verified, 78,4; e o AutomationBench v1.0.6, 48,8. No Z.ai Code Bench, criado pela própria Zhipu, o modelo alcançou 29,0 no nível de maior dificuldade, contra 29,5 do grupo de controle Opus.
A multimodalidade é a novidade desta geração: OfficeQA Pro chegou a 62,4, CharXiv com raciocínio por ferramentas a 89,4, Chartography com ferramentas a 78,0, e no lado de vídeo, MVBench marcou 77,8 e MMVU, 80,5. Esse conjunto de resultados aponta para um "agente de escritório capaz de entender tabelas e desenhos técnicos", mais do que uma vitrine de pontuações de compreensão de imagem genérica.
Em termos de arquitetura, é o primeiro modelo aberto de ponta a combinar atenção esparsa (sparse attention) e atenção linear (linear attention), introduzindo também o IndexPool e o mHC (hiperconexões com restrição de variedade). O efeito aparece em dois números: em comparação ao GLM-5.3, o volume de cálculo de atenção caiu para cerca de um terço (redução de 3,0 vezes), e o KV cache caiu para cerca de um quarto (redução de 4,4 vezes). Em contextos longos, a maior parte do custo está justamente no KV cache — essa proporção é que determina se uma janela de 1 milhão de tokens é realmente utilizável, e não apenas um número na ficha técnica.
Todo o tráfego rodando em chips nacionais
Durante o período de teste anônimo, o Ox Alpha chegou a ser, por um tempo, o modelo mais chamado no OpenCode. A Zhipu afirma que todo o tráfego de inferência desse período foi processado por chips de IA nacionais chineses, com o desempenho do serviço de ponta a ponta 3 vezes maior do que antes, e custos já equiparados às soluções convencionais com GPUs Nvidia.
Essa informação não vale menos do que as pontuações de benchmark. A narrativa predominante dos modelos abertos chineses no último ano era "pontuação próxima, mas a implantação ainda depende de placas da série H"; assim que o lado de inferência consegue operar em plena carga em silício nacional com custo unitário equivalente, o espaço de precificação dos fabricantes de modelos deixa de depender do preço de aquisição das placas. Parte da confiança da Zhipu para reduzir o preço de tabela a um décimo da geração anterior vem justamente daí.
Uma conta rápida: ao preço promocional por tempo limitado de 0,075 dólar por milhão de tokens de entrada e 0,25 dólar por milhão de tokens de saída, uma aplicação de Agent de porte médio, com consumo médio diário de 50 milhões de tokens de entrada e 10 milhões de saída, teria uma conta diária de modelo de cerca de 6,25 dólares (estimativa aproximada, sem considerar descontos de cache nem novas tentativas por falha). Com o mesmo volume de chamadas no Opus 4.8, a diferença é de uma ordem de grandeza. Para equipes chinesas que desenvolvem produtos de Agent, isso traz de volta a pergunta "dá para colocar em produção?" do campo do orçamento para o campo da engenharia.
No lado da implantação, SGLang, vLLM e KTransformers já dão suporte ao modelo, e a API também foi lançada simultaneamente em docs.z.ai. A licença MIT é um passo raro desta vez — as gerações anteriores do GLM costumavam usar licença própria; sob a MIT, a redistribuição comercial praticamente não tem condições adicionais, e equipes fora da China podem modificá-lo sem precisar passar novamente pelo departamento jurídico.
Uma semana antes, a Zhipu já havia reconhecido publicamente que o Ox Alpha era sua própria iteração, com dados na época mostrando um volume de chamadas mais que o dobro do DeepSeek. Agora nome, pesos e preço estão todos sobre a mesa; a questão que resta é quantas equipes estarão dispostas a trocá-lo de "modelo de teste barato" para principal modelo em produção.
Fontes: blog oficial da Z.ai, página do modelo no HuggingFace, CocoLoop, Artificial Analysis; escala de parâmetros, pontuações de benchmark e preços de API verificados conforme a página oficial de lançamento.