A Zhipu lançou o GLM-5.3-FlashX em 18 de setembro, com a API disponível simultaneamente, sob o identificador GLM-5.3-FlashX. O único indicador oficial divulgado é a velocidade máxima de saída de 200 tokens por segundo, que a Zhipu diz ser cinco vezes a do GLM-5.3-Flash atual.
A capacidade do modelo nessa faixa não mudou. Segundo a documentação aberta, Flash e FlashX compartilham as mesmas especificações: janela de contexto de 1 milhão de tokens, saída máxima de 128 mil tokens, entrada com suporte a vídeo, imagem, texto e arquivos, saída em texto, além de modo de raciocínio, chamada de ferramentas, streaming, cache de contexto e saída estruturada em JSON. A diferença é declarada com clareza: o FlashX ganha em throughput, o Flash mantém o preço mais baixo.
O preço sobe junto com a velocidade
Segundo reportagens públicas, o preço é de 2 yuans por milhão de tokens de entrada e 7 yuans por milhão de tokens de saída, o equivalente a 2,5 vezes a faixa Flash original. A Zhipu não destacou esse ponto no anúncio oficial, e nas redes sociais a discussão gira quase toda em torno dessa troca de velocidade por custo.
Calculando ao contrário pelo fator 2,5, o preço de saída da faixa Flash fica em torno de 2,8 yuans por milhão de tokens. Para um negócio de agentes que consome em média 1 bilhão de tokens de saída por dia, o custo mensal de saída no Flash fica em torno de 84 mil yuans, e no FlashX em torno de 210 mil yuans — a diferença de 126 mil yuans compra o mesmo volume de trabalho, só que mais rápido. Se vale a pena depende de o negócio estar ou não limitado pela latência do primeiro token e pelo tamanho da fila: em produtos conversacionais, legendas em tempo real ou autocompletar de código, onde um segundo de atraso já pesa, 200 tokens por segundo e pouco mais de quarenta tokens por segundo são duas experiências completamente diferentes; já em processamento em lote offline, análise de documentos ou processamento noturno de dados, onde alguns minutos a mais não custam nada, continuar com o Flash ainda é a escolha mais adequada.
De onde vêm os 200 tokens por segundo
A explicação da Zhipu é que, com base na capacidade de inferência de 100 mil chips domésticos, foi reforçada a otimização de inferência. A frase fica em aberto: o anúncio não diz se a otimização está na decodificação especulativa, no escalonamento paralelo ou na organização de memória; também não fica claro se os 100 mil chips se referem apenas ao cluster próprio ou incluem parceiros.
O antecessor do FlashX tem um histórico público. O GLM-5.3-Flash rodou por um tempo sob o codinome Ox Alpha nos círculos de desenvolvedores no exterior, com um volume de chamadas que a Zhipu chegou a dizer que superava o dobro do da DeepSeek. De Ox Alpha para Flash e depois para FlashX, o padrão de movimento da Zhipu nessa linha é consistente: primeiro usar preços baixos para acumular volume de chamadas, entender a forma real da carga e só depois cobrar por faixas de velocidade. Quando a versão oficial do GLM-5.3 foi lançada, o preço de saída por milhão de tokens era de US$ 4,4; a faixa Flash reduziu os parâmetros ativados para 18 bilhões para comprimir o custo; o FlashX é mais um degrau na mesma curva, na direção da velocidade.
O que o aumento de preço sinaliza
O movimento padrão dos grandes modelos domésticos chineses no último ano e pouco tem sido cortar preços — quem corta primeiro ganha volume. O FlashX faz o inverso: mesma capacidade, preço mais alto, vendido como velocidade. Isso só funciona se a oferta do lado da inferência deixar de ser infinitamente barata, e a folga de capacidade simultânea do cluster passar a ser algo precificável por si só.
Se isso vai se sustentar depende de duas coisas: se concorrentes domésticos da mesma faixa vão subir os preços nas próximas semanas, e se o FlashX consegue manter o teto de 200 tokens por segundo em horários de alta concorrência. Dados independentes de testes de carga ainda não foram divulgados.
Fontes: documentação da plataforma aberta da Zhipu, anúncio oficial da Zhipu, CocoLoop, Sina Technology, Chinaz; especificações de velocidade e contexto verificadas na documentação oficial, preços conforme reportagens públicas.