A equipe Qwen da Alibaba atualizou seu modelo principal, o Qwen3.8-Max, para a versão 0902, adicionando mais uma rodada de pós-treinamento voltada a tarefas de programação e trabalho profissional de escritório. No ranking geral de programação frontend do Code Arena, essa versão obteve 1691 pontos, ficando em primeiro lugar, 22 pontos acima da versão anterior.
Outro número divulgado pela Alibaba ao mesmo tempo deixa ainda mais clara a posição que ela busca ocupar: o preço médio combinado da nova versão é de cerca de 5 dólares por milhão de tokens, enquanto o segundo e o terceiro colocados logo atrás no ranking custam 20 e 12 dólares, respectivamente.
22 pontos e 15 dólares
A diferença entre os primeiros colocados do ranking já é pequena. Entre os 1691 pontos e a versão anterior há apenas 22 pontos, uma margem que, em avaliações cegas feitas por humanos, costuma ser alcançada por concorrentes em uma ou duas semanas. O que realmente separa os modelos está na coluna ao lado: na mesma tarefa de programação frontend, trocar para o modelo em segundo lugar no ranking quadruplica a conta.
Segundo reportagens públicas, o preço da API da nova versão é de 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída. Fazendo o cálculo inverso a partir do preço médio oficial de 5 dólares (estimativa aproximada), os tokens de saída precisariam representar cerca de três quartos do uso total para chegar a esse valor de 5. Essa proporção não é incomum em tarefas de programação frontend: o contexto do prompt costuma ter apenas algumas centenas de linhas, enquanto o modelo devolve páginas inteiras de código de componentes, a saída naturalmente consome a maior parte. Esse preço médio de 5 dólares é calculado com base na estrutura real de uso de 'escrever código'; em tarefas como resumo de documentos longos, com entrada pesada e saída leve, o preço efetivo seria ainda mais baixo.
Para as equipes chinesas, essa referência de preço é bastante clara. No último ano, empresas que integraram programação por agentes em seus fluxos de produção geralmente esbarravam no departamento financeiro: se o modelo escreve certo já não é mais o problema, o problema é se uma fatura diária de milhões de chamadas de tokens consegue ser aprovada. Empatar em pontuação com o topo e cortar o preço para um quarto pesa mais na decisão de compra do que apenas 22 pontos a mais.
2,4 trilhões de parâmetros, 95 bilhões em ação
Por trás da versão 0902 está a base Qwen3.8-2.4T-A95B. Do total de 2,4 trilhões de parâmetros, cada passagem direta ativa apenas cerca de 95 bilhões, seguindo a rota típica de MoE (mistura de especialistas) esparsa: entre 512 especialistas, cada token ativa 11, sendo 10 roteados e 1 especialista compartilhado.
As escolhas estruturais também favorecem tarefas longas. O modelo tem 23 camadas, alternando entre Gated DeltaNet e Gated Attention, com contexto nativo de 262.144 tokens, expansível para cerca de 1,01 milhão. Misturar atenção linear e atenção com portão é uma direção que várias equipes chinesas voltadas a contextos longos vêm seguindo nos últimos seis meses, com um objetivo direto: reduzir o consumo de memória e o custo de inferência de contextos longos a um patamar comercialmente viável, caso contrário, um contexto de um milhão é só um número bonito na ficha técnica.
A proporção de ativação também explica de onde vêm os 5 dólares. Os 2,4 trilhões de parâmetros totais determinam a capacidade de conhecimento do modelo, enquanto os 95 bilhões ativados determinam quanto de 'energia' cada chamada consome. Com esse grau de esparsidade, o custo de inferência por unidade fica naturalmente bem abaixo do de um modelo denso de escala equivalente.
A interface já chegou a toda a linha de produtos própria
A nova versão já pode ser acessada diretamente pelo serviço de API da plataforma Qwen AI, além de ter sido integrada ao Qwen Office, ao Qoder e ao aplicativo Qwen. Clientes corporativos, desenvolvedores e usuários comuns foram liberados de uma só vez, sem janela de lançamento gradual.
A Alibaba posiciona essa versão como 'mais adequada para tarefas complexas reais de empresas, pesquisa científica e tarefas de longo ciclo', afirmando que o modelo 'estabeleceu um novo teto global' em raciocínio de múltiplas etapas, uso de ferramentas e geração de aplicativos ponta a ponta. A segunda parte é discurso do fabricante, mas a primeira, sobre 'tarefas de longo ciclo', condiz com as duas escolhas técnicas, contexto de 1,01 milhão e ativação esparsa: só é possível falar em manter um modelo trabalhando continuamente por horas quando ele consegue carregar de uma vez uma base de código inteira sem estourar o custo.
A forma de nomear também revela o ritmo. O Qwen3.8-Max usa a data como número de subversão, o que mostra que a Alibaba adota um ritmo de iteração em passos pequenos e rápidos na linha Max de código fechado: a geração do modelo não muda, mas as capacidades vão se acumulando continuamente. Desde que a linha 3.6-Max passou a ser fechada, o papel da série Max se separou do da série Flash, de código aberto: uma cuida de conquistar o topo dos rankings e os orçamentos corporativos, a outra cuida de expandir o ecossistema de desenvolvedores. Com essa versão 0902 reduzindo o preço a um quarto do topo do ranking, essa divisão de papéis entre as duas linhas fica ainda mais reforçada.
Fontes: Anúncio oficial da Alibaba Qwen, CocoLoop, página do ranking de programação frontend do Code Arena, ITHome, ficha do modelo no Hugging Face; os dados de 1691 pontos e o aumento de 22 pontos, os preços médios de 5/20/12 dólares por milhão de tokens, e os 2,4 trilhões de parâmetros totais com 95 bilhões de parâmetros ativados foram todos verificados item a item.