O Qwen3.8-Max saiu da promessa e chegou a um repositório real. Em 12 de agosto, a página Qwen/Qwen3.8-2.4T-A95B no ModelScope informava que o repositório contém pesos pós-treinados e arquivos de configuração no formato Hugging Face Transformers.
O cartão do modelo cita compatibilidade com vLLM, SGLang e TokenSpeed. Os metadados do ModelScope apontam cerca de 4,89TB de armazenamento. O Qwen3.8-Max já estava no Qoder e no Token Plan; a novidade é a disponibilidade de um artefato open-weight de classe Max.
Os pesos viram ponto de auditoria
“This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.”
As especificações incluem 2,4T parâmetros totais, 95B parâmetros ativos, contexto nativo de 262.144 tokens e extensão até 1.010.000 tokens. A arquitetura usa 92 camadas, 512 especialistas, 10 routed experts mais um shared expert e vocabulário de 248.320 tokens.
A versão do ModelScope é diferente do serviço gerenciado Qwen3.8-Max. Ela é apenas texto e exige thinking mode; o Qwen Cloud adiciona entrada visual, modo sem thinking, contexto padrão de 1M e ferramentas oficiais embutidas.
Controle pesa mais que desconto
Para equipes de engenharia, desconto de API e pesos abertos não são equivalentes. O desconto pode acabar; os pesos permitem testar engines de inferência, quantização, bases de código privadas, documentos longos e isolamento de permissões no próprio ambiente.
O tamanho de 4,89TB também coloca limite na empolgação. Este não é um modelo casual de laptop. Muitos usuários chegarão a ele por inferência hospedada, builds quantizados ou clusters corporativos. O valor está em abrir espaço para reprodução externa e otimização.
A tabela oficial mostra 86,6 no Terminal Bench 2.1, 67,7 no SWE-bench Pro, 93,0 no PaperBench e 86,1 no OSWorld-Verified. Mas harnesses, limites de tempo, janelas de contexto e fontes de baseline variam. Os próximos pontos são licença, downloads estáveis, receitas de vLLM e SGLang, benchmarks independentes e desempenho após quantização.
Fontes: cartão do modelo ModelScope Qwen3.8-2.4T-A95B, blog oficial Qwen3.8-Max, documentação do Qwen Cloud, DataCamp, CocoLoop; verificados status open-weight, tamanho do repositório, parâmetros totais e ativos, contexto, compatibilidade de frameworks, limites de thinking mode, benchmarks e diferenças da API gerenciada.