A comunidade ModelScope publicou uma página de anúncio do Qwen3.8-Flash-Next, com contagem regressiva apontando para as 23h do dia 26 de agosto (UTC+8); as versões padrão e FP8 serão liberadas para download ao mesmo tempo. O repositório de mesmo nome no Hugging Face traz apenas uma frase de descrição: A Preview of the Qwen4 Architecture.
A configuração de parâmetros vazada na página de anúncio é: 125 bilhões de parâmetros principais, mais 51 bilhões de embeddings N-gram, com 6 bilhões ativados por token. O modelo é posicionado como um MoE multimodal; segundo a empresa, ele é construído sobre a arquitetura de próxima geração Qwen4, disponibilizando o avanço da arquitetura em código aberto antecipadamente para preparar a comunidade para a série Qwen4.
Taxa de ativação comprimida para menos de 5%
Dos 125 bilhões, apenas 6 bilhões são ativados — a taxa de ativação, em cálculo aproximado, fica abaixo de 5%. Para efeito de comparação, os modelos MoE esparsos mais comuns do setor nos últimos dois anos costumam ficar entre 5% e 10%; o Flash-Next empurra a esparsidade um degrau abaixo disso.
Trata-se de uma configuração claramente voltada para o custo de inferência. O consumo de VRAM de um MoE depende do total de parâmetros, enquanto o volume de computação depende dos parâmetros ativados — os 125 bilhões de pesos precisam caber na VRAM, mas cada passagem direta percorre apenas o caminho de 6 bilhões. Do lado da implantação, isso significa: o limite de capacidade de GPU não cai, mas o limite de poder computacional e latência cai bastante. Com a versão FP8, o consumo de peso ainda pode ser cortado pela metade. O "Flash" no nome provavelmente se refere justamente a isso.
Algo pouco comum na tabela de parâmetros é o bloco de 51 bilhões de embeddings N-gram, listado separadamente dos parâmetros principais. Estruturas do tipo embedding costumam funcionar principalmente por busca em tabela, sem participar do cálculo matricial camada a camada — se o Flash-Next seguir esse caminho, os 51 bilhões seriam mais um investimento que troca VRAM por desempenho do que um custo computacional adicional. A implementação exata só poderá ser confirmada quando o model card e os arquivos de configuração forem divulgados hoje à noite.
Por que "3.8" carrega a arquitetura do Qwen4
O nome parece estranho, mas a lógica é consistente. Não é a primeira vez que a Qwen coloca uma prévia "Next" no fim da série 3.x — a fórmula é sempre a mesma: pegar o método de roteamento, a variante de atenção e a pilha de treinamento da próxima geração, testá-los em um modelo de porte médio e abrir o código, deixando a comunidade adaptar as ferramentas antes do lançamento oficial da versão maior.
O benefício é bem prático. O fato de um modelo de código aberto ser ou não absorvido diretamente por frameworks como vLLM, SGLang e llama.cpp no dia do lançamento influencia bastante a curva de adoção nas primeiras duas semanas. Quando a arquitetura traz novos operadores ou novos métodos de roteamento, a adaptação costuma se arrastar por semanas. A Unsloth já anunciou que está trabalhando em suporte "day-zero", seguindo exatamente esse caminho — transferindo o custo de tempo da adaptação da arquitetura do dia de lançamento do Qwen4 para hoje.
Aquele repositório no Hugging Face já tinha 1.299 pessoas clicando para receber notificação antes mesmo da abertura, um número nada baixo para um repositório vazio que ainda nem tem model card.
O que observar depois de hoje à noite
As informações da página de anúncio param na contagem de parâmetros; vários indicadores-chave ainda não foram revelados: comprimento de contexto, quais modalidades o multimodal cobre, se a licença continuará sendo a Apache 2.0 e, o mais importante, os resultados de benchmark.
Nos últimos doze meses, a estratégia da Alibaba em código aberto tem sido tratar os pesos como porta de entrada para o ecossistema, incluindo a liberação dos pesos dos modelos de nível Max. Com o Flash-Next, a linha do tempo avança ainda mais: a arquitetura é divulgada antes mesmo de o modelo amadurecer. Para equipes locais que fazem implantação de inferência e fine-tuning, as primeiras 48 horas após as 23h de hoje devem ser bem movimentadas.
Fontes: página do modelo no ModelScope, repositório no Hugging Face, CocoLoop, Decrypt, discussão da comunidade no Hacker News; a configuração de parâmetros e o horário de abertura seguem as informações exibidas na página do modelo, e a taxa de ativação é um cálculo aproximado com base nos parâmetros públicos.