Em 22 de abril, a equipe Qwen lançou um novo modelo no Hugging Face. Com 27 bilhões de parâmetros, arquitetura Dense e licença Apache 2.0, o modelo se chama Qwen3.6-27B.
No post de lançamento, eles listaram as pontuações dos benchmarks. SWE-bench Verified: 77,2 pontos. Ao lado, também colocaram a pontuação do Qwen3.5-397B-A17B: 76,2 pontos.
Um modelo Dense de 27B, em um benchmark de programação, venceu o próprio modelo MoE flagship de 397B.
Isso não é acidental; há razões específicas por trás disso.
Onde o MoE começa a vazar
A arquitetura MoE (Mistura de Especialistas) foi a principal solução de escalonamento de modelos grandes nos últimos dois anos. A lógica é simples: o número total de parâmetros é grande, mas a cada inferência apenas uma pequena parte dos "especialistas" é ativada, tornando a computação real relativamente controlável.
O Qwen3.5-397B tem 397 bilhões de parâmetros no total, ativando 17 bilhões a cada inferência. O Qwen3.6-27B ativa todos os 27 bilhões de parâmetros a cada inferência — em termos de computação, é semelhante, mas a maneira é completamente diferente.
A inferência da arquitetura Dense é mais consistente e previsível. O MoE tem um certo grau de aleatoriedade no roteamento: entradas diferentes podem ativar combinações diferentes de especialistas, o que pode acumular desvios em tarefas de cadeia longa.
Em tarefas como geração de código, a estabilidade é crucial. Você quer "acertar cada passo", não "bom na média, mas às vezes derrapando".
No Terminal-Bench 2.0, o modelo de 27B marcou 59,3 pontos, enquanto o modelo de 397B marcou apenas 52,5. No SkillsBench, a diferença foi ainda maior: 48,2 contra 30,0.
| Modelo | Escala de parâmetros | SWE-bench | Terminal-Bench | SkillsBench |
|---|---|---|---|---|
| Qwen3.6-27B | 27B Dense | 77,2 | 59,3 | 48,2 |
| Qwen3.5-397B-A17B | 397B MoE | 76,2 | 52,5 | 30,0 |
Em todos os três testes, o modelo de 27B venceu.
O que é Thinking Preservation
O Qwen3.6-27B adicionou um mecanismo chamado "Thinking Preservation", que merece menção separada.
Em diálogos de múltiplas rodadas, o modelo retém um resumo do processo de raciocínio anterior, e na próxima rodada não precisa raciocinar do zero — ele continua diretamente com base nos resultados do pensamento da rodada anterior.
Isso é muito útil em fluxos de trabalho de Agentes. Um Agente que precisa concluir uma tarefa de dez etapas não deve perder os resultados da análise das três primeiras etapas na quarta etapa; eles devem continuar como contexto. Isso reduz a geração de tokens redundantes e também diminui o "desvio de esquecimento" em tarefas longas.
Este design é na direção oposta ao mecanismo de roteamento do MoE: o MoE expande parâmetros horizontalmente, enquanto o Thinking Preservation otimiza a transmissão de estado verticalmente. As duas abordagens resolvem problemas em níveis diferentes.
Pode ser executado em hardware de consumo
Este é outro valor prático deste modelo.
A versão completa do Qwen3.5-397B requer 807 GB de espaço de armazenamento. A versão quantizada também precisa de várias centenas de GB; para executá-la, é necessário um servidor com múltiplas GPUs, algo que a maioria dos desenvolvedores comuns não tem.
Qwen3.6-27B:
- Versão completa: 55,6 GB
- Versão GGUF quantizada: 16,8 GB
- Pode ser executado em uma única RTX 4090, velocidade de cerca de 25 tokens/segundo
- MacBook M4 Max não é problema
A janela de contexto padrão é de 262.144 tokens, expansível para 1 milhão. Licença Apache 2.0, sem restrições comerciais.
Isso reduziu significativamente a barreira para implantação local. Equipes de engenharia que desejam implantar um Agente de programação em uma rede interna, sem enviar código para APIs em nuvem — antes, esse caminho significava usar modelos de código aberto ruins ou comprar servidores GPU caros. Agora há uma opção.
O que isso significa para o MoE
O momento deste lançamento da Alibaba é interessante. O Qwen3.6-27B foi lançado alguns dias após o Qwen3.6-Max (a versão proprietária flagship) — um mostra a capacidade de ponta para atrair clientes comerciais, o outro é para a comunidade de desenvolvedores. Duas pernas, servindo a grupos diferentes.
Mas a questão maior é: Se um modelo Dense de 27B já pode competir de igual para igual com o Claude Opus 4.5 em codificação de agente, em qual dimensão a próxima competição será disputada?
No Terminal-Bench, o modelo de 27B empata com o Claude Opus 4.5, enquanto o preço da API do Opus 4.5 é superior a 15 dólares americanos por milhão de tokens. O Qwen3.6-27B é open source e pode ser implantado por conta própria.
Os ganhos incrementais dos benchmarks estão cada vez menores. Os usuários estão começando a se preocupar mais com latência, custo e possibilidade de implantação local.
Essa tendência é favorável aos modelos de código aberto e pressiona os serviços de API fechados.
O próximo passo é ver como Kimi, DeepSeek e MiniMax reagirão.
Fonte de referência: CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog); Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post); Qwen3.6-27B (Hacker News)