Alibaba lança Qwen3.6-35B como código aberto, atingindo 73,4% no SWE-bench

Em 16 de abril, a equipe Qwen da Alibaba lançou o Qwen3.6-35B-A3B como código aberto sob a licença Apache 2.0, sem quaisquer restrições comerciais.

Este modelo é interessante: tem 35B parâmetros no total, mas ativa apenas 3B durante a inferência. Utiliza a arquitetura de Mistura de Especialistas (MoE) com uma taxa de esparsidade computacional de 12:1 – com desempenho próximo a um modelo grande de 35B, mas com custo operacional de 3B.

No SWE-bench Verified (teste de correção de issues reais do GitHub), alcançou 73,4%, enquanto o Gemma 4-31B, lançado como código aberto pelo Google no mesmo período, obteve apenas 52,0%, uma diferença de 21 pontos percentuais.

Por que a arquitetura é importante

Primeiro, vamos falar sobre a lógica de design do MoE.

Em um modelo denso comum, ao processar um token, todos os parâmetros são envolvidos no cálculo. Um modelo de 35B parâmetros requer 35B de computação para cada token.

O MoE é diferente. Ele divide os parâmetros em vários "especialistas" (experts), ativando apenas uma parte de cada vez. O mecanismo de roteamento do Qwen3.6-35B-A3B chama apenas o grupo de especialistas correspondente a 3B parâmetros para processar cada token, mas o modelo inteiro acumula a capacidade de conhecimento representada por 35B parâmetros.

O resultado: velocidade de inferência e uso de memória na escala de 3B, capacidade de resolução de problemas na escala de 35B.

Em uma RTX 4090, a velocidade ultrapassa 120 tokens/segundo. Um MacBook Pro M4/M5 com 64 GB de RAM pode executá-lo diretamente. Após quantização Q4_K_M, ocupa cerca de 21 GB, cabendo em uma placa de vídeo consumidor comum.

Isso significa muito para a implantação local – antes, para executar um modelo de programação de ponta em código aberto, era necessário pelo menos uma A100 ou várias RTX 4090; agora, uma única placa de vídeo consumidor é suficiente.

Comparação numérica com outros modelos

vs. Google Gemma 4-31B:

Teste Qwen3.6-35B Gemma 4-31B
SWE-bench Verified 73,4% 52,0%
Terminal-Bench 2.0 51,5% 42,9%
MCPMark (chamada de ferramentas) 37,0% 18,1%
GPQA (raciocínio geral) 86,0% 84,3%
AIME26 (competição de matemática) 92,7% 89,2%

Na chamada de ferramentas (MCPMark), o Qwen3.6 é mais que o dobro do Gemma 4. Este cenário de teste corresponde diretamente ao desempenho em tarefas reais de Agente, sendo ainda mais próximo do uso real do que o SWE-bench.

O QwenWebBench (tarefas web) obteve 1397 ELO, uma melhoria de 43% em relação à geração anterior.

vs. Claude Sonnet 4.5:

De acordo com a avaliação do The Decoder, em benchmarks puros de programação, os dois modelos estão praticamente empatados, com a diferença dentro da margem de erro. Em diálogos no estilo assistente e conversas gerais, o Claude ainda lidera.

Detalhes do código aberto e disponibilidade

Os pesos do modelo estão disponíveis no Hugging Face (Qwen/Qwen3.6-35B-A3B) e no ModelScope, sendo compatíveis com Transformers, vLLM (>=0.19.0), SGLang (>=0.5.10) e KTransformers.

Suporta dois modos:

  • Modo Thinking: semelhante a um modelo de raciocínio, pensamento profundo em várias etapas, mantendo o processo de raciocínio para diálogos subsequentes
  • Modo Fast: saída direta, adequado para diálogos e tarefas leves

A janela de contexto nativa é de 262.144 tokens, podendo ser estendida para mais de 1 milhão com a extensão YaRN.

A API também pode ser acessada através do Alibaba Cloud Model Studio (nome "Qwen3.6 Flash") ou por implantação própria.

Análise

Este é o terceiro passo da Alibaba na direção do código aberto. Primeiro, o lançamento do Qwen3 básico como código aberto (licença Apache), depois o lançamento da versão empresarial fechada Qwen3.6-Plus, e então o lançamento do Qwen3.6-35B-A3B como código aberto, uma versão especializada em programação de alto desempenho.

Cada passo é muito claro: primeiro construir a comunidade e a base de desenvolvedores, depois monetizar com a versão fechada, e então usar a versão de código aberto para aprofundar o ecossistema.

O resultado de 73,4% no SWE-bench do Qwen3.6-35B-A3B está em que nível entre todos os modelos de código aberto? Atualmente, entre os modelos de código aberto, apenas o DeepSeek V4 e este são dignos de nota, e entre os modelos fechados, o Claude Sonnet 4.5 também está nessa faixa. Um modelo MoE que pode ser executado localmente alcançar essa pontuação realmente mudou alguma coisa.

Claro, uma pontuação alta no SWE-bench não significa que será bom em produção. O desempenho real de Agentes de programação também depende do gerenciamento de contexto, recuperação de erros e estabilidade em fluxos longos – tudo isso não está no benchmark. Mas o ponto de partida foi estabelecido, vale a pena testá-lo seriamente.

Fonte de referência: CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks (The Decoder); Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally (Build Fast with AI); Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model (DEV Community)