Primeiro, este número: SWE-bench Pro 53,5 vs 50,9.
O primeiro é do Qwen3.6-27B, um modelo de 27B parâmetros, lançado como código aberto em 22 de abril sob licença Apache 2.0. O segundo é do Qwen3.5-397B, um modelo de 397B parâmetros com arquitetura de mistura de especialistas (MoE), anteriormente o modelo principal da Alibaba.
Um modelo pequeno de 27 bilhões de parâmetros derrotar um modelo grande de quase 40 bilhões de parâmetros ativados em um teste de engenharia de software não é pouca coisa.
Thinking Preservation: Este é o ponto crucial
Sinceramente, a história de "menos parâmetros, mais potência" já foi vista várias vezes neste setor. O desempenho do Qwen3.6-27B não vem da arquitetura central, mas de um novo recurso: Thinking Preservation (Preservação de Raciocínio).
Há um problema negligenciado em LLMs de código aberto: quando um Agent executa tarefas de múltiplas etapas, o processo de raciocínio de cada etapa é descartado. O modelo precisa inferir do zero a cada vez, em vez de reutilizar cadeias cognitivas já estabelecidas.
A abordagem do Qwen3.6-27B é manter os "vestígios de raciocínio" de mensagens históricas como contexto persistente:
"retém e aproveita vestígios de raciocínio de mensagens históricas em toda a conversa, em vez de descartar o raciocínio anterior, melhorando a eficiência em fluxos de trabalho de agente de múltiplas etapas"
Em termos simples: o modelo se lembra de como pensou antes, em vez de zerar a cada vez.
Em tarefas de codificação agentivas, essa diferença é evidente. Ao processar o mesmo repositório de código, a diferença de desempenho entre um modelo que se lembra das conclusões de raciocínio da rodada anterior e um que não se lembra é grande. O SWE-bench Pro, por ser um teste executado em repositórios de código reais, amplifica essa vantagem.
Panorama completo de pontuações
Não apenas no SWE-bench, o Qwen3.6-27B tem desempenho abrangente:
| Teste | Qwen3.6-27B | Comparação |
|---|---|---|
| SWE-bench Pro | 53,5 | vs Qwen3.5-397B MoE: 50,9 |
| Terminal-Bench 2.0 | 59,3 | Empatado com Claude Opus versão principal |
| AIME26 (Matemática) | 94,1 | vs Qwen3.5-27B: 92,6 |
| QwenWebBench | 1487 | vs Qwen3.5-27B: 1068 (+39%) |
| SkillsBench Média | 48,2 | 77% de melhoria em relação ao modelo da geração anterior de mesmo tamanho |
| GPQA Diamond | 87,8 | vs Qwen3.5-27B: 85,5 |
A melhoria de 77% no SkillsBench merece destaque. Este teste mede capacidades gerais entre domínios. A transição do Qwen3.5-27B para o Qwen3.6-27B não é um pequeno ajuste, mas uma reestruturação em nível de sistema.
Janela de contexto
Suporte nativo a 262.144 tokens (cerca de 200 mil caracteres chineses), expansível para 1.010.000 tokens usando YaRN.
Para cenários que exigem processamento de repositórios de código longos ou documentos extensos, esta janela de contexto é suficiente.
O que o código aberto significa
Licença Apache 2.0, sem restrições de uso comercial.
Para empresas, isso é mais prático do que números de desempenho: um modelo de 27B parâmetros tem custo de implantação local muito menor do que um de 397B, mas alcança pontuações mais altas em tarefas principais – essa combinação é muito atraente para empresas que desejam construir capacidade de IA própria. Pense: uma GPU de consumo já pode executar 27B, enquanto 397B exige pelo menos várias GPUs de alto desempenho.
É por isso que o número de 77% no SkillsBench é tão importante: não é apenas mais forte em código, mas as capacidades gerais melhoraram de forma abrangente – essa é a verdadeira premissa para substituir modelos grandes.
O cenário desta semana
Esta semana, coincidentemente, a OpenAI lançou o GPT-5.5 e a Alibaba lançou o Qwen3.6-27B.
Vendo os dois juntos: o modelo fechado principal busca "mais rápido e com menos tokens", enquanto o modelo aberto pequeno busca "usar menos parâmetros para obter melhores resultados". As direções são diferentes, mas ambos estão comprimindo o espaço um do outro.
O próximo a ser perturbado pode não ser uma empresa específica, mas a suposição de que "é preciso um modelo grande para executar bem o código".
Fonte de referência: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)