Qwen3.6-27B open source bat un MoE de 397B en tests de codage

D'abord, ce chiffre : SWE-bench Pro 53,5 contre 50,9.

Le premier provient de Qwen3.6-27B, un modèle de 27B paramètres, publié en open source le 22 avril sous licence Apache 2.0. Le second est celui de Qwen3.5-397B, un modèle de 397B paramètres avec architecture de mixture d'experts (MoE), auparavant le modèle phare d'Alibaba.

Un petit modèle de 27 milliards de paramètres qui bat un grand modèle de près de 40 milliards de paramètres activés dans un test de génie logiciel, ce n'est pas anodin.

Thinking Preservation : C'est le point crucial

Honnêtement, l'histoire « moins de paramètres, plus de puissance » a déjà été vue plusieurs fois dans ce secteur. La performance de Qwen3.6-27B ne vient pas de l'architecture centrale, mais d'une nouvelle fonctionnalité : Thinking Preservation (Conservation du raisonnement).

Il y a un problème négligé dans les LLM open source : lorsqu'un Agent exécute des tâches multi-tours, le processus de raisonnement de chaque tour est jeté. Le modèle doit inférer à partir de zéro à chaque fois, au lieu de réutiliser des chaînes cognitives déjà établies.

L'approche de Qwen3.6-27B consiste à conserver les « traces de raisonnement » des messages historiques comme contexte persistant :

« conserve et exploite les traces de raisonnement des messages historiques sur l'ensemble de la conversation plutôt que de jeter le raisonnement antérieur, améliorant ainsi l'efficacité dans les flux de travail d'agent multi-tours »

En termes simples : le modèle se souvient comment il a pensé auparavant, au lieu de repartir de zéro à chaque fois.

Dans les tâches de codage agentiques, cette différence est flagrante. En traitant le même dépôt de code, l'écart de performance entre un modèle qui se souvient des conclusions de raisonnement du tour précédent et un modèle qui ne s'en souvient pas est important. SWE-bench Pro, étant un test exécuté sur des dépôts de code réels, amplifie cet avantage.

Panorama complet des scores

Pas seulement SWE-bench, Qwen3.6-27B est performant sur tous les plans :

Test Qwen3.6-27B Comparaison
SWE-bench Pro 53,5 vs Qwen3.5-397B MoE : 50,9
Terminal-Bench 2.0 59,3 À égalité avec Claude Opus version phare
AIME26 (Mathématiques) 94,1 vs Qwen3.5-27B : 92,6
QwenWebBench 1487 vs Qwen3.5-27B : 1068 (+39%)
SkillsBench Moyenne 48,2 Amélioration de 77% par rapport au modèle de la génération précédente de même taille
GPQA Diamond 87,8 vs Qwen3.5-27B : 85,5

L'amélioration de 77% sur SkillsBench mérite d'être soulignée. Ce test mesure les capacités générales inter-domaines. Le passage de Qwen3.5-27B à Qwen3.6-27B n'est pas une petite retouche, mais une restructuration au niveau système.

Fenêtre de contexte

Prise en charge native de 262 144 tokens (environ 200 000 caractères chinois), extensible à 1 010 000 tokens avec YaRN.

Pour les scénarios nécessitant le traitement de longs dépôts de code ou de documents volumineux, cette fenêtre de contexte est suffisante.

Ce que signifie l'open source

Licence Apache 2.0, sans restriction d'utilisation commerciale.

Pour les entreprises, c'est plus concret que les chiffres de performance : un modèle de 27B paramètres a un coût de déploiement local bien inférieur à celui d'un modèle de 397B, tout en obtenant des scores plus élevés sur les tâches principales – cette combinaison est très attractive pour les entreprises qui souhaitent développer leurs propres capacités d'IA. Pensez-y : un GPU grand public peut faire tourner un modèle 27B, alors que 397B nécessite au moins plusieurs GPU haut de gamme.

C'est pourquoi le chiffre de 77% sur SkillsBench est si important : le modèle n'est pas seulement plus fort en code, mais ses capacités générales se sont améliorées de manière globale – c'est la véritable condition préalable pour remplacer les grands modèles.

Le paysage de cette semaine

Cette semaine, par coïncidence, OpenAI a publié GPT-5.5 et Alibaba a publié Qwen3.6-27B.

En regardant les deux ensemble : le modèle fermé phare cherche à être « plus rapide et plus économe en tokens », tandis que le petit modèle open source cherche à « utiliser moins de paramètres pour obtenir de meilleurs résultats ». Les directions sont différentes, mais tous deux réduisent l'espace de l'autre.

La prochaine chose qui pourrait être bouleversée n'est pas nécessairement une entreprise en particulier, mais l'hypothèse selon laquelle « il faut un grand modèle pour bien coder ».

Source de référence : CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)