Le modèle 27B d'Alibaba atteint des résultats comparables à son propre modèle 397B

Le 22 avril, l'équipe Qwen a publié un nouveau modèle sur Hugging Face. Avec 27 milliards de paramètres, une architecture Dense et une licence Apache 2.0, le modèle s'appelle Qwen3.6-27B.

Dans l'article de lancement, ils ont listé les scores des benchmarks. SWE-bench Verified : 77,2 points. À côté, ils ont également placé le score de Qwen3.5-397B-A17B : 76,2 points.

Un modèle Dense de 27B, sur un benchmark de programmation, a battu le propre modèle MoE phare de 397B.

Ce n'est pas un hasard ; il y a des raisons spécifiques derrière cela.

Où le MoE commence à fuir

L'architecture MoE (Mixture of Experts) a été la principale solution de passage à l'échelle des grands modèles ces deux dernières années. La logique est simple : le nombre total de paramètres est grand, mais à chaque inférence, seule une petite partie des « experts » est activée, ce qui rend le calcul réel relativement contrôlable.

Qwen3.5-397B a 397 milliards de paramètres au total, activant 17 milliards à chaque inférence. Qwen3.6-27B active la totalité des 27 milliards de paramètres à chaque inférence — en termes de calcul, c'est similaire, mais la manière est complètement différente.

L'inférence de l'architecture Dense est plus cohérente et prévisible. Le MoE a un certain degré d'aléatoire dans le routage : différentes entrées peuvent activer différentes combinaisons d'experts, ce qui peut accumuler des écarts dans les tâches à longue chaîne.

Dans des tâches comme la génération de code, la stabilité est cruciale. Vous voulez « avoir raison à chaque étape », pas « bon en moyenne mais parfois dériver ».

Sur Terminal-Bench 2.0, le modèle 27B a obtenu 59,3 points, tandis que le modèle 397B n'a obtenu que 52,5. Sur SkillsBench, l'écart était encore plus grand : 48,2 contre 30,0.

Modèle Taille des paramètres SWE-bench Terminal-Bench SkillsBench
Qwen3.6-27B 27B Dense 77,2 59,3 48,2
Qwen3.5-397B-A17B 397B MoE 76,2 52,5 30,0

Dans les trois tests, le modèle 27B a gagné.

Qu'est-ce que Thinking Preservation

Qwen3.6-27B a ajouté un mécanisme appelé « Thinking Preservation », qui mérite d'être mentionné séparément.

Dans les dialogues à plusieurs tours, le modèle conserve un résumé du processus de raisonnement précédent, et au tour suivant, il n'a pas besoin de raisonner à partir de zéro — il continue directement sur les résultats de la réflexion du tour précédent.

C'est très utile dans les workflows d'Agent. Un Agent qui doit accomplir une tâche en dix étapes ne devrait pas perdre les résultats de l'analyse des trois premières étapes à la quatrième étape ; ils devraient continuer comme contexte. Cela réduit la génération de tokens redondants et diminue également la « dérive d'oubli » dans les tâches longues.

Cette conception est dans la direction opposée au mécanisme de routage du MoE : le MoE étend les paramètres horizontalement, tandis que Thinking Preservation optimise la transmission d'état verticalement. Les deux approches résolvent des problèmes à différents niveaux.

Peut fonctionner sur du matériel grand public

C'est une autre valeur pratique de ce modèle.

La version complète de Qwen3.5-397B nécessite 807 Go d'espace de stockage. La version quantifiée nécessite également plusieurs centaines de Go ; pour l'exécuter, il faut un serveur multi-GPU, ce que la plupart des développeurs ordinaires n'ont pas.

Qwen3.6-27B :

  • Version complète : 55,6 Go
  • Version GGUF quantifiée : 16,8 Go
  • Peut fonctionner sur une seule RTX 4090, vitesse d'environ 25 tokens/seconde
  • MacBook M4 Max sans problème

La fenêtre de contexte par défaut est de 262 144 tokens, extensible à 1 million. Licence Apache 2.0, sans restriction commerciale.

Cela a considérablement abaissé la barrière pour le déploiement local. Les équipes d'ingénieurs qui souhaitent déployer un Agent de programmation sur un réseau interne, sans envoyer de code à des API cloud — auparavant, cette voie signifiait soit utiliser de mauvais modèles open source, soit acheter des serveurs GPU coûteux. Maintenant, il y a une option.

Ce que cela signifie pour le MoE

Le moment de cette publication par Alibaba est intéressant. Qwen3.6-27B est sorti quelques jours après Qwen3.6-Max (la version propriétaire phare) — l'un montre la capacité de pointe pour attirer les clients commerciaux, l'autre est destiné à la communauté des développeurs. Deux jambes, servant des groupes différents.

Mais la question plus large est : Si un modèle Dense de 27B peut déjà rivaliser avec Claude Opus 4.5 en codage agentique, dans quelle dimension la prochaine compétition aura-t-elle lieu ?

Sur Terminal-Bench, le modèle 27B est à égalité avec Claude Opus 4.5, tandis que le prix de l'API d'Opus 4.5 dépasse 15 dollars américains par million de tokens. Qwen3.6-27B est open source et peut être déployé par soi-même.

Les gains marginaux des benchmarks deviennent de plus en plus faibles. Les utilisateurs commencent à se soucier davantage de la latence, du coût et de la possibilité de déploiement local.

Cette tendance est favorable aux modèles open source et exerce une pression sur les services API fermés.

La prochaine étape est de voir comment Kimi, DeepSeek et MiniMax réagiront.

Source de référence : CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog) ; Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post) ; Qwen3.6-27B (Hacker News)