Alibaba publie Qwen3.6-35B en open source, atteignant 73,4 % au SWE-bench

Le 16 avril, l'équipe Qwen d'Alibaba a publié Qwen3.6-35B-A3B en open source sous licence Apache 2.0, sans aucune restriction commerciale.

Ce modèle est intéressant : il totalise 35B paramètres, mais n'en active que 3B lors de l'inférence. Il utilise une architecture de Mixture of Experts (MoE) avec un ratio de parcimonie de calcul de 12:1 – avec des performances proches d'un grand modèle de 35B, mais un coût de fonctionnement de 3B.

Au SWE-bench Verified (test de correction de problèmes GitHub réels), il a atteint 73,4 %, tandis que le Gemma 4-31B, publié en open source par Google à la même période, n'a obtenu que 52,0 %, soit un écart de 21 points de pourcentage.

Pourquoi l'architecture est importante

Commençons par la logique de conception du MoE.

Dans un modèle dense classique, lors du traitement d'un token, tous les paramètres participent au calcul. Un modèle de 35B paramètres nécessite 35B de calcul pour chaque token.

Le MoE est différent. Il divise les paramètres en plusieurs « experts » (experts), n'en activant qu'une partie à chaque fois. Le mécanisme de routage de Qwen3.6-35B-A3B n'appelle que le groupe d'experts correspondant à 3B paramètres pour traiter chaque token, mais l'ensemble du modèle accumule la capacité de connaissance représentée par 35B paramètres.

Le résultat : vitesse d'inférence et utilisation mémoire à l'échelle de 3B, capacité de résolution de problèmes à l'échelle de 35B.

Sur une RTX 4090, la vitesse dépasse les 120 tokens/seconde. Un MacBook Pro M4/M5 avec 64 Go de RAM peut l'exécuter directement. Après quantification Q4_K_M, il occupe environ 21 Go, ce qui tient dans une carte graphique grand public standard.

Cela signifie beaucoup pour le déploiement local – auparavant, pour exécuter un modèle de codage de pointe en open source, il fallait au moins une A100 ou plusieurs RTX 4090 ; désormais, une seule carte graphique grand public suffit.

Comparaison chiffrée avec d'autres modèles

vs. Google Gemma 4-31B :

Test Qwen3.6-35B Gemma 4-31B
SWE-bench Verified 73,4 % 52,0 %
Terminal-Bench 2.0 51,5 % 42,9 %
MCPMark (appel d'outils) 37,0 % 18,1 %
GPQA (raisonnement général) 86,0 % 84,3 %
AIME26 (concours de maths) 92,7 % 89,2 %

Dans l'appel d'outils (MCPMark), Qwen3.6 est plus de deux fois supérieur à Gemma 4. Ce scénario de test correspond directement aux performances dans les tâches réelles d'Agent, étant encore plus proche de l'utilisation réelle que SWE-bench.

QwenWebBench (tâches web) a obtenu 1397 ELO, soit une amélioration de 43 % par rapport à la génération précédente.

vs. Claude Sonnet 4.5 :

Selon l'évaluation de The Decoder, sur les benchmarks de codage pur, les deux modèles sont quasiment à égalité, la différence se situant dans la marge d'erreur. Dans les dialogues de type assistant et les conversations générales, Claude reste en tête.

Détails de l'open source et disponibilité

Les poids du modèle sont disponibles sur Hugging Face (Qwen/Qwen3.6-35B-A3B) et ModelScope, et sont compatibles avec Transformers, vLLM (>=0.19.0), SGLang (>=0.5.10) et KTransformers.

Il prend en charge deux modes :

  • Mode Thinking : similaire à un modèle de raisonnement, réflexion profonde en plusieurs étapes, conservation du processus de raisonnement pour les dialogues suivants
  • Mode Fast : sortie directe, adapté aux dialogues et aux tâches légères

La fenêtre de contexte native est de 262 144 tokens, pouvant être étendue à plus d'un million avec l'extension YaRN.

L'API peut également être appelée via Alibaba Cloud Model Studio (nom « Qwen3.6 Flash ») ou par déploiement propre.

Analyse

Il s'agit de la troisième étape d'Alibaba dans la direction de l'open source. D'abord, la publication de Qwen3 de base en open source (licence Apache), puis la publication de la version fermée entreprise Qwen3.6-Plus, et ensuite la publication de Qwen3.6-35B-A3B en open source, une version spécialisée en codage haute performance.

Chaque étape est très claire : d'abord construire la communauté et la base de développeurs, puis monétiser avec la version fermée, puis utiliser la version open source pour approfondir l'écosystème.

Le score de 73,4 % au SWE-bench de Qwen3.6-35B-A3B, à quel niveau se situe-t-il parmi tous les modèles open source ? Actuellement, parmi les modèles open source, seuls DeepSeek V4 et celui-ci sont notables, et parmi les modèles fermés, Claude Sonnet 4.5 se situe également dans cette fourchette. Un modèle MoE pouvant être exécuté localement atteindre ce score a vraiment changé quelque chose.

Bien sûr, un score élevé au SWE-bench ne signifie pas qu'il sera performant en production. Les performances réelles des Agents de codage dépendent également de la gestion du contexte, de la récupération d'erreurs et de la stabilité des longs processus – tout cela n'est pas dans le benchmark. Mais le point de départ est fixé, cela vaut la peine de le tester sérieusement.

Source de référence : CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks (The Decoder) ; Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally (Build Fast with AI) ; Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model (DEV Community)