Le 2 avril, Alibaba a publié Qwen3.6-Plus.
Cette fois-ci, il ne s'agit pas d'une publication ordinaire du type « modèle plus grand », mais d'une mise à niveau ciblée spécifiquement pour les scénarios d'agents d'IA d'entreprise. Du point de vue du positionnement du produit, Alibaba a compris une chose cette fois-ci : il est impossible de gagner la course aux armements des capacités générales, alors autant se concentrer sur la « couche d'exécution qui peut réellement travailler dans un environnement de production ».
Les trois changements les plus importants
1. Capacité de codage : Compétence technique au niveau du dépôt
Les grands modèles précédents pour écrire du code fonctionnaient essentiellement comme « voici une fonction, utilise-la ». Le positionnement de Qwen3.6-Plus est différent : il peut travailler dans l'ensemble du dépôt de code : planifier, écrire du code, exécuter des tests, détecter des problèmes, corriger du code, un cycle d'exécution complet.
Ce mode de travail est assez similaire à Claude Code ; le modèle n'est pas un « fournisseur de suggestions » dans l'invite, mais un participant.
Il prend en charge par défaut une fenêtre de contexte de 1 million de tokens, ce qui permet d'intégrer sans problème le code complet d'un projet de taille moyenne.
2. Compréhension visuelle : Captures d'écran directement en code
Donnez-lui une capture d'écran d'interface utilisateur, un croquis dessiné à la main ou un prototype de produit, et il peut générer directement du code frontend exécutable. Il ne s'agit pas de générer une structure approximative, mais d'une boucle fermée « voir l'image et écrire le code ».
En plus des images statiques, il prend également en charge la compréhension du contenu de documents et de vidéos, ce qui est assez utile pour les scénarios de création d'outils internes d'entreprise.
3. Appel d'outils et planification à long terme
C'est là que se situent actuellement les plus grandes différences dans les capacités des agents d'IA entre les entreprises. Qwen3.6-Plus a obtenu les meilleurs résultats sur plusieurs benchmarks de planification à long terme, et la précision de l'appel d'outils a également été améliorée.
En termes de chiffres spécifiques, il a des performances compétitives sur des évaluations de programmation spécialisées comme SWE-Bench et Terminal-Bench, mais Alibaba n'a pas publié toutes les données complètes du benchmark.
Une nouvelle fonctionnalité API : preserve_thinking
Ce paramètre maintient le contexte de raisonnement dans les dialogues à plusieurs tours, au lieu de raisonner à nouveau à chaque tour.
Très utile pour les scénarios d'agents : réduire le raisonnement redondant signifie réduire la consommation de tokens, ce qui signifie des coûts d'utilisation réels plus faibles. Dans les tâches d'automatisation de processus longs, cette différence est amplifiée.
Pourquoi dit-on que c'est un modèle « Alibaba utilise d'abord pour lui-même » ?
Qwen3.6-Plus sera intégré dans deux produits internes d'Alibaba :
- Wukong : La plateforme d'entreprise native IA d'Alibaba, qui utilise des systèmes multi-agents pour automatiser des tâches commerciales complexes
- Qwen App : L'application IA grand public phare d'Alibaba
L'utiliser d'abord pour soi-même, puis l'ouvrir à l'extérieur – cette logique signifie généralement que ce modèle a subi des tests de stress plus proches de scénarios réels que les benchmarks purement externes.
La compatibilité avec les environnements de programmation est bonne : il prend en charge OpenClaw, Claude Code, Qwen Code, Kilo Code, et est compatible avec les deux ensembles de protocoles API d'OpenAI et d'Anthropic, permettant aux développeurs de l'intégrer sans modifications majeures.
Comparaison horizontale : La voie de Qwen est-elle la bonne ?
En observant la ligne d'évolution de la série Qwen – de la conversation générale au contexte long, puis à la spécialisation en code, au multimodal et maintenant à l'exécution agentive – chaque étape va dans la direction de « pouvoir travailler davantage ».
Cette direction ressemble de plus en plus aux stratégies de produit d'Anthropic (Claude Code) et d'OpenAI (Codex). La différence est qu'Alibaba a un avantage inné avec les clients entreprises chinois et un lien profond avec l'écosystème Alibaba Cloud – c'est l'espace de différenciation sur le marché intérieur, ne gagnant pas par les scores de benchmark, mais par l'intégration de l'écosystème.
Sources de référence : Qwen3.6-Plus: Towards Real World Agents (Alibaba Cloud Community) ; Alibaba Unveils Qwen3.6-Plus to Accelerate Agentic AI Deployment for Enterprises (Alibaba Cloud) ; CocoLoop ; Beyond Passive Assistance: How Qwen3.6-Plus Is Advancing Agentic AI (The Tech Revolutionist)