Qwen3.8-Max est passé de l’annonce au dépôt réel. Le 12 août, la page ModelScope Qwen/Qwen3.8-2.4T-A95B indiquait que le dépôt contient les poids post-entraînement et les fichiers de configuration au format Hugging Face Transformers.
La carte du modèle cite vLLM, SGLang et TokenSpeed comme chemins compatibles. Les métadonnées ModelScope affichent environ 4,89TB de stockage. Qwen3.8-Max était déjà disponible dans Qoder et Token Plan; la nouveauté est l’existence d’un artefact open-weight de classe Max.
Les poids deviennent le point d’audit
“This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.”
Les spécifications annoncent 2,4T paramètres au total, 95B paramètres actifs, un contexte natif de 262.144 tokens et une extension jusqu’à 1.010.000 tokens. L’architecture comprend 92 couches, 512 experts, 10 routed experts plus un shared expert, et un vocabulaire de 248.320 tokens.
La version ModelScope diffère du service Qwen3.8-Max managé. Le modèle ouvert est textuel et impose thinking mode; Qwen Cloud ajoute l’entrée visuelle, le mode sans thinking, le contexte 1M par défaut et des outils intégrés.
Le contrôle compte plus que la remise
Pour une équipe technique, une remise API et des poids ouverts n’ont pas la même valeur. Une remise peut disparaître; les poids permettent de tester moteurs d’inférence, quantification, bases de code privées, documents longs et séparation des droits dans son propre environnement.
La taille de 4,89TB rappelle aussi la limite. Ce n’est pas un modèle de laptop. La plupart des usages passeront par de l’inférence hébergée, des versions quantifiées ou des clusters d’entreprise. L’ouverture sert surtout la reproduction indépendante et l’optimisation.
La table officielle donne 86,6 sur Terminal Bench 2.1, 67,7 sur SWE-bench Pro, 93,0 sur PaperBench et 86,1 sur OSWorld-Verified. Mais les harnesses, délais, fenêtres de contexte et sources de référence diffèrent. Les prochains contrôles portent sur la licence, la stabilité des téléchargements, les recettes vLLM et SGLang, les benchmarks tiers et la performance après quantification.
Sources : carte ModelScope Qwen3.8-2.4T-A95B, blog officiel Qwen3.8-Max, documentation Qwen Cloud, DataCamp, CocoLoop ; vérification du statut open-weight, de la taille du dépôt, des paramètres totaux et actifs, de la longueur de contexte, de la compatibilité framework, des limites thinking mode, des benchmarks et des différences avec l’API managée.