Qwen3.8-Flash-Next sort ce soir avec une architecture Qwen4 anticipée

La communauté ModelScope a publié une page teaser pour Qwen3.8-Flash-Next, avec un compte à rebours pointant vers 23h le 26 août (UTC+8) ; la version standard et la version FP8 seront ouvertes au téléchargement en même temps. Le dépôt du même nom sur Hugging Face ne comporte qu'une seule phrase de description : A Preview of the Qwen4 Architecture.

La configuration de paramètres qui a filtré depuis la page teaser est la suivante : 125 milliards de paramètres principaux, plus 51 milliards d'embeddings N-gram, avec 6 milliards activés par token. Le modèle est positionné comme un MoE multimodal ; selon l'éditeur, il s'appuie sur l'architecture de nouvelle génération Qwen4, et ouvrir à l'avance les avancées architecturales doit préparer la communauté à l'arrivée de la série Qwen4.

Un taux d'activation comprimé sous les 5%

Sur 125 milliards, seuls 6 milliards sont activés, soit un taux d'activation, calculé grossièrement, inférieur à 5%. À titre de comparaison, les modèles MoE épars les plus courants du secteur ces deux dernières années se situent le plus souvent entre 5% et 10% ; Flash-Next pousse encore la parcimonie d'un cran vers le bas.

C'est une configuration clairement orientée vers la réduction du coût d'inférence. L'occupation VRAM d'un MoE dépend du nombre total de paramètres, tandis que le volume de calcul dépend des paramètres activés : les 125 milliards de poids doivent tenir dans la VRAM, mais chaque passage avant ne parcourt que le chemin des 6 milliards. Côté déploiement, cela signifie que le seuil de capacité de carte graphique ne baisse pas, mais que le seuil de puissance de calcul et de latence baisse fortement. Avec la version FP8, l'occupation des poids peut encore être réduite d'environ moitié. Le "Flash" du nom fait sans doute référence à cela.

Chose plus rare dans le tableau des paramètres, ce bloc de 51 milliards d'embeddings N-gram, listé séparément des paramètres principaux. Les structures de type embedding fonctionnent généralement surtout par recherche dans une table, sans participer au calcul matriciel couche par couche ; si Flash-Next suit cette voie, ces 51 milliards ressembleraient davantage à un investissement échangeant de la VRAM contre de l'efficacité qu'à une charge de calcul supplémentaire — la mise en œuvre exacte ne pourra être confirmée qu'une fois la fiche modèle et les fichiers de configuration publiés ce soir.

Pourquoi "3.8" porte-t-il l'architecture de Qwen4

Le nom paraît maladroit, mais la logique reste cohérente. Ce n'est pas la première fois que Qwen place un aperçu "Next" en fin de série 3.x ; la recette est toujours la même : reprendre la méthode de routage, la variante d'attention et la pile d'entraînement de la génération suivante, les faire tourner sur un modèle de taille moyenne, les publier en open source, laisser la communauté adapter d'abord la chaîne d'outils, avant que la grande version officielle n'arrive.

Le bénéfice est bien concret. Qu'un modèle open source soit ou non directement pris en charge dès le jour de sa sortie par des frameworks comme vLLM, SGLang ou llama.cpp détermine en grande partie sa courbe d'adoption des deux premières semaines. Dès qu'une architecture apporte de nouveaux opérateurs ou de nouvelles méthodes de routage, l'adaptation traîne souvent sur plusieurs semaines. Unsloth a déjà annoncé travailler sur un support "day-zero", suivant exactement cette voie : déplacer le coût en temps de l'adaptation architecturale du jour de sortie de Qwen4 à aujourd'hui.

Ce dépôt sur Hugging Face comptait déjà, avant son ouverture, 1299 personnes ayant cliqué pour être notifiées, un chiffre loin d'être négligeable pour un dépôt vide qui n'a même pas encore de fiche modèle.

Ce qu'il faudra surveiller après ce soir

Les informations de la page teaser s'arrêtent au nombre de paramètres ; plusieurs indicateurs clés restent inconnus : la longueur de contexte, les modalités couvertes par le multimodal, si la licence reste Apache 2.0, et surtout, les résultats des benchmarks.

Depuis un an, la stratégie d'Alibaba en open source consiste à traiter les poids comme une porte d'entrée vers l'écosystème, les poids des modèles de niveau Max ayant eux aussi été publiés. Avec Flash-Next, le calendrier avance encore davantage : l'architecture est livrée avant même que le modèle n'ait atteint sa maturité. Pour les équipes locales qui font du déploiement d'inférence et du fine-tuning, les 48 premières heures après 23h ce soir s'annoncent chargées.

Sources : page du modèle ModelScope, dépôt Hugging Face, CocoLoop, Decrypt, discussion de la communauté Hacker News ; la configuration des paramètres et l'heure d'ouverture reprennent les informations affichées sur la page du modèle, le taux d'activation étant un calcul approximatif fondé sur les paramètres publics.