Qwen3.8-Flash-Next今晚开源,架构提前跳到Qwen4

魔搭社区挂出了 Qwen3.8-Flash-Next 的预告页,倒计时指向 8 月 26 日 23 时(UTC+8),标准版与 FP8 版同时开放下载。Hugging Face 上同名仓库的描述只有一句话:A Preview of the Qwen4 Architecture。

从预告页流出的参数配置是:125B 主参数、额外 51B 的 N-gram 嵌入、每 token 激活 6B。模型定位是多模态 MoE,官方说法是它建立在下一代 Qwen4 架构之上,提前把架构进展开源出来,为社区迎接 Qwen4 系列做准备。

激活率被压到不足 5%

125B 里只激活 6B,激活率粗算不到 5%。作为参照,业界这两年常见的稀疏 MoE 大多落在 5% 到 10% 这一档,Flash-Next 把稀疏度又往下压了一截。

这是一个明确朝推理成本去的配置。MoE 的显存占用看总参数,计算量看激活参数——125B 权重要装进显存,但每次前向只走 6B 的路径。放到部署侧就是:显卡容量的门槛不降,算力和延迟的门槛大降。配上 FP8 版本,权重占用还能再砍一半左右。名字里那个 Flash,指的应该就是这条线。

参数表里比较少见的是那 51B 的 N-gram 嵌入,被单独从主参数里拎出来列。嵌入类结构通常以查表为主、不参与逐层矩阵运算,如果 Flash-Next 走的也是这条路,那这 51B 更像是花显存换效果的一笔投入,而非算力开销——具体怎么实现,得等今晚模型卡和配置文件放出来才能确认。

为什么是”3.8”却挂 Qwen4 架构

命名看着别扭,逻辑倒是顺的。Qwen 在 3.x 系列末期放一个 Next 预览版已经不是第一次,套路是同一个:先把下一代的路由方式、注意力变体、训练栈拿一个中等规模的模型跑通并开源,让社区先把工具链适配好,正式的大版本再压上来。

好处很实在。开源模型发布当天能不能被 vLLM、SGLang、llama.cpp 这些框架直接吃下,很大程度上决定了它头两周的采用曲线。架构一旦有新算子、新路由方式,适配往往要拖上数周。Unsloth 已经宣布在做 day-zero 支持,走的正是这个路径——把架构适配的时间成本,从 Qwen4 发布日挪到了今天。

Hugging Face 那个仓库在开放前已经有 1299 人点了等待通知,这个数字对一个连模型卡都还没有的空仓库来说不算低。

今晚之后该看哪几项

预告页给的信息只到参数量为止,几个关键指标一个都没露:上下文长度、多模态覆盖到哪些模态、许可证是不是延续 Apache 2.0、以及最要紧的——评测成绩。

阿里过去一年在开源侧的打法是把权重当生态入口,Max 级模型权重也放了出去。Flash-Next 这一手把时间轴又往前挪:不等模型成熟就先交架构。对国内做推理部署和微调的团队来说,今晚 23 点之后的头 48 小时会比较忙。

参考来源:魔搭社区模型页、Hugging Face 仓库、CocoLoop、Decrypt、Hacker News 社区讨论;参数配置与开放时间以模型页展示信息为准,激活率为按公开参数粗算。