魔搭社群(ModelScope)掛出了Qwen3.8-Flash-Next的預告頁,倒數計時指向8月26日23時(UTC+8),標準版與FP8版同時開放下載。Hugging Face上同名倉庫的說明只有一句話:A Preview of the Qwen4 Architecture。
從預告頁流出的參數配置是:1250億(125B)主參數、額外510億(51B)的N-gram嵌入、每token啟用60億(6B)。模型定位是多模態MoE,官方說法是它建立在下一代Qwen4架構之上,提前把架構進展開源出來,為社群迎接Qwen4系列做準備。
啟用率被壓到不足5%
1250億裡只啟用60億,啟用率粗算不到5%。作為參照,業界這兩年常見的稀疏MoE大多落在5%到10%這個區間,Flash-Next把稀疏度又往下壓了一截。
這是一個明確朝推理成本去的配置。MoE的顯存占用看總參數,計算量看啟用參數——1250億權重要裝進顯存,但每次前向只走60億的路徑。放到部署端就是:顯卡容量的門檻不會降,但算力和延遲的門檻大幅降低。搭配FP8版,權重占用還能再砍一半左右。名字裡那個Flash,指的應該就是這一點。
參數表裡比較少見的是那510億的N-gram嵌入,被單獨從主參數裡拉出來列。嵌入類結構通常以查表為主、不參與逐層矩陣運算,如果Flash-Next走的也是這條路,那這510億更像是花顯存換效果的一筆投資,而非算力開銷——具體怎麼實作,得等今晚模型卡和設定檔放出來才能確認。
為什麼是「3.8」卻掛Qwen4架構
命名看起來彆扭,邏輯倒是順的。Qwen在3.x系列末期放一個Next預覽版已經不是第一次,套路是同一套:先把下一代的路由方式、注意力變體、訓練堆疊拿一個中等規模的模型跑通並開源,讓社群先把工具鏈適配好,正式的大版本再壓上來。
好處很實在。開源模型發布當天能不能被vLLM、SGLang、llama.cpp這些框架直接吃下,很大程度上決定了它頭兩週的採用曲線。架構一旦有新算子、新路由方式,適配往往要拖上數週。Unsloth已經宣布在做day-zero支援,走的正是這條路徑——把架構適配的時間成本,從Qwen4發布日挪到了今天。
Hugging Face那個倉庫在開放前已經有1299人點了等待通知,這個數字對一個連模型卡都還沒有的空倉庫來說不算低。
今晚之後該看哪幾項
預告頁給的資訊只到參數量為止,幾個關鍵指標一個都沒露:上下文長度、多模態涵蓋到哪些模態、授權條款是不是延續Apache 2.0、以及最要緊的——評測成績。
阿里過去一年在開源這一側的打法是把權重當生態入口,Max級模型權重也放了出來。Flash-Next這一手把時間軸又往前挪:不等模型成熟就先交架構。對做推理部署和微調的團隊來說,今晚23點之後的頭48小時會比較忙。
參考來源:魔搭社群模型頁、Hugging Face倉庫、CocoLoop、Decrypt、Hacker News社群討論;參數配置與開放時間以模型頁顯示資訊為準,啟用率為依公開參數粗算。