4月22日,Qwen團隊在Hugging Face發布了一個新模型。27B參數,Dense架構,Apache 2.0協議,名為Qwen3.6-27B。
發布部落格中,他們列出了基準測試分數。SWE-bench Verified:77.2分。旁邊也附上了Qwen3.5-397B-A17B的成績:76.2分。
一個27B的Dense模型,在程式碼基準測試上贏了自家397B的MoE旗艦。
這不是偶然,背後有具體原因。
MoE從哪裡開始漏水
MoE(混合專家)架構是過去兩年大型模型擴展的主流解法。邏輯很簡單:總參數量很大,但每次推理只啟動一小部分「專家」,實際計算量相對可控。
Qwen3.5-397B有397B總參數,每次推理啟動17B。Qwen3.6-27B每次推理啟動全部27B——從計算量來說差不多,但方式完全不同。
Dense架構的推理更一致、更可預測。MoE在路由時有一定的隨機性:不同輸入可能觸發不同的專家組合,這在長鏈式任務裡會累積出偏差。
在程式碼生成這種任務上,穩定性很關鍵。你想要的是「每一步都對」,而不是「平均來說不錯但有時候會漂移」。
Terminal-Bench 2.0上,27B跑出了59.3分,397B只有52.5。SkillsBench上差距更大:48.2 對 30.0。
| 模型 | 參數規模 | SWE-bench | Terminal-Bench | SkillsBench |
|---|---|---|---|---|
| Qwen3.6-27B | 27B Dense | 77.2 | 59.3 | 48.2 |
| Qwen3.5-397B-A17B | 397B MoE | 76.2 | 52.5 | 30.0 |
三個測試裡,27B全贏了。
Thinking Preservation是什麼
Qwen3.6-27B加入了一個名為「Thinking Preservation」的機制,值得單獨說明。
在多輪對話中,模型會把之前推理過程的摘要保留下來,下一輪不需要從頭推理——直接在上一輪的思考結果上繼續。
這在Agent工作流程中很實用。一個Agent要完成十步任務,前三步的分析結果不應該在第四步時消失,而應該作為上下文延續下去。這減少了重複的Token生成,也降低了長任務中的「遺忘漂移」。
這個設計和MoE的路由機制方向相反:MoE在橫向擴展參數,Thinking Preservation在縱向最佳化狀態傳遞。兩個思路解決的是不同層次的問題。
能在消費級硬體上跑
這是這個模型的另一個實際價值。
Qwen3.5-397B的完整版需要807GB儲存空間。量化版也要幾百GB,要跑起來得準備一台多GPU伺服器,一般開發者基本上沒機會。
Qwen3.6-27B:
- 完整版55.6GB
- 量化GGUF版16.8GB
- 一張RTX 4090就能跑,速度約25 tokens/秒
- M4 Max MacBook更沒問題
上下文視窗預設262,144 tokens,可擴展到100萬。Apache 2.0協議,商用沒有限制。
這把本地部署的門檻降低了很多。想在內網部署一個程式碼Agent、不想把程式碼傳給雲端API的工程師團隊——以前這條路要嘛用很差的開源模型,要嘛買很貴的GPU伺服器。現在有了一個選項。
這對MoE意味著什麼
阿里巴巴這次發布的時間點很有意思。Qwen3.6-27B在Qwen3.6-Max(旗艦閉源版)發布幾天後跟上——一個展示頂尖能力吸引商業客戶,一個提供給開發者社群。兩條腿,各自服務不同族群。
但更大的問題是:如果一個27B的Dense模型在Agentic Coding上已經能跟Claude Opus 4.5平起平坐,接下來這場競爭要在哪個維度打?
Terminal-Bench上27B和Claude Opus 4.5打成平手,而Opus 4.5的API價格在每百萬token 15美元以上。Qwen3.6-27B開源可以自己部署。
基準測試的增量收益越來越小。使用者開始更關心延遲、成本、本地部署的可能性。
這個趨勢對開源模型有利,對閉源API服務有壓力。
下一步看Kimi、DeepSeek和MiniMax怎麼跟進。
參考來源:CocoLoop、Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model(Simon Willison's Blog);Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks(AI Daily Post);Qwen3.6-27B(Hacker News)