阿里27B模型成績比肩自家397B

4月22日,Qwen團隊在Hugging Face發布了一個新模型。27B參數,Dense架構,Apache 2.0協議,名為Qwen3.6-27B。

發布部落格中,他們列出了基準測試分數。SWE-bench Verified:77.2分。旁邊也附上了Qwen3.5-397B-A17B的成績:76.2分。

一個27B的Dense模型,在程式碼基準測試上贏了自家397B的MoE旗艦。

這不是偶然,背後有具體原因。

MoE從哪裡開始漏水

MoE(混合專家)架構是過去兩年大型模型擴展的主流解法。邏輯很簡單:總參數量很大,但每次推理只啟動一小部分「專家」,實際計算量相對可控。

Qwen3.5-397B有397B總參數,每次推理啟動17B。Qwen3.6-27B每次推理啟動全部27B——從計算量來說差不多,但方式完全不同。

Dense架構的推理更一致、更可預測。MoE在路由時有一定的隨機性:不同輸入可能觸發不同的專家組合,這在長鏈式任務裡會累積出偏差。

在程式碼生成這種任務上,穩定性很關鍵。你想要的是「每一步都對」,而不是「平均來說不錯但有時候會漂移」。

Terminal-Bench 2.0上,27B跑出了59.3分,397B只有52.5。SkillsBench上差距更大:48.2 對 30.0。

模型 參數規模 SWE-bench Terminal-Bench SkillsBench
Qwen3.6-27B 27B Dense 77.2 59.3 48.2
Qwen3.5-397B-A17B 397B MoE 76.2 52.5 30.0

三個測試裡,27B全贏了。

Thinking Preservation是什麼

Qwen3.6-27B加入了一個名為「Thinking Preservation」的機制,值得單獨說明。

在多輪對話中,模型會把之前推理過程的摘要保留下來,下一輪不需要從頭推理——直接在上一輪的思考結果上繼續。

這在Agent工作流程中很實用。一個Agent要完成十步任務,前三步的分析結果不應該在第四步時消失,而應該作為上下文延續下去。這減少了重複的Token生成,也降低了長任務中的「遺忘漂移」。

這個設計和MoE的路由機制方向相反:MoE在橫向擴展參數,Thinking Preservation在縱向最佳化狀態傳遞。兩個思路解決的是不同層次的問題。

能在消費級硬體上跑

這是這個模型的另一個實際價值。

Qwen3.5-397B的完整版需要807GB儲存空間。量化版也要幾百GB,要跑起來得準備一台多GPU伺服器,一般開發者基本上沒機會。

Qwen3.6-27B:

  • 完整版55.6GB
  • 量化GGUF版16.8GB
  • 一張RTX 4090就能跑,速度約25 tokens/秒
  • M4 Max MacBook更沒問題

上下文視窗預設262,144 tokens,可擴展到100萬。Apache 2.0協議,商用沒有限制。

這把本地部署的門檻降低了很多。想在內網部署一個程式碼Agent、不想把程式碼傳給雲端API的工程師團隊——以前這條路要嘛用很差的開源模型,要嘛買很貴的GPU伺服器。現在有了一個選項。

這對MoE意味著什麼

阿里巴巴這次發布的時間點很有意思。Qwen3.6-27B在Qwen3.6-Max(旗艦閉源版)發布幾天後跟上——一個展示頂尖能力吸引商業客戶,一個提供給開發者社群。兩條腿,各自服務不同族群。

但更大的問題是:如果一個27B的Dense模型在Agentic Coding上已經能跟Claude Opus 4.5平起平坐,接下來這場競爭要在哪個維度打?

Terminal-Bench上27B和Claude Opus 4.5打成平手,而Opus 4.5的API價格在每百萬token 15美元以上。Qwen3.6-27B開源可以自己部署。

基準測試的增量收益越來越小。使用者開始更關心延遲、成本、本地部署的可能性。

這個趨勢對開源模型有利,對閉源API服務有壓力。

下一步看Kimi、DeepSeek和MiniMax怎麼跟進。

參考來源:CocoLoop、Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model(Simon Willison's Blog);Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks(AI Daily Post);Qwen3.6-27B(Hacker News)