Qwen3.6-27B開源,成績打敗3970億MoE

先看這個數字:SWE-bench Pro 53.5 vs 50.9

前者是Qwen3.6-27B,270億參數,4月22日剛開源,採用Apache 2.0協議。後者是Qwen3.5-397B,3970億參數,混合專家架構(MoE),阿里巴巴之前的主力模型。

270億參數的小模型,在軟體工程測試上打敗了近400億活化參數的大模型,這不是小事。

Thinking Preservation:這才是關鍵

老實說,參數越少越強這個故事,業界已經看過好幾輪了。Qwen3.6-27B能打出這個成績,核心不在於架構本身,而在於一個新功能:Thinking Preservation(思考保留)

開源LLM裡有一個被忽視的問題:當Agent執行多輪任務時,每一輪的推理過程是被丟棄的。模型每次都要從上下文重新推斷,而不是重複使用已經建立好的認知鏈路。

Qwen3.6-27B的做法是把歷史訊息中的「思考軌跡」作為持久上下文保留下來:

「保留並利用整個對話中歷史訊息的思考軌跡,而不是丟棄先前的推理,從而提高多輪代理工作流程的效率」

白話來說就是:模型記住了自己之前是怎麼想的,而不是每次歸零。

在代理型編碼任務上,這個差距很明顯。處理同一個程式碼倉庫時,記得上一輪推理結論的模型和不記得的模型,表現差距很大。SWE-bench Pro這個測試本來就是跑真實程式碼庫的任務,這一點上的優勢會被放大。

跑分全景

不只是SWE-bench,Qwen3.6-27B的表現全面:

測試Qwen3.6-27B對比
SWE-bench Pro53.5vs Qwen3.5-397B MoE: 50.9
Terminal-Bench 2.059.3與Claude Opus旗艦版持平
AIME26(數學競賽)94.1vs Qwen3.5-27B: 92.6
QwenWebBench1487vs Qwen3.5-27B: 1068(+39%)
SkillsBench平均48.2比上代同尺寸模型提升77%
GPQA Diamond87.8vs Qwen3.5-27B: 85.5

SkillsBench提升77%,這個數字值得特別關注。這個測試衡量的是跨領域通用能力,從Qwen3.5-27B到Qwen3.6-27B,不是小修小補,而是系統級重構。

上下文視窗

原生支援262,144 tokens(約20萬中文字),使用YaRN縮放可以達到1,010,000 tokens。

對於需要處理長程式碼倉庫或長文件的場景,這個上下文已經足夠。

開源意味著什麼

Apache 2.0協議,商用無限制。

這對企業來說比效能數字更實際:270億參數的模型,本地部署成本遠低於3970億參數的模型,但在核心任務上跑分更高——這個組合對想自建AI能力的公司很有吸引力。想想看,一張消費級GPU就能跑27B,而397B至少需要多張高階機器。

這也是為什麼SkillsBench那個77%的數字很關鍵:不只是在程式碼上更強,而是通用能力全面提升了,這才是真正能取代大模型的前提。

這週的格局

這週很巧,OpenAI發表了GPT-5.5,阿里巴巴發表了Qwen3.6-27B。

兩件事放在一起看:封閉源碼旗艦在追求「更快更省token」,開源小模型在追求「用更少參數打出更好的成績」。方向不同,但都在擠壓對方的空間。

下一個被顛覆的,可能不是哪家公司,而是「需要大模型才能跑好程式碼」這個假設。

參考來源:CocoLoop、Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks(MarkTechPost)