先看這個數字:SWE-bench Pro 53.5 vs 50.9。
前者是Qwen3.6-27B,270億參數,4月22日剛開源,採用Apache 2.0協議。後者是Qwen3.5-397B,3970億參數,混合專家架構(MoE),阿里巴巴之前的主力模型。
270億參數的小模型,在軟體工程測試上打敗了近400億活化參數的大模型,這不是小事。
Thinking Preservation:這才是關鍵
老實說,參數越少越強這個故事,業界已經看過好幾輪了。Qwen3.6-27B能打出這個成績,核心不在於架構本身,而在於一個新功能:Thinking Preservation(思考保留)。
開源LLM裡有一個被忽視的問題:當Agent執行多輪任務時,每一輪的推理過程是被丟棄的。模型每次都要從上下文重新推斷,而不是重複使用已經建立好的認知鏈路。
Qwen3.6-27B的做法是把歷史訊息中的「思考軌跡」作為持久上下文保留下來:
「保留並利用整個對話中歷史訊息的思考軌跡,而不是丟棄先前的推理,從而提高多輪代理工作流程的效率」
白話來說就是:模型記住了自己之前是怎麼想的,而不是每次歸零。
在代理型編碼任務上,這個差距很明顯。處理同一個程式碼倉庫時,記得上一輪推理結論的模型和不記得的模型,表現差距很大。SWE-bench Pro這個測試本來就是跑真實程式碼庫的任務,這一點上的優勢會被放大。
跑分全景
不只是SWE-bench,Qwen3.6-27B的表現全面:
| 測試 | Qwen3.6-27B | 對比 |
|---|---|---|
| SWE-bench Pro | 53.5 | vs Qwen3.5-397B MoE: 50.9 |
| Terminal-Bench 2.0 | 59.3 | 與Claude Opus旗艦版持平 |
| AIME26(數學競賽) | 94.1 | vs Qwen3.5-27B: 92.6 |
| QwenWebBench | 1487 | vs Qwen3.5-27B: 1068(+39%) |
| SkillsBench平均 | 48.2 | 比上代同尺寸模型提升77% |
| GPQA Diamond | 87.8 | vs Qwen3.5-27B: 85.5 |
SkillsBench提升77%,這個數字值得特別關注。這個測試衡量的是跨領域通用能力,從Qwen3.5-27B到Qwen3.6-27B,不是小修小補,而是系統級重構。
上下文視窗
原生支援262,144 tokens(約20萬中文字),使用YaRN縮放可以達到1,010,000 tokens。
對於需要處理長程式碼倉庫或長文件的場景,這個上下文已經足夠。
開源意味著什麼
Apache 2.0協議,商用無限制。
這對企業來說比效能數字更實際:270億參數的模型,本地部署成本遠低於3970億參數的模型,但在核心任務上跑分更高——這個組合對想自建AI能力的公司很有吸引力。想想看,一張消費級GPU就能跑27B,而397B至少需要多張高階機器。
這也是為什麼SkillsBench那個77%的數字很關鍵:不只是在程式碼上更強,而是通用能力全面提升了,這才是真正能取代大模型的前提。
這週的格局
這週很巧,OpenAI發表了GPT-5.5,阿里巴巴發表了Qwen3.6-27B。
兩件事放在一起看:封閉源碼旗艦在追求「更快更省token」,開源小模型在追求「用更少參數打出更好的成績」。方向不同,但都在擠壓對方的空間。
下一個被顛覆的,可能不是哪家公司,而是「需要大模型才能跑好程式碼」這個假設。
參考來源:CocoLoop、Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks(MarkTechPost)