4 月 16 日,阿里 Qwen 團隊將 Qwen3.6-35B-A3B 開源,採用 Apache 2.0 協議,沒有任何商用限制。
這個模型有點意思:總參數 35B,但推理時只激活 3B。它採用混合專家(MoE)架構,計算稀疏比為 12:1——效果上接近 35B 大模型,運行開銷則按 3B 計算。
SWE-bench Verified(真實 GitHub Issue 修復測試)跑出 73.4%,同期 Google 開源的 Gemma 4-31B 為 52.0%,差距達 21 個百分點。
架構為什麼重要
先說 MoE 這個設計邏輯。
普通的稠密模型,每次處理一個 token,所有參數都會參與計算。35B 參數的模型,每個 token 都要用到 35B 的計算量。
MoE 不一樣。它把參數分成很多個「專家」(expert),每次只激活其中一部分。Qwen3.6-35B-A3B 的路由機制每次只調用對應 3B 參數的專家組來處理每個 token,但整體模型累積了 35B 參數代表的知識容量。
結果就是:推理速度和顯存佔用按 3B 算,解題能力按 35B 算。
在 RTX 4090 上跑速超過 120 tokens/秒。64GB 的 MacBook Pro M4/M5 能直接跑。Q4_K_M 量化之後約 21GB,一張主流消費級顯卡就能裝下。
這對本地部署意味著很多——以前要跑開源前沿級別的編程模型,起碼要有 A100 或者多張 4090,現在一張消費級顯卡就夠了。
和其他模型的數字對比
vs. Google Gemma 4-31B:
| 測試 | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73.4% | 52.0% |
| Terminal-Bench 2.0 | 51.5% | 42.9% |
| MCPMark(工具調用) | 37.0% | 18.1% |
| GPQA(通用推理) | 86.0% | 84.3% |
| AIME26(數學競賽) | 92.7% | 89.2% |
在工具調用(MCPMark)上,Qwen3.6 是 Gemma 4 的兩倍多。這個測試場景直接對應實際 Agent 任務裡的表現,比 SWE-bench 還貼近真實使用。
QwenWebBench(網頁任務)拿下 1397 ELO,比上一代提升 43%。
vs. Claude Sonnet 4.5:
根據 The Decoder 的評測,在純編程 benchmark 上接近持平,差距在測量誤差範圍內。助手風格對話和通用閒聊方面,Claude 仍然領先。
開源細節和可用性
模型權重在 Hugging Face(Qwen/Qwen3.6-35B-A3B)和 ModelScope 都能下載,相容 Transformers、vLLM(>=0.19.0)、SGLang(>=0.5.10)和 KTransformers。
支援兩種模式:
- Thinking 模式:類似推理模型,多步深度思考,保留推理過程供後續對話繼承。
- Fast 模式:直接輸出,適合對話和輕量任務。
原生上下文視窗 262,144 tokens,YaRN 擴展後能到 100 萬以上。
API 也可以透過阿里雲 Model Studio 調用(名稱「Qwen3.6 Flash」),或者自行部署。
如何看待這件事
這是阿里在開源方向的第三步了。Qwen3 基礎版開源(Apache 協議)、Qwen3.6-Plus 企業閉源版發布,然後開源了 Qwen3.6-35B-A3B 這個高性能編程特化版本。
每一步節奏都很清晰:先建社群和開發者基礎,再用閉源版本賺錢,再用開源版本把生態做深。
Qwen3.6-35B-A3B 的 73.4% SWE-bench 成績放在整個開源模型裡是什麼水準?目前開源裡排得上名的也就 DeepSeek V4 和這個,閉源裡 Claude Sonnet 4.5 也在這個區間附近。一個能本地跑的 MoE 模型跑到這個分數,確實改變了一些東西。
當然,SWE-bench 高分不等於生產用起來就好用。編程 Agent 的實際表現還要看上下文管理、錯誤恢復、長流程穩定性——這些都不在 benchmark 裡。但起點放到這裡,值得認真跑一跑。
參考來源:CocoLoop、Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks(The Decoder);Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally(Build Fast with AI);Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model(DEV Community)