阿里開源 Qwen3.6-35B,SWE-bench 達 73.4%

4 月 16 日,阿里 Qwen 團隊將 Qwen3.6-35B-A3B 開源,採用 Apache 2.0 協議,沒有任何商用限制。

這個模型有點意思:總參數 35B,但推理時只激活 3B。它採用混合專家(MoE)架構,計算稀疏比為 12:1——效果上接近 35B 大模型,運行開銷則按 3B 計算。

SWE-bench Verified(真實 GitHub Issue 修復測試)跑出 73.4%,同期 Google 開源的 Gemma 4-31B 為 52.0%,差距達 21 個百分點。

架構為什麼重要

先說 MoE 這個設計邏輯。

普通的稠密模型,每次處理一個 token,所有參數都會參與計算。35B 參數的模型,每個 token 都要用到 35B 的計算量。

MoE 不一樣。它把參數分成很多個「專家」(expert),每次只激活其中一部分。Qwen3.6-35B-A3B 的路由機制每次只調用對應 3B 參數的專家組來處理每個 token,但整體模型累積了 35B 參數代表的知識容量。

結果就是:推理速度和顯存佔用按 3B 算,解題能力按 35B 算。

在 RTX 4090 上跑速超過 120 tokens/秒。64GB 的 MacBook Pro M4/M5 能直接跑。Q4_K_M 量化之後約 21GB,一張主流消費級顯卡就能裝下。

這對本地部署意味著很多——以前要跑開源前沿級別的編程模型,起碼要有 A100 或者多張 4090,現在一張消費級顯卡就夠了。

和其他模型的數字對比

vs. Google Gemma 4-31B:

測試Qwen3.6-35BGemma 4-31B
SWE-bench Verified73.4%52.0%
Terminal-Bench 2.051.5%42.9%
MCPMark(工具調用)37.0%18.1%
GPQA(通用推理)86.0%84.3%
AIME26(數學競賽)92.7%89.2%

在工具調用(MCPMark)上,Qwen3.6 是 Gemma 4 的兩倍多。這個測試場景直接對應實際 Agent 任務裡的表現,比 SWE-bench 還貼近真實使用。

QwenWebBench(網頁任務)拿下 1397 ELO,比上一代提升 43%。

vs. Claude Sonnet 4.5:

根據 The Decoder 的評測,在純編程 benchmark 上接近持平,差距在測量誤差範圍內。助手風格對話和通用閒聊方面,Claude 仍然領先。

開源細節和可用性

模型權重在 Hugging Face(Qwen/Qwen3.6-35B-A3B)和 ModelScope 都能下載,相容 Transformers、vLLM(>=0.19.0)、SGLang(>=0.5.10)和 KTransformers。

支援兩種模式:

  • Thinking 模式:類似推理模型,多步深度思考,保留推理過程供後續對話繼承。
  • Fast 模式:直接輸出,適合對話和輕量任務。

原生上下文視窗 262,144 tokens,YaRN 擴展後能到 100 萬以上。

API 也可以透過阿里雲 Model Studio 調用(名稱「Qwen3.6 Flash」),或者自行部署。

如何看待這件事

這是阿里在開源方向的第三步了。Qwen3 基礎版開源(Apache 協議)、Qwen3.6-Plus 企業閉源版發布,然後開源了 Qwen3.6-35B-A3B 這個高性能編程特化版本。

每一步節奏都很清晰:先建社群和開發者基礎,再用閉源版本賺錢,再用開源版本把生態做深。

Qwen3.6-35B-A3B 的 73.4% SWE-bench 成績放在整個開源模型裡是什麼水準?目前開源裡排得上名的也就 DeepSeek V4 和這個,閉源裡 Claude Sonnet 4.5 也在這個區間附近。一個能本地跑的 MoE 模型跑到這個分數,確實改變了一些東西。

當然,SWE-bench 高分不等於生產用起來就好用。編程 Agent 的實際表現還要看上下文管理、錯誤恢復、長流程穩定性——這些都不在 benchmark 裡。但起點放到這裡,值得認真跑一跑。

參考來源:CocoLoop、Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks(The Decoder);Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally(Build Fast with AI);Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model(DEV Community)