阿里 Qwen3.6 Plus 支援 1M 上下文,與 Claude Opus 在代理式程式設計上較勁

阿里雲在 4 月初發佈了 Qwen3.6 Plus,官方定位是「面向企業的 Agentic AI」。放到一堆大模型發佈公告裡可能顯得平平無奇,但仔細看技術細節和基準測試,仍有幾個值得認真看待的地方。

1M 上下文,專為倉庫級程式碼分析設計

Qwen3.6 Plus 的上下文視窗是 100 萬 token,大約等於 2000 頁文件。這個數字本身已不新鮮,但阿里這次給了一個比較具體的用法:倉庫級程式碼分析

一個完整的程式碼倉庫,幾十個檔案、幾萬行程式碼,全部塞進上下文,讓模型在這個範圍內規劃、編寫、測試和修復。這種「不需要分塊、不需要檢索」的方式,在 agent 任務裡減少了大量工程複雜度。終端執行、長鏈規劃、工具呼叫,這幾個 agent 核心能力 Qwen3.6 Plus 都有針對性地做了強化。

SWE-bench 上與 Claude Opus 4.5 打平

這個基準測試結果是最容易引戰的地方:Qwen3.6 Plus 在 SWE-bench Verified 和 Terminal-Bench 2.0 上的表現,阿里說和 Anthropic 的 Claude Opus 4.5 相當。

基準測試Qwen3.6 PlusClaude Opus 4.5
SWE-bench Verified相當參照基準
Terminal-Bench 2.0相當參照基準

「相當」這個說法出自廠商自己,獨立第三方驗證仍在進行中。不過從社群在 OpenRouter 上的評測來看,Qwen3.6 Plus Preview 的推理速度大約是 Claude Opus 4.6 的 2-3 倍,價格則低得多:阿里雲上的輸入定價約 0.29 美元/百萬 token

社群評測顯示 Qwen 3.6 Plus 的整體得分和排名相較 Qwen 3.5 Plus 有明顯提升,這個進化節奏是真實的。

給它截圖,它幫你寫前端程式碼

多模態部分值得單獨說明:給 Qwen3.6 Plus 一張 UI 截圖、手繪線框圖或產品原型,它能直接生成對應的前端程式碼。這把「從設計稿到程式碼」這個環節直接自動化了,結合 1M 上下文來處理複雜元件庫,實用價值不低。

模型還能跨高密度文件、視覺環境和長影片進行多模態推理,設計和開發工作流程之間的橋接能力算是這個版本的主打方向之一。

接入 Claude Code 和 Cline

第三方工具支援方面,Qwen3.6 Plus 明確相容 Claude Code 和 Cline 這兩個主流 AI 程式設計工具。加上阿里雲自家的吳空(Wukong)平台——多 agent 自動化業務流程的系統——基本覆蓋了企業端和開發者端兩個方向。

阿里還說後續會開源更小尺寸的版本,但具體時間表沒有明說。

這次發佈的背景

這不只是一個模型更新,而是阿里把 AI 部門重組為 Token Hub 之後,加速發佈節奏的一個訊號。競爭壓力是真實的:字節跳動豆包、DeepSeek 系列都在搶企業市場,Qwen3.6 Plus 是阿里對「agent 賽道」的一個明確表態。

能不能真的在大廠生產環境裡跑穩、複雜任務的成功率能穩定在什麼水平——這才是後續要驗證的關鍵,光靠基準分數說話還不夠。

參考來源:CocoLoop、Alibaba launches Qwen3.6-Plus for agentic AI and coding(techcoffeehouse.com);Alibaba Releases Qwen 3.6-Plus AI Model With Enhanced Coding Capabilities(Caixin Global);Qwen 3.6 Plus Review: Alibaba Frontier-Level Agentic Coding Model(MindStudio);Qwen 3.6 Plus Preview: 1M Context, Speed and Benchmarks 2026(BuildFastWithAI)