SWE-bench 已經成了 AI 程式能力的「大學入學考試分數線」——每個新模型發布必報的數字。但這個基準到底在考什麼?刷到 80% 以上就意味著 AI 真的能當程式設計師了嗎?
測試方式
SWE-bench 用的是真實 GitHub Issue。從 Django、Flask、Requests、Matplotlib 這些知名專案裡抽取真實的 bug report 和 feature request,讓 AI 模型生成 patch 來修復。修完之後跑專案自帶的單元測試,通過算成功。
Verified 子集有500 個任務,每個都在獨立 Docker 容器裡執行,確保環境隔離。
當前排行
截至 2026 年 3 月:
| 模型 | Verified 分數 |
|---|---|
| Claude Opus 4.5 | 80.9% |
| Claude Opus 4.6 | 80.8% |
| Gemini 3.1 Pro | 80.6% |
| MiniMax M2.5 | 80.2% |
| GPT-5.2 | 80.0% |
| DeepSeek V3.2-exp | 60.0% |
| Qwen 3 | 55.0% |
頭部已經擠到 80% 以上,尾部還在 55-60%。差距很明顯。
一個容易被忽視的問題
SWE-bench 測的其實是「模型+腳手架」的整體表現。不同的 agent 框架、不同的工具鏈配置,同一個模型可以跑出差別很大的分數。所以不能簡單地看分數就斷定「A 模型比 B 強」。
為了應對分數飽和問題,研究者又推出了:
- SWE-bench PRO:更嚴格的子集
- SWE-bench Live:每月更新新題,防止數據污染
從 2024 年初的 30% 到 2026 年的 80%+,兩年翻了近三倍。進步速度確實驚人,但距離「完全替代程式設計師」還遠得很——這些基準測的都是定義明確的單個 issue,真正的軟體開發中大量時間花在需求理解、架構設計、團隊溝通這些基準覆蓋不到的地方。
參考來源:CocoLoop、SWE-bench 官方、LocalAIMaster 排行榜