解析 SWE-bench 基準到底在測什麼

SWE-bench 已經成了 AI 程式能力的「大學入學考試分數線」——每個新模型發布必報的數字。但這個基準到底在考什麼?刷到 80% 以上就意味著 AI 真的能當程式設計師了嗎?

測試方式

SWE-bench 用的是真實 GitHub Issue。從 Django、Flask、Requests、Matplotlib 這些知名專案裡抽取真實的 bug report 和 feature request,讓 AI 模型生成 patch 來修復。修完之後跑專案自帶的單元測試,通過算成功。

Verified 子集有500 個任務,每個都在獨立 Docker 容器裡執行,確保環境隔離。

當前排行

截至 2026 年 3 月:

模型Verified 分數
Claude Opus 4.580.9%
Claude Opus 4.680.8%
Gemini 3.1 Pro80.6%
MiniMax M2.580.2%
GPT-5.280.0%
DeepSeek V3.2-exp60.0%
Qwen 355.0%

頭部已經擠到 80% 以上,尾部還在 55-60%。差距很明顯。

一個容易被忽視的問題

SWE-bench 測的其實是「模型+腳手架」的整體表現。不同的 agent 框架、不同的工具鏈配置,同一個模型可以跑出差別很大的分數。所以不能簡單地看分數就斷定「A 模型比 B 強」。

為了應對分數飽和問題,研究者又推出了:

  • SWE-bench PRO:更嚴格的子集
  • SWE-bench Live:每月更新新題,防止數據污染

從 2024 年初的 30% 到 2026 年的 80%+,兩年翻了近三倍。進步速度確實驚人,但距離「完全替代程式設計師」還遠得很——這些基準測的都是定義明確的單個 issue,真正的軟體開發中大量時間花在需求理解、架構設計、團隊溝通這些基準覆蓋不到的地方。

參考來源:CocoLoop、SWE-bench 官方、LocalAIMaster 排行榜