SWE-benchが実際に測定しているもの

SWE-benchは、AIのコーディング能力における「大学入試センター試験」のような存在となっている。新しいモデルがリリースされるたびに、そのスコアが報告される。しかし、このベンチマークは実際に何を測定しているのか?80%以上のスコアを獲得すれば、AIが本当にプログラマーとして働けるのだろうか?

テスト方法

SWE-benchは実際のGitHub Issueを使用する。Django、Flask、Requests、Matplotlibといった著名なプロジェクトから実際のバグレポートや機能リクエストを抽出し、AIモデルにパッチを生成させて修正させる。修正後、プロジェクトに付属する単体テストを実行し、合格すれば成功とみなす。

Verifiedサブセットには500のタスクが含まれており、各タスクは独立したDockerコンテナ内で実行され、環境の分離が保証される。

現在のランキング

2026年3月時点:

モデルVerifiedスコア
Claude Opus 4.580.9%
Claude Opus 4.680.8%
Gemini 3.1 Pro80.6%
MiniMax M2.580.2%
GPT-5.280.0%
DeepSeek V3.2-exp60.0%
Qwen 355.0%

上位陣はすでに80%以上に密集しているが、下位は55~60%にとどまっている。その差は明らかだ。

見落とされがちな問題

SWE-benchが実際に測定しているのは、「モデル+足場(スキャフォールディング)」の組み合わせである。エージェントフレームワークやツールチェーンの設定が異なれば、同じモデルでもスコアが大きく変わる可能性がある。したがって、単にスコアを見て「モデルAはモデルBより優れている」と結論づけるのは誤解を招く。

スコアの飽和に対処するため、研究者らは以下を導入している:

  • SWE-bench PRO:より厳格なサブセット
  • SWE-bench Live:データ汚染を防ぐため毎月新しい問題を追加

2024年初頭の約30%から2026年の80%超へと、スコアは2年間で約3倍になった。進歩のペースは確かに目覚ましいが、「プログラマーの完全な代替」にはほど遠い。これらのベンチマークは明確に定義された個別のIssueをテストするものであり、実際のソフトウェア開発では、要件理解、アーキテクチャ設計、チームコミュニケーションに多くの時間が費やされており、これらの領域はベンチマークではカバーされていない。

参考元:CocoLoop、SWE-bench公式、LocalAIMasterランキング