SWE-bench는 AI 코딩 능력의 '대학수학능력시험'이 되었습니다. 새 모델이 출시될 때마다 반드시 보고되는 점수입니다. 하지만 이 벤치마크는 실제로 무엇을 평가하는 것일까요? 80% 이상의 점수를 받으면 AI가 정말 프로그래머로 일할 수 있다는 의미일까요?
테스트 방식
SWE-bench는 실제 GitHub 이슈를 사용합니다. Django, Flask, Requests, Matplotlib 같은 유명 프로젝트에서 실제 버그 리포트와 기능 요청을 추출하여 AI 모델이 패치를 생성해 수정하도록 합니다. 수정 후 프로젝트 자체 단위 테스트를 실행하여 통과하면 성공으로 간주합니다.
Verified 하위 집합에는 500개의 작업이 있으며, 각 작업은 독립적인 Docker 컨테이너에서 실행되어 환경 격리를 보장합니다.
현재 순위
2026년 3월 기준:
| 모델 | Verified 점수 |
|---|---|
| Claude Opus 4.5 | 80.9% |
| Claude Opus 4.6 | 80.8% |
| Gemini 3.1 Pro | 80.6% |
| MiniMax M2.5 | 80.2% |
| GPT-5.2 | 80.0% |
| DeepSeek V3.2-exp | 60.0% |
| Qwen 3 | 55.0% |
상위권은 이미 80% 이상으로 밀집되어 있지만, 하위권은 55~60%에 머물러 있습니다. 격차가 뚜렷합니다.
쉽게 간과되는 문제
SWE-bench가 실제로 측정하는 것은 '모델 + 스캐폴딩' 조합입니다. 에이전트 프레임워크와 툴체인 구성이 다르면 동일한 모델이라도 점수가 크게 달라질 수 있습니다. 따라서 단순히 점수만 보고 "모델 A가 모델 B보다 낫다"고 판단하는 것은 오해의 소지가 있습니다.
점수 포화 문제에 대응하기 위해 연구자들은 다음을 도입했습니다:
- SWE-bench PRO: 더 엄격한 하위 집합
- SWE-bench Live: 데이터 오염을 방지하기 위해 매월 새로운 문제 추가
2024년 초 약 30%에서 2026년 80% 이상으로, 2년 만에 점수가 거의 3배가 되었습니다. 진보 속도는 확실히 인상적이지만, '프로그래머 완전 대체'와는 거리가 멉니다. 이러한 벤치마크는 명확히 정의된 개별 이슈를 테스트하는 반면, 실제 소프트웨어 개발에서는 요구사항 이해, 아키텍처 설계, 팀 커뮤니케이션에 대부분의 시간이 소요되며, 이러한 영역은 벤치마크가 다루지 않습니다.
참고 출처: CocoLoop, SWE-bench 공식, LocalAIMaster 순위