Giải mã SWE-bench: Chuẩn đánh giá này thực sự đo lường điều gì?

SWE-bench đã trở thành "điểm chuẩn đại học" cho khả năng lập trình AI — mỗi khi một mô hình mới ra mắt, con số này luôn được công bố. Nhưng benchmark này thực sự kiểm tra điều gì? Liệu đạt trên 80% có đồng nghĩa AI thực sự có thể làm lập trình viên?

Phương pháp kiểm tra

SWE-bench sử dụng các issue GitHub thực tế. Nó trích xuất các báo cáo lỗi và yêu cầu tính năng thực từ các dự án nổi tiếng như Django, Flask, Requests, Matplotlib, yêu cầu mô hình AI tạo ra bản vá để sửa chữa. Sau khi sửa, các bài kiểm tra đơn vị đi kèm của dự án được chạy; nếu vượt qua, được tính là thành công.

Tập con Verified có 500 tác vụ, mỗi tác vụ được thực thi trong một container Docker riêng biệt để đảm bảo cách ly môi trường.

Bảng xếp hạng hiện tại

Tính đến tháng 3 năm 2026:

Mô hìnhĐiểm Verified
Claude Opus 4.580,9%
Claude Opus 4.680,8%
Gemini 3.1 Pro80,6%
MiniMax M2.580,2%
GPT-5.280,0%
DeepSeek V3.2-exp60,0%
Qwen 355,0%

Nhóm đầu đã chạm mốc trên 80%, trong khi nhóm cuối vẫn ở mức 55-60%. Khoảng cách rất rõ rệt.

Một vấn đề dễ bị bỏ qua

SWE-bench thực sự đo lường hiệu suất tổng thể của "mô hình + giàn giáo". Các framework agent khác nhau, cấu hình công cụ khác nhau có thể khiến cùng một mô hình đạt được điểm số rất khác nhau. Vì vậy, không thể chỉ nhìn vào điểm số để kết luận "Mô hình A mạnh hơn mô hình B".

Để giải quyết vấn đề bão hòa điểm số, các nhà nghiên cứu đã đưa ra:

  • SWE-bench PRO: Tập con khắt khe hơn
  • SWE-bench Live: Cập nhật câu hỏi mới hàng tháng để ngăn ngừa ô nhiễm dữ liệu

Từ mức 30% đầu năm 2024 lên hơn 80% vào năm 2026, con số đã tăng gần gấp ba trong hai năm. Tốc độ tiến bộ thực sự đáng kinh ngạc, nhưng còn rất xa mới có thể "thay thế hoàn toàn lập trình viên" — những benchmark này chỉ kiểm tra các issue đơn lẻ được xác định rõ ràng, trong khi phần lớn thời gian phát triển phần mềm thực tế dành cho hiểu yêu cầu, thiết kế kiến trúc, giao tiếp nhóm — những lĩnh vực mà benchmark không thể bao phủ.

Nguồn tham khảo: CocoLoop, SWE-bench chính thức, Bảng xếp hạng LocalAIMaster