Apa yang Sebenarnya Diukur oleh SWE-bench

SWE-bench telah menjadi "garis kelulusan ujian masuk perguruan tinggi" untuk kemampuan coding AI—setiap rilis model baru pasti melaporkan skornya. Namun, apa sebenarnya yang diuji oleh tolok ukur ini? Apakah skor di atas 80% berarti AI benar-benar bisa bekerja sebagai programmer?

Cara Pengujian

SWE-bench menggunakan issue GitHub nyata. Issue tersebut diambil dari proyek terkenal seperti Django, Flask, Requests, dan Matplotlib, berupa laporan bug dan permintaan fitur aktual, lalu model AI diminta untuk menghasilkan patch guna memperbaikinya. Setelah diperbaiki, pengujian unit bawaan proyek dijalankan; jika lulus, dianggap berhasil.

Subset Verified memiliki 500 tugas, masing-masing dijalankan dalam kontainer Docker terisolasi untuk memastikan pemisahan lingkungan.

Peringkat Saat Ini

Per Maret 2026:

ModelSkor Verified
Claude Opus 4.580,9%
Claude Opus 4.680,8%
Gemini 3.1 Pro80,6%
MiniMax M2.580,2%
GPT-5.280,0%
DeepSeek V3.2-exp60,0%
Qwen 355,0%

Peringkat atas sudah padat di atas 80%, sementara peringkat bawah masih di 55–60%. Kesenjangannya jelas.

Masalah yang Sering Terabaikan

SWE-bench sebenarnya mengukur kombinasi "model + perancah (scaffolding)". Kerangka kerja agen dan konfigurasi rantai alat yang berbeda dapat menghasilkan skor yang sangat berbeda untuk model yang sama. Jadi, tidak bisa hanya melihat skor lalu menyimpulkan "Model A lebih baik dari Model B".

Untuk mengatasi kejenuhan skor, para peneliti telah memperkenalkan:

  • SWE-bench PRO: subset yang lebih ketat
  • SWE-bench Live: soal baru setiap bulan untuk mencegah kontaminasi data

Dari sekitar 30% pada awal 2024 menjadi lebih dari 80% pada 2026, skor hampir tiga kali lipat dalam dua tahun. Laju kemajuannya memang mengesankan, tetapi masih jauh dari "menggantikan programmer sepenuhnya"—tolok ukur ini menguji isu individual yang terdefinisi dengan jelas, sementara pengembangan perangkat lunak nyata menghabiskan sebagian besar waktu pada pemahaman kebutuhan, desain arsitektur, dan komunikasi tim, area yang tidak tercakup oleh tolok ukur ini.

Sumber referensi: CocoLoop, SWE-bench resmi, Peringkat LocalAIMaster