O SWE-bench se tornou a "nota de corte do vestibular" para habilidades de programação de IA — cada novo modelo lançado deve divulgar esse número. Mas o que esse benchmark realmente avalia? Atingir mais de 80% significa que a IA pode realmente trabalhar como programadora?
Método de teste
O SWE-bench usa issues reais do GitHub. Ele extrai relatórios de bugs reais e solicitações de funcionalidades de projetos conhecidos como Django, Flask, Requests e Matplotlib, e pede que modelos de IA gerem patches para corrigi-los. Após a correção, os testes de unidade do próprio projeto são executados; se forem aprovados, a tarefa é considerada bem-sucedida.
O subconjunto Verified tem 500 tarefas, cada uma executada em um contêiner Docker independente para garantir o isolamento do ambiente.
Ranking atual
Até março de 2026:
| Modelo | Pontuação Verified |
|---|---|
| Claude Opus 4.5 | 80,9% |
| Claude Opus 4.6 | 80,8% |
| Gemini 3.1 Pro | 80,6% |
| MiniMax M2.5 | 80,2% |
| GPT-5.2 | 80,0% |
| DeepSeek V3.2-exp | 60,0% |
| Qwen 3 | 55,0% |
O grupo da liderança já ultrapassou a marca dos 80%, enquanto o grupo inferior ainda está entre 55% e 60%. A diferença é evidente.
Um problema facilmente negligenciado
O SWE-bench mede, na verdade, o desempenho geral do "modelo + arcabouço". Diferentes frameworks de agente e diferentes configurações de cadeia de ferramentas podem fazer com que o mesmo modelo obtenha pontuações muito diferentes. Portanto, não se pode simplesmente olhar para a pontuação e concluir que "o Modelo A é melhor que o Modelo B".
Para lidar com o problema da saturação de pontuações, os pesquisadores introduziram:
- SWE-bench PRO: Um subconjunto mais rigoroso
- SWE-bench Live: Atualização mensal com novas perguntas para evitar contaminação de dados
De 30% no início de 2024 para mais de 80% em 2026, o número quase triplicou em dois anos. A velocidade do progresso é realmente impressionante, mas ainda estamos longe de "substituir completamente os programadores" — esses benchmarks testam issues individuais bem definidas, enquanto a maior parte do tempo no desenvolvimento de software real é gasta em compreensão de requisitos, design de arquitetura e comunicação em equipe — áreas que o benchmark não cobre.
Fontes de referência: CocoLoop, SWE-bench oficial, Ranking LocalAIMaster