Decifrando o SWE-bench: O que esse benchmark realmente mede?

O SWE-bench se tornou a "nota de corte do vestibular" para habilidades de programação de IA — cada novo modelo lançado deve divulgar esse número. Mas o que esse benchmark realmente avalia? Atingir mais de 80% significa que a IA pode realmente trabalhar como programadora?

Método de teste

O SWE-bench usa issues reais do GitHub. Ele extrai relatórios de bugs reais e solicitações de funcionalidades de projetos conhecidos como Django, Flask, Requests e Matplotlib, e pede que modelos de IA gerem patches para corrigi-los. Após a correção, os testes de unidade do próprio projeto são executados; se forem aprovados, a tarefa é considerada bem-sucedida.

O subconjunto Verified tem 500 tarefas, cada uma executada em um contêiner Docker independente para garantir o isolamento do ambiente.

Ranking atual

Até março de 2026:

ModeloPontuação Verified
Claude Opus 4.580,9%
Claude Opus 4.680,8%
Gemini 3.1 Pro80,6%
MiniMax M2.580,2%
GPT-5.280,0%
DeepSeek V3.2-exp60,0%
Qwen 355,0%

O grupo da liderança já ultrapassou a marca dos 80%, enquanto o grupo inferior ainda está entre 55% e 60%. A diferença é evidente.

Um problema facilmente negligenciado

O SWE-bench mede, na verdade, o desempenho geral do "modelo + arcabouço". Diferentes frameworks de agente e diferentes configurações de cadeia de ferramentas podem fazer com que o mesmo modelo obtenha pontuações muito diferentes. Portanto, não se pode simplesmente olhar para a pontuação e concluir que "o Modelo A é melhor que o Modelo B".

Para lidar com o problema da saturação de pontuações, os pesquisadores introduziram:

  • SWE-bench PRO: Um subconjunto mais rigoroso
  • SWE-bench Live: Atualização mensal com novas perguntas para evitar contaminação de dados

De 30% no início de 2024 para mais de 80% em 2026, o número quase triplicou em dois anos. A velocidade do progresso é realmente impressionante, mas ainda estamos longe de "substituir completamente os programadores" — esses benchmarks testam issues individuais bem definidas, enquanto a maior parte do tempo no desenvolvimento de software real é gasta em compreensão de requisitos, design de arquitetura e comunicação em equipe — áreas que o benchmark não cobre.

Fontes de referência: CocoLoop, SWE-bench oficial, Ranking LocalAIMaster