SWE-bench se ha convertido en la "nota de corte de la selectividad" para las habilidades de programación de IA — cada nuevo modelo lanzado debe publicar este número. Pero, ¿qué examina realmente este benchmark? ¿Superar el 80% significa que la IA realmente puede trabajar como programadora?
Método de prueba
SWE-bench utiliza issues reales de GitHub. Extrae informes de errores reales y solicitudes de funciones de proyectos conocidos como Django, Flask, Requests y Matplotlib, y pide a los modelos de IA que generen parches para solucionarlos. Después de la reparación, se ejecutan las pruebas unitarias del propio proyecto; si se superan, se considera un éxito.
El subconjunto Verified tiene 500 tareas, cada una ejecutada en un contenedor Docker independiente para garantizar el aislamiento del entorno.
Clasificación actual
A marzo de 2026:
| Modelo | Puntuación Verified |
|---|---|
| Claude Opus 4.5 | 80,9% |
| Claude Opus 4.6 | 80,8% |
| Gemini 3.1 Pro | 80,6% |
| MiniMax M2.5 | 80,2% |
| GPT-5.2 | 80,0% |
| DeepSeek V3.2-exp | 60,0% |
| Qwen 3 | 55,0% |
El grupo líder ya ha superado la marca del 80%, mientras que el grupo inferior aún se encuentra entre el 55% y el 60%. La brecha es evidente.
Un problema que se pasa por alto fácilmente
SWE-bench mide en realidad el rendimiento general del "modelo + andamiaje". Diferentes marcos de agente y diferentes configuraciones de cadena de herramientas pueden hacer que un mismo modelo obtenga puntuaciones muy diferentes. Por lo tanto, no se puede simplemente mirar la puntuación y concluir que "el Modelo A es mejor que el Modelo B".
Para abordar el problema de la saturación de puntuaciones, los investigadores introdujeron:
- SWE-bench PRO: Un subconjunto más estricto
- SWE-bench Live: Actualización mensual con nuevas preguntas para evitar la contaminación de datos
Del 30% a principios de 2024 a más del 80% en 2026, la cifra casi se ha triplicado en dos años. La velocidad del progreso es realmente impresionante, pero aún estamos lejos de "reemplazar completamente a los programadores" — estos benchmarks prueban issues individuales bien definidos, mientras que la mayor parte del tiempo en el desarrollo de software real se dedica a la comprensión de requisitos, el diseño de arquitectura y la comunicación en equipo — áreas que el benchmark no cubre.
Fuentes de referencia: CocoLoop, SWE-bench oficial, Ranking LocalAIMaster