Descifrando SWE-bench: ¿Qué mide realmente este benchmark?

SWE-bench se ha convertido en la "nota de corte de la selectividad" para las habilidades de programación de IA — cada nuevo modelo lanzado debe publicar este número. Pero, ¿qué examina realmente este benchmark? ¿Superar el 80% significa que la IA realmente puede trabajar como programadora?

Método de prueba

SWE-bench utiliza issues reales de GitHub. Extrae informes de errores reales y solicitudes de funciones de proyectos conocidos como Django, Flask, Requests y Matplotlib, y pide a los modelos de IA que generen parches para solucionarlos. Después de la reparación, se ejecutan las pruebas unitarias del propio proyecto; si se superan, se considera un éxito.

El subconjunto Verified tiene 500 tareas, cada una ejecutada en un contenedor Docker independiente para garantizar el aislamiento del entorno.

Clasificación actual

A marzo de 2026:

ModeloPuntuación Verified
Claude Opus 4.580,9%
Claude Opus 4.680,8%
Gemini 3.1 Pro80,6%
MiniMax M2.580,2%
GPT-5.280,0%
DeepSeek V3.2-exp60,0%
Qwen 355,0%

El grupo líder ya ha superado la marca del 80%, mientras que el grupo inferior aún se encuentra entre el 55% y el 60%. La brecha es evidente.

Un problema que se pasa por alto fácilmente

SWE-bench mide en realidad el rendimiento general del "modelo + andamiaje". Diferentes marcos de agente y diferentes configuraciones de cadena de herramientas pueden hacer que un mismo modelo obtenga puntuaciones muy diferentes. Por lo tanto, no se puede simplemente mirar la puntuación y concluir que "el Modelo A es mejor que el Modelo B".

Para abordar el problema de la saturación de puntuaciones, los investigadores introdujeron:

  • SWE-bench PRO: Un subconjunto más estricto
  • SWE-bench Live: Actualización mensual con nuevas preguntas para evitar la contaminación de datos

Del 30% a principios de 2024 a más del 80% en 2026, la cifra casi se ha triplicado en dos años. La velocidad del progreso es realmente impresionante, pero aún estamos lejos de "reemplazar completamente a los programadores" — estos benchmarks prueban issues individuales bien definidos, mientras que la mayor parte del tiempo en el desarrollo de software real se dedica a la comprensión de requisitos, el diseño de arquitectura y la comunicación en equipo — áreas que el benchmark no cubre.

Fuentes de referencia: CocoLoop, SWE-bench oficial, Ranking LocalAIMaster