GLM-5.1 lidera SWE-Bench Pro, entrenado completamente en Huawei Ascend

El 7 de abril, Z.ai (anteriormente Zhipu AI) lanzó GLM-5.1, con 754B parámetros, arquitectura MoE y código abierto bajo licencia MIT.

Resultado de benchmark: SWE-Bench Pro 58,4%, primero a nivel mundial. GPT-5.4 tiene 57,7%, Claude Opus 4.6 tiene 57,3%.

Solo esta cifra es suficiente para generar revuelo: un modelo de código abierto supera a dos buques insignia cerrados en la dimensión de capacidad de programación. Pero lo más interesante es otro aspecto:

El entrenamiento de este modelo se realizó completamente en chips Huawei Ascend 910B y el framework MindSpore, sin ninguna GPU NVIDIA involucrada.

Parámetros técnicos del modelo

Primero, los indicadores técnicos:

Parámetro Valor
Total de parámetros 754B
Parámetros activados por vez 40B
Arquitectura MoE + Dynamic Sparse Attention
Ventana de contexto 200K tokens
Salida máxima 131072 tokens
Tamaño del archivo del modelo 1,51 TB (HuggingFace)
Licencia MIT

Resultados de algunos benchmarks:

  • SWE-Bench Pro: 58,4% (primero a nivel mundial)
  • CyberGym: 68,7%
  • BrowseComp: 68,0%
  • AIME 2026: 95,3%

SWE-Bench Pro mide la reparación de issues reales de GitHub, no conjuntos de datos sintéticos que se pueden manipular fácilmente para obtener puntuaciones altas. El 58,4% tiene valor real.

Agente con capacidad de 8 horas

GLM-5.1 tiene una capacidad poco mencionada pero importante: capacidad de ejecución autónoma.

La descripción oficial es "ejecución independiente de tareas durante más de 8 horas, abarcando cientos de rondas de operaciones y miles de llamadas a herramientas" — puede trabajar continuamente durante más de 8 horas, procesando cientos de rondas de tareas y miles de llamadas a herramientas.

La mayoría de los modelos en tareas complejas de agente pierden el control después de unas pocas docenas de rondas: la ventana de contexto se llena, el razonamiento comienza a fallar, las llamadas a herramientas entran en bucle. GLM-5.1 fue claramente optimizado para esto, no solo confiando en una gran ventana de contexto.

Esto es un avance sustancial para la implementación de Agentes a nivel empresarial, no solo una puntuación de benchmark.

Lo más destacable: Sin NVIDIA

Hardware de entrenamiento: Huawei Ascend 910B
Framework de entrenamiento: Huawei MindSpore

Esto no es un pequeño detalle.

Durante mucho tiempo, el camino óptimo para entrenar modelos a gran escala era casi exclusivamente CUDA de NVIDIA. H100, H800, A100 — se usaba lo que estuviera disponible, y MindSpore siempre tuvo una brecha significativa en madurez de ingeniería en comparación con PyTorch.

GLM-5.1 demostró que este camino es viable: no solo funcionó, sino que entrenó un modelo que derrota a GPT-5.4 y Claude Opus 4.6.

"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents

El significado político de esto es tan grande como el técnico. Las restricciones de exportación de chips de IA de EE. UU. a China son ahora una restricción de producción real, no una amenaza futura. GLM-5.1 es un resultado experimental: lo que los equipos de IA chinos pueden lograr bajo condiciones de recursos computacionales limitados.

La respuesta actualmente es: primero a nivel mundial en SWE-Bench Pro, código abierto bajo licencia MIT, precio de API $1,26/M token.

Comparación de precios

Precios de API de GLM-5.1:

  • Entrada: $1,26/M tokens
  • Salida: $3,96/M tokens

Como comparación: Claude Opus 4.6 cuesta alrededor de $15/$75, GPT-5.4 está en el mismo rango.

La capacidad de programación líder mundial en SWE-Bench Pro a este precio hace que la elección sea clara para los desarrolladores de infraestructura de programación con IA.

Por supuesto, SWE-Bench Pro no representa todos los escenarios. GLM-5.1 todavía está por detrás de los principales modelos cerrados en razonamiento matemático y benchmarks generales, el artículo original no lo oculta. No es un campeón versátil, sino un modelo especializado que se diferencia en la dirección Programación + Agente.

Una tendencia digna de mención

En el último año, modelos de código abierto chinos como Z.ai (GLM-5.1), DeepSeek (V3.2) y Kimi K2 han alcanzado sucesivamente la cima en varios benchmarks especializados, bajo licencias MIT o Apache, con precios de API que aplastan a los competidores cerrados.

Meta anunció cierre parcial, OpenAI nunca abrió realmente sus buques insignia — mientras que las empresas chinas continúan publicando los pesos.

Esta configuración era casi inimaginable a principios de 2025.

Fuente de referencia: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)