El 7 de abril, Z.ai (anteriormente Zhipu AI) lanzó GLM-5.1, con 754B parámetros, arquitectura MoE y código abierto bajo licencia MIT.
Resultado de benchmark: SWE-Bench Pro 58,4%, primero a nivel mundial. GPT-5.4 tiene 57,7%, Claude Opus 4.6 tiene 57,3%.
Solo esta cifra es suficiente para generar revuelo: un modelo de código abierto supera a dos buques insignia cerrados en la dimensión de capacidad de programación. Pero lo más interesante es otro aspecto:
El entrenamiento de este modelo se realizó completamente en chips Huawei Ascend 910B y el framework MindSpore, sin ninguna GPU NVIDIA involucrada.
Parámetros técnicos del modelo
Primero, los indicadores técnicos:
| Parámetro | Valor |
|---|---|
| Total de parámetros | 754B |
| Parámetros activados por vez | 40B |
| Arquitectura | MoE + Dynamic Sparse Attention |
| Ventana de contexto | 200K tokens |
| Salida máxima | 131072 tokens |
| Tamaño del archivo del modelo | 1,51 TB (HuggingFace) |
| Licencia | MIT |
Resultados de algunos benchmarks:
- SWE-Bench Pro: 58,4% (primero a nivel mundial)
- CyberGym: 68,7%
- BrowseComp: 68,0%
- AIME 2026: 95,3%
SWE-Bench Pro mide la reparación de issues reales de GitHub, no conjuntos de datos sintéticos que se pueden manipular fácilmente para obtener puntuaciones altas. El 58,4% tiene valor real.
Agente con capacidad de 8 horas
GLM-5.1 tiene una capacidad poco mencionada pero importante: capacidad de ejecución autónoma.
La descripción oficial es "ejecución independiente de tareas durante más de 8 horas, abarcando cientos de rondas de operaciones y miles de llamadas a herramientas" — puede trabajar continuamente durante más de 8 horas, procesando cientos de rondas de tareas y miles de llamadas a herramientas.
La mayoría de los modelos en tareas complejas de agente pierden el control después de unas pocas docenas de rondas: la ventana de contexto se llena, el razonamiento comienza a fallar, las llamadas a herramientas entran en bucle. GLM-5.1 fue claramente optimizado para esto, no solo confiando en una gran ventana de contexto.
Esto es un avance sustancial para la implementación de Agentes a nivel empresarial, no solo una puntuación de benchmark.
Lo más destacable: Sin NVIDIA
Hardware de entrenamiento: Huawei Ascend 910B
Framework de entrenamiento: Huawei MindSpore
Esto no es un pequeño detalle.
Durante mucho tiempo, el camino óptimo para entrenar modelos a gran escala era casi exclusivamente CUDA de NVIDIA. H100, H800, A100 — se usaba lo que estuviera disponible, y MindSpore siempre tuvo una brecha significativa en madurez de ingeniería en comparación con PyTorch.
GLM-5.1 demostró que este camino es viable: no solo funcionó, sino que entrenó un modelo que derrota a GPT-5.4 y Claude Opus 4.6.
"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents
El significado político de esto es tan grande como el técnico. Las restricciones de exportación de chips de IA de EE. UU. a China son ahora una restricción de producción real, no una amenaza futura. GLM-5.1 es un resultado experimental: lo que los equipos de IA chinos pueden lograr bajo condiciones de recursos computacionales limitados.
La respuesta actualmente es: primero a nivel mundial en SWE-Bench Pro, código abierto bajo licencia MIT, precio de API $1,26/M token.
Comparación de precios
Precios de API de GLM-5.1:
- Entrada: $1,26/M tokens
- Salida: $3,96/M tokens
Como comparación: Claude Opus 4.6 cuesta alrededor de $15/$75, GPT-5.4 está en el mismo rango.
La capacidad de programación líder mundial en SWE-Bench Pro a este precio hace que la elección sea clara para los desarrolladores de infraestructura de programación con IA.
Por supuesto, SWE-Bench Pro no representa todos los escenarios. GLM-5.1 todavía está por detrás de los principales modelos cerrados en razonamiento matemático y benchmarks generales, el artículo original no lo oculta. No es un campeón versátil, sino un modelo especializado que se diferencia en la dirección Programación + Agente.
Una tendencia digna de mención
En el último año, modelos de código abierto chinos como Z.ai (GLM-5.1), DeepSeek (V3.2) y Kimi K2 han alcanzado sucesivamente la cima en varios benchmarks especializados, bajo licencias MIT o Apache, con precios de API que aplastan a los competidores cerrados.
Meta anunció cierre parcial, OpenAI nunca abrió realmente sus buques insignia — mientras que las empresas chinas continúan publicando los pesos.
Esta configuración era casi inimaginable a principios de 2025.
Fuente de referencia: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)