Zhipu libera GLM-5.3-Flash en código abierto y recorta parámetros activos a 18.000 millones

El 26 de agosto, Zhipu quitó la máscara a Ox Alpha, el modelo que llevaba más de una semana funcionando de forma anónima en OpenCode y OpenRouter. Su nombre oficial es GLM-5.3-Flash, y sus pesos se publicaron ese mismo día en HuggingFace bajo licencia MIT.

Es el primer miembro nativamente multimodal de la familia GLM-5. El total de parámetros es de 320.000 millones, pero cada token solo activa 18.000 millones; el número de capas bajó de las 92 de GLM-5.3 a 45, y los parámetros activos se redujeron de los 32.000 millones de la generación anterior a 18.000 millones. El ahorro de cómputo se traduce directamente en el precio: el precio oficial de lista es cerca de una décima parte del de GLM-5.3 y, durante el periodo promocional por tiempo limitado, se reduce otra vez a la mitad, lo que equivale aproximadamente a una cuarentava parte de Claude Opus 4.8. Según otro cálculo de Z.ai, al precio con descuento, completar una tarea cuesta en promedio 0,045 dólares.

Parámetros a la mitad, la puntuación no bajó con ellos

En el Intelligence Index v4.1.1 de Artificial Analysis, GLM-5.3-Flash obtuvo 57 puntos, entrando en el rango de los modelos de vanguardia mundial, al mismo nivel que Opus 4.8, el modelo más popular de Anthropic en este momento. Las diferencias entre pruebas individuales son más amplias: DeepSWE v1.1 subió de los 46,2 puntos de GLM-5.2 a 63,4; Terminal-Bench 2.1 alcanzó 84,3; Toolathlon Verified, 78,4; y AutomationBench v1.0.6, 48,8. En el Z.ai Code Bench de la propia Zhipu, en el nivel de máxima dificultad, el modelo obtuvo 29,0, frente a 29,5 del grupo de control con Opus.

La multimodalidad es lo nuevo de esta generación: OfficeQA Pro llegó a 62,4, CharXiv con razonamiento asistido por herramientas a 89,4, Chartography con herramientas a 78,0, y en vídeo, MVBench marcó 77,8 y MMVU, 80,5. Esta combinación apunta más a un "agente de oficina capaz de entender tablas y planos" que a una exhibición de puntuaciones de comprensión de imágenes en general.

En cuanto a arquitectura, es el primer modelo abierto de vanguardia que combina atención dispersa (sparse attention) y atención lineal (linear attention), e introduce además IndexPool y mHC (hiperconexiones con restricción de variedad). El efecto se refleja en dos cifras: comparado con GLM-5.3, el cómputo de atención se reduce a cerca de un tercio (una reducción de 3,0 veces), y la caché KV se reduce a cerca de una cuarta parte (una reducción de 4,4 veces). En contextos largos, el mayor coste recae precisamente en la caché KV; esa proporción es la que determina si una ventana de 1 millón de tokens es realmente utilizable o solo una cifra en la ficha técnica.

Todo el tráfico corre sobre chips nacionales

Durante el periodo de pruebas anónimo, Ox Alpha llegó a ser, por momentos, el modelo más invocado en OpenCode. Zhipu afirma que todo el tráfico de inferencia de ese periodo fue atendido por chips de IA nacionales chinos, que el rendimiento del servicio de extremo a extremo mejoró 3 veces respecto a antes, y que los costes ya están a la par de las soluciones convencionales con GPU de Nvidia.

Este dato no vale menos que las puntuaciones de los benchmarks. La narrativa dominante sobre los modelos abiertos chinos durante el último año era "puntuaciones cercanas, pero el despliegue todavía depende de las tarjetas de la serie H"; en cuanto el lado de inferencia pueda funcionar a plena carga en silicio nacional con un coste unitario equiparable, el margen de precios de los fabricantes de modelos deja de estar limitado por el precio de adquisición de las tarjetas. Parte de la confianza de Zhipu para bajar el precio de lista a una décima parte de la generación anterior viene de ahí.

Un cálculo rápido: al precio promocional por tiempo limitado de 0,075 dólares por millón de tokens de entrada y 0,25 dólares por millón de tokens de salida, una aplicación de tipo Agent de tamaño mediano, con un consumo medio diario de 50 millones de tokens de entrada y 10 millones de salida, tendría una factura de modelo de alrededor de 6,25 dólares al día (cálculo aproximado, sin contar descuentos por caché ni reintentos por fallos). Con el mismo volumen de llamadas en Opus 4.8, la diferencia es de un orden de magnitud. Para los equipos chinos que desarrollan productos basados en Agent, esto devuelve la pregunta de "¿se puede llevar a producción?" del terreno del presupuesto al terreno de la ingeniería.

En el lado del despliegue, SGLang, vLLM y KTransformers ya son compatibles, y la API se puso en marcha simultáneamente en docs.z.ai. La licencia MIT es un paso poco habitual esta vez: las generaciones anteriores de GLM solían usar una licencia propia, mientras que bajo MIT la redistribución comercial casi no tiene condiciones adicionales, y los equipos fuera de China pueden modificarlo sin pasar de nuevo por el departamento legal.

Una semana antes, Zhipu ya había reconocido públicamente que Ox Alpha era su propia iteración, con datos que en ese momento mostraban un volumen de llamadas más del doble que DeepSeek. Ahora el nombre, los pesos y el precio están sobre la mesa; lo que queda por ver es cuántos equipos estarán dispuestos a pasarlo de "modelo de prueba barato" a modelo principal en producción.

Fuentes: blog oficial de Z.ai, página del modelo en HuggingFace, CocoLoop, Artificial Analysis; la escala de parámetros, las puntuaciones de los benchmarks y los precios de la API se han verificado según la página oficial de lanzamiento.