Zhipu lanza la API de GLM-5.3, a 4,4 dólares por millón de tokens de salida

Zhipu lanzó GLM-5.3 el 14 de agosto, y la API se abrió oficialmente al acceso hacia el 18 de agosto: 1,40 dólares por millón de tokens de entrada, 4,40 dólares por millón de tokens de salida, con una ventana de contexto de 1 millón de tokens. Ese mismo día, la organización independiente de evaluación Artificial Analysis le asignó un Intelligence Index de 60 puntos, situándolo en el puesto 8 entre los 182 modelos que recoge; la mediana de los modelos de razonamiento en la misma franja de precio es de 35 puntos.

La primera capa de esta noticia es la puntuación; la segunda, ya después, es el precio. Si se ponen uno junto a otro varios modelos de pesos abiertos o de acceso público en la misma ronda de datos de Artificial Analysis: GLM-5.3 alcanza como máximo 59,5 puntos (la página del modelo redondea y muestra 60), cuesta 0,68 dólares por tarea y genera 41.107 tokens de salida por tarea; Kimi K3 alcanza como máximo 59,7 puntos, cuesta 0,84 dólares y genera 25.474 tokens; Qwen 3.8 Max marca 58,1 puntos, cuesta 1,13 dólares y genera 38.287 tokens; Grok 4.6 (high) de xAI marca 60,9 puntos, cuesta 0,84 dólares y genera 21.735 tokens. En puntuación, GLM-5.3 queda solo 0,2 puntos por detrás de Kimi K3, prácticamente empatado en la cabeza del grupo de pesos abiertos; pero para completar la misma tarea genera alrededor de un sesenta por ciento más de tokens, lo que erosiona parte de la ventaja de precio unitario por ser "más hablador" — aun así, convertido el costo, sigue siendo el más bajo del grupo con 0,68 dólares por tarea.

El día del lanzamiento, Zhipu puso el acento en programación y seguridad

En las notas de lanzamiento del 14 de agosto, Zhipu define GLM-5.3 como el resultado de un "post-entrenamiento extremo" sobre la misma base que GLM-5.2: el entorno y la duración del entrenamiento se ampliaron considerablemente, pero el modelo base no cambió. Los resultados presentados se concentran en tareas de programación y de agentes: Terminal Bench 3.0 pasó de 4,6 en GLM-5.2 a 28,3; DeepSWE v1.1 pasó de 46,2 a 66,9; Agents' Last Exam pasó de 23,8 a 28,5; en el propio Z.ai Code Bench (High) de Zhipu, la precisión fue del 31,4%, por encima del 29,5% que atribuyen a Claude Opus. La evaluación interna de la empresa sostiene que la capacidad de programación mejoró un 50% respecto a GLM-5.2.

"GLM-5.3 is the open-source model with the strongest programming ability."

Así se posiciona la propia Zhipu: el modelo con la mayor capacidad de programación dentro del campo del código abierto.

Otro punto destacado por separado es la capacidad de ciberseguridad. Zhipu afirma que durante el post-entrenamiento surgió una capacidad emergente de seguridad "por encima de lo esperado"; en la fase de pruebas de equipo rojo (red team) se encontraron en total 2.436 vulnerabilidades. En CyberGym obtuvo 84,5%, comparable al 83,8% de Mythos 5 de Anthropic; en ExploitBench obtuvo 54,4%, claramente por debajo del 78,0% de Mythos 5. Según la propia compañía, la cobertura se extiende más allá del software, hacia protocolos de internet y sistemas robóticos.

Los pesos se publicarán en dos semanas, con integración previa en herramientas de programación

El plan de código abierto contempla publicar los pesos en Hugging Face dentro de las dos semanas posteriores al lanzamiento (aproximadamente antes del 28 de agosto), siempre que se completen la evaluación de seguridad y el endurecimiento del modelo; los términos de la licencia aún no se han dado a conocer. Mientras tanto, el modelo se ofrece primero a través de la API y de un conjunto de herramientas de programación; entre los socios de integración que menciona Zhipu están ZCode y AutoClaw, además de plataformas de programación de terceros como TraeWork, WorkBuddy, Qoder y CatPaw.

La discusión en Hacker News en torno a los datos de Artificial Analysis aportó una perspectiva adicional desde el punto de vista de los usuarios: algunos desarrolladores consideran una ventaja que los tokens de razonamiento de GLM-5.3 sean visibles, ya que permite "detenerlo a tiempo cuando se desvía"; otros señalan directamente que su consumo de tokens es mayor que el de Kimi K3. Para los equipos que pagan por token, el precio unitario de 1,4/4,4 dólares debe multiplicarse por una salida más larga antes de comparar; fijarse solo en la lista de precios distorsiona la imagen real.

Las cuentas para los desarrolladores chinos

Situando este precio dentro de la secuencia de precios de los modelos nacionales chinos: cuando se lanzó GLM-5.2, se afirmaba que su puntuación en programación se acercaba a la de los modelos cerrados, con un precio equivalente a una sexta parte del de GPT-5.5; GLM-5.3 eleva un peldaño más la puntuación absoluta, manteniendo el precio unitario en el mismo rango. Para quienes usan la API en China, el verdadero punto de comparación son los precios de API de DeepSeek V4 Pro y Kimi K3, junto con los descuentos de horas punta y valle de cada proveedor; en puntuación, GLM-5.3 ya forma parte de esa conversación, y si eso desencadena o no una guerra de precios dependerá de las tarifas que se anuncien una vez se publiquen los pesos dentro de dos semanas y se integren las plataformas de inferencia de terceros.

Fuentes: notas de lanzamiento de GLM-5.3 de Zhipu, página del modelo en Artificial Analysis, CocoLoop, discusión en Hacker News, VentureBeat; se verificaron los precios de API de entrada/salida, la puntuación y el ranking del Intelligence Index, el costo por tarea y el criterio de conteo de tokens de salida (entorno de evaluación unificado de Artificial Analysis), las cifras oficiales de benchmark y el cronograma de apertura de los pesos.