Zhipu lanzó GLM-5.3-FlashX el 18 de septiembre, con la API disponible en paralelo, bajo el identificador GLM-5.3-FlashX. El único indicador oficial publicado es la velocidad máxima de salida de 200 tokens por segundo, que según Zhipu es cinco veces la del actual GLM-5.3-Flash.
La capacidad del modelo en esta gama no ha cambiado. Según la documentación abierta, Flash y FlashX comparten las mismas especificaciones: ventana de contexto de 1 millón de tokens, salida máxima de 128.000 tokens, entrada compatible con video, imagen, texto y archivos, salida en texto, además de modo de razonamiento, llamada a herramientas, transmisión en streaming, caché de contexto y salida estructurada en JSON. La diferencia queda clara: FlashX gana en throughput, Flash mantiene el precio más bajo.
El precio sube junto con la velocidad
Según reportes públicos, el precio es de 2 yuanes por millón de tokens de entrada y 7 yuanes por millón de tokens de salida, equivalente a 2,5 veces la gama Flash original. Zhipu no destacó este punto en el anuncio oficial, y en redes sociales la discusión gira casi por completo en torno a este intercambio de velocidad por costo.
Calculando hacia atrás con el factor 2,5, el precio de salida de la gama Flash queda en torno a 2,8 yuanes por millón de tokens. Para un negocio de agentes que consume en promedio 1.000 millones de tokens de salida al día, el costo mensual de salida con Flash ronda los 84.000 yuanes, y con FlashX ronda los 210.000 yuanes: la diferencia de 126.000 yuanes compra el mismo volumen de trabajo, solo que más rápido. Si vale la pena depende de si el negocio está limitado por la latencia del primer token y la longitud de la cola: en productos conversacionales, subtítulos en tiempo real o autocompletado de código, donde un segundo de retraso ya pesa, 200 tokens por segundo y poco más de cuarenta tokens por segundo son dos experiencias completamente distintas; en procesamiento por lotes fuera de línea, análisis de documentos o ejecuciones nocturnas de datos, donde unos minutos más no cuestan nada, seguir con Flash sigue siendo lo más adecuado.
De dónde salen los 200 tokens por segundo
La explicación de Zhipu es que, sobre la base de la capacidad de inferencia de 100.000 chips nacionales, se reforzó la optimización de inferencia. La frase queda sin desglosar: el anuncio no dice si la optimización está en la decodificación especulativa, la planificación paralela o la organización de memoria; tampoco se aclara si la cifra de 100.000 chips cubre solo el clúster propio o incluye socios.
El predecesor de FlashX tiene un historial público. GLM-5.3-Flash circuló un tiempo bajo el nombre en clave Ox Alpha entre desarrolladores extranjeros, con un volumen de llamadas que Zhipu llegó a afirmar que superaba el doble del de DeepSeek. De Ox Alpha a Flash y luego a FlashX, el patrón de Zhipu en esta línea es consistente: primero usar precios bajos para acumular volumen de llamadas, entender la forma real de la carga, y después cobrar por niveles de velocidad. Cuando se lanzó la versión oficial de GLM-5.3, el precio de salida por millón de tokens era de 4,4 dólares; la gama Flash redujo los parámetros activados a 18.000 millones para comprimir costos; FlashX es un peldaño más en la misma curva, hacia el lado de la velocidad.
Lo que señala esta subida de precio
El movimiento por defecto de los grandes modelos chinos en el último año y pico ha sido bajar precios: quien baja primero se lleva el volumen. FlashX hace lo contrario: misma capacidad, precio más alto, vendido como velocidad. Esto solo funciona si la oferta del lado de la inferencia deja de ser infinitamente barata, y el margen de concurrencia del clúster se convierte en algo que se puede tasar por sí mismo.
Que esto se sostenga depende de dos cosas: si los competidores nacionales de la misma gama suben precios en las próximas semanas, y si FlashX logra mantener el tope de 200 tokens por segundo en horarios de alta concurrencia. Por ahora no hay datos públicos de pruebas de carga de terceros.
Fuentes: documentación de la plataforma abierta de Zhipu, anuncio oficial de Zhipu, CocoLoop, Sina Technology, Chinaz; las especificaciones de velocidad y contexto se verificaron con la documentación oficial, los precios según reportes públicos.