智谱 9 月 18 日上线 GLM-5.3-FlashX,API 同步开放,模型标识 GLM-5.3-FlashX。官方端出来的指标只有一个:输出速度最高 200 tokens/s,按智谱的说法,是现有 GLM-5.3-Flash 的 5 倍。
模型能力这一档没有动。开放文档里 Flash 与 FlashX 共用同一套规格:100 万 token 上下文、最大输出 12.8 万 token,输入支持视频、图像、文本和文件,输出为文本,支持思考模式、工具调用、流式返回、上下文缓存和 JSON 结构化输出。两者的差别写得直白,FlashX 换来的是吞吐,Flash 保的是单价。
价格跟着速度一起抬
公开报道给出的定价是每百万 token 输入 2 元、输出 7 元,相当于原 Flash 档的 2.5 倍。智谱在公告里没有强调这一点,社交平台上的讨论几乎全落在”速度换成本”这个对价上。
按 2.5 倍倒推,Flash 档的输出价粗算在每百万 token 2.8 元左右。一个日均消耗 10 亿输出 token 的 Agent 业务,输出侧走 Flash 一个月约 8.4 万元,换到 FlashX 约 21 万元,差出来的 12.6 万元买的是同一批活干得更快。划不划算取决于业务是不是被首 token 延迟和排队长度卡着:对话式产品、实时字幕、代码补全这些一秒都拖不起的场景,200 tokens/s 和四十几 tokens/s 是两类体验;离线批处理、文档解析、夜间跑数多等几分钟没有代价,继续用 Flash 更合适。
200 tokens/s 从哪来
智谱给的解释是在 10 万张国产芯片的推理算力基础上加大推理优化。这句话没有拆开:优化落在投机解码、并行调度还是显存编排,公告没有说;10 万张这个口径覆盖的是自有集群还是含合作方,同样没有披露。
FlashX 的前身有一条对外的履历。GLM-5.3-Flash 曾以 Ox Alpha 的代号在海外开发者圈里跑过一轮,调用量一度被智谱称为超过 DeepSeek 的两倍。从 Ox Alpha 到 Flash 再到 FlashX,智谱这条线的动作很一致:先用低价把调用量堆起来,摸清真实负载的形状,再按速度切档收钱。GLM-5.3 正式版上线时,百万 token 输出标的是 4.4 美元;Flash 档把激活参数砍到 180 亿压成本;FlashX 是同一条曲线上往速度那头走的一格。
抬价这件事的信号
国产大模型这一年多的默认动作是降价,谁先降谁抢量。FlashX 反着来,同一份能力标了更高的价,卖点写成速度。这么干成立的前提是推理侧的供给不再无限便宜,集群里的并发余量本身变成了可以定价的东西。
能不能站住,看两件事:同档国产竞品会不会在随后几周跟着调价,以及 FlashX 在高并发时段能不能守住 200 tokens/s 的上限。第三方压测数据目前还没有公开。
参考来源:智谱开放平台文档、智谱官方公告、CocoLoop、新浪科技、站长之家;速度与上下文规格按官方文档核对,定价按公开报道口径。