智譜(Zhipu)9月18日上線 GLM-5.3-FlashX,API同步開放,模型代號為GLM-5.3-FlashX。官方公佈的指標只有一項:輸出速度最高每秒200個token,依智譜的說法,是現有GLM-5.3-Flash的5倍。
模型能力這一檔並沒有調整。開放平台文件顯示,Flash與FlashX共用同一套規格:100萬token的上下文長度、最大輸出12.8萬token,輸入支援影片、圖片、文字與檔案,輸出則為文字,並支援思考模式、工具呼叫、串流回應、上下文快取與JSON結構化輸出。兩者差異寫得很直白:FlashX換來的是吞吐量,Flash守住的是單價。
價格跟著速度一起漲
公開報導給出的定價是每發百token輸入2元、輸出7元,相當於原本Flash檔的2.5倍。智譜在公告裡並未特別強調這一點,社群平台上的討論幾乎都集中在「速度換成本」這個對價關係上。
以2.5倍反推,Flash檔的輸出單價粗估在每發百token 2.8元左右。以一個每日消茀10億輸出token的代理(Agent)業務為例,輸出端走Flash一個月約8.4萬元,改用FlashX則約21萬元,多出來的12.6萬元買的是同一批工作做得更快。划不划算,取決於業務是否被首個token延遲與排隊長度卡住:對話式產品、即時字幕、程式碼自動完成這類一秒都拖不得的場景,每秒200個token與四十幾個token是完全不同等級的體驗;離線批次處理、文件解析、夜間跥批這類慢個幾分鐘也無妒的工作,繼續Flash仍是比較划算的選擇。
每秒200個token從哪裡來
智譜給出的解釋是,在10萬張國產晶片的推理算力基礎上,加大了推理優化的力道。這句話並沒有進一步拆解:優化究竟是落在推測解碼、並行排程還是顯示記憶體編排上,公告沒有說明;10萬張這個口徑涵蓋的是自有叢集,還是連合作夥伴的產能都算進去,同樣沒有揭露。
FlashX的前身在海外有一段對外的經歷。GLM-5.3-Flash曾以Ox Alpha的代號在海外開發者圈裡跑過一輪,呼叫量一度被智譜稱超過DeepSeek的兩倍。從Ox Alpha到Flash再到FlashX,智譜在這條產品線上的動作相當一致:先用低價把呼叫量衝起來,摸清楚真實負載的樣貌,再按速度分檔收費。GLM-5.3正式版上線時,發百token輸出報價是4.4美元;Flash檔把啟用參數砍到180億以壓低成本;FlashX則是在同一條曲線上,往速度那一端再走一格。
漲價這件事透露的訊號
過去一年多,中國大型語言模型業者的預設動作是降價,誰先降誰就探到用量。FlashX反其道而行,同一份能力標出更高的價,賣點寫成速度。這樣的操作能成立,前提是推理端的供給不再是無限便宜,叢集裡的並發餘裕本身變成了可以定價的資源。
能不能站得住腳,要看兩件事:同檔次的國產竞品會不會在接下來幾週跟進漲價,以及FlashX在高並發時段能不能守住每秒200個token的上限。第三方壓力測試數據目前還沒有公開。
參考來源:智譜開放平台文件、智譜官方公告、CocoLoop、新浪科技、站長之家;速度與上下文規格已按官方文件核對,定價依公開報導口徑。