阿里通義千問團隊將旗艦模型Qwen3.8-Max更新到0902版,針對程式撰寫與專業辦公任務追加了一輪後訓練。在Code Arena的前端程式總排行榜上,這個版本拿下1691分登上榜首,比上一版高出22分。
阿里同時公布的另一個數字,更能說明它想搶佔的位置:新版本每百萬token的綜合均價約5美元,而排行榜緊追在後的第二名與第三名分別要價20美元與12美元。
22分與15美元
排行榜前段的分差其實已經很小。1691分與上一版之間只相差22分,這種量級的差距,在人類盲測評分裡往往一兩週就會被對手追平。真正拉開距離的是右邊那一欄:同樣一次前端任務,換成排行榜第二名的模型,帳單會直接翻四倍。
根據公開報導,新版本的API報價為每百萬輸入token 2美元、輸出6美元。把這兩個數字拿去對照官方公布的5美元綜合均價倒推(粗估),輸出token大約要佔到整體用量的四分之三,才會得出5這個數字。這個比例對前端程式類任務來說並不奇怪:提示詞往往只有幾百行的上下文,模型吐出來的卻是整頁的元件程式碼,輸出端自然吃掉用量大頭。5美元這個均價,是按「寫程式」的真實用量結構算出來的,換成長文件摘要那種輸入重、輸出輕的工作,實際單價還會更低。
對中國國內團隊來說,這條價格線的參照系相當清楚。過去一年把Agent程式開發接進正式流程的公司,卡關的地方往往在財務這一關:模型寫得對不對早就不是問題,一天下來動輒數百萬token的呼叫量累積起來,帳單能不能核准才是關鍵。分數追平前段班、價格砍到只剩四分之一,這個組合對採購決策的影響,比單純多22分要大得多。
2.4兆參數,950億在運作
0902版背後的底層模型是Qwen3.8-2.4T-A95B。總參數量2.4兆,每次前向運算實際只啟動約950億——走的是典型的稀疏MoE(混合專家)路線。512個專家裡,每個token會啟動11個,其中10個經路由挑選、1個是共用專家。
架構上的選擇也偏向長任務。模型共23層,Gated DeltaNet與Gated Attention交替排列,原生上下文長度262144個token,可延伸到約101萬。線性注意力與閘控注意力混合使用,是過去半年中國國內幾家做長上下文的團隊都在走的方向,目的很直接:把長上下文帶來的記憶體與推論成本壓到能商轉的區間,否則100萬上下文就只是規格表上好看的數字。
啟動比例也解釋了那個5美元從哪裡來。2.4兆的總參數決定模型的知識容量,950億的啟動量決定每次呼叫要付多少「電費」,稀疏度拉到這種程度,單位推論成本自然比同規模的稠密模型低上一大截。
API已鋪到自家全產品線
新版本現在可以在千問AI平台的API服務裡直接呼叫,同時也已經接進千問辦公、Qoder與千問App。企業客戶、開發者與一般使用者三條通路一次打通,沒有留任何漸進開放的空窗期。
阿里對這個版本的定位是「更適合企業的真實複雜任務、科學研究、長週期任務等」,並宣稱模型在多步驟推理、工具呼叫、端到端App生成上「刷新了全球模型的新上限」。後半句是廠商自己的說法,但前半句提到的「長週期任務」,倒是和101萬上下文、稀疏啟動這兩個技術選擇對得上——能一次裝下整個程式碼庫、又不至於把成本燒穿,才談得上讓模型連續運作好幾個小時。
命名方式也透露出節奏。Qwen3.8-Max用日期當子版本號,說明阿里在Max這條閉源產品線上採取的是小步快跑的迭代節奏,模型世代不變、能力持續疊加。從3.6-Max轉為閉源開始,Max系列的角色就與開源的Flash系列分工:一個負責搶佔排行榜與企業預算,一個負責擴大開發者生態。這次0902版把價格壓到排行榜前段的四分之一,等於把兩條產品線的分工又拉得更緊了一格。
參考來源:阿里通義千問官方公告、CocoLoop、Code Arena前端程式排行榜頁面、IT之家、Hugging Face模型卡;1691分與22分增幅、5/20/12美元的每百萬token綜合均價口徑、2.4兆總參數與950億啟動參數,均逐項核對過。