騰訊8月28日發布並開源混元Hy4 preview,總參數770B,每個token啟用49B,原生上下文視窗達1,048,576 tokens。模型權重以Apache 2.0授權放在Hugging Face、ModelScope、GitCode等平台,同時上線騰訊雲TokenHub、OpenRouter,以及騰訊自家的WorkBuddy/CodeBuddy、元寶和ima。騰訊給它的定位是「Hy4迭代的一個早期版本」,官方說法是「穩居開源模型第一梯隊」。
從模型卡來看,Hy4 preview是一套典型的高稀疏MoE架構:78層裡只有1層是稠密FFN,其餘77層走專家路由,每層配置256個路由專家加1個共用專家,每個token挑選8個路由專家。隱藏層寬度6144,詞表120832。注意力部分採用了帶IndexCache的閘控稀疏注意力,查詢壓縮到2048維、鍵值壓縮到512維,搭配4條iHC殘差流。部署端支援vLLM和SGLang,並預設開啟MTP投機解碼。
6.4%啟用率背後的一筆算力帳
49B除以770B,啟用率約6.4%。這個數字是理解整個模型定價的關鍵——參數總量決定顯存與載入成本,啟用量決定每token的實際運算量。騰訊把兩者拉開了15倍以上的差距,換來的是一份不算貴的價目表:輸入每百萬tokens 6元人民幣(約0.834美元),輸出18元(約2.501美元),快取命中0.3元。
這個價位放在中國開源陣營裡屬於中檔。同一週發布的GLM-5.3-Flash輸入價格低到每百萬tokens 0.075美元,是Hy4 preview的十一分之一,但那是18B啟用參數的輕量級;Hy4 preview鎖定的是需要跨檔案讀程式碼、跨文件做分析的重活。兩者不在同一條賽道上,混著比價沒有意義。
真正的成本變數藏在1M上下文裡。把一百萬tokens灌滿一次輸入,按牌價粗算約6元人民幣,快取命中後降到0.3元——快取價只有原價的二十分之一,這個折扣幅度基本上是在告訴開發者:把長上下文當常駐工作區用,別每次重傳。
那0.07分該怎麼解讀
騰訊給出的盲測結果是:163位內部專家評了203個工程任務,Hy4 preview平均2.99分(滿分4分),GLM-5.3為2.92分,Kimi K3為2.94分。
分差很小,勝負分布反而更有資訊量。對GLM-5.3,Hy4 preview勝46.8%、平12.8%、負40.4%;對Kimi K3,勝51.2%、平7.9%、負40.9%。兩組對局裡輸掉的比例都在四成上下,也就是說在近一半的具體任務上,對手表現更好。三個模型咬得很緊,誰也沒拉開差距。
還有兩個限制條件不能省:評審是騰訊內部專家,任務集也由騰訊選定,這類自辦盲測天然帶有主場優勢;203個任務的樣本數,落到0.05到0.07分的差距上,統計意義相當有限。
公開基準的數字更能橫向比對:SWE-bench Multilingual 82.9、SWE-bench Pro 65.7、Terminal-Bench 2.1拿到85.4、GPQA Diamond 92.3、帶工具的HLE 55.4。SWE-bench Pro這一項一直是各家掉分最兇的地方,65.7在目前開源模型裡屬於第一梯隊。
押注長週期任務
騰訊把這個模型的主攻方向講得很直白:長週期軟體工程、跨檔案辦公分析、遊戲開發和科學研究。模型提供high和no_think兩種推理模式,前者用於需要長鏈條思考的場景,後者用來省token。
官方拿出來當範例的一個例子是三維Blaschke–Lebesgue問題——模型把體積下界從0.380799推到了0.41104,距離Meissner四面體猜想的0.41986還差約2%。這類例子的說服力有限,屬於精心挑選的展示,但方向很清楚:騰訊想讓Hy4 preview進到研究工作流裡,不只是待在聊天框裡。
對中國開發者來說,實際影響是選項又多了一個。GLM-5.3、Kimi K3、DeepSeek-V4-Pro已經把開源長上下文這塊擠得很滿,Hy4 preview擠進來靠的是Apache 2.0的寬鬆授權加上騰訊雲的現成推理服務。授權這一點尤其關鍵——不少中國開源模型附加了商用限制條款,Apache 2.0意味著企業可以直接拿去改、去部署、去賣,不必另外談授權。
預覽版終究是預覽版。騰訊沒有給出正式版Hy4的時間表,也沒說預覽版和正式版之間會有多大差別。
參考來源:騰訊混元技術部落格、Hugging Face模型卡、IT之家、CocoLoop、DataLearner;模型參數、盲測口徑與API價格按官方模型卡與定價頁核實,價格換算按牌價粗估。