騰訊混元開源推理加速框架

騰訊混元在 7 月 29 日開源 AngelSpec。它面向的不是普通聊天使用者,而是大模型服務的底層推理鏈路:訓練 speculative decoding 的 drafter,讓生成少走幾輪串行計算。

它想加速什麼

第一財經確認,騰訊混元同步開放 Hy3-A21B 的 MTP 與 DFly drafter 權重及訓練程式碼。GitHub 顯示,AngelSpec v0.1.0 支援 MTP 與 block-parallel speculative decoding training。

論文寫道:“We release the AngelSpec framework to support training and extending these speculative-decoding methods.” 工程語境下,這代表 drafter 不再只是一次性實驗,而是一套可訓練、可替換配置、可評測的工具箱。

數字有清楚口徑

arXiv 報告稱,在 Hy3-A21B 上,DFly 將平均接受長度提高約 30%;在並發 4 到 64 的測試點上取得最高平均吞吐;相對自回歸解碼端到端加速 1.98 到 2.40 倍,相對 DFlash 吞吐提升 10.5% 到 11.8%。

GitHub benchmark 補充,離線吞吐使用 HY3-295B-A21B、TP=8、temperature 1,每個單元使用 3 個 120 秒窗口;線上 D-cut 負載標註為 8x H20,並發 2 到 64。這讓本地與線上數字不會被混成同一指標。

競爭轉向推理系統

對開發者來說,AngelSpec 的價值在於提供可追蹤的實驗基線:聊天、程式碼、數學和 Agent 工作負載應該用哪類 drafter,接受長度與驗證成本如何隨並發變化。

如果第三方能復現這些收益,國產大模型競爭會從參數和榜單,往吞吐、尾延遲、顯存與多租戶穩定性推進。

參考來源:第一財經、騰訊 AngelSpec GitHub、arXiv:2607.25852、CocoLoop、Hugging Face;核驗開源範圍、Hy3-A21B TP=8 離線吞吐、8x H20 線上負載、並發 4-64、drafter 權重與 Apache 2.0 許可口徑。