腾讯混元开源推理加速框架

腾讯混元在 7 月 29 日把 AngelSpec 放到 GitHub 上。它不算面向普通用户的新聊天模型,作用更偏底层:训练和评测 speculative decoding 的 drafter,让大模型生成时少走几轮串行计算。

第一财经同日确认,腾讯混元团队正式开源 AngelSpec,并同步开放 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。GitHub 仓库显示,AngelSpec v0.1.0 支持 MTP 和 block-parallel speculative decoding training,技术报告挂在 arXiv:2607.25852。

这条新闻的抓手在于,国产大模型公司开始把推理加速从“论文技巧”推进到“可复用工程框架”。推理价格战已经打了半年,模型能力继续长大后,谁能把每个 token 的等待和成本压下去,谁才有条件承接 Agent、代码和长上下文服务。

它瞄准推理成本

推测解码的白话版是:先让一个较轻的 drafter 猜后面几个 token,再由目标大模型批量验收。猜对的部分直接提交,猜错的部分回到正常生成。目标分布不变,省的是等待时间。

AngelSpec 把这个过程拆成训练、架构和线上验证三层。论文原句写道:“We release the AngelSpec framework to support training and extending these speculative-decoding methods.” 放到工程语境里,就是把 drafter 从一次性实验样板,做成能训练、能换配置、能接推理引擎的工具箱。

GitHub README 列出的范围很具体:6 种 draft 架构放进同一条训练流水线,包含 DFly、DFlash、DFlare、Eagle3、DSpark 和 MTP;MTP 路径支持 TTT 训练,长上下文训练可到 128k;在线评测会用 serving engine 真实测 mean accepted length 和逐位置接受率。

这比只说“更快”要硬。因为 speculative decoding 常见的坑,恰好是离线指标好看,到了线上多并发、不同任务分布、硬件负载一变,收益就塌。AngelSpec 把评测服务器和训练流程绑在一起,是在补这个缺口。

DFly 押代码和数学

论文把不同任务分得很清楚。开放式聊天熵高,下一句合理答案很多,drafter 往深处猜的命中率会快速下降;代码和数学更规整,括号、变量、公式、步骤都有约束,长一点的预测更容易被目标模型接受。

因此混元没有把一个 universal drafter 往所有场景里硬塞。MTP drafter 面向高熵聊天,DFly 则用代码和数学数据增强,配合 block-diffusion drafting,在一个 backbone pass 里并行给出候选块。

arXiv 报告给出的关键数字是:在 Hy3-A21B 上,DFly 将平均接受长度提高约 30%;在并发 4 到 64 的全部测试点上获得最高平均吞吐;相对自回归解码的端到端加速为 1.98 到 2.40 倍,相对 DFlash 的吞吐提升为 10.5% 到 11.8%

GitHub 仓库的 benchmark 说明补上了口径:离线吞吐基于 HY3-295B-A21B、TP=8,温度为 1,每个单元使用 3 个 120 秒窗口;线上 D-cut 负载则标注为 8×H20,并发从 2 到 64。数字能用,是因为本地/线上、硬件和并发范围都没有混在一起。

加速框架也会变成竞争资产

对开发者来说,AngelSpec 最直接的价值并非立刻把某个 API 账单砍半。它先提供一套可追踪的实验基线:同一模型在聊天、代码、数学、Agent 工具调用里,应该用哪类 drafter,接受长度和验证成本如何随并发变化。

这会影响云厂商和模型厂的定价能力。过去几个月,DeepSeek、Kimi、Qwen、混元都在讲参数、上下文和开源;但落到企业服务时,吞吐、尾延迟、显存占用和多租户稳定性会更早卡住预算。一个 2 倍级推理加速,如果只在特定 Hy3 场景成立,也足以改变代码生成和批量推理的成本模型。

同时,开源 drafter 权重会把竞争从“谁有大模型”推进到“谁能把大模型跑得更稳”。Hugging Face 上已经出现 AngelSlim/Hy3-DFly-Block8、AngelSlim/Hy3-MTP-TTT3 等配套模型。开发者可以复现实验,也可以把 Qwen3-8B 这类目标模型放进单节点样例里试跑。

还要看生产账本

AngelSpec 的限制同样清楚。第一,论文数字来自 Hy3 系列和特定部署条件,不能外推到所有模型;第二,MTP、DFly、D-cut 都会增加训练和系统复杂度,团队需要懂推理引擎、并行训练和线上调度;第三,有商业价值的是尾延迟、单位 GPU 小时产出和故障恢复,不只是平均吞吐。

这也是后续最该核验的节点。看混元是否把 AngelSpec 接进自家 MaaS 服务,看第三方是否复现 1.98 到 2.40 倍加速,看 Qwen、DeepSeek 或其他开源模型社区会不会采用同类训练框架。

如果这些环节跟上,AngelSpec 会把国产大模型竞争的一部分,从模型榜单拉到推理系统工程:谁能更便宜、更稳定地吐出 token,谁在 Agent 时代的胜算就多一层。

参考来源:第一财经、腾讯 AngelSpec GitHub、arXiv:2607.25852、CocoLoop、Hugging Face;核验开源范围、Hy3-A21B TP=8 离线吞吐、8×H20 线上负载、并发 4-64、drafter 权重与 Apache 2.0 许可口径。