豆包2.2推迟,字节先补编程能力

字节跳动原计划 8 月推出的豆包大模型 2.2 确认延期。多位接近字节的人士称,推迟是为了用更充分的预训练和后训练把编程、工具调用和 Agent 能力拉起来,用更长的研发周期换一次幅度更大的提升。在内部的排序里,2.2 被定位成代际之间的关键补强,而非一次大版本跃迁。

短板集中在编程

补强的方向说得很直接:编程、工具调用、Agent。这三项本来就是一条链上的东西——模型写不好代码,工具调用就不稳;工具调用不稳,Agent 跑不完长任务。

编程能力是 Seed 团队 2026 年的主要目标之一,内部给自己定的年底标准,是做到和 GLM-5.2、Kimi-K3 相当的行业影响力。这个参照系选得很实在,说明字节清楚自己在开发者心里的位置。

编程也是眼下最能换回收入的场景。C 端对话的付费转化一直难看,开发者调 API 写代码则是按量计费,国产模型今年的收入增量大多来自这条线。字节在消费端有豆包 App 和抖音撑着,在这条线上却拿不出对应的位置。

为了追这一块,字节 7 月几乎每天都在做小功能迭代。日更式的迭代能修体验,改不了底座能力,最后还是得靠一次重训。

8 月 20 日的部门重组

8 月 20 日,字节对 Seed 基础模型部门做了一次重大重组,按预训练数据、强化学习、办公场景、C 端场景重新划出四个一级部门。

这个切法把能力建设和场景落地拆开了:前两个部门管模型本身,后两个管把模型变成产品。刚拆完组织就发新版本,从来不是一个现实的排期。推迟发布和这次重组,更像同一个决策的两面。

同行没有慢下来

这两个月国产阵营的动作可以排一排:智谱放出 GLM-5.3-Flash,激活参数 18B、价格压到上一代的十分之一;腾讯混元的 Hy4 preview 在盲测里略胜 GLM-5.3 和 Kimi K3;Kimi、阿里千问的更新密度同样不低。一个月能冒出两三个改动排名的版本,字节反倒是收着的那一个。

延期的代价也可以粗算一下。一次带完整后训练的重训周期通常按月计,2.2 从 8 月往后推,落地大概率要走到四季度。而按眼下这个节奏,那时候对手的下一档版本也该上线了——2.2 出场时要对标的,未必还是它立项时瞄准的 GLM-5.2 和 Kimi-K3。

创始人张一鸣此前的表态是不走蒸馏路线,哪怕短期落后。CEO 梁汝波在 8 月 6 日的年中全员会上说得更完整:

在大语言模型上,接下来字节跳动还是会坚持自研,做好基本功,接受短期落后,坚持优化长期。

对一家习惯用产品迭代速度取胜的公司来说,把「接受短期落后」写进全员会,是个不太常见的表述。短期缺一个版本不会让豆包掉用户,分发摆在那里;但开发者市场认的是能力排名,那里没有分发红利可吃。公开报道还提到字节同时在推进下一代超大规模模型,2.2 的位置因此更清楚:它要接住的是从现在到那一代之间的这段空窗。

参考来源:白鲸实验室、CocoLoop、IT之家;豆包 2.2 的推迟原因、Seed 部门重组的四个划分与梁汝波全员会表述均经公开报道核对。