字節跳動原訂8月推出的豆包大模型2.2確認延期。多位接近字節跳動的人士透露,延後是為了用更完整的預訓練與後訓練,把程式撰寫、工具調用與Agent能力拉上來,用拉長研發週期換一次幅度更大的提升。在內部排序裡,2.2被定位成世代之間的關鍵補強版,而非一次大改版。
短板集中在程式能力
補強的方向講得很直白:程式撰寫、工具調用、Agent。這三項本來就是同一條鏈——模型寫不好程式碼,工具調用就會不穩;工具調用不穩,Agent就跑不完長任務。
程式能力是Seed團隊2026年的主要目標之一,內部訂下的年底標準,是做到與GLM-5.2、Kimi-K3相當的產業影響力。這個對標對象選得相當務實,說明字節跳動很清楚自己在開發者心中的位置。
程式能力也是目前最容易換到營收的場景。消費端對話服務的付費轉換率一直不好看,開發者呼叫API寫程式碼卻是按用量計費,國產模型今年的營收成長多半來自這條線。字節跳動在消費端有豆包App與抖音撐著,在這條線上卻拿不出對應的位置。
為了追上這一塊,字節跳動7月幾乎每天都在做小功能迭代。天天迭代能改善體驗,卻改不了底層能力,最後還是得靠一次重新訓練。
8月20日的部門重組
8月20日,字節跳動對Seed基礎模型部門做了一次重大重組,依預訓練資料、強化學習、辦公場景、消費端場景重新劃出四個一級部門。
這種切法把能力建設與場景落地分開了:前兩個部門負責模型本身,後兩個部門負責把模型變成產品。組織才剛拆完就發新版本,從來就不是務實的排程。延後發布跟這次重組,更像是同一個決策的兩面。
同業沒有慢下來
把過去這兩個月國產陣營的動作排一排:智譜推出GLM-5.3-Flash,啟動參數18B,價格壓到上一代的十分之一;騰訊混元的Hy4 preview在盲測中略勝GLM-5.3與Kimi K3;Kimi、阿里通義千問的更新密度同樣不低。一個月能冒出兩三個改變排名的版本,字節跳動反倒是收著的那一個。
延期的代價也可以粗抓一下。一次帶完整後訓練的重新訓練週期通常要以月計算,2.2從8月往後推,落地大概率會拖到第四季。照目前這個節奏,屆時對手的下一階版本恐怕也已經上線——2.2登場時要對標的,未必還是立項當初瞄準的GLM-5.2與Kimi-K3。
創辦人張一鳴先前的表態是不走蒸餾路線,就算短期落後也一樣。執行長梁汝波在8月6日的年中全員會議上講得更完整:
在大型語言模型上,字節跳動接下來還是會堅持自主研發,把基本功做好,接受短期落後,堅持優化長期表現。
對一家習慣靠產品迭代速度取勝的公司來說,把「接受短期落後」講進全員會議,並不是常見的表態。短期少一個版本不會讓豆包立刻掉用戶,畢竟通路都已經鋪好了;但開發者市場看的是能力排名,那裡沒有通路紅利可吃。公開報導還提到字節跳動同時在推進下一代超大規模模型,2.2的位置因此更清楚:它要扛住的,是從現在到下一代模型上線之間的這段空窗期。
參考來源:白鯨實驗室、CocoLoop、IT之家;豆包2.2的延期原因、Seed部門重組的四個劃分與梁汝波全員會表述均經公開報導核對。