開源追平閉源時間逐代減半

SemiAnalysis於8月21日發布一份報告,把過去三年半開源模型與閉源前沿之間的分差畫成一條曲線。它給出的規律很直白:開源每追一代,需要的時間就少一半。

作者把這段歷史切成三段來量。早期擴展階段以GPT-3.5 Turbo為參照,開源一側從Llama-2-70B起步,一路熬到2024年7月的Llama-3.1-405B才把口子補上,跨度是一年多。推理階段的節奏明顯快了:o1-preview劃出的12.1分差距,被R1-0528用8.5個月填平。到了智能體階段,Kimi K2.6以56.3分超車Opus 4.5,用時4.8個月;GLM-5.2拿到72.4分超車GPT-5.2,用時6個月。

一年多、8.5個月、5到6個月——三段窗口擺在一起,減半的斜率就出來了。

追趕為什麼越來越快

報告把加速歸因於幾件同時發生的事:開放權重讓能力可以被直接拿走,蒸餾讓分數可以被便宜地搬運,強化學習環境本身也在被公開複製。作者寫下一句聽起來像判詞的話——沒有什麼能永遠保密,尤其考慮到蒸餾的作用。

按這條曲線粗略推算一下(這是推算,報告並沒有做這一步外推):如果減半規律再走一代,下一輪追平窗口會落到兩到三個月,幾乎等於同代同期發布。對閉源一方而言,壓力落在定價上比落在榜單上更快。一個模型能收多久的溢價,取決於它領先多久;領先窗口從一年壓到一個季度,定價策略要跟著調整的時間也就同步縮短了。

商品化那個問句

報告沒有迴避市場最擔心的那句話:如果開源以極低成本保持得足夠接近前沿,模型層會不會被商品化?作者寫道,這種結局對前沿實驗室的利潤率顯然會是災難。

緊接著他們給出了自己的判斷依據。GLM 5.3、Kimi K3這類開源模型,已經能承接許多把Anthropic推上650億美元以上年化收入的程式編寫與智能體任務——原文的措辭是「genuinely capable」,指的是同類活兒開源真的做得到,跑分接近只是表層。

需求端的量級也被擺了出來:報告稱Fireworks一家每天處理的token數已經超過40兆,是OpenAI API三月底用量的兩倍。託管開放權重模型的推論生意在成長,這既是開源能力被驗證的結果,也是模型層利潤被攤薄的路徑之一。

作者自己踩了煞車

結論段的基調卻沒有往看空前沿走。報告直接承認基準只是一部分:Kimi K3的評分更高,作者日常工作仍舊偏向Fable 5。理由有兩條,一是產品化體驗的差距在分數之外,二是評分本身可以被針對性的強化學習環境拉高,榜單和實際手感之間存在系統性落差。他們把整篇的結論定成一句相對溫和的話——沒有你一開始想的那麼看空前沿模型。

對中文讀者而言,這份報告還有一層讀法。三段曲線裡,最後一段的追趕主角基本上是中國團隊的開放權重模型:Kimi、GLM,加上被點名的下一代。海外分析師用來論證「開源在提速」的樣本,幾乎就是這批模型的發布節奏。同一組數據換個角度看,也說明相關廠商已經把開放權重當成正面戰場,不再拿它當閉源之外的補充選項。

至於閉源一方還剩什麼,報告的答案落在產品化、通路和企業交付上。這些東西不進基準表,卻決定了650億美元這樣的數字最終長在誰身上。

參考來源:SemiAnalysis《Are Open Models Catching Up?》、CocoLoop編輯整理;報告原文核驗各時代追平月數、Kimi K2.6與GLM-5.2的評分口徑及Fireworks每日token處理量。