SemiAnalysis 8 月 21 日发布的一份报告,把过去三年半开源模型与闭源前沿之间的分差画成了一条曲线。它给出的规律很直白:开源每追一代,需要的时间就少一半。
作者把这段历史切成三段来量。早期扩展阶段以 GPT-3.5 Turbo 为参照,开源一侧从 Llama-2-70B 起步,一路熬到 2024 年 7 月的 Llama-3.1-405B 才把口子补上,跨度是一年多。推理阶段的节奏明显快了:o1-preview 划出的 12.1 分差距,被 R1-0528 用 8.5 个月填平。到了智能体阶段,Kimi K2.6 以 56.3 分越过 Opus 4.5,用时 4.8 个月;GLM-5.2 拿到 72.4 分越过 GPT-5.2,用时 6 个月。
十几个月、8.5 个月、5 到 6 个月——三段窗口摆在一起,减半的斜率就出来了。
追赶为什么越来越快
报告把加速归给几件同时发生的事:开放权重让能力可以被直接拿走,蒸馏让分数可以被便宜地搬运,强化学习环境本身也在被公开复制。作者写下一句听着像判词的话——没有什么能永远保密,尤其考虑到蒸馏的作用。
按这条曲线粗算一下(估算,报告没有做这一步外推):如果减半规律再走一代,下一轮追平窗口会落到两三个月,几乎等于同代同期发布。对闭源一方而言,压力落在定价上比落在榜单上更快。一个模型能收多久的溢价,取决于它领先多久;领先窗口从一年压到一个季度,定价策略要跟着改的时间也就同步缩短了。
商品化那个问句
报告没有回避市场最担心的那句话:如果开源以零头的成本保持得足够接近前沿,模型层会不会被商品化?作者写道,这种结局对前沿实验室的利润率显然会是灾难。
紧接着他们给出了自己的判断依据。GLM 5.3、Kimi K3 这类开源模型,已经能承接许多把 Anthropic 推上 650 亿美元以上年化收入的编程与智能体任务——这句原文里的措辞是”genuinely capable”,指的是同类活儿开源真干得了,跑分接近只是表层。
需求侧的量级也被摆了出来:报告称 Fireworks 一家每天处理的 token 已经超过 40 万亿,是 OpenAI API 三月底用量的两倍。托管开放权重模型的推理生意在长大,这既是开源能力被验证的结果,也是模型层利润被摊薄的路径之一。
作者自己踩了刹车
结论段的基调却没有往看空前沿走。报告直接承认基准只是一部分:Kimi K3 的评分更高,作者日常干活仍旧偏向 Fable 5。理由有两条,一是产品化体验的差距在分数之外,二是评分本身可以被针对性的强化学习环境拉高,榜单和实际手感之间存在系统性缝隙。他们把整篇的落点定成一句相对温和的话——没有你一开始想的那么看空前沿模型。
对中文读者,这份报告还有一层读法。三段曲线里,最后一段的追赶主角基本是中国团队的开放权重模型:Kimi、GLM,加上被点名的下一代。海外分析师用来论证”开源在提速”的样本,几乎就是国内这一批模型的发布节奏。同一组数据换个角度看,也说明国内厂商已经把开放权重当成正面战场,不再拿它当闭源之外的补充选项。
至于闭源一方还剩什么,报告的答案落在产品化、分发和企业交付上。这些东西不进基准表,却决定了 650 亿美元这样的数字长在谁身上。
参考来源:SemiAnalysis《Are Open Models Catching Up?》、CocoLoop 编辑整理;报告原文核验各时代追平月数、Kimi K2.6 与 GLM-5.2 的评分口径及 Fireworks 每日 token 处理量。