四家一周发新模型,企业犯起模型疲劳

8 月底到 9 月初的一周里,几家实验室把新模型排着队放了出来:Anthropic 更新 Claude Fable 5.1 与 Mythos 5.1,Meta 发布 Muse Spark 1.3,谷歌上线 Gemini 3.8 Flash,OpenAI 发布 GPT-6 Astra,英伟达放出 Nemotron 3.5 Lightning。CNBC 在 9 月 6 日的报道里给这一周的企业侧反应起了个名字:模型疲劳。

疲劳的来源不在能力本身。报道的说法是,企业高管和 IT 负责人要不断比较的东西已经不止跑分:价格、速度、可靠性,以及放进自己业务场景里能不能真的省下人力。每来一批新模型,这套比较就得重做一遍。一位受访的公司负责人说,十个新模型里他实际来得及评估的只有五个。

支出还在往上走

Gartner 对今年全球 AI 支出的预测是 2.59 万亿美元,比 2025 年高 47%。这笔钱里超过一半流向基础设施,剩下的部分中,服务、软件、网络安全、模型及相关工具合计超过 1 万亿美元。

把这 1 万亿拆开看,模型调用费只是其中一格。选型要占掉的,是评测环境、内部基准、迁移适配和回归测试这些不出现在报价单上的东西。一家中型公司如果按季度重评一次主力模型,一年就是四轮;每轮涉及提示词重写、评测集重跑和上下游联调,这部分工时按人力口径算,往往比调用账单更沉。这是按公开报价和常见工程流程做的粗算,没有哪家公司公布过自己的选型成本。

供给侧为什么停不下来

从模型厂商那边看,密集发布是在抢钱包份额。圣母大学门多萨商学院的 Ahmed Abbasi 用的词是 share of wallet:几家实验室不仅要跟上彼此的节奏,还要不断向开发者证明自己没有掉队。Anthropic 和 OpenAI 都在往公开市场走,一级市场给两家的估值都接近 1 万亿美元,发布密度和融资叙事挂在同一条线上。

这条线的另一头是采购方的注意力。模型换代越快,企业越容易把选型往后拖,或者干脆先锁死一家用着——两种反应都会削弱新模型的发布效果。CNBC 的报道没有配量化调查,说法来自受访者的感受。

能对表的东西在后面。2.59 万亿是预测机构给出的年度口径,实际结算要到明年才有;企业侧到底是加速换模型还是拖着不换,也要等几家云厂商季度财报里 AI 服务收入的构成才看得出来。眼下能确定的只有发布节奏这一项。

参考来源:CNBC、CocoLoop、Gartner 预测数据、Digital Today;2.59 万亿美元支出预测与 47% 增幅、基础设施占比及一万亿美元服务软件口径、当周五款模型的发布清单逐项核对。