阶跃Step 5 Preview上线,自称成本为Opus 5八分之一

阶跃星辰 9 月 20 日发布新一代旗舰基座模型 Step 5 Preview,即日起在自家产品和 API 上可用,完整权重定在 10 月 15 日开源。

模型走的是稀疏 MoE 路线,总参数 600B,每个 token 激活 27B,上下文窗口 100 万 token,原生支持文本与视觉输入。发布把应用方向说得很具体:AI 编程、软件工程、专业知识工作和金融场景。

榜单成绩与自建基准

在 Artificial Analysis 综合智能指数上,Step 5 Preview 得 44 分,进入全球开源模型前三。其余公开基准的成绩是:GPQA Diamond 93.5%,Terminal-Bench v2.1 85.0%,BrowseComp 88.7%,多模态的 MMMU-Pro 76.0%。阶跃还提到在 AA-LCR、CyberGym 等基准上拿到最好或次好成绩。

需要分开看的是另一组数字。阶跃同时给出了 StepCodeBench 和 FinStepBench 两项成绩,这两个基准由阶跃自建:StepCodeBench 覆盖 553 个代码仓库、9 类任务、20 个应用领域和 33 种编程语言,用来测 Bug 修复、功能开发、代码重构、环境配置这类真实开发任务。自建基准的设计意图和公开榜单不同,不同设置下的结果也不具备直接可比性,这一点阶跃自己在材料里写了。

Agent 能力这一块,阶跃称模型可以自主执行超过 3 小时的连续任务,支持代码调试、串口访问、截图获取、摄像头调用和鼠标模拟操作。这类描述目前缺少第三方复现,外界能核的只有公开榜单那几项。

一笔账,和这笔账的口径

发布里被引用最多的一句是:单任务成本仅为 Anthropic Claude Opus 5 的八分之一。这句话的来源是阶跃自己,公开材料没有标注测算依据——多少任务、什么难度分布、按 API 挂牌价还是实际调用量算,一项都没写。

把这个口径放进具体场景算一遍:如果一个团队每月在 Opus 5 上的推理支出是 10 万元,按八分之一推,换到 Step 5 Preview 大约是 1.25 万元,一年省下的是百万量级。这个数字成立的前提是任务分布和阶跃测算时一致,而这正是没有公开的部分。对准备迁移的团队来说,10 月 15 日权重放出之后自己跑一遍同构任务,比引用这个倍数要可靠。

对比对象的选择也说明了定位。阶跃没有拿另一个开源模型做参照,挑的是闭源第一梯队里单价最高的那一档。

一个月的窗口

Preview 版本先上 API、正式权重等一个月,这种节奏国内厂商今年用得越来越多:先占榜单和舆论窗口,再放权重。风险在于这中间的一个月里,同量级的开源旗舰随时可能落地,44 分这个位次能不能保到 10 月 15 日,没人能打包票。

从工程角度看,600B 总参数、27B 激活的配置对部署方相对友好,27B 的激活量意味着单机多卡推理是可行的,不必按 600B 的稠密模型准备资源。这也是把权重开出来的前提条件,参数规模再往上,开源的实际意义会被部署门槛吃掉不少。

许可协议和 API 定价,阶跃这次都没有公布。这两项决定了 10 月 15 日之后有多少人会真的把它装起来。

参考来源:阶跃星辰官方发布、凤凰科技、CocoLoop、新浪科技;参数规模、AA 综合智能指数得分与开源时间按官方口径核对,成本倍数与自建基准成绩均为阶跃单方数据。