Claude Opus 5.5 发布,运行成本降 40%

Anthropic 9 月 22 日发布 Claude Opus 5.5,这是 Claude 5.5 系列的第一个模型。官方给的定位有两句:多数工作上的表现与 Claude Fable 5.1 相当,整体运行成本比 Opus 5 低 40%

价格表按项分开看:输入每百万 token 4 美元、输出 20 美元,各降两成;缓存读取从 0.50 美元降到 0.20 美元,降幅 60%。输出速度方面,官方称比 Opus 5 快 30% 以上,另有一档 fast 模式,价格 8 美元和 40 美元,速度最高 2.5 倍。模型在 Claude 平台 API(模型 ID claude-opus-5-5)、AWS、Google Cloud、微软 Azure 上线,消费端各平台同步可用,单次最大输出 12.8 万 token。

跑分

官方发布页给出的对照如下。

评测Opus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.154.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
GDPval-AA v2.11846 Elo17351708
OSWorld 2.081.8%80.7%74.0%

第三方评测机构 Artificial Analysis 把 Opus 5.5 放在智能指数第一位,得分 58。Claude Code 在同日发布的 2.1.280 版本里,已经把 Opus 5.5 设为默认的 Opus 模型。

发布页还引用了几家客户的试用反馈:GitHub 称解同样的终端任务,步骤不到 Opus 5 的一半;Optiver 称质量与 Opus 5 相当而轮次约减一半,成本降 40% 到 50%;Deloitte 称在最低思考档下抓到 72% 的已知缺陷,Opus 5 在高档位是 56%。这些数字都来自厂商发布页转述的客户说法,没有第三方复核口径。

安全部分官方说了什么

Anthropic 称 Opus 5.5 通过了自动化行为审计,对齐分数为历代最强,试图绕过隔离边界的行为比 Opus 5 少 85%。网络安全类任务大部分仍路由给 Opus 4.8 处理,生物领域的防护等级与 Fable 5.1 相同。模型保留了针对蒸馏的思维过程保护措施,按欧盟《人工智能法案》加了水印,企业侧可以选择零数据保留。发布前,METR 和 Frontier Design 参与了评估。

具体的失败率、拒答率和红队条目,要等系统卡的完整内容才能核对,官方页面本身没有列出这些数字。

放在同一天的价目表里看

9 月 22 日这一天,OpenAI 也发布了 GPT-6 Sol 和 Luna,API 价格比上一代低一半,Sol 是 2 美元和 10 美元,Luna 是 0.10 美元和 0.50 美元。横向对照,Opus 5.5 的单价仍是 Sol 的两倍,Anthropic 卖的是同一档位上的分数与更少的步骤:按 Optiver 和 GitHub 的说法,单次任务的轮数下降之后,单价差距在账单上会被部分抵消。抵消多少,取决于任务的具体形态,没有通用答案。

开发者侧已经出现了一条反面实测。技术博主 Simon Willison 在测试中让 Opus 5.5 以最高思考档生成一张复杂 SVG,模型跑满 12.8 万输出 token 也没有完成任务。高思考档配合长输出容易吃掉整个输出预算,接进自动化流程之前,这个上限要先算进去。

对已经在用 Opus 5 的团队,切换成本主要在两处:模型 ID 要改,输出速度和轮数的变化会让原有的超时与重试参数不再合适。价格下调对高频调用的场景更明显,缓存读取那 60% 的降幅尤其如此——常驻系统提示词越长、请求越密,省下的比例越高。

参考来源:Anthropic 官方发布页、Artificial Analysis、CocoLoop、Simon Willison 博客;官方发布页核对各档单价、跑分与安全措施口径。