Claude Sonnet 5.5 发布,提速三成不加价

Anthropic 9 月 28 日发布 Claude Sonnet 5.5,这是 Claude 5.5 家族继 Opus 5.5 之后的第二款模型。公司给出的两个核心数字是:比 Sonnet 5 快 30% 以上,多数工作的单任务成本最多低 30%。API 价格没动,仍是每百万输入 token 2 美元、输出 10 美元,缓存读取 0.2 美元。

模型当天上线 Claude 自家平台、AWS、Google Cloud 和 Microsoft Azure,API 名称为 claude-sonnet-5-5,零数据保留选项在各平台照常提供。独立开发者 Simon Willison 注意到,claude.ai 的免费层已经换成 Sonnet 5.5。

官方成绩单

Anthropic 在发布页列出的主要成绩:

基准Sonnet 5.5
Terminal-Bench 4.070.6%
OSWorld 2.1(部分)80.1%
Humanity’s Last Exam(带工具)64.5%
CursorBench 4.055.5%
FrontierCode 1.1(Max)46.2%
GDPval-AA v2.11844

几家早期客户的反馈集中在速度上。Box 称新模型比上一版快 2.4 倍,Slack 说不改提示词就拿到了更好、更快的结果。

“Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows.” (Sonnet 5.5 写代码快,迭代时一句话就能把它拉回正轨。)——Every 的 Tyler Nishida

第三方跑出来的另一面

Artificial Analysis 给 Sonnet 5.5 的智能指数打了 56 分,排第二,只比 Opus 5.5 的 58 分低 2 分。在它自己的 Terminal-Bench 4.0 测试里,Sonnet 5.5 拿到 64%,Opus 5.5 和 GPT-6 Astra 都是 60%。短板在事实类题目:事实准确率 54%,Opus 5.5 是 66%,科学推理类测试也比 Opus 5.5 低 6 分。

成本那一栏跟官方说法对不上。Artificial Analysis 用最高推理档位(max)跑完整套测试,Sonnet 5.5 平均每个任务吐出约 19.3 万个输出 token,比 Opus 5.5 和 Sonnet 5 的 max 档都多约六成,是 GPT-6 Astra 的 7 倍。单价没变、token 变多,每任务成本落在 7.6 美元左右,比 Sonnet 5 高约 50%。

两边口径不同。Anthropic 说的是”多数工作”,默认档位下的日常编码、写作任务;Artificial Analysis 测的是把思考预算开满的极限情况。Willison 也碰到了同样的现象:他让模型用 max 档写一个 WebGL 小程序,花掉 12.8 万 token、1.28 美元;换成 xhigh 档,41 秒出结果,只花了约 0.06 美元。他还提到 Sonnet 5.5 跟 Opus 5.5 有同一个毛病,max 档容易把 token 上限耗光。

放进同级模型里比

横向看,Sonnet 这条线现在的定位很清楚:拿 Opus 八九成的能力,收更低的价格。Sonnet 5 发布时主打的是跑智能体任务只收 Opus 约三分之一的钱;5.5 这一代把速度拉上来,基准分数又贴近了 Opus 5.5 一截,Artificial Analysis 的榜上两者只差 2 分。

免费层的变化影响面更大。Willison 的判断是,claude.ai 免费用户现在拿到的模型,比 ChatGPT 免费层用的 Luna 系列强出不少。OpenAI 那边 GPT-6 Luna 走的是低价路线,Arena 最新数据显示它的单任务成本只有 0.05 美元左右。Anthropic 还没有公布 Haiku 5.5,Willison 预计它会在未来几周到来,届时低价档才会正面碰上 Luna。

对开发者来说,最直接的动作是先别急着开 max 档。按目前公开的数据,默认或 xhigh 档位更接近官方宣称的”提速降本”,max 档的账单可能比换代前还高。具体到自己的任务上划不划算,Anthropic 没有给出按档位拆分的成本表,只能自己跑一遍看。

参考来源:Anthropic 官方发布页、Simon Willison 博客、CocoLoop、Artificial Analysis 测评报告;API 价格以 Anthropic 发布页为准,每任务成本与 token 用量以 Artificial Analysis 智能指数 max 档口径为准。