Sonnet 5.5 登 Agent Arena 第三,GPT-6.1 Sol 第五

评测平台 Arena 在 10 月 2 日把 Claude Sonnet 5.5(Max 档)和 GPT-6.1 Sol(Max 档)加进了 Agent Arena 排行榜。两款模型分别排在第 3 名和第 5 名,净改进率为 12.52% 和 11.23%。前两名仍是 Anthropic 自家的 Claude Fable 5.1(14.31%)和 Opus 5.5(13.82%),第 4 名是 GPT-6 Astra(12.27%)。

Agent Arena 跟大家熟悉的文本竞技场打分方式不同。它统计的是真实用户把模型当智能体用的会话:模型要调工具、跑多步任务,最后看用户满不满意。榜单页显示,目前累计会话约 215.8 万次,覆盖 51 个模型。净改进率综合了工具调用的可靠性、任务完成情况和可引导性,9 月 30 日 Arena 刚改过可引导性的算法,从只看“被纠正后改没改”,扩展到对话里每一轮能判断的回复,一次就做对的模型会多拿分。

第三和第五,差距在误差里

只看名次,Sonnet 5.5 压过了 GPT-6 Astra 和 GPT-6.1 Sol。把误差范围带上就是另一幅图景:Sonnet 5.5 的分数是 12.52% ± 3.09%,GPT-6.1 Sol 是 11.23% ± 2.76%,两者的区间大面积重叠,跟第 4 名 Astra 只差 0.25 个百分点。新模型刚上榜,会话样本还少,误差带比 Opus 5.5(± 2.17%)宽一截。按现在的数据,第 3 到第 5 名很难说谁一定更强。

细分项上两家各有长处。Sonnet 5.5 在 Bash 命令失败后的恢复一项排第一,得分 15.05%;GPT-6.1 Sol 在工具幻觉一项排第一,编造不存在工具的比例只有 0.49%,“用户确认任务完成”一项以 15.47% 排第二。

账单拉开了距离

两款模型的 API 单价其实一样,都是每百万输入 token 2 美元、输出 10 美元。到了智能体任务里,单个任务的花费差出好几倍。Arena 的成本页显示:

模型净改进率单任务成本
Claude Fable 5.114.31%约 4.91 美元
Claude Opus 5.513.82%约 1.56 美元
Claude Sonnet 5.512.52%约 2.99 美元
GPT-6 Astra12.27%约 3.10 美元
GPT-6.1 Sol11.23%约 0.58 美元
DeepSeek V4.1 Flash4.02%约 0.11 美元

单价一样、单任务成本差五倍左右,差在 token 用量上。Sonnet 5.5 在 Max 档会写得更长、想得更久,此前第三方测评也发现它每个任务消耗的 token 比上一代多出一截。结果是它比自家更大的 Opus 5.5 分低、花得还多,没能进入 Arena 标注的性价比前沿(Pareto 前沿)。这条前沿目前由 Fable 5.1、Opus 5.5、GPT-6.1 Sol 和 DeepSeek V4.1 Flash 四个点连成。

GPT-6.1 Sol 是这次重新画了前沿的那个。Arena 在发布时给的对比是:它的单任务中位成本比上一版 GPT-6 Sol 低 39%,分数反而高 1.52 个百分点;比 GPT-6 Astra 便宜 81%,分数差距在 1.04 个百分点内。GPT-6.1 Sol 发布才一周多就替换掉了 GPT-6 Sol,这份榜单给了 OpenAI 一个“便宜又不掉分”的第三方注脚。

这套成本数字也有它的口径限制。Arena 统计的是用户在它平台上发起的会话,任务类型以写代码、查资料、跑命令为主,分布跟企业内部的真实工作流未必一致;成本按 Arena 实际调用 API 的花费折算,用了缓存折扣、批量折扣的企业账单会更低。拿这张表做采购决策,最好先在自己的任务上抽样复测一遍。

跟上一代比

把时间往回拉,Sonnet 这条线在 Agent Arena 上的位置一直在往前挪。上一代 Sonnet 5 初次上榜时排第 6,这次 5.5 进了前三。OpenAI 那边则是另一种节奏:GPT-6 Sol 9 月 25 日上榜时净改进率 9.71%,一周后 6.1 Sol 补上来,分数涨了一点半,成本降了约四成。

对开发者来说,选哪个模型跑智能体,取决于任务量。偶尔跑几个复杂任务,Opus 5.5 这类分高、单价不算离谱的模型更省心;要批量跑、按量计费,GPT-6.1 Sol 和 DeepSeek V4.1 Flash 这样的低成本点更合适。至于 Sonnet 5.5,换到更低的推理档位后,成本和分数会落在哪里,Arena 目前只测了 Max 一档,还没有数据。

参考来源:Arena Agent Arena 排行榜、Arena 成本前沿页、CocoLoop、Arena 官方账号、Artificial Analysis;各模型净改进率、误差范围与单任务成本以 Arena 页面显示数值为准。