Opus 5.5 以 1509 分登顶文本竞技场

模型评测平台 Arena 在北京时间 9 月 27 日凌晨宣布,Claude Opus 5.5(High)首次进入 Text Arena 就排到第一,得分 1509。它比上一代 Opus 5(High)高 18 分,后者目前排第 11。

Text Arena 是 Arena 最老的一张榜,用户同时看到两个匿名模型的回答,投票选更好的一个,平台再按 Elo 类方法换算成分数。榜单累计投票超过 850 万张,覆盖写作、编程、数学、日常问答等各类提问。

前六名全是 Anthropic

这次更新后,Text Arena 前六名全部来自 Anthropic。按 Arena 页面的排序:

名次模型分数投票数
1Claude Opus 5.5(High)1509 ±122,307
2Claude Opus 4.6(High)1505 ±376,518
3Claude Fable 5(High)1504 ±436,462
4Claude Opus 4.7(High)1502 ±464,007
5Claude Fable 5.1(Max)1501 ±79,942
6Claude Opus 4.61498 ±380,836

第七名是 Meta 的 Muse Spark 1.2(xHigh),1496 分;Google 排得最靠前的是第十名 Gemini 3.8 Flash(High),1492 分。前 15 名里只有 Anthropic、Meta、Google 三家,OpenAI 9 月 22 日刚发布的 GPT-6 系列没有出现在这个区间。

Arena 还把 Opus 5.5 标在了 Text Arena 的性价比前沿线上。按输入、输出价格折算,它的混合单价是每百万 token 16 美元。Anthropic 给 Opus 5.5 定的 API 价格是输入 4 美元、输出 20 美元,比 Opus 5 各降了五分之一。

票数还太少

第一名和第六名只差 11 分,而 Opus 5.5 自己的置信区间是上下 12 分。换个说法,从第一到第六,这几款模型在统计上还分不出高低。

原因在票数。Opus 5.5 上线不到一周,只积累了 2307 张票;排在它后面的 Opus 4.6(High)有 7.6 万多张,区间只有 ±3。新模型上榜初期区间宽、分数波动大,是 Arena 的常态,后续几周分数往上走还是往下掉都有可能。

Arena 发帖时也只说它”首次亮相即登顶”,没有给各分项的排名。编程、数学、创意写作分榜上 Opus 5.5 各排第几,官方暂未公布。

Opus 5 为什么排在老模型后面

这张榜上更耐人寻味的是 Opus 5。按发布顺序它比 Opus 4.6、4.7 都新,到了 Text Arena 却只排第 11,落后 Opus 4.6(High)14 分,也落后同门的 Fable 5(High)13 分。

Text Arena 量的是匿名对比时用户更喜欢哪个回答,和解题正确率并不等同。回答的长度、语气、格式都会影响投票,一个在推理题上更强的模型,完全可能因为写得啰嗦或太像说明书而输掉偏好票。

Anthropic 这一代在写作上下了功夫。公司工程师此前公开解释过 Claude 写作变差的原因,称强化学习的奖励配比让模型越来越像在写给 AI 看,Opus 5.5 是第一个针对句子清晰度做定向改进的版本。Opus 5.5 比 Opus 5 高出的 18 分,有多少来自这次写作调整、有多少来自能力本身,Arena 的数据拆不开,Anthropic 也没有给出对应的评测。

把几代模型串起来看:Opus 4.6、4.7 至今仍在前四,Opus 5 发布后没能接班,Opus 5.5 才把第一名换成新面孔。眼下 Anthropic 在这张偏好榜上的主要对手,是自家的旧版本。

参考来源:Arena 官方账号、Arena Text 排行榜、CocoLoop、Anthropic 模型定价页;分数、置信区间与投票数以 Arena 页面当前数据为准。