模型评测平台 Arena 在北京时间 9 月 27 日凌晨宣布,Claude Opus 5.5(High)首次进入 Text Arena 就排到第一,得分 1509。它比上一代 Opus 5(High)高 18 分,后者目前排第 11。
Text Arena 是 Arena 最老的一张榜,用户同时看到两个匿名模型的回答,投票选更好的一个,平台再按 Elo 类方法换算成分数。榜单累计投票超过 850 万张,覆盖写作、编程、数学、日常问答等各类提问。
前六名全是 Anthropic
这次更新后,Text Arena 前六名全部来自 Anthropic。按 Arena 页面的排序:
| 名次 | 模型 | 分数 | 投票数 |
|---|---|---|---|
| 1 | Claude Opus 5.5(High) | 1509 ±12 | 2,307 |
| 2 | Claude Opus 4.6(High) | 1505 ±3 | 76,518 |
| 3 | Claude Fable 5(High) | 1504 ±4 | 36,462 |
| 4 | Claude Opus 4.7(High) | 1502 ±4 | 64,007 |
| 5 | Claude Fable 5.1(Max) | 1501 ±7 | 9,942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80,836 |
第七名是 Meta 的 Muse Spark 1.2(xHigh),1496 分;Google 排得最靠前的是第十名 Gemini 3.8 Flash(High),1492 分。前 15 名里只有 Anthropic、Meta、Google 三家,OpenAI 9 月 22 日刚发布的 GPT-6 系列没有出现在这个区间。
Arena 还把 Opus 5.5 标在了 Text Arena 的性价比前沿线上。按输入、输出价格折算,它的混合单价是每百万 token 16 美元。Anthropic 给 Opus 5.5 定的 API 价格是输入 4 美元、输出 20 美元,比 Opus 5 各降了五分之一。
票数还太少
第一名和第六名只差 11 分,而 Opus 5.5 自己的置信区间是上下 12 分。换个说法,从第一到第六,这几款模型在统计上还分不出高低。
原因在票数。Opus 5.5 上线不到一周,只积累了 2307 张票;排在它后面的 Opus 4.6(High)有 7.6 万多张,区间只有 ±3。新模型上榜初期区间宽、分数波动大,是 Arena 的常态,后续几周分数往上走还是往下掉都有可能。
Arena 发帖时也只说它”首次亮相即登顶”,没有给各分项的排名。编程、数学、创意写作分榜上 Opus 5.5 各排第几,官方暂未公布。
Opus 5 为什么排在老模型后面
这张榜上更耐人寻味的是 Opus 5。按发布顺序它比 Opus 4.6、4.7 都新,到了 Text Arena 却只排第 11,落后 Opus 4.6(High)14 分,也落后同门的 Fable 5(High)13 分。
Text Arena 量的是匿名对比时用户更喜欢哪个回答,和解题正确率并不等同。回答的长度、语气、格式都会影响投票,一个在推理题上更强的模型,完全可能因为写得啰嗦或太像说明书而输掉偏好票。
Anthropic 这一代在写作上下了功夫。公司工程师此前公开解释过 Claude 写作变差的原因,称强化学习的奖励配比让模型越来越像在写给 AI 看,Opus 5.5 是第一个针对句子清晰度做定向改进的版本。Opus 5.5 比 Opus 5 高出的 18 分,有多少来自这次写作调整、有多少来自能力本身,Arena 的数据拆不开,Anthropic 也没有给出对应的评测。
把几代模型串起来看:Opus 4.6、4.7 至今仍在前四,Opus 5 发布后没能接班,Opus 5.5 才把第一名换成新面孔。眼下 Anthropic 在这张偏好榜上的主要对手,是自家的旧版本。
参考来源:Arena 官方账号、Arena Text 排行榜、CocoLoop、Anthropic 模型定价页;分数、置信区间与投票数以 Arena 页面当前数据为准。