模型評測平台Arena在台北時間9月27日凌晨宣布,Claude Opus 5.5(High)首度登上Text Arena就拿下第一名,得分1509。這個成績比上一代Opus 5(High)高出18分,Opus 5(High)目前排在第11名。
Text Arena是Arena歷史最久的一張榜單,使用者會同時看到兩個匿名模型的回答,投票選出比較好的一個,平台再用類似Elo等級分的方式換算成分數。這張榜單累計投票數已超過850萬張,涵蓋寫作、程式設計、數學、日常問答等各種提問類型。
前六名全部是Anthropic
這次更新之後,Text Arena前六名全部來自Anthropic。依照Arena頁面的排序:
| 名次 | 模型 | 分數 | 投票數 |
|---|---|---|---|
| 1 | Claude Opus 5.5(High) | 1509 ±12 | 2,307 |
| 2 | Claude Opus 4.6(High) | 1505 ±3 | 76,518 |
| 3 | Claude Fable 5(High) | 1504 ±4 | 36,462 |
| 4 | Claude Opus 4.7(High) | 1502 ±4 | 64,007 |
| 5 | Claude Fable 5.1(Max) | 1501 ±7 | 9,942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80,836 |
第七名是Meta的Muse Spark 1.2(xHigh),1496分;Google排名最高的是第十名Gemini 3.8 Flash(High),1492分。前15名裡只有Anthropic、Meta、Google三家上榜,OpenAI在9月22日才發表的GPT-6系列並未出現在這個區間。
Arena還把Opus 5.5標在Text Arena的性價比前緣線上。以輸入、輸出價格折算,它的混合單價是每百萬token 16美元。Anthropic替Opus 5.5訂的API價格是輸入4美元、輸出20美元,分別比Opus 5低了大約五分之一。
票數還太少
第一名和第六名只差11分,而Opus 5.5自己的信賴區間就有正負12分。換句話說,從第一名到第六名,這幾款模型在統計上還分不出高下。
原因出在票數。Opus 5.5上線不到一週,只累積了2307張票;緊追在後的Opus 4.6(High)已經有超過7萬6000張,區間縮小到只有正負3分。新模型剛上榜時區間偏寬、分數容易波動,這在Arena上是常態,接下來幾週分數往上走或往下掉都有可能。
Arena發文時只表示它「首度亮相就登頂」,沒有公布各分項的排名。程式設計、數學、創意寫作分榜上Opus 5.5各排第幾,官方目前還沒有公開。
Opus 5為何排在舊模型之後
這張榜單上更耐人尋味的是Opus 5。按發布順序它比Opus 4.6、4.7都新,到了Text Arena卻只排第11名,落後Opus 4.6(High)14分,也落後同門的Fable 5(High)13分。
Text Arena衡量的是匿名對比時使用者比較喜歡哪個回答,和解題正確率並不是同一件事。回答的長度、語氣、格式都會影響投票結果,一個在推理題上比較強的模型,完全有可能因為寫得太囉嗦或太像說明書而在偏好投票中輸掉。
Anthropic這一代在寫作上下了不少功夫。公司工程師先前公開解釋過Claude寫作變差的原因,指出強化學習的獎勵配比讓模型愈來愈像是在寫給AI看,Opus 5.5是第一個針對句子清晰度做專門調整的版本。Opus 5.5比Opus 5高出的18分裡,有多少來自這次寫作調整、有多少來自能力本身的提升,Arena的資料無法拆分,Anthropic也沒有提出對應的評測結果。
把幾個世代串起來看:Opus 4.6、4.7至今仍在前四名,Opus 5發布後沒能接下棒子,一直到Opus 5.5才把第一名換成新面孔。眼下Anthropic在這張偏好榜上的主要對手,是自家的舊版本。
參考來源:Arena官方帳號、Arena Text排行榜、CocoLoop、Anthropic模型定價頁;分數、信賴區間與投票數以Arena頁面當前資料為準。