Opus 5.5登上Text Arena榜首

模型評測平台Arena在台北時間9月27日凌晨宣布,Claude Opus 5.5(High)首度登上Text Arena就拿下第一名,得分1509。這個成績比上一代Opus 5(High)高出18分,Opus 5(High)目前排在第11名。

Text Arena是Arena歷史最久的一張榜單,使用者會同時看到兩個匿名模型的回答,投票選出比較好的一個,平台再用類似Elo等級分的方式換算成分數。這張榜單累計投票數已超過850萬張,涵蓋寫作、程式設計、數學、日常問答等各種提問類型。

前六名全部是Anthropic

這次更新之後,Text Arena前六名全部來自Anthropic。依照Arena頁面的排序:

名次模型分數投票數
1Claude Opus 5.5(High)1509 ±122,307
2Claude Opus 4.6(High)1505 ±376,518
3Claude Fable 5(High)1504 ±436,462
4Claude Opus 4.7(High)1502 ±464,007
5Claude Fable 5.1(Max)1501 ±79,942
6Claude Opus 4.61498 ±380,836

第七名是Meta的Muse Spark 1.2(xHigh),1496分;Google排名最高的是第十名Gemini 3.8 Flash(High),1492分。前15名裡只有Anthropic、Meta、Google三家上榜,OpenAI在9月22日才發表的GPT-6系列並未出現在這個區間。

Arena還把Opus 5.5標在Text Arena的性價比前緣線上。以輸入、輸出價格折算,它的混合單價是每百萬token 16美元。Anthropic替Opus 5.5訂的API價格是輸入4美元、輸出20美元,分別比Opus 5低了大約五分之一。

票數還太少

第一名和第六名只差11分,而Opus 5.5自己的信賴區間就有正負12分。換句話說,從第一名到第六名,這幾款模型在統計上還分不出高下。

原因出在票數。Opus 5.5上線不到一週,只累積了2307張票;緊追在後的Opus 4.6(High)已經有超過7萬6000張,區間縮小到只有正負3分。新模型剛上榜時區間偏寬、分數容易波動,這在Arena上是常態,接下來幾週分數往上走或往下掉都有可能。

Arena發文時只表示它「首度亮相就登頂」,沒有公布各分項的排名。程式設計、數學、創意寫作分榜上Opus 5.5各排第幾,官方目前還沒有公開。

Opus 5為何排在舊模型之後

這張榜單上更耐人尋味的是Opus 5。按發布順序它比Opus 4.6、4.7都新,到了Text Arena卻只排第11名,落後Opus 4.6(High)14分,也落後同門的Fable 5(High)13分。

Text Arena衡量的是匿名對比時使用者比較喜歡哪個回答,和解題正確率並不是同一件事。回答的長度、語氣、格式都會影響投票結果,一個在推理題上比較強的模型,完全有可能因為寫得太囉嗦或太像說明書而在偏好投票中輸掉。

Anthropic這一代在寫作上下了不少功夫。公司工程師先前公開解釋過Claude寫作變差的原因,指出強化學習的獎勵配比讓模型愈來愈像是在寫給AI看,Opus 5.5是第一個針對句子清晰度做專門調整的版本。Opus 5.5比Opus 5高出的18分裡,有多少來自這次寫作調整、有多少來自能力本身的提升,Arena的資料無法拆分,Anthropic也沒有提出對應的評測結果。

把幾個世代串起來看:Opus 4.6、4.7至今仍在前四名,Opus 5發布後沒能接下棒子,一直到Opus 5.5才把第一名換成新面孔。眼下Anthropic在這張偏好榜上的主要對手,是自家的舊版本。

參考來源:Arena官方帳號、Arena Text排行榜、CocoLoop、Anthropic模型定價頁;分數、信賴區間與投票數以Arena頁面當前資料為準。