Sonnet 5.5排第三 GPT-6.1 Sol第五

評測平台Arena在10月2日把Claude Sonnet 5.5(Max檔)和GPT-6.1 Sol(Max檔)加入了Agent Arena排行榜。兩款模型分別排在第3名和第5名,淨改善率為12.52%與11.23%。前兩名仍是Anthropic自家的Claude Fable 5.1(14.31%)與Opus 5.5(13.82%),第4名是GPT-6 Astra(12.27%)。

Agent Arena跟大家熟悉的文字對戰排行榜計分方式不同。它統計的是真實使用者把模型當AI代理使用的對話:模型要呼叫工具、執行多步驟任務,最後看使用者滿不滿意。排行榜頁面顯示,目前累計對話約215.8萬次,涵蓋51個模型。淨改善率綜合了工具呼叫的可靠性、任務完成情況與可引導性,9月30日Arena剛改過可引導性的演算法,從只看「被糾正後有沒有改」,擴大到對話裡每一輪能判斷的回覆都納入計分,一次就做對的模型會多拿分。

第三與第五,差距藏在誤差裡

只看名次,Sonnet 5.5壓過了GPT-6 Astra和GPT-6.1 Sol。把誤差範圍一起看就是另一幅光景:Sonnet 5.5的分數是12.52%±3.09%,GPT-6.1 Sol是11.23%±2.76%,兩者的區間大幅重疊,跟第4名Astra只差0.25個百分點。新模型剛上榜,對話樣本還少,誤差帶比Opus 5.5(±2.17%)寬了一截。照現在的數據,第3到第5名很難說誰一定更強。

細項指標上兩家各有所長。Sonnet 5.5在「Bash指令失敗後的復原」一項排名第一,得分15.05%;GPT-6.1 Sol在「工具幻覺」一項排名第一,捏造不存在工具的比例只有0.49%,「使用者確認任務完成」一項以15.47%排名第二。

帳單拉開了差距

兩款模型的API單價其實一樣,都是每百萬輸入token 2美元、輸出10美元。但到了AI代理任務裡,單個任務的花費差出好幾倍。Arena的成本頁面顯示:

模型淨改善率單任務成本
Claude Fable 5.114.31%約4.91美元
Claude Opus 5.513.82%約1.56美元
Claude Sonnet 5.512.52%約2.99美元
GPT-6 Astra12.27%約3.10美元
GPT-6.1 Sol11.23%約0.58美元
DeepSeek V4.1 Flash4.02%約0.11美元

單價一樣、單個任務成本卻差了五倍左右,差在token用量上。Sonnet 5.5在Max檔會寫得更長、想得更久,先前第三方測試也發現它每個任務消耗的token比上一代多出不少。結果是它比自家更大的Opus 5.5分數低、花費還更高,沒能擠進Arena標註的性價比前緣(Pareto front)。這條前緣目前由Fable 5.1、Opus 5.5、GPT-6.1 Sol和DeepSeek V4.1 Flash四個點連成。

GPT-6.1 Sol就是這次重新畫出前緣的那一個。Arena發表時給出的比較是:它的單任務中位成本比上一版GPT-6 Sol低39%,分數反而高1.52個百分點;比GPT-6 Astra便宜81%,分數差距在1.04個百分點以內。GPT-6.1 Sol上線才一週多就取代了GPT-6 Sol,這份排行榜給了OpenAI一個「便宜又不掉分」的第三方佐證。

這套成本數字也有它的統計限制。Arena統計的是使用者在它平台上發起的對話,任務類型以寫程式、查資料、跑指令為主,分布未必跟企業內部的實際工作流程一致;成本是按Arena實際呼叫API的花費換算出來的,用了快取折扣、批量折扣的企業帳單會更低。拿這張表來做採購決策,最好先用自己的任務抽樣重新測一次。

跟上一代比

把時間拉長來看,Sonnet這條產品線在Agent Arena上的排名一直在往前移動。上一代Sonnet 5剛上榜時排第6,這次5.5擠進了前三。OpenAI那邊則是另一種節奏:GPT-6 Sol在9月25日上榜時淨改善率9.71%,一週後6.1 Sol接棒,分數漲了約1.5個百分點,成本降了約四成。

對開發者來說,選哪個模型來跑AI代理任務,取決於任務量。偶爾跑幾個複雜任務,Opus 5.5這類分數高、單價還算合理的模型比較省心;要大量跑、按用量計費,GPT-6.1 Sol和DeepSeek V4.1 Flash這類低成本選項更合適。至於Sonnet 5.5,換到較低的推理檔位後成本與分數會落在哪裡,Arena目前只測了Max這一檔,還沒有數據。

參考來源:Arena Agent Arena排行榜、Arena成本前緣頁面、CocoLoop、Arena官方帳號、Artificial Analysis;各模型淨改善率、誤差範圍與單任務成本以Arena頁面顯示數值為準。