Anthropic於9月28日發布Claude Sonnet 5.5,是繼Opus 5.5之後、Claude 5.5家族的第二款模型。官方給出的兩個核心數字是:比Sonnet 5快30%以上,多數工作單次任務成本最多降低30%。API價格沒有調整,仍是每百萬輸入token 2美元、輸出10美元,快取讀取0.2美元。
模型當天同步上線Anthropic自家平台、AWS、Google Cloud與Microsoft Azure,API名稱為claude-sonnet-5-5,零資料保留選項在各平台照常提供。獨立開發者Simon Willison發現,claude.ai的免費方案已經換成Sonnet 5.5。
官方成績單
Anthropic在發布頁列出的主要成績如下:
| 基準測試 | Sonnet 5.5 |
|---|---|
| Terminal-Bench 4.0 | 70.6% |
| OSWorld 2.1(部分) | 80.1% |
| Humanity's Last Exam(含工具) | 64.5% |
| CursorBench 4.0 | 55.5% |
| FrontierCode 1.1(Max) | 46.2% |
| GDPval-AA v2.1 | 1844 |
幾家早期客戶的回饋大多集中在速度上。Box表示新模型比前一版快2.4倍,Slack則說沒有更動提示詞,就得到更好、更快的結果。
"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."
——Every公司Tyler Nishida
第三方測試出的另一面
Artificial Analysis給Sonnet 5.5的智能指數打了56分,排名第二,只比Opus 5.5的58分低2分。在該機構自己的Terminal-Bench 4.0測試中,Sonnet 5.5拿到64%,Opus 5.5與GPT-6 Astra都是60%。弱點在事實類題目:事實準確率只有54%,Opus 5.5則是66%,科學推理測試也比Opus 5.5低6分。
成本這一項與官方說法不太一致。Artificial Analysis用最高推理檔(max)跑完整套測試,Sonnet 5.5平均每個任務吐出約19.3萬個輸出token,比Opus 5.5和Sonnet 5的max檔都多出約六成,是GPT-6 Astra的7倍。單價沒變、token數增加,每個任務成本落在約7.6美元,比Sonnet 5高出約50%。
雙方的計算基礎不同。Anthropic說的是「多數工作」,也就是預設檔位下的日常寫程式、寫作任務;Artificial Analysis測的則是把思考預算開到滿的極端情況。Willison也遇到同樣的現象:他讓模型用max檔寫一個WebGL小程式,花掉12.8萬個token、1.28美元;換成xhigh檔,41秒就跑完,只花了約0.06美元。他還提到Sonnet 5.5跟Opus 5.5有同樣的毛病,max檔很容易把token額度用光。
放進同級模型裡比較
橫向來看,Sonnet這條產品線的定位已經很清楚:用Opus八九成的能力,換來更低的價格。Sonnet 5剛推出時主打的是,執行代理型任務只要花Opus約三分之一的錢;5.5世代把速度拉上來,基準分數也更貼近Opus 5.5,在Artificial Analysis的排行榜上兩者只差2分。
免費方案的變動影響的人更多。Willison的判斷是,claude.ai免費用戶現在拿到的模型,比ChatGPT免費方案用的Luna系列強不少。OpenAI那邊的GPT-6 Luna走低價路線,Arena最新數據顯示它單次任務成本只要0.05美元左右。Anthropic還沒公布Haiku 5.5,Willison預期會在未來幾週內推出,到時候低價檔才會正面對上Luna。
對開發者來說,最直接的建議是先別急著開max檔。依目前公開的數據,預設或xhigh檔比較接近官方宣稱的「提速降本」,max檔的帳單反而可能比上一代還高。至於自己手上的任務值不值得,Anthropic沒有給出按檔位拆分的成本表,只能自己實測看看。
參考來源:Anthropic官方發布頁、Simon Willison部落格、CocoLoop、Artificial Analysis測評報告;API價格以Anthropic發布頁為準,每任務成本與token用量以Artificial Analysis智能指數max檔數據為準。