Claude Opus 5.5發表 成本降四成

Anthropic 於 9 月 22 日發表 Claude Opus 5.5,這是 Claude 5.5 系列的第一款模型。官方的定位主要有兩點:多數工作的表現與 Claude Fable 5.1 相當,整體執行成本比 Opus 5 低 40%

價目表按項目拆開來看:輸入每百萬 token 4 美元、輸出 20 美元,各降約兩成;快取讀取從 0.50 美元降到 0.20 美元,降幅達 60%。輸出速度方面,官方表示比 Opus 5 快 30% 以上,另外還有一款 fast 模式,價格為 8 美元和 40 美元,速度最高可達 2.5 倍。模型已在 Claude 平台 API(模型 ID「claude-opus-5-5」)、AWS、Google Cloud、微軟 Azure 上線,消費端各平台同步開放使用,單次最大輸出為 12.8 萬 token。

跑分表現

官方發表頁提供的對照如下。

評測項目Opus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.154.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
GDPval-AA v2.11846 Elo17351708
OSWorld 2.081.8%80.7%74.0%

第三方評測機構 Artificial Analysis 將 Opus 5.5 列為智慧指數第一名,得分 58。同日發布的 Claude Code 2.1.280 版本,也已把 Opus 5.5 設為預設的 Opus 模型。

發表頁還引用了幾家客戶的試用回饋:GitHub 表示解決同樣的終端任務,所需步驟不到 Opus 5 的一半;Optiver 表示品質與 Opus 5 相當,但回合數約減少一半,成本降低 40% 到 50%;Deloitte 表示在最低思考層級下抓到 72% 的已知缺陷,Opus 5 在最高層級也只有 56%。這些數字都來自廠商發表頁轉述的客戶說法,並未經過第三方覆核。

安全性方面官方怎麼說

Anthropic 表示 Opus 5.5 通過了自動化行為稽核,對齊分數是歷代最高,試圖繞過沙箱邊界的行為比 Opus 5 少 85%。網路安全類任務大多仍會路由給 Opus 4.8 處理,生物領域的防護等級與 Fable 5.1 相同。模型保留了針對蒸餾的思考過程保護機制,並依歐盟《人工智慧法案》加上浮水印,企業端可選擇零資料保留。發表前,METR 和 Frontier Design 參與了評估。

具體的失敗率、拒答率與紅隊測試項目,要等系統卡完整公開後才能核對,官方頁面本身並未列出這些數字。

放進同一天的價目表裡看

9 月 22 日這一天,OpenAI 也發表了 GPT-6 Sol 和 Luna,API 價格比上一代低約一半,Sol 是 2 美元和 10 美元,Luna 是 0.10 美元和 0.50 美元。橫向對照,Opus 5.5 的單價仍是 Sol 的兩倍,Anthropic 賣的是同一價格帶上的分數與更少的步驟:按 Optiver 和 GitHub 的說法,單次任務的回合數下降之後,單價差距在帳單上會被部分抵銷。抵銷多少,取決於任務的具體形態,沒有通用答案。

開發者端已經出現一則反向實測。技術部落客 Simon Willison 在測試中讓 Opus 5.5 以最高思考層級生成一張複雜 SVG,模型把 12.8 萬輸出 token 全部用完也沒能完成任務。高思考層級搭配長輸出很容易吃掉整個輸出預算,接進自動化流程之前,這個上限要先算進去。

對已經在用 Opus 5 的團隊來說,轉換成本主要在兩處:模型 ID 要改,輸出速度與回合數的變化也會讓原本的逾時與重試參數不再合適。價格下調對高頻呼叫的場景更明顯,快取讀取那 60% 的降幅尤其如此——常駐系統提示詞越長、請求越密集,省下的比例就越高。

參考來源:Anthropic 官方發表頁、Artificial Analysis、CocoLoop、Simon Willison 部落格;官方發表頁核對各檔位單價、跑分與安全措施口徑。