Fable 5.1上線 快取讀取砍到四分之一

Anthropic 上線 Claude Fable 5.1,模型 ID 為 claude-fable-5-1,Claude API 與 Bedrock、Google Cloud、Microsoft Foundry 同步開放使用。規格與定價完全相同的 Mythos 5.1 也同期發布,目前僅開放受邀客戶使用。

底層架構沿用上一代:100萬 token 的上下文視窗全區間統一計價,最大輸出上限12.8萬 token,自適應思考預設常開,可靠的知識截止日為2026年6月。

整張價目表只改了一格

輸入每百萬 token 10美元、輸出50美元,與上一代一致,快取寫入價格也沒變動。唯一有變化的是快取讀取:Fable 5.1 按基礎輸入價的0.025倍計費,也就是每百萬 token 0.25美元,其他 Claude 模型則是0.1倍。

這個降幅只對一種用法有效:同一段前綴被反覆讀取。粗估一下,20萬 token 的系統提示加程式庫前綴,在一次跑好幾個小時的代理(agent)對話裡被回看100次,就是2000萬 token 的快取讀取,舊價格要價20美元,新價格只要5美元。寫入價格與512 token 的最小可快取長度都沒變,省下來的錢全部來自「回看」這個動作。

長時間執行的代理任務,正好是回看最密集的場景。把降價集中在這一格,指向性相當明確。

三處會直接噴錯的改動

從上一代遷移過來,只換模型 ID 而不改程式碼會出問題。

強制工具呼叫被取消。 tool_choice 設成 any 或指定某個工具,會直接回傳400錯誤。官方的解釋是這個模型思考功能預設常開,強制呼叫會讓思考被跳過,模型反而會把推演過程寫進工具參數裡,拉低參數品質。要拿到結構合法的 JSON,得改用嚴格模式或結構化輸出。

思考區塊開始認模型。 每個思考區塊都會記錄自己是由哪個模型產生,而且只能單向傳遞:Fable 5.1 讀得懂更早期模型的思考區塊,反過來卻讀不了。對話中往上升級模型,推理鏈能保住;往回降級,那幾輪的推理就沒了。中途切換模型的路由與 fallback 機制,API 會把讀不了的區塊悄悄丟掉,不計費,但預設也不會告訴你。

修改歷史紀錄會讓後面的思考區塊全部作廢。 只要動了思考區塊之前的任何東西——系統提示、工具陣列、更早的某則訊息——下一次請求就會噴400。這一條對8月31日以後建立的新帳號強制生效。最常見的踩雷方式,是把每輪的臨時提醒注入歷史紀錄、下一輪再刪掉,以及在兩次請求之間重建系統提示。用官方客戶端的人不用擔心,要自己檢查的是自行組裝訊息陣列的整合方。

省下來的輸入費,可能從輸出那頭補回去

比破壞性改動更值得留意的,是不改程式碼也會自動發生的預設行為變化。官方一口氣列出七條,其中三條直接關係到帳單。

第一,平行工具呼叫變得不穩定:上一代一輪能批次發出好幾個呼叫的地方,5.1可能一輪只發一個,文件說答案品質不會下降,但輪次一多就要吃 token 和往返成本。第二,它更傾向整個檔案重寫,結果通常一樣,但多花的是輸出 token。第三,在低努力(effort)檔位下呼叫搜尋的次數變少,更常憑記憶作答。

把這幾條和價目表擺在一起看,5.1做的與其說是降價,不如說是把成本從輸入端挪到輪次端。快取讀取便宜了四分之三,但更零碎的工具呼叫與整檔重寫,吃掉的是每百萬 token 50美元的輸出價,比輸入貴五倍。帳單究竟是漲是跌,取決於自己的代理迴圈裡「重複讀取上下文」跟「反覆吐出內容」哪一頭比較重——遷移完重新跑一次評測、順手對一次帳,這一步省不掉。

新增的四項 beta 功能裡,對話中途調整努力檔位、單輪生效的系統訊息,這兩項正是為了繞開上面提到的坑而準備的。另外還有一項預設開啟的內容溯源機制:生成的文字在所有平台都會帶統計式浮水印,取回的圖片與影片則帶有 C2PA 憑證。

跑分拉開最大的是科研代理

官方公布的橫向對比裡,各項提升幅度落差很大:

測試基準Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1(代理式科學研究)52.6%24.7%29.0%22.4%
Terminal-Bench 4.0(代理式程式撰寫)55.8%42.0%52.3%37.3%
GDPval-AA v2(知識工作,分數)1853172318241711
OSWorld 2.0(電腦操作,部分達成 / 嚴格達成)77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%
Humanity's Last Exam(無工具 / 有工具)60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%
AutomationBench(業務流程)31.4%17.1%26.9%19.6%
CursorBench 3.2.0(代理式程式撰寫)73.4%70.5%70.0%67.2%

跨度最大的是科研代理:52.6%對上一代的24.7%,翻了一倍還多。這也是上一代唯一明顯落後於Opus 5的地方(24.7%對29.0%),5.1補的是短板而非普漲。業務流程那欄同理,31.4%對17.1%。Mythos 5.1在Terminal-Bench 4.0上另報60.9%。

反過來看常規活兒:CursorBench從70.5%到73.4%,只多2.9個百分點;帶工具的Humanity's Last Exam多1.2個百分點;知識工作1853對Opus 5的1824,差29分。這組數字和定價那節能對上——貴一倍的錢買的是長程和高難度任務,日常編碼與常規問答的差距小到未必值回票價。官方建議也是這個意思:多數負載仍從Opus 5起步,Fable 5.1留給高難度推理和長程代理。價差擺在那裡,Opus 5是5美元和25美元,延遲還更快。

參考來源:Anthropic 模型文件、CocoLoop、版本異動說明頁;價格、上下文規格與破壞性改動已按官方文件揭露口徑核對,長對話成本為依公開單價粗估。