Anthropic 上线 Claude Fable 5.1,模型 ID claude-fable-5-1,Claude API 与 Bedrock、Google Cloud、Microsoft Foundry 同步开放。规格定价相同的 Mythos 5.1 同期发布,只给受邀客户。
底子沿用上一代:100 万 token 上下文全窗口统一计价,最大输出 12.8 万 token,自适应思考常开,知识截止 2026 年 6 月。
整张价目表只改了一格
输入 10 美元、输出 50 美元每百万 token,与上一代一致,缓存写入也没动。唯一变化的是缓存读取:Fable 5.1 按基础输入价的 0.025 倍计费,即 0.25 美元每百万 token,其他 Claude 模型是 0.1 倍。
这个降幅只对一种用法生效:同一段前缀被反复读取。粗算一笔,20 万 token 的前缀在一次跑几小时的 agent 会话里被回看 100 次,就是 2000 万 token 的缓存读,旧价 20 美元,新价 5 美元。写入价和 512 token 的最小可缓存长度都没动,省下的钱全部来自”回看”这个动作。
长程 agent 恰好是回看最密集的场景,把降价放在这一格,指向性很明确。
三处会直接报错的改动
从上一代迁过来,光换模型 ID 不改代码会出问题。
强制工具调用被取消。 tool_choice 设成 any 或指定工具直接返回 400。官方解释是这个模型思考常开,强制调用会跳过思考,模型转而把推演写进工具参数,反而拉低参数质量。要结构合法的 JSON,改用严格模式或结构化输出。
思考块开始认模型。 思考块只能单向传递:Fable 5.1 读得懂更早模型的,反过来读不了。会话往上升级推理链保得住,往回降级那几轮就没了。中途切模型的路由和 fallback,API 会把读不了的块悄悄丢掉,不计费也默认不告诉你。
改历史会让后面的思考块全部作废。 动了思考块之前的任何东西——系统提示、工具数组、更早的某条消息——下一次请求就报 400,对 8 月 31 日及以后创建的新账号强制生效。最常见的踩法是把每轮临时提醒注入历史、下一轮再删掉。要自查的是自己拼消息数组的集成,用官方客户端的不用管。
省下的输入钱,可能从输出那头还回去
比破坏性改动更需留意的是不改代码也会发生的默认行为变化。官方列了七条,三条直接关系到账单:并行工具调用变得不稳定,上一代一轮批量发几个的地方 5.1 可能只发一个;改文件时更倾向整文件重写,结果一样但多花输出 token;低努力档位下调用搜索变少。
把这几条和价目表并排看,5.1 与其说是降价,不如说把成本从输入侧挪到了轮次侧。缓存读便宜四分之三,但更碎的工具调用和整文件重写吃的是 50 美元每百万的输出价,比输入贵五倍。账单是涨是跌,取决于 agent 循环里”重复读上下文”和”反复吐内容”哪一头更重。
新增的四项 beta 里,会话中途改努力档位和单轮生效的系统消息正是为绕开上面那些坑准备的。另有一项默认开启的内容标识:生成文本带统计式水印,图片视频带 C2PA 凭证。
跑分拉开最大的是科研 agent
官方公布的横向对比里,各项提升幅度很不均匀:
| 基准(能力项) | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1(科研 agent) | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0(agent 编码) | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2(知识工作,计分制) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0(电脑操作,宽松/严格) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | — |
| Humanity’s Last Exam(无工具/带工具) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | — |
| AutomationBench(业务流程) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0(agent 编码) | 73.4% | 70.5% | 70.0% | 67.2% |
跨度最大的是科研 agent:52.6% 对上一代的 24.7%,翻了一倍还多。这也是上一代唯一明显落后于 Opus 5 的地方(24.7% 对 29.0%),5.1 补的是短板而非普涨。业务流程那栏同理,31.4% 对 17.1%。Mythos 5.1 在 Terminal-Bench 4.0 上另报 60.9%。
反过来看常规活儿:CursorBench 从 70.5% 到 73.4%,只多 2.9 个百分点;带工具的 Humanity’s Last Exam 多 1.2 个百分点;知识工作 1853 对 Opus 5 的 1824,差 29 分。这组数字和定价那节能对上——贵一倍的钱买的是长程和高难度任务,日常编码与常规问答的差距小到未必值回票价。官方建议也是这个意思:多数负载仍从 Opus 5 起步。
参考来源:Anthropic 模型文档、CocoLoop、版本变更说明页;价格、上下文规格与破坏性改动按官方文档披露口径核对,长会话成本为按公开单价粗算。