Fable 5.1登顶智能指数,单任务3.69美元

第三方评测机构 Artificial Analysis 更新了 Claude Fable 5.1 的测试结果:综合智能指数 66 分,在 192 个受测模型里排第一。上一代 Fable 5 是 62 分、第六名。

同一份结果里还有另一组数字。跑完整套智能指数评测,Fable 5.1 花掉 8523.16 美元,Fable 5 是 5455.22 美元;折算到单个任务,成本从 3.14 美元涨到 3.69 美元。

单价没动,话变多了

两代模型的挂牌价完全一样:输入每百万 token 10 美元,输出 50 美元。多出来的三千美元全部来自输出长度——Fable 5 跑完整套题吐了 8300 万 token,5.1 吐了 1.4 亿,多出约 69%。Artificial Analysis 给出的中位数是 7100 万,也就是说 5.1 的话量接近中位水平的两倍。

这符合近一年推理模型的普遍走向:能力提升靠让模型多想几步,而计费按 token 走,账单跟着思考长度一起涨。对按月付订阅的普通用户没有直接影响;对按 API 结算的团队来说,同样的任务量,预算得重排一遍。

首 token 等了近五分钟

速度那一栏更扎眼。Fable 5.1 输出速度 66.4 token/秒,在 192 个模型里排第 84,低于 70 的中位数;首 token 返回时间 296.81 秒,上一代是 116.06 秒,多等了一倍半还多。

这个延迟数字在交互式场景里基本没法用,但它测的是完整推理流程——模型在吐出第一个字之前先想了很久。放在无人值守的后台任务上,等五分钟不算问题;放在编辑器里等补全,就是另一回事。

和 GPT-5.6 Sol 摆一起看

同一榜单上,OpenAI 的 GPT-5.6 Sol 拿 61 分排第八,跑完整套评测花 2017.29 美元,单任务 0.95 美元,输出 7000 万 token,挂牌价输入 4 美元、输出 20 美元。

粗算一下:Fable 5.1 比它多 5 分智能指数,单任务成本是它的 3.9 倍,跑完整套题的总开销是 4.2 倍。很难据此断言谁更划算——两者接的活不一样,一次做对复杂任务省下的返工时间,未必抵不上这个差价。但它确实解释了为什么越来越多团队开始把模型分层调度:难题交给榜首,剩下八成的琐事丢给便宜档。

榜单只回答一个问题:谁最聪明。付账的人还得回答第二个:这一分值多少钱。

参考来源:Artificial Analysis 模型对比页、CocoLoop;智能指数得分、评测总开销、单任务成本、输出 token 量与首 token 时延均取自该机构公开页面的同一轮测试口径。