第三方評測機構Artificial Analysis更新了Claude Fable 5.1的測試結果:綜合智慧指數66分,在192個受測模型中排名第一。上一代Fable 5是62分、第六名。
同一份結果裡還有另一組數字。跑完整套智慧指數評測,Fable 5.1花掉8523.16美元,Fable 5是5455.22美元;換算成單一任務的成本,則是從3.14美元漲到3.69美元。
單價沒變,輸出變多了
兩代模型的掛牌價完全相同:輸入每百萬token 10美元、輸出50美元。多出來的三千美元全部來自輸出長度——Fable 5跑完整套題吐出8300萬個token,5.1則是1億4000萬個,多了約69%。Artificial Analysis給出的中位數是7100萬個token,也就是說5.1的輸出量接近中位水準的兩倍。
這符合近一年推理模型的普遍走向:能力提升靠的是讓模型多想幾步,而計費是照token算,帳單自然跟著思考長度一起漲。對用月費訂閱的一般使用者沒有直接影響;但對用API結算的團隊來說,同樣的工作量,預算得重新抓一次。
第一個token等了將近五分鐘
速度那一欄更扎眼。Fable 5.1的輸出速度是每秒66.4個token,在192個模型中排第84名,低於中位數的70;首個token的回應時間是296.81秒,上一代是116.06秒,多等了一倍半以上。
這個延遲數字放在互動式場景裡基本沒法用,但它量測的是完整的推理過程——模型在吐出第一個字之前先想了很久。放在無人值守的後台工作上,等五分鐘不算問題;放在編輯器裡等自動完成,就是另一回事了。
和GPT-5.6 Sol放在一起看
同一份榜單上,OpenAI的GPT-5.6 Sol拿61分、排第八,跑完整套評測花了2017.29美元,單一任務0.95美元,輸出7000萬個token,掛牌價輸入每百萬token 4美元、輸出20美元。
粗估一下:Fable 5.1比它多5分智慧指數,單任務成本是它的3.9倍,跑完整套題的總開銷是4.2倍。單憑這些很難斷言誰比較划算——兩者接的活本來就不一樣,一次把複雜任務做對省下的返工時間,未必比不上這個價差。但它確實解釋了為什麼愈來愈多團隊開始把模型分層調度:難題交給榜首,剩下八成的例行工作丟給便宜的選項。
榜單只回答一個問題:誰最聰明。付帳的人還得回答第二個問題:這一分值多少錢。
參考來源:Artificial Analysis模型比較頁面、CocoLoop;智慧指數分數、評測總開銷、單任務成本、輸出token量與首個token時延,均取自該機構公開頁面的同一輪測試資料。