Anthropic於10月7日發布Claude Haiku 5.5,這是Claude第5代的第一款小型模型,上一款Haiku還停留在4.5。新模型當天就上線Claude Platform,同步在AWS、Google Cloud和Microsoft Azure上架,Claude Code也在同一天的版本中加入了它。
官方給它的定位相當窄:高吞吐量的批次任務,以及作為大型模型呼叫的子代理。價格才是這次發布的主角。
兩檔計價,依提示長度切分
Haiku 5.5把定價依單次提示長度拆成兩檔,以10萬token為分界:
| 每百萬token | Haiku 5.5(≤10萬) | Haiku 5.5(>10萬) | Haiku 4.5 |
|---|---|---|---|
| 輸入 | 0.10美元 | 0.50美元 | 1.00美元 |
| 輸出 | 0.50美元 | 2.50美元 | 5.00美元 |
| 快取讀取 | 0.01美元 | 0.05美元 | 0.10美元 |
| 快取寫入 | 0.125美元 | 0.625美元 | 1.25美元 |
短提示那一檔,各項單價都是Haiku 4.5的十分之一;長提示那一檔則是一半。Anthropic對外的說法是整體運算成本平均下降約75%。
短檔的輸入輸出價格,和OpenAI 9月下旬發布的GPT-6 Luna完全一致。兩家的小型模型在價格表上已經貼到同一條線。
同一天,Anthropic還把Sonnet 5.5的快取讀取價格從每百萬token 0.20美元降到0.10美元,並向訂閱用戶發放API額度:Max 5x每月100美元,Max 20x每月200美元,Team方案全團隊合計最多500美元。開發者Simon Willison在部落格中提到,這筆額度當月沒用完不會累計到下個月。
跑分與推理檔位
Haiku 5.5內建推理功能,無法關閉,可以在low、medium、high、xhigh、max五檔之間調整,預設為medium。官方公布的成績中,電腦操作測試OSWorld 2.1離線子集達72.4%,Terminal-Bench 4.0為39.2%,Humanity's Last Exam不使用工具為45.9%、使用工具則為57.4%。
幾家早期客戶公開了自己的內部數字。Box表示,新模型在他們的測試集上比Haiku 4.5高11分,延遲約減少一半:
"Claude Haiku 5.5 scored 11 points higher than Haiku 4.5 at about half the latency."
(Claude Haiku 5.5比Haiku 4.5高11分,延遲大約減半。)
Asana回報延遲降了三成以上,HubSpot表示拿到了這套測試中見過的最高分92.8%。這些數字都來自客戶自行測試,題目並未公開。
推理檔位對成本的影響很大。Simon Willison用同一個「畫一隻騎自行車的鵜鶘」提示,分別試了最低檔與最高檔:low檔花了約0.0009美元、7秒;max檔花了約0.034美元、5分9秒,單次成本差了30多倍。
粗算:分詞器吃掉一部分降價
價格表之外還有一個容易被忽略的變數。Simon Willison指出,Haiku 5.5換了分詞器,同一段文字切出來的token數約為Haiku 4.5的1.25倍。
依這個係數粗算:短提示檔的實際輸入成本,相當於每百萬「舊token」0.125美元,對比Haiku 4.5的1美元,降幅約87%,依然相當可觀。長提示檔就沒那麼好看了,0.50美元乘以1.25是0.625美元,降幅縮到約37%。
若再把預設開啟的推理算進去,輸出token會比不帶推理的Haiku 4.5多出一截,具體多少取決於檔位與任務。對跑分、擷取、路由這類短輸入任務的團隊來說,換模型基本上是直接省錢;常餵長文件、長上下文的場景,最好先拿自己的流量試算一次帳單再切換。
安全設定上,官方稱Haiku 5.5對網路安全類請求的限制介於Haiku 4.5和Sonnet 5.5之間,生物領域的防護與Sonnet 5系列一致,相關研究需要另外申請驗證資格。
參考來源:Anthropic Claude Haiku 5.5產品頁、Simon Willison部落格、CocoLoop、SiliconANGLE;Anthropic定價表核驗兩檔單價、快取價格與Haiku 4.5的對比,Sonnet 5.5快取讀取調價以官方公告為準。