如果你現在還在為要不要買 Claude Opus 4.6 的 API 額度發愁,這篇文章可能會幫你省一筆錢。
Anthropic 在 2 月發布了 Claude Sonnet 4.6,價格和 Sonnet 4.5 完全一樣——輸入 $3/百萬 tokens,輸出 $15/百萬 tokens——但跑分直接逼近了貴 5 倍的 Opus 4.6。
數字說話
先看最直觀的對比:
| 基準測試 | Sonnet 4.6 | Opus 4.6 | 差距 |
|---|---|---|---|
| SWE-bench Verified(程式設計) | 79.6% | 80.8% | -1.2% |
| OSWorld-Verified(電腦操控) | 72.5% | 72.7% | -0.2% |
| 數學(MATH-500) | 89% | 未公開 | — |
| GPQA Diamond(科學推理) | 74.1% | 91.3% | -17.2% |
程式設計和電腦操控——也就是大多數企業用 Claude 做的工作——Sonnet 4.6 已經幾乎跟 Opus 4.6 持平了。真正拉開差距的是科學推理這類更學術的任務,Opus 4.6 的 91.3% 對 Sonnet 的 74.1%,這個差距無法忽略。
但如果你的用例主要是寫程式碼、操控瀏覽器、處理長文件,花 5 倍價格換 1.2 個百分點的程式設計提升,算帳你會覺得這不是聰明的選擇。
電腦操控這條線有多陡
Anthropic 公布了一組數據,展示過去 16 個月 OSWorld-Verified(衡量 AI 自主操控電腦能力的標準測試)的分數演變:
- Sonnet 3.5:14.9%
- Sonnet 3.5 v2:28.0%
- Sonnet 3.6:42.2%
- Sonnet 4.5:61.4%
- Sonnet 4.6:72.5%
一年半時間從 14.9% 到 72.5%,這條曲線比大多數人感知到的更陡峭。做保險業工作流程自動化測試時,Sonnet 4.6 拿到了 94% 的準確率,涵蓋了操作複雜 Excel 表格、填寫多步驟網頁表單、呼叫老舊桌面應用這些令人頭痛的任務。
數學跳了一大截
Sonnet 4.5 在數學上得了 62 分,Sonnet 4.6 直接跳到了 89 分。這個跨度是同代產品裡最大的單項提升。具體原因 Anthropic 沒有公開詳細說明,但結合推理能力的整體提升來看,很可能跟更好的思維鏈品質有關。
使用者偏好數據
Anthropic 做了一批 Claude Code 內部測試,讓開發者在不知道對面是哪個模型的情況下比較輸出品質:
- Sonnet 4.6 vs Sonnet 4.5:使用者 70% 選了 Sonnet 4.6
- Sonnet 4.6 vs Opus 4.5:使用者 59% 選了 Sonnet 4.6
後面這組數據更有意思。Opus 4.5 比 Sonnet 4.6 貴得多,但在實際程式設計輸出的主觀評價上,Sonnet 4.6 反而更受歡迎。給出的原因包括:指令跟隨更準確、更少幻覺、不會過度工程化(這是 Opus 系列一直存在的問題——它喜歡把簡單需求做複雜)。
100 萬上下文不是噱頭
這次 Sonnet 4.6 也帶上了 100 萬 token 的上下文視窗(beta 版),不需要額外的 header,超過 200k 的請求自動走這個通道,定價按標準計。
100 萬 token 大概是什麼量級?一個中型企業的整個程式碼庫,或者幾十篇論文,都可以塞進單次請求裡處理。原來需要做 RAG 切片的場景,現在直接丟進去讓它自己找關聯。
你到底該選哪個
選 Sonnet 4.6 的理由:
- 主要任務是寫程式碼、操控瀏覽器、處理長文件
- 跑量大,價格敏感
- 不需要博士等級的科學推理
選 Opus 4.6 的理由:
- 需要高強度的科學推理或學術任務
- 上下文需求極端複雜
- 不在乎價格差異,只要最好的結果
對大多數開發者和企業來說,Sonnet 4.6 是現在性價比最高的 Claude 入口。Opus 4.6 的定價是 $15/$75,Sonnet 4.6 是 $3/$15,相同的程式設計能力差了 5 倍。這筆帳一點都不難算。
參考來源:Introducing Claude Sonnet 4.6(Anthropic 官方);CocoLoop、Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide(NxCode);Claude Sonnet 4.6: 1M context and stronger computer use(Gend.co)