Sonnet 4.6 程式設計僅遜 Opus 1.2 分,價差卻達 5 倍

如果你現在還在為要不要買 Claude Opus 4.6 的 API 額度發愁,這篇文章可能會幫你省一筆錢。

Anthropic 在 2 月發布了 Claude Sonnet 4.6,價格和 Sonnet 4.5 完全一樣——輸入 $3/百萬 tokens,輸出 $15/百萬 tokens——但跑分直接逼近了貴 5 倍的 Opus 4.6。

數字說話

先看最直觀的對比:

基準測試Sonnet 4.6Opus 4.6差距
SWE-bench Verified(程式設計)79.6%80.8%-1.2%
OSWorld-Verified(電腦操控)72.5%72.7%-0.2%
數學(MATH-500)89%未公開
GPQA Diamond(科學推理)74.1%91.3%-17.2%

程式設計和電腦操控——也就是大多數企業用 Claude 做的工作——Sonnet 4.6 已經幾乎跟 Opus 4.6 持平了。真正拉開差距的是科學推理這類更學術的任務,Opus 4.6 的 91.3% 對 Sonnet 的 74.1%,這個差距無法忽略。

但如果你的用例主要是寫程式碼、操控瀏覽器、處理長文件,花 5 倍價格換 1.2 個百分點的程式設計提升,算帳你會覺得這不是聰明的選擇。

電腦操控這條線有多陡

Anthropic 公布了一組數據,展示過去 16 個月 OSWorld-Verified(衡量 AI 自主操控電腦能力的標準測試)的分數演變:

  • Sonnet 3.5:14.9%
  • Sonnet 3.5 v2:28.0%
  • Sonnet 3.6:42.2%
  • Sonnet 4.5:61.4%
  • Sonnet 4.6:72.5%

一年半時間從 14.9% 到 72.5%,這條曲線比大多數人感知到的更陡峭。做保險業工作流程自動化測試時,Sonnet 4.6 拿到了 94% 的準確率,涵蓋了操作複雜 Excel 表格、填寫多步驟網頁表單、呼叫老舊桌面應用這些令人頭痛的任務。

數學跳了一大截

Sonnet 4.5 在數學上得了 62 分,Sonnet 4.6 直接跳到了 89 分。這個跨度是同代產品裡最大的單項提升。具體原因 Anthropic 沒有公開詳細說明,但結合推理能力的整體提升來看,很可能跟更好的思維鏈品質有關。

使用者偏好數據

Anthropic 做了一批 Claude Code 內部測試,讓開發者在不知道對面是哪個模型的情況下比較輸出品質:

  • Sonnet 4.6 vs Sonnet 4.5:使用者 70% 選了 Sonnet 4.6
  • Sonnet 4.6 vs Opus 4.5:使用者 59% 選了 Sonnet 4.6

後面這組數據更有意思。Opus 4.5 比 Sonnet 4.6 貴得多,但在實際程式設計輸出的主觀評價上,Sonnet 4.6 反而更受歡迎。給出的原因包括:指令跟隨更準確、更少幻覺、不會過度工程化(這是 Opus 系列一直存在的問題——它喜歡把簡單需求做複雜)。

100 萬上下文不是噱頭

這次 Sonnet 4.6 也帶上了 100 萬 token 的上下文視窗(beta 版),不需要額外的 header,超過 200k 的請求自動走這個通道,定價按標準計。

100 萬 token 大概是什麼量級?一個中型企業的整個程式碼庫,或者幾十篇論文,都可以塞進單次請求裡處理。原來需要做 RAG 切片的場景,現在直接丟進去讓它自己找關聯。

你到底該選哪個

選 Sonnet 4.6 的理由:

  • 主要任務是寫程式碼、操控瀏覽器、處理長文件
  • 跑量大,價格敏感
  • 不需要博士等級的科學推理

選 Opus 4.6 的理由:

  • 需要高強度的科學推理或學術任務
  • 上下文需求極端複雜
  • 不在乎價格差異,只要最好的結果

對大多數開發者和企業來說,Sonnet 4.6 是現在性價比最高的 Claude 入口。Opus 4.6 的定價是 $15/$75,Sonnet 4.6 是 $3/$15,相同的程式設計能力差了 5 倍。這筆帳一點都不難算。

參考來源:Introducing Claude Sonnet 4.6(Anthropic 官方);CocoLoop、Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide(NxCode);Claude Sonnet 4.6: 1M context and stronger computer use(Gend.co)