Claude Opus 4.7 發佈,程式碼能力三倍碾壓前代

Anthropic 在4月16日發佈了 Claude Opus 4.7,這個版本在程式設計能力上的提升幅度出乎不少人的預料——生產程式碼修復任務直接做到了前代的三倍,SWE-bench Pro 從53.4%跳到64.3%。

三個最值得看的跑分

先把核心數據擺出來:

基準測試 Opus 4.6 Opus 4.7 變化
SWE-bench Pro 53.4% 64.3% +10.9%
CursorBench 58% 70% +12%
Rakuten-SWE-Bench(生產任務) 基線 3倍 大幅提升

SWE-bench Pro 現在是公認比較難刷的程式設計基準。64.3%已經超過了3月份發佈的 GPT-5.4 和2月份 Google 的 Gemini 3.1 Pro。在 Anthropic 內部的93項程式設計任務測試裡,Opus 4.7比4.6提升了13%,還多解決了4道4.6完全拿不下的題目。

Rakuten 那個數字最有趣——「生產程式碼修復任務是前代的三倍」說的是真實企業程式碼庫裡的 bug 修復,不是合成資料集。拿真實線上程式碼跑出來的數字,比實驗室合成題目更有參考價值。

Anthropic 自己也做了金融智能體評測(Finance Agent Evaluation)和經濟價值知識工作基準(GDPval-AA),兩項都拿了當前最好成績。

視覺能力翻了三倍多,但這件事很少有人提

程式設計之外,Opus 4.7 在影像處理上做了比較大的升級:

  • 支援長邊最高2576像素(約3.75百萬像素)
  • 是此前 Claude 系列影像解析度上限的3倍以上
  • 對化學分子結構圖、複雜工程示意圖的辨識明顯更準

這對科研場景、分析技術文件或者讀工程圖紙的人影響會比較大。寫程式碼的話感知可能不那麼直接,但做多模態工程的人應該測一測。

還有一個容易忽視的變化:tokenizer 更新了,同樣的文字輸入現在會生成1.0到1.35倍的 token 數量。聽起來像是壞事(token 多了就是貴),但實際上說明模型在處理資訊時粒度更細,長文件和複雜程式碼的理解應該更紮實。

為什麼 Anthropic 故意關掉了網路安全能力

這是4.7發佈裡最反直覺的決定:Opus 4.7 主動加了安全護欄,會自動檢測並攔截高風險的網路安全請求

等等——Anthropic 上週剛發佈了 Claude Mythos Preview,主打的就是網路安全,還拉著 Amazon、Apple、Microsoft 搞了個 Project Glasswing 專項計劃。兩件事怎麼同時成立?

答案是產品分層

  • Mythos 是專門為安全專業人員設計的受控模型,通過 Cyber Verification Program 身份核驗才能使用
  • Opus 4.7 是面向大眾的通用旗艦,Anthropic 不希望它成為任何人都能隨手呼叫的攻擊工具

邏輯說得通。把高危能力集中在可驗證身份的專業渠道,而不是透過 API 把它開放給所有人——這是一種務實的安全分層。

新功能速覽

這次同步上線了幾個輔助功能:

  • Task budgets(公測):讓 Claude 在長時間執行任務時自己管理 token 消耗節奏,避免在最後階段突然用完預算
  • /ultrareview 命令:專門的程式碼審查會話,標註 bug 和設計問題,比普通 review 更深
  • xhigh 努力檔:此前只有 high,現在加了 xhigh,在推理深度和回應速度之間提供了更細的調節空間
  • Auto mode 擴展:Max Claude Code 用戶可以使用了

價格沒變:API 呼叫 $5/百萬輸入 token、$25/百萬輸出 token,跟 Opus 4.6 完全一樣。平台支援方面:claude.ai、API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 都已上線,model ID 是 claude-opus-4-7

和競品的差距到底多大

按 Anthropic 的說法,Opus 4.7 在 agentic 程式設計、大規模工具呼叫、agentic 電腦使用和金融分析這幾項上,都超過了 GPT-5.4(3月發佈)和 Gemini 3.1 Pro(2月發佈)。

當然,跑分只是跑分。真實體驗上的差距,等社群用起來之後才會有更多證據。但光是 Rakuten-SWE-Bench 那個「3倍」數字,在生產程式碼修復這個場景上已經夠有說服力了。

從 Opus 4.6 到 4.7,不是那種換了個皮膚的小步迭代——至少在程式設計任務上,這次的提升幅度值得認真對待。

參考來源:CocoLoop、Introducing Claude Opus 4.7(Anthropic Blog);Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities(The Decoder);Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM(VentureBeat)