Claude Mythos 登頂 SWE-bench Pro 77.8%

4月7日,Anthropic 官方宣布了一件有點奇怪的事:他們發布了一個新模型,叫做 Claude Mythos,同時宣布這個模型不對公眾開放

不是「稍後開放」,是「目前只給 40 家機構用,其他人等著」。

這個專案叫做 Project Glasswing

Mythos 到底有多強

先看數據:

基準測試Claude Opus 4.6Claude Mythos變化
SWE-bench Verified80.8%93.9%+13.1%
SWE-bench Pro未公布77.8%當前榜首

SWE-bench Pro 目前的第二名是智譜 GLM-5.1(58.4%),第三是 GPT-5.4(57.7%)。Mythos 以 77.8% 把第二名甩出了將近 20 個百分點,差距不算小。

但 Anthropic 不只是在刷榜。他們讓 Mythos 去掃了真實的程式碼庫,找出了:

  • 主流作業系統和瀏覽器裡的數千個零日漏洞
  • 一個在 FFmpeg 裡藏了 16 年 的老漏洞——這個漏洞曾經被超過 500 萬次傳統安全掃描工具掃過,全部漏檢

Cisco 首席安全官 Anthony Grieco 的原話是:「這代表了一次深刻的典範轉移,也是一個清晰的訊號——過去那套強化系統的方法已經不夠用了。」

Project Glasswing 的邏輯是什麼

Anthropic 給這 40 家機構的是 Mythos 的預覽版存取權限,用途只有一個:防禦性網路安全工作

目前拿到存取權限的合作方包括:Amazon、Apple、Broadcom、Cisco、CrowdStrike、Linux 基金會、Microsoft、Palo Alto Networks。

Anthropic 配套提供了:

  • 1 億美元的 API 使用額度,涵蓋參與方的安全測試和研究
  • 400 萬美元直接捐給開源安全組織

他們為什麼要搞成這種「限量版」形式?

官方解釋很直接:Mythos 在網路安全能力上「目前遠超其他任何 AI 模型」,但正因為這樣,它也能被拿來加速大規模網路攻擊。Anthropic 認為在沒有足夠防護措施的情況下,公開這個模型的風險太高。

所以他們選擇了一個折中方案:先給防禦方用,讓安全團隊提前打好補丁,再考慮更大範圍的開放。

這個策略對不對

值得想一想。

傳統的 AI 模型發布邏輯是:發布、測試、發現問題、修補、循環。這個過程是公開的,風險是擴散的——攻擊者和防禦者同時拿到新工具。

Glasswing 的思路反過來:先給防守方一段時間窗口,讓他們用 Mythos 主動找漏洞、提前修,然後再考慮更廣泛的存取。

從博弈論角度,這個設計有道理——如果防禦方先行動,攻擊方利用同樣模型的成本就高了一截。

但實際效果怎麼樣,取決於兩件事:這 40 家機構能不能真的在這個窗口期把關鍵漏洞修掉;以及模型能力本身有沒有洩漏風險(畢竟 Mythos 的存在已經先因資料洩漏被媒體披露了)。

Mythos 是什麼級別的模型

這是 Anthropic 明確說的「迄今為止最強的模型」,不屬於 Opus 4.x 的延伸迭代,是新一代。

前幾週有媒體因為一次資料洩漏事件提前曝光了 Mythos 的存在,Fortune 報導稱 Anthropic 內部把它描述為「能力上的一次階躍式跨越」。現在這個名字和能力都官方落地了,但不是以發布的方式,而是以定向合作計畫的方式。

Anthropic 在等什麼還沒說清楚。但從 SWE-bench Pro 77.8% 這個數字來看,這個模型的程式碼能力已經是另一個量級。

參考來源:Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative(TechCrunch);Anthropic debuts Project Glasswing,CocoLoop、 leveraging its powerful Mythos model to reinforce software security(SiliconAngle);Anthropic is giving some firms early access to Claude Mythos to bolster cybersecurity defenses(Fortune);Exclusive: Anthropic Mythos AI model representing step change in power revealed in data leak(Fortune)