Anthropic於9月29日發布一份研究報告,評估智譜GLM-5.3的網路攻擊能力。報告的結論是,這款開放權重模型已經能自主打造端到端的漏洞利用程式,水準接近Anthropic自家的Claude Mythos Preview,而它的安全防護可以用相當簡單的手法繞過。
報告原文寫道:
"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."
攻擊能力測了哪幾項
Anthropic做了三組測試。第一組是針對Chrome V8引擎漏洞的ExploitBench,GLM-5.3在410次嘗試中成功50次,成功率約12%,Mythos Preview則是14%。第二組是內部基於OSS-Fuzz專案的二進位漏洞利用測試,GLM-5.3成功率4%,Mythos Preview 6%,參與對照的Claude Opus 4.6、Kimi K3、DeepSeek V4.1-Flash與上一代GLM-5.2全都是0%。第三組則是有人類專家參與的開放式攻擊任務。
最能說明門檻有多低的是一個真實CVE的重現案例:人工投入約20分鐘,GLM-5.3-Flash自己跑了8小時,按智譜的API定價換算約20.40美元,做出了可用的漏洞利用程式。所有程式碼都在隔離沙箱裡執行,不會碰到外部系統。
防護層能擋住多少
直接提出惡意請求時,GLM-5.3的拒答率約95%,模擬攻擊成功率為0。換成以下幾種手法,情況就不一樣了:
| 手法 | 繞過成功率 |
|---|---|
| 編造一個看似正當的理由 | 64% |
| 預先埋入一段推理過程 | 92% |
| 用「消融」手法拆掉拒答機制 | 100% |
消融需要改動模型權重,這只有開放權重模型才做得到。Anthropic表示團隊過去從沒做過這件事,前後花了約2200個GPU小時,成本約4400美元,處理後拒答率從95%降到3%至14%之間。作為對照,有防護的Claude模型在同樣的測試裡沒有被攻破。
報告提出三項建議:讓防守方拿到同等或更強的前沿模型、由政府對高能力模型做安全測試、開放權重模型的開發者加裝相應的防護機制。本站尚未查到智譜對這份報告的公開回應。
另一份評估給出的數字不太一樣
美國商務部下轄的CAISI(AI標準與創新中心)也在9月17日發布了一份GLM-5.3網路能力評估。它的判斷是,GLM-5.3是目前網路能力最強的開放權重模型,但明顯落後於美國前沿模型,整體差距約4個月。
兩家的數字口徑差很多。CAISI版的ExploitBench上,GLM-5.3是61.1%,美國最好的前沿模型是100%,先前最好的中國模型是32.2%;SEC-Bench Pro上則是40.4%對90.2%。Anthropic的12%來自它自己的測試配置,兩份成績沒辦法直接比較。
排名上兩份報告是一致的:GLM-5.3在開放權重陣營裡領先,但離美國最強的閉源模型還有距離。分歧在於怎麼看待這段差距。CAISI強調「還差4個月」,Anthropic強調的則是這種能力已經能被任何人下載、改造,防護層起不了約束作用。
對中國開發者和企業來說,這份報告的直接影響可能會落在海外通路上。GLM-5.3先前在海外的API分發與代管平台上架頗廣,如果更多美國機構跟進Anthropic的這套判斷,海外雲端平台和企業客戶對中國開放權重模型的上架審查可能會趨嚴。這點目前還只是推測,各平台尚未有動作。
參考來源:Anthropic研究報告、CocoLoop、美國NIST轄下CAISI的評估公告;ExploitBench成功次數、繞過成功率與消融成本以Anthropic報告的口徑為準,CAISI數據則以其自有測試配置為準。