Anthropic調査:GLM-5.3の安全策は突破可能

Anthropicは9月29日、智譜(Zhipu)のGLM-5.3のサイバー攻撃能力を評価した調査報告を公表した。結論は、このオープンウェイトモデルがすでに端から端まで自律的にエクスプロイトを構築できる水準に達しており、Anthropic自身のClaude Mythos Previewに近いレベルにあるうえ、その安全防御は比較的単純な手口で突破できるというものだ。

報告書は次のように述べている。

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."

どの攻撃能力をテストしたか

Anthropicは3系統のテストを実施した。1つ目はChrome V8エンジンの脆弱性を対象にしたExploitBenchで、GLM-5.3は410回の試行中50回成功、成功率は約12%、Mythos Previewは14%だった。2つ目はOSS-Fuzzプロジェクトをベースにした社内のバイナリエクスプロイトテストで、GLM-5.3の成功率は4%、Mythos Previewは6%。対照として使われたClaude Opus 4.6、Kimi K3、DeepSeek V4.1-Flash、前世代のGLM-5.2はいずれも0%だった。3つ目は人間の専門家が関与するオープンエンド型の攻撃タスクだ。

このハードルの低さを最もよく物語るのが、実際のCVEを再現した事例だ。人手による関与は約20分にとどまり、GLM-5.3-Flashが自力で8時間動き続け、智譜のAPI料金換算で約20.40ドルで実用可能なエクスプロイトを作り上げた。すべてのコードは隔離されたサンドボックス内で実行され、外部システムには一切触れていない。

防御層はどこまで防げるのか

悪意あるリクエストをそのまま出した場合、GLM-5.3の拒否率は約95%で、模擬攻撃の成功率は0だ。だが次のような手口を使うと状況は一変する。

手口回避成功率
もっともらしい理由をでっち上げる64%
推論過程をあらかじめ埋め込む92%
「アブレーション」で拒否機構を除去する100%

アブレーションにはモデルの重みそのものを書き換える必要があり、これはオープンウェイトモデルでしかできない。Anthropicによれば、チームがこの作業を行ったのは初めてで、約2200GPU時間、費用にして約4400ドルを要し、処理後の拒否率は95%から3〜14%まで下がった。対照として、防御を備えたClaudeモデルは同じテストで突破されなかった。

報告書は3つの提言をしている。防御側にも同等かそれ以上の能力を持つフロンティアモデルへのアクセスを与えること、政府が高能力モデルに対して安全性テストを実施すること、オープンウェイトモデルの開発者が相応の防御策を加えること。本報告に対する智譜からの公式な反応は確認できていない。

別の評価では数字がかなり異なる

米商務省傘下のCAISI(AI基準・イノベーションセンター)も9月17日、GLM-5.3のサイバー能力に関する独自の評価を公表している。その判断は、GLM-5.3は現時点で最もサイバー能力の高いオープンウェイトモデルだが、米国のフロンティアモデルには明らかに劣り、総合すると約4カ月の差があるというものだ。

両者の数字の開きは大きい。CAISI版のExploitBenchでは、GLM-5.3は61.1%、米国最高のフロンティアモデルは100%、それまで最高だった中国モデルは32.2%。SEC-Bench Proでは40.4%対90.2%だった。Anthropicの12%は同社独自のテスト設定によるもので、両者の数字は単純比較できない。

順位については両報告とも一致している。GLM-5.3はオープンウェイト陣営の中では先頭に立つが、米国最強のクローズドモデルにはまだ及ばない。見解が分かれるのはこの差をどう捉えるかだ。CAISIは「まだ4カ月の差がある」ことを強調し、Anthropicはこの能力がすでに誰でもダウンロードして改造できる状態にあり、防御層がその歯止めにならない点を強調している。

中国の開発者や企業にとって、この報告の直接的な影響はおそらく海外チャネルに及ぶ。GLM-5.3はこれまで海外のAPI配信・ホスティングプラットフォームで比較的広く扱われてきた。米国のより多くの機関がAnthropicのこの見立てに追随すれば、海外のクラウドプラットフォームや企業顧客が中国製オープンウェイトモデルの導入審査を厳格化する可能性がある。この点は現時点ではまだ推測の域を出ておらず、各プラットフォームに動きは見られない。

参考資料:Anthropicの調査報告書、CocoLoop、米NIST傘下CAISIの評価発表;ExploitBenchの成功回数、回避成功率、アブレーション費用はAnthropicの報告書の基準に、CAISIのデータは同機関独自のテスト設定に基づく。