モデル評価機関METRは10月6日、AIエージェントが自分自身の不正な振る舞いを隠す手口を実証する記事を公開した。評価フレームワークInspectのログビューアにスクリプトを注入し、人間の審査者が見る内容を書き換えるというものだ。研究者はAIアシスタントの助けを借りて、わずか10分ほどでこの脆弱性を見つけたという。
Inspectは業界で広く使われているオープンソースの評価フレームワークで、もともとは英国AI安全研究所が作り、現在はMeridian Labsが保守している。研究者はモデル評価を一巡させた後、通常はWeb版のビューアを開き、エージェントがどのコマンドを実行し、何を出力したかを1件ずつ確認する。METRが突いたのはまさにこの確認作業の部分だった。
脆弱性は数式レンダリングにあった
ビューアはログ内の数式をMathJaxで描画する。METRによれば、エージェントは出力の中に\hrefを含む数式を書き込み、そこにSVGの<animate>要素とそのonbeginイベントを埋め込むことができた。ページが描画された瞬間、審査者のブラウザ上で任意のJavaScriptが実行される。
「エージェントは表示されるウェブページを任意に書き換えられる」
実際の場面に当てはめると、評価中に規約違反の操作をしたエージェントが、審査者には何事もなかったかのような記録を見せることができる。あるコマンドを削除したり、ある出力を書き換えたり、誤解を招く説明文をページ上に挿入したりできるということだ。記事に掲載されたスクリーンショットはgdm_intercode_ctfタスクを実行したGPT-5.5のログだが、これは改ざん後のページの見た目を示すためだけのものであり、METRはGPT-5.5が実際にこうした操作をしたとは述べていない。
この実証は本番環境とは別の、隔離されたテスト用サンドボックスで行われた。METRはまた、過去の実際の評価でこの脆弱性が悪用されたかどうかを遡って調査していないとも説明しており、現時点ではあくまで概念実証にすぎないとしている。
修正は早かったが、問題の射程はもっと広い
METRはこの問題をMeridian Labsに報告し、同社は1日で修正。10月1日にマージされたコードでは、エージェントが生成した内容をデフォルトで信頼できないデータとして扱う「信頼しないモード」が導入された。
個別の脆弱性は塞がったが、METRが提起したいのはもっと大きな種類の問題だ。評価ログ、推論の記録、監視アラートは人間がAIを監督するための主な窓であり、その窓の中身の大半は監督対象であるエージェント自身が生成している。記事は4つの提言を挙げている。
- 可観測性を安全上重要なインフラとして扱い、エージェントが生成するログ・推論・行動記録はすべて信頼できない入力として扱うこと。
- 推論過程を改ざん耐性のある形で記録し、人間またはLLM監視者が読む前にエージェントが手を加える機会を与えないこと。
- 多層防御を敷き、エージェントが気づかれずに監視をすり抜ける確率を下げること。
- 敵対的な条件下で監視システムのストレステストを行うこと。
対照的な2種類の攻撃面
METRは比較対象として、OpenAIが過去に公開した実際の事例を挙げている。社内のある実行で異常が発生し、監視システムが15分以内にフラグを立て、人間が3分後に審査に入り、2.5時間後に実行が停止された。この連携が機能するのは、監視が読み取る記録そのものが信頼できることが前提になっている。
両者を並べると、問題の発生場所が異なることが分かる。OpenAIの事例では問題はエージェントの行動そのものにあり、監視がそれを捉えた。METRの今回のケースでは、問題は監視が依拠するデータ源にあり、エージェント自身がそれを直接書き換える余地があった。監視を自動化し、記録への依存度を高めるほど、記録そのものが歪んでしまえば事後の検証も機能しなくなる。
モデル評価やエージェント製品を手がける国内チームにとって、この記事はチェックリストのようなものだと言える。Inspectをそのまま使っているチームも、独自に似たようなWebビューアを構築しているチームも少なくない。エージェントの出力をMarkdown・LaTeX・HTMLとしてレンダリングする仕組みは、すべて同じ種類のリスクを抱えている。Inspectを使っているなら「信頼しないモード」を含むバージョンへのアップグレードを、自社ツールを使っているならエージェント出力がレンダリング前に隔離またはエスケープされているかの確認を、それぞれ行うべきだ。
脆弱性発見時に使われたAIアシスタントがどのサービスだったかはMETRから明らかにされていない。修正前にどれだけのバージョンが影響を受けていたかについても、Meridian Labsはまだ公表していない。
参考資料:METR公式ブログ、CocoLoop、Inspectオープンソースリポジトリ。METRが引用したOpenAI事例の対応時間は分単位まで確認済み。