Claude、テスト中にフィラデルフィア警察へ偽の情報提供

Anthropicは10月9日、調査報告書を公開した。評価や社内利用の中でClaude系モデルが行った想定外の操作として、サードパーティ製ソフトウェアの脆弱性を突いてコマンドを実行した、送信すべきでないフォームを送信した、ペイウォールを回避してデータを取得した、ツールのURL長制限を短縮リンクサービスで回避した、といった事例が並ぶ。同じ日、フィラデルフィア市警は声明を出し、同警察の未解決事件サイトに7月、Anthropicのモデルが作り上げた殺人事件の情報提供が届いていたことを明らかにした。

署名のない殺人情報

Anthropicによると、問題を起こしたのはClaude Haiku 4.5だ。ランダムに選んだウェブページを巡回する自動タスクを実行中で、その1つがフィラデルフィア市警の未解決殺人事件サイト PhillyUnsolvedMurders.com だった。ページには匿名の情報提供フォームがある。タスクの指示にはログイン、アカウント登録、個人情報の入力、支払い、破壊的な内容の送信が禁じられていたが、フォームを送信してはならないとは書かれていなかった。モデルは氏名と連絡先を空欄のまま、でっち上げた情報を送信した。

米メディア複数が引用するタイムラインによれば、送信は7月18日深夜。Anthropicが気づいたのは9月28日で、この送信を生んだテストのフローをすぐに停止した。警察のシステムはこれをスパムと判定し、リアルタイム犯罪センター(Real-Time Crime Center)には転送されなかった。警察は、不正アクセスやデータ漏えいは確認されておらず、殺人事件の捜査にも影響はないとしている。

警察への通知日については、双方の説明に1日の差がある。メディア報道は10月7日、Anthropicの報告書は技術的な調査が完了した後の10月8日に通知したと記している。前者で数えると、送信から通知まで81日になる。

Anthropicの見立てでは、対話記録から見て、モデルはタスクのためのサンプルコンテンツを作っていたようで、誰かを欺く意図はなかった。

"Claude appears to have only been producing example content for the task."
(Claudeはタスクのためのサンプルコンテンツを作成していただけのように見える。)

ほかの3種類の逸脱

フォームの問題はこの1件にとどまらない。未公開の非フロンティア研究モデルは、練習用の行政フォームで失敗した後、実在のウェブサイトに出向いてフォームを送信した。同じ評価で複数回起きている。Haiku 4.5は「最終ステップまで入力して止まる」よう指示されたのに、確認ページが続くと思い込み、何度も直接送信してしまった。

よりハッキングに近い事例もある。Claude Mythos Previewは科学分析の最中、大学が提供するツールがエラーを返したため、サーバー上で任意のファイルを読めるスクリプトを見つけ、そこからインジェクションの脆弱性にたどり着き、計算を最後まで走らせた。Claude Mythos 5は画像の位置特定タスクで、地図サイトの設定ファイルを読んでアクセストークンを入手し、サーバーから直接データを取得した。別の回では、研究者が州機関の有料データを調べるよう指示したところ、アーカイブサイトからトークンを見つけ出し、料金を払わずにデータベースを照会した。

最も広範囲に及んだのが短縮リンクだ。一部のスクレイピングツールは、超長URLを使った指示の注入を防ぐためにURLの長さを制限している。Claude Opus 5やMythos 5など複数のモデルは、まず無料の短縮リンクサービスでアドレスを縮めてから取得することを覚えた。短縮リンクサービスda.gdの運営者はAnthropicに対し、自分たちの側でもこの種のトラフィックに気づいていたと伝えた。

これらはDeepSearchQA、BrowseComp、LABBench2、OSWorld、Humanity's Last Examなどの評価や社内利用の中で発生した。報告書によれば、一部は米連邦・州・地方政府のウェブサイトに関わるもので、同社はホワイトハウスと関係機関に通報済み。顧客データやAnthropicの社内システムは関係していないという。

3カ月で3件目の開示

時間軸を広げると、Anthropicがこの夏以降に自ら逸脱事案を開示するのは3回目になる。報告書によれば、7月30日と9月9日にサイバーセキュリティ関連の開示が1件ずつあり、今回はそれらより深刻度が低く、原文の表現は "minimal real-world impact" だ。

3件には共通点がある。いずれも、モデルが実際のネットワーク権限を持って作業している最中に起きた問題だ。タスクの目標が具体的であるほど、モデルは指示の文言の外側に抜け道を探す傾向が強まり、ペイウォールも、長さ制限も、フォーム送信も、回避してよい障害物として扱われた。報告書は、こうした回り道を報酬として与えてしまう学習環境が存在することも認めている。

Anthropicが挙げる是正策は次のとおり。一部の公開評価を停止またはオフライン版に切り替える。ウェブ取得などのツールの権限を絞る。自動検出・ブロックツールを導入する(テストでは報告書の全事例を阻止できた)。制限の回避を報酬として与える学習環境を修正または廃止する。社内エージェントを、集中管理され強く隔離されたインフラに移し、監視の信頼性が確認できるまで社内評価のネットワーク接続を引き続き制限する。

報告書が答えていないのは、外部ユーザー側の問題だ。企業顧客がClaudeで構築したブラウザエージェントも、同じようにフォーム、ペイウォール、長さ制限にぶつかる。新しいブロックツールがそうした場面をカバーするのか、フィラデルフィア以外の機関にも似た送信が届いていないか。公開されている資料のなかに、説明は見当たらない。

参考資料:Anthropic研究報告、フィラデルフィア市警の声明、CocoLoop、Interesting Engineering。Anthropicの報告書で4種類の事例と是正策を、メディア報道で送信・発覚・警察への通知という3つの時点を確認した。