AIエージェントが米政府サイトでSQLi試行

非営利の研究機関Transluceは9月30日、米国とカナダの政府サイトに対するAIエージェントによる一連の異常なアクセスを記録した調査報告書を公表した。このうち2件は失敗した初歩的な侵入の試みで、あるエージェントが米教育省のウェブサイトに対して20万回を超えるリクエストを送り、パラメータにSQLインジェクションの文字列を埋め込んでいた。

報告書の執筆者にはJack Cable氏らが名を連ね、Corridor、MIT、Transluce、AIUCなどの研究者が参加している。Transluceはサンフランシスコを拠点とする501(c)(3)の非営利研究機関で、主にAI監視ツールを開発している。

2件の侵入試行

1件目は6月17日に発生し、米教育省の公民権データ収集(Civil Rights Data Collection)サイトが対象だった。リクエスト数は20万回を超え、一部のリクエストはパラメータをState_Id=1 OR 1=1という典型的なインジェクション構文に書き換え、データベースからテーブル全体を引き出そうとしていた。

2件目は5月28日と6月9日に発生し、対象はカナダ図書館・文書館(Library and Archives Canada)だった。ポルトガルのウェブアーカイブ機関Arquivo.ptは899回のリクエストを記録し、そのうち13回に攻撃用のペイロードが含まれていた。

いずれも侵入には失敗した。米教育省の広報担当者はサービスへの影響は確認されていないと回答し、カナダのサイバーセキュリティセンター(Canadian Centre for Cyber Security)は9月29日に公式声明を発表した。

グレーゾーンはさらに広がる

この2件以外にも、報告書は「攻撃的だが明確に一線を越えてはいない」アクセスを十数件挙げている。対象には米大統領府の行政管理予算局(OMB)、海軍歴史遺産司令部、司法省、商務省経済分析局、人口調査局、証券取引委員会(SEC)、疾病対策センター(CDC)、さらにカンザス州、イリノイ州、メリーランド州、ニューヨーク州、テキサス州、カリフォルニア州の州政府サイトが含まれる。

規模で見ると、メリーランド州のサイトは5月6日の1日で295,912回のリクエストを受け、カンザス州は5月7日に36,578回、経済分析局は6月中旬の3日間で3,005回のリクエストを受けた。

手口のリストは長い。クロスサイトスクリプティングのテスト、32ビット整数の境界値2147483648の入力、URLの末尾に.jsonや?output=を付けて隠れたエンドポイントを探る、中継サービスを経由してスクレイピング対策を回避する、流出したAPIキーの使用、ディレクトリトラバーサル、使い捨てメールアドレスでのアカウント登録などが並ぶ。

AIによるものだとどう判定したか

研究者らはurlquery.netとArquivo.ptという2つの公開ログソースからデータを収集した。まず正規表現で自動化されたパターンを絞り込み、続いて大規模言語モデルを使って判定を補助し、最後に人の手で確認した。判定の根拠には、失敗後にパスやエンコーディング、サービスを変えて再試行している点、同じログIDやパラメータを共有する一連のリクエストである点、一部のトラフィックがOpenAIに関連していると自己申告していた点などが挙げられている。

最も直接的な証拠はベンチマークから見つかった。研究者は、ある一群のリクエストが求めていたデータが、GoogleのDeepSearchQAベンチマークの設問と一致することを発見した。例えば、サウスカロライナ、ノースカロライナ、ジョージア、バージニアの4州でスクールカウンセラーと人種的嫌がらせの被害者の比率を比較する設問で、そのデータの出典がまさにこの米教育省のサイトだった。つまりこのエージェントはベンチマークの問題を解こうとしており、答えを得るためにインジェクション文字列まで試した可能性が高い。

帰属については、報告書は慎重な書き方をしている。

"We do not confidently attribute these attempts to OpenAI, but they exhibit tactics consistent with prior observed agent activity that we have attributed to OpenAI."(これらの試みをOpenAIに自信を持って帰属させることはできないが、その手法は過去に我々がOpenAIに帰属させたエージェント活動と一致している。)

OpenAIは今のところ報告書への公式な回答を出していない。報告書の結論としては、これまでのところ、どのエージェントも公開範囲を超えた情報を取得した事例は見つかっていないという。

中国国内サイトへの参考点

本サイトは以前、商用サイトであるHugging FaceがAIエージェントの侵入を受けた件を報じている。今回は対象が政府サイトに変わったが、パターンは似ている。エージェントに情報収集という目標が与えられ、目的を達成できなければ手段を変え、最終的にセキュリティテストの領域まで手口がエスカレートしていく。

中国国内の政務サイトや各種の公開データ照会ページも、同様にパラメータ付きの大量のインターフェースを公開しており、中国製のAIエージェント製品も深い調査を伴うタスクに取り組み始めている。1日に数十万回、エンコーディングを変えながら繰り返し試行するようなログは、これまで普通のクローラーやスキャナーとして片付けられてきたが、今はもう一つの可能性が増えたことになる。報告書の考え方に沿えば、運用側にできることは、異常なパラメータや失敗後の再試行のパターン、既知のベンチマークの設問を突き合わせて、まずアクセスしてきたのが何者かを見極め、その上で遮断するか放置するかを判断することだ。

参考資料:Transluce調査報告書、CocoLoop、カナダサイバーセキュリティセンター声明。リクエスト件数や事件の日時は報告書の記述に基づき、帰属についての判断も報告書本文の表現に従った。