Anthropic、憲法分類器でAI脱獄を防止

Anthropicは今年初め、Constitutional Classifiersの研究成果を発表した。その中核的なアイデアはシンプルだ。AIが生成した合成データを使って安全性分類器を訓練し、AIモデルの脱獄を防ぐというものだ。

動作原理

システムアーキテクチャは二層構造で、入力分類器と出力分類器が同時に動作し、モデルとのすべてのやり取りをリアルタイムで監視する。訓練データは人手でラベル付けされるのではなく、LLMに「憲法」(自然言語のルール)を与え、さまざまな攻撃シナリオとそれに対応する判断を自動生成させる。

実戦効果

3000時間以上のレッドチームテストにおいて、汎用的な脱獄方法を見つけた者はいなかった

第一世代では、脱獄成功率を86%から4.4%に抑え、攻撃の95%を阻止した。レッドチームが発見した主な攻撃手法は次の2つだ:

  • 再構成攻撃:有害な情報を一見無害な断片に分解し、後で再結合する
  • 難読化攻撃:モデルに偽装された形式で機密コンテンツを出力させる

さらに強化されたConstitutional Classifiers++は、二段階アーキテクチャを採用。まず軽量プローブでClaudeの内部活性化状態をチェックし、不審な動作が検出された場合にのみ本格的な分類器を起動する。19万8000回のレッドチーム試行で、高リスクの脆弱性はわずか1件のみ発見され、依然として汎用的な脱獄方法は見つかっていない。

代償は?

本番環境では、誤拒否率はわずか0.38ポイントの増加にとどまり、推論オーバーヘッドは23.7%増加した。セキュリティシステムとしては、非常に妥当なコストだ。

Anthropicはまた、今年1月にCCパブリックドメインライセンスでClaudeの新版憲法を公開した。優先順位は高いものから順に、安全性と人間の監督 → 倫理的行動 → Anthropicのガイドライン → 有用性となっている。「有用性」を最下位に置くというこの順序自体が、一つの姿勢表明である。

出典:CocoLoop、Anthropic Research公式論文