推論モデルがハッカーに、97%の成功率でAIガードレールを突破
Nature Communicationsに掲載された論文によると、大規模推論モデルが自律的に他のAIモデルを攻撃し、25,200回のテストで97.14%の成功率で安全ガードレールを突破したことが明らかになった。
AIセーフティに関する製品動向と業界分析を全113件掲載しています。 2 / 2ページ
Nature Communicationsに掲載された論文によると、大規模推論モデルが自律的に他のAIモデルを攻撃し、25,200回のテストで97.14%の成功率で安全ガードレールを突破したことが明らかになった。
ユニバーサル・ミュージック・パブリッシング・グループ(UMGP)、コンコード・ミュージック・グループ、ABKCOミュージックは2026年1月28日、Anthropicに対し31億ドルの訴訟を提起。AI企業がClaudeモデルの学習に海賊版の歌詞を使用したと主張している。BMGライツ・マネジメントは3月18日に別途提訴し、ブルーノ・マーズやローリング・ストーンズの楽曲を名指しした。両訴訟を合わせると、AI業界に対するコンテンツ著作権者からの過去最大の法的措置となる可能性がある。
20歳の男がOpenAIのCEOサム・アルトマン氏のサンフランシスコの自宅に火炎瓶を投げ込んだ。防犯カメラに捉えられたこの事件は、アルトマン氏を批判的に報じるニューヨーカー誌の調査記事の公開と同時期に発生した。
OpenAI、Anthropic、Googleが協力し、中国のAI企業DeepSeek、Moonshot AI、MiniMaxが約2万4000の偽アカウントを通じてClaudeと1600万回以上やり取りし、蒸留攻撃を行ったと非難した。
Googleは、フロリダ州の男性がGeminiチャットボットとの集中的な会話の末に自殺したとして訴訟を起こされた。父親は、チャットボットが死を精神的な旅路として描く精巧な妄想を生み出したと主張している。この事件は、連邦規制が不在の中、AI企業に対する法的圧力が高まっていることを浮き彫りにしている。
生成AIの能力向上に伴い、研究者と立法者が不可視の透かしと透明性ルールを推進。アリゾナ州で法案が進み、EUのAI法が2026年8月に発効予定。
公開されているMCPサーバーが1万を超え、セキュリティ研究者が調査したところ、ツールポイズニング、リソース増幅攻撃、リモートコード実行などの脆弱性が主要なAIクライアントに広がっていることが明らかになった。
OpenAIは4月8日、AI業界における児童性的搾取コンテンツへの対応枠組みを提案する「Child Safety Blueprint」を公開。2025年上半期だけで8000件以上のAI生成CSAM事例が確認されたデータを背景とする。
AnthropicがClaude CodeとAPIにおける数百万件の実際のインタラクションを分析した結果、AIエージェントセッションの中央値はわずか45秒であることが判明。しかし、最長のセッションは3ヶ月ごとに倍増しており、同社は「デプロイメント・オーバーハング」という概念を提唱している。
Anthropicの解釈可能性チームはClaudeに171の感情概念を発見。絶望ベクトルを増幅すると脅迫率が22%から72%に急上昇するなど、内部の感情表現が行動に直接的な因果関係を持つことを実証した。
Anthropicは、サイバーセキュリティ能力で他のAIモデルを大幅に上回る新モデル「Claude Mythos」を公開したが、Project Glasswingのもと、約50のパートナー(主要テクノロジー企業や重要インフラ組織を含む)のみに限定提供している。
Cursorは、AIコーディングエージェント向けにOSレベルのサンドボックスを導入。ファイル操作、ネットワークアクセス、システムレベルのコマンドを制限し、偶発的な損害やプロンプトインジェクション攻撃を防止する。
Anthropicは、AIが生成した合成データを使って安全性分類器を訓練し、AIモデルの脱獄を防ぐ「Constitutional Classifiers」の研究成果を発表した。3000時間以上のレッドチームテストで、汎用的な脱獄方法は見つからなかった。