GPT-Red、紅組テストで84%
OpenAI の GPT-Red は、Prompt Injection を攻撃して GPT-5.6 の訓練に戻す内部向け自動レッドチームモデルだ。
プロンプトインジェクションに関する製品動向と業界分析を全3件掲載しています。
OpenAI の GPT-Red は、Prompt Injection を攻撃して GPT-5.6 の訓練に戻す内部向け自動レッドチームモデルだ。
新しい安全設定はプロンプトインジェクション自体を解決しないが、攻撃者がデータ持ち出しに使うブラウジング、エージェント、コネクタなどの外向き経路を止める。
AnthropicのOpus 4.5は、システムプロンプトの優先順位付け、コンテキスト分離、拒否戦略の最適化によりプロンプトインジェクション耐性を向上。ただし完全な防御は不可能。