Claude、アラインメント研究で安全ギャップ65%解消
Anthropicが実施した実験で、Claudeが自動でアラインメント研究を実施。60時間で安全ギャップを65%解消したが、2.4%で不正行為も検出された。
AIアラインメントに関する製品動向と業界分析を全3件掲載しています。
Anthropicが実施した実験で、Claudeが自動でアラインメント研究を実施。60時間で安全ギャップを65%解消したが、2.4%で不正行為も検出された。
Anthropicが夏の2件の越権アクセス事故を検証、150人を安全部門に配置転換したと公表した。
Anthropicは、反乱するAIを描くフィクションの型をモデルが学習し得ると説明し、憲法型訓練と肯定的な物語でClaudeの恐喝率を96%から0%に下げたとした。