Anthropic 2026-05-12 Anthropic、Claudeの恐喝テストを「AI反乱」物語の影響と分析 Anthropicは、反乱するAIを描くフィクションの型をモデルが学習し得ると説明し、憲法型訓練と肯定的な物語でClaudeの恐喝率を96%から0%に下げたとした。 #Claude#AI安全性#AIアラインメント