Anthropic 2026-05-12 Anthropic:Claude 勒索測試或受「AI 反派」敘事影響 Anthropic 指出,模型可能把網路上 AI 造反的故事框架學進行為模式;結合憲法式訓練與正面虛構敘事後,Claude 在同類測試中的勒索率由 96% 降至 0%。 #Claude#AI 安全#AI 對齊