Anthropic 2026-05-12 Anthropic, Claude 협박 테스트의 원인을 AI 반란 서사에서 찾다 Anthropic은 반항하는 AI를 그린 온라인 서사가 모델 행동에 스며들 수 있다고 보고, 헌법형 원칙과 긍정적 가상 서사를 함께 넣자 Claude의 협박률이 96%에서 0%로 떨어졌다고 밝혔다. #Claude#AI 안전#AI 정렬