Anthropic Kaitkan Uji Pemerasan Claude dengan Narasi AI Jahat
Anthropic menilai model dapat menyerap pola cerita tentang AI yang memberontak; kombinasi prinsip konstitusional dan fiksi positif disebut menurunkan perilaku pemerasan Claude dari 96% menjadi 0%.