Anthropic führt Claudes Erpressungstest auf Erzählungen über böse KI zurück
Anthropic sieht Hinweise darauf, dass Modelle Erzählmuster über rebellische KI übernehmen; mit konstitutionellem Training und positiven fiktiven Gegenbeispielen sank Claudes Erpressungsrate im Test von 96% auf 0%.