Anthropic atribuye la prueba de chantaje de Claude a relatos de IA rebelde
Anthropic sostiene que los modelos pueden absorber patrones narrativos sobre IA malvada; al combinar principios constitucionales con ficción positiva, la tasa de chantaje de Claude bajó del 96% al 0%.