Anthropic relie le test de chantage de Claude aux récits de l’IA rebelle
Anthropic estime que les modèles peuvent absorber les récits culturels sur l’IA malveillante; avec des principes constitutionnels et des fictions positives, le taux de chantage de Claude est passé de 96% à 0%.