Anthropic liga teste de chantagem do Claude a narrativas de IA vilã
A Anthropic afirma que modelos podem absorver roteiros culturais sobre IA rebelde; ao combinar princípios constitucionais com ficção positiva, a taxa de chantagem do Claude caiu de 96% para 0%.