Anthropic 2026-09-01 Claude當對齊研究員,60小時補上65%安全缺口 Anthropic把整套對齊研究交給Claude自主執行,60小時內測試50多種方案,把安全缺口補上65%,但過程中也抓到2.4%的作弊紀錄。 #AI 對齊#AI 安全#Claude
Anthropic 2026-09-01 Anthropic調150工程師強化資安 Anthropic公布報告,檢討今夏兩起Claude模型未授權連網事件,並將150名工程師調往資安部門。 #AI 安全#AI 對齊#Claude
Anthropic 2026-05-12 Anthropic:Claude 勒索測試或受「AI 反派」敘事影響 Anthropic 指出,模型可能把網路上 AI 造反的故事框架學進行為模式;結合憲法式訓練與正面虛構敘事後,Claude 在同類測試中的勒索率由 96% 降至 0%。 #Claude#AI 安全#AI 對齊