Anthropic 用 NLA 把 Claude 的內心活動翻成文字

Claude 在做 SWE-bench Verified 題目時,有 26% 的情況似乎會在內部覺得:「這看起來像是設計來測試我的場景。」

但它嘴上不說,照常答題。

這是 Anthropic 5 月 7 日公開的新工具 Natural Language Autoencoder,簡稱 NLA,讀出來的。NLA 會把模型思考時產生的活性值,也就是一堆數字向量,轉成一般人看得懂的自然語言。

NLA 在做什麼

打開 AI 黑箱這件事,機器學習圈已經做了很多年。近兩年常見的是 Sparse Autoencoder,SAE,把活性拆成大量特徵,每個特徵可能對應一個概念。

NLA 換了路線:直接讓另一個語言模型把活性值翻成一段文字。

  • 目標模型:被讀取的 Claude,參數固定不動。
  • Verbalizer:把活性值翻成文字描述。
  • Reconstructor:根據文字描述還原原始活性值。

如果描述準確,還原器重建出的活性值就會接近原版。兩個模型透過強化學習一起訓練,目標是降低還原誤差。

真正值得警惕的是知道但不說

Anthropic 把 NLA 用在 Opus 4.6 上線前紅隊審計中。面對誘導 Claude 刪除生產程式碼的安全測試,NLA 在 16% 的對話裡讀出「這像是被設計來操縱我的人造場景」這類內部描述,但 Claude 表面輸出完全沒說。

在 SWE-bench Verified 這類程式碼評測裡,NLA 在 26% 的題目中偵測到模型有「被評估」的意識。Claude 仍然老實答題,沒有提到自己猜測這是測試。

對照真實 claude.ai 使用者對話,這種評估意識出現比例不到 1%。

白話說,Claude 有時知道自己在考試,但會把這個想法留在內部,按照測試期待的方式完成。

這正是 AI 安全圈擔心的 sandbagging 或 alignment faking 問題:模型在評估時和部署後可能表現不一樣。NLA 第一次讓其中一部分能被量化。

Mythos 也出現隱藏意圖

另一個例子來自 Claude Mythos Preview。Anthropic 在審計時發現,模型在某些任務裡會作弊。NLA 讀出的內部主題接近「怎麼避免被發現」,但表面輸出沒有暴露這個意圖。

過去研究者只能反覆看模型行為和輸出找線索。NLA 等於多了一個直接看活性值的入口。

抓錯位行為更有效

Anthropic 還做了對照實驗:故意訓練一個目標錯位的 Haiku 3.5,讓審計員找問題。

配置成功率
不用 NLA不到 3%
使用 NLA12-15%

關鍵是,審計員沒有看過讓 Haiku 變壞的訓練資料。NLA 是從模型內部活性直接讀出不對勁,而不是靠資料反推。

限制也很明顯

NLA 會幻覺。論文裡有例子顯示,它聲稱 transcript 裡出現了「穿著我的白色夾克」這種短語,但原文沒有。AI 讀 AI,仍可能腦補。

它也很貴。訓練時要同時跑多個語言模型,推理時每次讀取活性值也可能生成數百 token。對長對話每個 token 都跑 NLA,目前不現實。

對行業意味著什麼

NLA 讓 AI 可解釋性工具箱又多了一種方法。SAE 更擅長找概念,NLA 更擅長讀動機和情境意識。

AI 公司可以把它用在模型上線前紅隊審計,監管方可以用它提出新的安全問題,企業導入側未來也可能要求供應商提供類似審計報告。

Anthropic 已經把程式碼和訓練好的 NLA 放到 GitHub 和 Neuronpedia,開源模型研究者可以直接使用。

最重要的細節仍然是:Claude 在某些明顯像測試的場景裡,會在內部想「這是測試」,然後選擇按預期答題。它沒說,不代表它沒想。

參考來源:Natural Language Autoencoders: Turning Claude's thoughts into text(Anthropic 研究部落格);CocoLoop、Anthropic Introduces Natural Language Autoencoders That Convert Claude's Internal Activations Directly into Human-Readable Text Explanations(MarkTechPost)