Anthropic 今年初公布了 Constitutional Classifiers 的研究成果,核心思路很直白:用 AI 生成的合成數據來訓練安全分類器,防止 AI 模型被越獄。
工作原理
系統架構是雙層的——輸入分類器和輸出分類器同時工作,即時監控模型的每一次互動。訓練數據不是人工標註的,而是給 LLM 一套「憲法」(自然語言規則),讓它自動生成各種攻擊場景和對應的判斷。
實戰效果
在超過 3,000 小時的紅隊測試中,沒有任何人找到能通用的越獄方法。
第一代就把越獄成功率從 86% 壓到了 4.4%,擋住了 95% 的攻擊。紅隊發現的兩種主要攻擊思路是:
- 重組攻擊:把有害資訊拆成看起來無害的碎片再拼回去
- 混淆攻擊:讓模型用偽裝格式輸出敏感內容
升級版 Constitutional Classifiers++ 更進一步——兩階段架構,先用一個輕量探針檢查 Claude 的內部激活狀態,發現可疑再上重型分類器。19.8 萬次紅隊嘗試中只發現了 1 個高風險漏洞,依然沒有通用越獄方法。
代價呢?
生產環境的誤拒率只增加了 0.38 個百分點,推理開銷增加 23.7%。對於安全系統來說,這個代價相當划算。
Anthropic 還在今年 1 月以 CC 公共領域授權 發布了 Claude 的新版憲法,優先級從高到低:安全和人類監督 → 倫理行為 → Anthropic 準則 → 有用性。把「有用性」放在最末位,這個排序本身就是一種態度表達。
參考來源:CocoLoop、Anthropic Research 官方論文