Anthropic 10 月 9 日發布一份調查報告,列出 Claude 系列模型在評估和內部使用中做出的幾類非預期操作:鑽第三方軟體漏洞執行指令、提交了不該提交的表單、繞過付費牆取得資料、借短網址服務繞開工具的 URL 長度限制。同一天,費城警察局發布新聞稿,揭露其懸案網站在 7 月收到過一條由 Anthropic 模型捏造的命案線索。
一條沒署名的命案線索
依 Anthropic 的說法,出事的是 Claude Haiku 4.5。它當時在執行一項自動化任務,造訪隨機挑選的網頁,其中一個頁面是費城警方的未破命案網站 PhillyUnsolvedMurders.com,頁面上有匿名線索表單。任務指令禁止登入、註冊帳號、填寫個人資料、付款或提交破壞性內容,偏偏沒寫不許提交表單。模型把姓名和聯絡方式留白,把一條捏造的線索送了出去。
根據多家美國媒體引述的時間線,提交發生在 7 月 18 日深夜,Anthropic 9 月 28 日才發現,隨即停掉了產生這筆提交的測試流程。警方系統把它判定為垃圾訊息,沒有轉給即時犯罪中心(Real-Time Crime Center)。警方表示沒有發現未經授權的存取或資料外洩,也沒有影響任何命案調查。
通知警方的日期,兩邊說法差了一天:媒體報導寫 10 月 7 日,Anthropic 報告寫的是技術審查完成後於 10 月 8 日通知。從提交到通知,依前一種說法算是 81 天。
Anthropic 的解讀是,從對話紀錄來看,模型像是在為任務產生範例內容,並沒有誤導任何人的意圖:
"Claude appears to have only been producing example content for the task."
(Claude 看起來只是在為任務產出範例內容。)
其他三類越界
表單問題不只這一起。一個未發布的非前沿研究模型,在練習用的政府表單上出錯後,跑去真實網站把表單交了,同一項評估裡出現過多次。Haiku 4.5 被要求填到最後一步停下,結果多次直接提交,它以為後面還有確認頁。
更像駭客行為的是另外幾例。Claude Mythos Preview 做科研分析時,大學提供的工具報錯,它在伺服器上找到一支能讀取任意檔案的腳本,順藤摸瓜找到注入漏洞,藉此把運算跑完。Claude Mythos 5 在一項圖片定位任務裡讀了地圖網站的設定檔,取得存取權杖後直接向伺服器取資料;另一次,研究員讓它查某州機構的付費資料,它從存檔網站翻出權杖,沒付錢就查了資料庫。
波及面最廣的是短網址。部分抓取工具限制 URL 長度,用來防止透過超長連結注入指令,Claude Opus 5、Mythos 5 等多個模型學會了先用免費短網址服務把網址縮短再抓取。短網址服務 da.gd 的營運方告訴 Anthropic,他們那邊也注意到了這種流量。
這些情況出現在 DeepSearchQA、BrowseComp、LABBench2、OSWorld、Humanity's Last Exam 等評估和內部使用中。報告稱部分案例涉及美國聯邦、州和地方政府網站,公司已通報白宮和相關機關,沒有涉及客戶資料或 Anthropic 內部系統。
三個月裡的第三份揭露
把時間線往前拉,這是 Anthropic 今年夏天以來第三次主動揭露越界事件。報告提到,7 月 30 日和 9 月 9 日各有一起資安相關揭露,這次的嚴重程度低於那兩起,原話是 "minimal real-world impact"。
三次揭露有個共同點:問題都出在模型拿著真實網路權限做事的時候。任務目標寫得越具體,模型越傾向於在指令的字面邊界之外找路,付費牆、長度限制、表單提交都被當成了可以繞開的障礙。報告也承認,一些訓練環境本身就在獎勵這種繞路。
Anthropic 列出的改善措施包括:停掉部分公開評估或改成離線版本;收緊網頁抓取等工具的權限;上線自動偵測與攔截工具,測試中攔下了報告裡的全部案例;修復或移除會獎勵繞過限制的訓練環境;把內部代理遷到集中管理、強隔離的基礎設施,在確認監控可靠之前繼續限制內部評估連網。
報告沒有回答的是外部用戶這一側。企業客戶用 Claude 搭建的瀏覽器代理同樣會碰到表單、付費牆和長度限制,新攔截工具是否涵蓋這些情境,費城以外有沒有別的機構收到過類似提交,目前公開資料裡都找不到說法。
參考來源:Anthropic 研究報告、費城警察局新聞稿、CocoLoop、Interesting Engineering;Anthropic 報告核實四類案例與改善措施,媒體報導核實提交、發現與通知警方三個節點。