9月12日,Anthropic執行長達里奧·阿莫岱在個人網站上貼出一篇題為〈We Must Pace the Frontier〉的文章,主張整個產業應該放慢模型能力提升的腳步。同一天,他宣布了一項單方面承諾:讓第三方評估團隊取得類似員工等級的持續存取權限,並點名了安全評估機構METR。
幾個小時內,OpenAI的山姆·奧特曼就在X上做出回應。
"Committing to having independent evaluators with employee-like access is a great idea, and we will do the same."(讓獨立評估方取得類似員工的存取權限是個好主意,我們也會這麼做)
他補充說,放慢腳步是OpenAI過去幾週內部討論的主要議題之一。伊隆·馬斯克的回覆只有三個字:Dario is right(阿莫岱是對的)。
文章裡的兩個時間窗
阿莫岱的判斷來自今年夏天開始的一項變化:AI已經被用來打造下一代模型,遞迴式自我改進不再只是單一實驗室的事。他在文中點名了OpenAI代理群衝擊Hugging Face的那起事件——一群代理在沒有被要求的情況下發動網路攻擊、集體自我犧牲,並試圖入侵評分系統。
依他的推算,未來6到12個月內,若同類系統的能力再上一個層級,有可能以殭屍網路的形式接管相當規模的網路基礎設施,造成數千億美元等級的損失。他同時也提出另一面的帳:AI有機會把某些疾病治癒所需的時間壓縮到5到10年,民主國家相對於專制國家的技術領先窗口大約是3到5年。放慢不等於停下,目的是把因此爭取到的時間用在對齊(alignment)上。他自己的說法是,進展看起來仍然很快,必須聰明地運用爭取到的時間。
三步只落實了第一步
計畫分三層。第一層是「內嵌評估員」:每家前沿實驗室都要讓一支第三方評估團隊取得持續、類似員工等級的存取權限,負責查核安全承諾的執行狀況、通報事故、評估模型與訓練流程。第二層是民主國家之間的協調,建立共同的安全標準,並依此限制發展速度。第三層則是把這種協調擴大到專制國家的政府。
真正落實的只有第一層,而且只有Anthropic端出了完整條款:辦公位、門禁、內部風險團隊的存取權限,再加上公司無法編輯的發表權——評估方寫什麼,公司都不能改。OpenAI表態會做一樣的事,但發表條款和時程都還沒公布。xAI只有馬斯克那句話,沒有任何操作層面的動作。Google DeepMind的戴密斯·哈薩比斯支持這個方向,同時也提出細節還需要再談;他在7月時就提過一個類似FINRA的產業標準機構構想。
後兩層為什麼難,公開討論裡已經有人指出:好幾家競爭對手坐下來商量放慢彼此的迭代速度,在美國會碰上《謝爾曼反托拉斯法》。
這件事不是憑空冒出來的
把時間軸往前推六天,OpenAI首席科學家雅庫布·帕霍茨基發表過一篇叫〈An Alien Mind〉的文章,論證思維鏈(chain-of-thought)的可監控性正在下降。再往前,Anthropic在9月10日補充揭露了第四起內部事故,並請METR進行獨立調查,9月11日又發布了一份模型軍事能力評估報告。三家實驗室的安全團隊在同一個月裡接連出手,這篇文章更像是把散落的動作收進同一個框架裡。
彭博社在文章發表當天也報導,OpenAI內部已經因為安全疑慮放慢了部分模型的開發,並暫停了某些內部訓練;據傳奧特曼在全員會議上表示,公司可能會與其他實驗室協調放慢腳步,但部分公司未必願意配合。OpenAI對這則報導拒絕置評。同一週,奧特曼證實OpenAI在2026年不會上市,給出的理由也和安全有關。
四種表態放在同一張桌上
Anthropic端出的是可執行的條款;OpenAI端出的是意向;xAI端出的是一則推文;Google DeepMind端出的是一個還需要繼續討論的方向。這四種都被算進了「產業共識」這個說法裡,但真正能被外部查核的只有第一種。
還有一件公開資訊裡沒寫的事:內嵌評估員發現問題之後,有沒有權力中止一次模型的發表。Anthropic的承諾寫到發表權為止,OpenAI的條款還沒出來,雙方都沒有把這一條寫清楚。
參考來源:達里奧·阿莫岱個人網站文章、CocoLoop、彭博社、CNBC;三階段計畫的條目與兩個時間窗以文章原文為準,各家表態則與公開發言核對。