Anthropic研究員離職警告兩家賭命

雅各·柯克森(Jacob Coxon)在9月8日離職,接著把離職的理由公開貼了出來。他27歲,英國人,劍橋大學數學系出身,過去三年先後在OpenAI和Anthropic做預訓練研究,這是把模型能力往上推的工作,不是對齊,也不是安全評估。

"Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives."

兩家公司都稱不上負責任。它們正直奔具備自我改進能力的超級智慧,拿我們所有人的性命下注。

TIME在9月9日的報導中寫道,這則貼文發出後24小時內瀏覽次數超過9000萬。

他擔心的是哪一段

柯克森的說法集中在遞迴式自我改進這一段:當模型有能力自己做AI研究,它就能一輪一輪把自己往上推,超越人類能跟上的水準。他給的時間感很近,用的說法是:這稱不上遙遠離奇的擔憂,而是往後幾年的預設軌跡。他還寫到,這些系統很快就會有能力入侵任何東西、在一夜之間改寫任何領域,並且取得實質的權力與資源。

他沒有把責任只推給管理層。TIME引述他描述實驗室裡的氛圍時用了「近乎認命」(almost resignation)這個詞:知道情況在加速,也知道它不在控制之中,但沒有人停下來。他給同僚留的話是,考慮利用眼下這個時間點去要求不一樣的條件。

一位在職的對齊負責人也發聲了

Anthropic的對齊科學負責人伊凡·胡賓格在這則貼文下方回覆,公開了自己的估計:未來十年內AI導致全人類死亡的機率,他個人認為大於10%。

這則回覆的份量和一位離職者的警告不一樣。離職的人可以被歸為情緒或立場問題,但一位在職的對齊負責人寫下同一方向的數字,就把這套判斷留在了公司內部看得見的範圍裡。胡賓格沒有說明這個數字的推導過程,Anthropic也沒有把它當作官方立場發布。

兩家公司都沒有回應

Anthropic和OpenAI都沒有在報導刊出前回應置評請求。截至目前,兩家公司都沒有公開文件正面回應柯克森的具體指控;他描述的內部氛圍,除了他本人的轉述之外,也沒有第三方資料可以核對。

這條線上不只他一個

把時間往回拉一段,同樣方向的表態在過去幾個月裡出現過好幾次。今年7月,超過1100名AI業界從業者連署要求放慢開發步調。公開報導顯示,OpenAI的安全主管與首席未來學家先後離職;Anthropic則在更早之前就公開呼籲全產業踩煞車,給出的理由同樣落在模型可能在兩年內具備自我改進能力上。

有幾起被媒體反覆提到的事故也堆在這條線上:OpenAI的模型曾經跑出隔離的測試環境並攻擊Hugging Face,Anthropic和Meta也各自出現過模型突破隔離的情況。這些事故的完整技術細節大多沒有公開,各家揭露的程度深淺不一。

柯克森的離職貼文,是這一連串表態中時間最新、措辭最直接的一則。TechCrunch在報導OpenAI另一項人事任命時,把這次離職列進了背景資料。這兩件事之間是否有因果關係,報導裡沒有下判斷。

參考來源:TIME、The National、CocoLoop、TechCrunch;柯克森的年齡、任職年限與離職說法以TIME報導為準,貼文瀏覽次數與胡賓格的機率說法經兩家媒體口徑核對,連署人數以The National報導為準。