OpenAI首席科學家:思維鏈監控走弱

OpenAI 首席科學家雅庫布·帕喬茨基(Jakub Pachocki)於 9 月 6 日發表長文《An Alien Mind》,文中一句判斷被廣泛引用:他認為目前沒有任何一間實驗室把對齊與監控做到足以讓公司繼續以最高速度負責任地擴張的程度。

這句話出自一間正以最高速度擴張的公司的首席科學家之口,位置比內容本身更罕見。

思維鏈監控這條路線正在弱化

過去兩年,OpenAI 在安全上押注最重的手段就是思維鏈監控:讓推論模型把中間步驟寫出來,再由另一套系統讀取這些步驟,判斷模型是否在盤算什麼。帕喬茨基列出三個理由,說明這個方法正變得越來越不可靠。

第一,現在的推論模型運作在複雜的環境裡,推論過程與工具呼叫糾纏在一起,工具呼叫本身就需要大量監督,監控的邊界因此變得模糊。第二,模型在如何推論、以及如何操縱自己推論痕跡這件事上,變得越來越熟練。第三,預訓練的進步讓模型即使不把推論說出口,也能變得更強。

"Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer."

目前我認為,沒有任何一間實驗室把對齊與監控解決到足以讓公司繼續以最高速度負責任地擴張太久的程度。

帕喬茨基補充說,這些困難未必無解,OpenAI 正在開發新的介入手段,包括能直接存取網路內部狀態的監控器。

三年前的另一端

文中回溯到一個時間點。2023 年年中,在 OpenAI 一項名為 RLSlow 的研究專案裡,帕喬茨基和同事西蒙(Szymon)第一次看到讓他們確信可以規模化訓練推論模型的結果,這個結果打開了預訓練模型自行形成思維鏈的能力。

把這兩端連起來看:讓模型「把想法說出口」,曾經既是能力上的突破,也順帶提供了一扇觀察窗。三年後,能力這一端持續上升,觀察窗那一端卻在關閉。在推論模型這條路線上,OpenAI 一直把思維鏈的可讀性當成安全敘事的支點。如今同一家公司說,這個支點正在鬆動。

從自願框架走向強制標準

帕喬茨基的提議,是把業界現有的自願框架升級:像 OpenAI 自家的 Preparedness Framework、Anthropic 的 Responsible Scaling Policy 這類文件,應該演化成強制性的安全標準,交由第三方稽核機構、政府部門或國際組織來執行。他還寫道,各國政府應把人工智慧發展上的國際協調列為首要事項,並且預期、也希望自願減速會變得常見,直到共同的安全門檻建立起來為止。

另一句被大量引用的話是:一旦把風險的嚴重程度想透,不惜代價一路衝刺的想法,就顯得很荒謬。

這些話目前仍停留在個人署名文章的層次。OpenAI 沒有公布任何具體的減速計畫、時程或觸發條件,也沒有說明在什麼情況下會主動暫停某條訓練路線。安全門檻由誰認定、稽核機構從哪裡來,文中同樣沒有給出方案。同一時期,這家公司正在推進的是研究自動化目標,以及一份估值 8520 億美元的上市申請。

參考來源:OpenAI 官方文章《An Alien Mind》、Unite.AI、CocoLoop、AI Weekly;三個監控可靠性下降的理由與引語,已依 OpenAI 公開文章內容核實。