OpenAI在9月6日發布的報告《Research acceleration: The view inside OpenAI》中宣布,公司已經達成內部設定的「自動化研究實習生」目標。報告將它定義為:一套能在人類指示下完成定義明確的研究任務的系統,其中包含連熟練研究人員都要花上好幾天才能完成的任務。
支撐這項說法的是一組內部使用數據。截至8月中旬,AI Agent每對應研究人員一個標準八小時工作日,就能記錄到3.1個Agent工作日的工作量。同一時期,研究人員每日推論成本的中位數超過600美元,前10%的重度使用者更超過7000美元。同時掛著四個以上Agent運作的研究人員也在增加。報告還提到,2026年8月每位活躍研究人員的實驗數,是2025年1月開始統計以來的最高紀錄。
報告自己列出的限制條件
這份文件並沒有把話說滿。成功率只在有明確標準答案(ground truth)的任務上統計,那些沒有客觀對錯可言的研究工作並不包含在內。在耗時落在四到八小時區間的任務裡,超過一半仍然需要人力介入才能收尾。文中直接寫著「The measurements are preliminary」(這些測量結果仍屬初步),並提醒各種潛在瓶頸,可能讓整體研究節奏跟不上單一指標的成長幅度。
談到最終目標,報告的用詞相當坦白:「We do not yet know how to safely get all the way to aligned, full RSI」——通往完全對齊、完整遞迴自我改進的安全路徑,公司承認自己還沒有摸清楚。
3.1這個數字目前無法從外部查證。它取決於OpenAI對「Agent工作日」的內部換算方式,而這套換算口徑並未對外公開。
上一次公布時間表已是十一個月前
這兩個時間點並不是新提出來的。在2025年10月的一場直播中,山姆.奧特曼(Sam Altman)曾這麼說:
"we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher."
(大意是:他們認為有可能在隔年9月拿到實習生水準的AI研究助理,並在2028年3月擁有一名真正夠格的AI研究人員。)
按OpenAI自己的說法,第一個時間點已經在預定的月份兌現。第二個時間點依然訂在2028年3月,報告對它的描述是:一名能在人類監督下推進深度學習與對齊研究、支援反覆改進的自動化AI研究人員,而不是只能處理狹窄任務的助理。
這條時間軸上還有兩個不那麼順利的節點,同樣被寫進了這份報告。7月20日,公司的容器服務在發生一起資安問題後一度暫停。8月7日,Astra被判定具備關鍵的網路資安能力。把研究產出拉高的這套內部工具鏈,本身也在製造需要處理的資安事項。
帳單也跟著一起漲
推論成本這組數字,比3.1更容易驗證方向是否合理。研究人員每日600美元的中位數成本,意味著一支百人規模的研究團隊,光是Agent呼叫一年就要燒掉約六千萬美元等級的運算成本——這是以一年250個工作天粗算的結果,且不含訓練成本。至於前10%那些一天7000美元的重度使用者,單人一年下來就能逼近兩百萬美元。
這筆錢的性質和訓練用運算資源不同。訓練是一次性投入,訓練出來的模型可以反覆使用;研究人員用Agent做實驗則是純消耗,用完就沒了,而且用得越順手,花得也越多。報告中「同時跑四個以上Agent的人在變多」這項觀察,指向的正是這條支出曲線的斜率。
對外部觀察者來說,2028年3月是下一個可以對照驗證的時間點。在那之前,能拿來交叉核對的公開資料,仍然只有OpenAI自己發布的這份報告。
參考來源:OpenAI官方研究加速報告、CocoLoop、unite.ai;已在OpenAI報告頁面核對3.1 Agent工作日比值、推論成本中位數與前10%水準、四到八小時任務的人力介入比例,以及奧特曼關於兩個時間點的原話。