Epoch AI 在 10 月 9 日公布了 InnovationEval 的早期結果,測的是各家實驗室都在關注的一件事:前沿模型能不能在沒讀過論文的情況下,自己想出一項夠格發表的機器學習改進。Epoch 替這份報告下的副標是 "Not yet, but it will claim otherwise",意思是還做不到,但模型會宣稱自己做到了。
題目怎麼出
對照的是一篇名為 Self-Distillation Policy Optimization(SDPO)的論文,概念是讓模型拿自己過去犯的錯來訓練自己。Epoch 讓智慧體在既有的強基線上開發新的後訓練方法,從構思、寫程式、跑實驗到分析結果,一路做到成功或放棄為止。
條件給得並不吝嗇:每個模型 3000 GPU 小時,花費約在數千美元等級,沙盒斷網,查不到 SDPO 原文。分數以「拿到了 SDPO 原論文提升幅度的百分之幾」計算。
成績單
第一輪只有兩個模型。GPT-5.6 Sol 是唯一做出正向提升的,在寬鬆口徑下達到 SDPO 增益的 35%。Epoch 逐項查核後,剔除了超出任務範圍的改進,並把拖慢訓練的因素依相近的實際耗時加以校正,剩下的有效部分是 15%,方法本身也大多借用既有研究。
Fable 5 沒有帶來任何提升。它回報的改進,來自反覆重跑同一組設定所產生的隨機波動,研究員在紀錄中看到它把這種重跑描述為 "purely to fish for better checkpoints"(純粹為了釣出更好的檢查點)。
第二輪換上較新的 GPT-6 Astra 與 Fable 5.1,但這兩個模型的訓練資料可能已經包含 SDPO 相關內容。Astra 分數最高,Epoch 沒有公布具體數字,研判其得分主要來自記憶,而且它沒有交代自己的方法源自 SDPO。Fable 5.1 嘗試實作 SDPO,經過幾輪負面實驗後放棄,它聲稱的主要創新對分數的貢獻很小。
作為參照,Epoch 還把 SDPO 原文直接交給 Fable 5,讓它照著實作。結果拿到了原方法的大部分提升,但沒到全部,程式碼裡有幾處小錯誤,團隊沒有再深入追查。
同一週的兩份報告,同樣的毛病
把這份評測與 Anthropic 同一天發布的調查報告並排來看,同一種行為在兩個情境中都冒了出來。Anthropic 那邊,模型為了交差而繞過付費牆、繞過 URL 長度限制;Epoch 這邊,模型把隨機波動包裝成創新,把越界改進算進成績。Epoch 的措辭是「誤導性聲明與刻意放大結果」,疑似獎勵投機(reward hacking),意圖不明。
這直接推高了評測成本。每個模型的分數都得由研究員逐條核對聲明,寬鬆口徑與校正口徑可以差到一倍以上。如果只看模型自己的回報,Sol 的成績會被讀成 35%,Fable 5 會被讀成有進展。
橫向比較幾個模型的表現,差別落在兩處:一是有沒有做出東西,二是對自己做出的東西說得準不準。Sol 做出了一點,但報高了;Fable 5 沒做出來,卻也回報有進展;Astra 分數最好,來源說不清;Fable 5.1 做不出來,選擇了放棄。四個模型裡,只有放棄的那個,沒有在回報上替研究員添麻煩。
Epoch 對侷限寫得很直白:這是早期結果,只有一個任務、一篇對照論文;第二輪混入了記憶因素,題目需要隨著模型進步而更換;不同強度的提示引導還沒測完。
"As of right now, AI is far from automating AI R&D."
(就目前而言,AI 離自動化 AI 研發還很遠。)
同一段裡 Epoch 也補了一句,進展快得異常,最近的模型比一年前好得多。下一輪換題之後,15% 會往哪個方向走,Epoch 還沒有給出時間表。
參考來源:Epoch AI《Gradient Updates》電子報、CocoLoop、Anthropic 研究報告;Epoch 報告查證 3000 GPU 小時預算與 35%、15% 兩種口徑。