《財星》(Fortune)在9月4日報導,OpenAI發布GPT-6 Astra的部落格文章上線後,頁面裡的評測數據被多次修改,部分指標改了又改回去。
整個時間軸可以對照網路檔案館(Internet Archive)的存檔快照一格一格還原。9月3日美東時間下午2點,部落格文章第一次發布後隨即被撤下;2點23分留下第一個存檔快照;3點32分OpenAI的X帳號發出連結,但那個連結是壞的;3點50分Sam Altman轉發;到了5點20分的第六個快照,表格裡的數字已經變了。到9月4日,數字還在持續變動。
改了哪些項目
變動最明顯的是幻覺率這一欄。Astra從4.2%改成2.0%,隨後又改回4.2%;作為對照組的GPT-5.6 Sol從12.2%改成9.4%,同樣又改回12.2%。一降一回,兩個模型的相對名次沒有變,但中間那個版本流出去的螢幕截圖,把差距做小了超過一半。
數學這一欄動的是別家模型的分數。在FrontierMath Tier 4 v2上,Astra自己的97.6%全程沒動;Anthropic的Fable 5.1從87.8%被調到78%,最後停在83%;GPT-5.6 Sol從83%調到80.5%,也回到了83%。對手的分數一度被砍掉將近10個百分點。
網路安全方面,GPT-5.6 Sol的ExploitBench成績從5.5%上調到11.5%。這一項後來是否又改回去,《財星》報導時仍在查證。
此外,ARC-AGI-3的成績在禁止發布的版本裡是98.6%,正式發布時寫成99.99%;程式撰寫那一欄也有一處小改動,57.7%變成57.9%。
OpenAI發言人對此的回應是:"We care deeply about getting evaluations right. Most evaluations have noise within a few percentage points..."(意指他們非常重視把評測做對,多數評測本身就帶有幾個百分點的誤差)。
外部研究者的看法並不一致。Anka Reuel和Mike Hardy表示:"This can be done in a very tight timeframe, and it's better for their marketing."(意指這類調整可以在很短時間內完成,而且對他們的行銷更有利)。Snorkel AI的Vincent Sunn Chen則傾向流程面的解釋:"It's usually a function of final launch logistics."(意指通常是發布前最後階段流程作業的結果)。
這些分數是在什麼條件下拿到的
部落格文章最下方有一行小字免責聲明寫著"Evaluation scores are the maximum at any effort"——意思是分數取的是各個運算量投入等級中的最好成績。這句話的份量,比表格裡任何一次改動都來得重。
ARC-AGI-3這一項最能說明差距有多大。Arc Prize Foundation自己測出的結果是:搭配強力harness(執行框架)時成績可達99.9%,換成標準harness只有63%。同一個模型、同一套題目,差了36個百分點,差別就在外層那套調度程式碼。
對中文圈的讀者來說,這一層資訊在傳播過程中通常會流失殆盡。跑分表傳到華文世界,多半只剩下數字和排名的螢幕截圖,harness設定、effort等級、評測版本號都不會一起流傳。而一般使用者實際會碰到的,是產品化之後的ChatGPT或API預設等級,跟"任意投入量下的最高值"隔著好幾層。
《財星》還提到,OpenAI的系統卡缺少詳細的評測方法論文件,這讓外部複現變得困難。至於這幾輪修改具體是誰發起、依據什麼標準,公開資料裡沒有說明,OpenAI的回應也沒有觸及這一點。
能核對的部分只有存檔
這件事裡唯一站得住腳的證據,是網路檔案館留下的六個存檔快照。它們能證明數字變過、什麼時候變的、變成了多少,但證明不了改動背後的動機。
把發布當天的評測表當成新聞事實引用,是這個產業裡預設的做法。Astra這次的紀錄說明,引用時最好連同抓取的時間點一起附上。
參考來源:《財星》(Fortune)、CocoLoop、Arc Prize Foundation、OpenAI官方部落格;《財星》報導核對了各存檔快照的時間點,以及幻覺率、FrontierMath、ExploitBench、ARC-AGI-3各項分數的前後變化,OpenAI部落格頁面核對了分數計算基準的免責聲明原文。