OpenAI開源Codex執行層 Cisco導入

8月19日,OpenAI在開發者部落格發布一篇《Codex as a platform》,把Codex的對外定位從「跑在終端機裡的程式碼助理」換成了「別人可以直接建構其上的開源執行層」。

文章開頭先點出一件容易被忽略的事:多數人認識Codex是透過桌面應用程式、命令列或IDE外掛,這三個入口共用同一套底層系統,而那套系統早就掛在GitHub上(儲存庫openai/codex,Apache 2.0授權,目前star數10.9萬)。OpenAI這一步做的是重新定位:把它從「自家產品的實作細節」,改寫成「你們的地基」。

模型外圍的那一層

OpenAI用harness這個詞來稱呼這套系統,給出的定義相當簡潔:

"That surrounding execution system is the harness."

拆開來看,它負責蒐集情境、把任務拆成可執行的步驟、跨輪次維持工作階段狀態、呼叫工具、在設定好的沙盒與權限邊界內執行、該讓人拍板時停下來等待核准、最後把結果交回業務系統。這些工作跟模型權重無關,但做得好不好會直接影響跑分。OpenAI在文中回引了自家7月底那組ARC-AGI-3數據:只在harness層打開保留推理與情境壓縮兩個開關,GPT-5.6 Sol的公開評測成績從13.3%衝到38.3%,輸出token量降到約六分之一。模型沒換,改的是外圍那一層。

三種整合方式,依侵入程度排列

OpenAI把整合方式明確分成三層,讓開發者依場景挑選,不必一律塞進聊天框。

codex exec面向指令碼、CI任務與一次性背景作業,跑一段有邊界的agent流程,吐出結構化結果就收工。Codex SDK面向需要在程式碼裡啟動、恢復、串流讀取Codex任務的應用程式。Codex app-server是侵入最深的一層:應用程式連上本機的Codex行程,讓工作階段常駐、接收事件串流、隨時中斷、向agent暴露自己的工具,並接手處理核准請求。

為了說清楚app-server怎麼用,OpenAI順手做了一個叫Relay的示範應用,一個虛構的貨運異常處理台。使用者不用寫提示詞,先選取一筆貨運,再點「Compare recovery」這類按鈕;應用程式把相關情境餵過去,Codex透過應用程式自己掛載的MCP工具去抓最新資料、解釋可選方案;真要改班機或行程,必須經過人工核准,寫入動作落地資料庫之後應用程式才會刷新自己的業務畫面。

這個設計取向文章講得很直白:不要拿一個通用聊天框去取代調度台、時間軸、地圖和工單頁面,那些介面本來就是讓人理解現場、做判斷、保持掌控感的地方。

已經導入產品的幾家

OpenAI列了三組公開案例。GitHub和JetBrains把Codex接進各自的IDE工作流程;Cisco在Cloud Control裡的App Builder用了Codex SDK;Thrive Holdings和Crete把Codex裝進報稅流程,試點階段處理了7000份報稅案件,報稅準備時間減少約三分之一。

最後這個數字比較實在。報稅是典型的高重複、低容錯、強法規遵循場景,能拿出試點規模和一個可比較的效率指標,遠比「生產力大幅提升」這類說法有用。OpenAI也順勢強調,這套模式並不只服務工程團隊:客服排查、營運協調、資安事件分級、業務背景調查,都是同一種形狀:應用程式提供情境、工具與核准環節,Codex提供那圈迴圈。

開源到哪裡為止

文章裡有一句畫線強調的話:開源的是harness與整合介面,模型存取與代管服務仍然另外計費。

把這句話和三種整合方式放在一起看,OpenAI的取捨就清楚了。執行層免費釋出、可稽核、可任意改造,誰都能拿去裝進自家產品;而每一次agent迴圈跑起來,token還是要透過OpenAI的API走。開源的部分越好用、被嵌入的產品越多,模型端的呼叫量就越大。這跟Anthropic靠MCP把工具整合做成事實標準是同一類打法,只是OpenAI這次讓渡的東西更重──整個執行環境都端出來了。

對中國大陸做agent產品的團隊來說,現成的收益是省下一段重複勞動。工作階段狀態、事件串流、工具呼叫、核准中斷這幾件事,多數團隊都自己寫過一遍,寫完還得自己調;現在多了一個經過大規模驗證、能逐行閱讀的實作可以對照。粗略算一下,如果harness層的調整就能把輸出token壓到六分之一,同樣的預算能多跑五輪,光這筆帳就夠多數團隊認真讀一遍原始碼了。

代價也擺在那裡:接得越深,跟OpenAI計費模式綁得越緊。app-server那一層尤其明顯,它已經超出單純的呼叫關係,等於把對方的行程請進了自家產品裡。

參考來源:OpenAI開發者部落格《Codex as a platform》、CocoLoop、GitHub儲存庫openai/codex;授權條款、star數與三種整合方式已對照儲存庫與官方文件核實,ARC-AGI-3分數與token降幅則按OpenAI自行公布的數據。