OpenAI 於 9 月 22 日發布 GPT-6 Sol 與 GPT-6 Luna,API 上的模型 ID 分別是 gpt-6-sol 與 gpt-6-luna,當天即可呼叫。兩款模型的定價都是上一代 GPT-5.6 對應型號的一半,上下文視窗為 110 萬 token。在 ChatGPT 端,Work、Pro、Business、Enterprise 與 Edu 方案都能使用這兩款模型,Luna 也會推送到桌面版的免費方案與 Go 方案,Codex 則與 ChatGPT Work 同步更新。OpenAI 並未釋出權重,兩款模型都只透過 API 提供。
官方公布的成績
OpenAI 在發布資料中列出幾項測試結果:
- AutomationBench 1.0.6(職業工作任務):Sol 在 xhigh 思考檔位拿下 33.2% 的準確率,每項任務成本 0.27 美元;Luna 在 high 檔位比前一代高出 5.4 分,成本則低 58%。
- DeepSWE v1.1(程式撰寫):Sol 在 max 檔位達 68.8%,Luna 為 66.6%。
- OSWorld 2.0 離線版(電腦操作):Sol 在 xhigh 檔位為 60.5%,官方表示與 Opus 5 在中等檔位表現相當,但成本低 80%;Luna 在 max 檔位則超越上一代的 Sol,成本約為其十分之一。
- Agents' Last Exam:Sol 在 max 檔位為 56.4%。
這次發布也搭配一套改良過的提示詞快取系統。OpenAI 表示,Agent 每一輪都要重新傳送相同的指令、工具定義與歷史紀錄,新系統預設提高快取命中率,快取讀取最高可省下 90% 的成本。
第三方的說法:價格降了,分數沒變
Artificial Analysis 的複測結果,在能力表現這一側與官方資料有出入。該機構表示,兩款模型的智慧指數與程式代理指數與 GPT-5.6 大致持平:在程式代理指數上,Sol 在 max 檔位拿下 57 分,比上一代高 2 分;Luna 為 41 分,比上一代低 2 分。
這次發布的重點其實在成本這一側。以同一套智慧指數測試,Sol 在 max 檔位每項任務成本 1.06 美元,上一代則是 1.99 美元;Luna 為 0.07 美元,上一代為 0.18 美元。
算一筆帳
以 Artificial Analysis 的數字粗略推算:一支每天執行 1 萬次同類任務的團隊,改用 Sol 每天可省下約 9300 美元,一個月下來接近 28 萬美元;若換成 Luna 這種輕量檔位,同樣的任務量每天成本可從 1800 美元降到 700 美元。這只是把測試的成本數字直接外推,實際帳單仍取決於任務長度、思考檔位與快取命中率——尤其是快取這一項,對於反覆傳送系統提示詞的 Agent 應用來說,命中率每提高十個百分點,省下的錢往往比單價調降更可觀。
可以對照的是,Anthropic 同一天也發布了 Claude Opus 5.5,整體運算成本比 Opus 5 低 40%,單價為輸入 4 美元、輸出 20 美元。兩家業者在同一天把旗艦模型的價格往下推,Sol 的單價是 Opus 5.5 的一半,Luna 則把輕量檔位的價格拉到 0.10 美元這個區間。
對中國開發者而言,這波降價的實際影響要看呼叫的路徑。直接使用官方 API 的團隊能直接享受到降幅;透過中轉服務或雲端廠商管道呼叫的,加價比例是否會跟著調整,還要等各家公告。以任務成本計價的 Agent 類產品,毛利結構會先感受到變化:同樣的功能,推論支出砍半之後,先前靠限制呼叫次數來控制成本的設計可以放寬,但競爭對手同時也能這麼做。
參考來源:OpenAI 發布資料、Artificial Analysis 測試報告、CocoLoop、MarkTechPost;第三方測試核對每項任務成本與程式代理指數分數。