ChatGPT Images 2.5發布,API拆成快慢兩檔

OpenAI於9月8日發布ChatGPT Images 2.5,同時在API釋出兩款新模型。官方將這個版本定位為目前最好的圖像模型,改進集中在三個方向:多輪編輯時更能貼合指令、參考照片裡的人物與物體較不容易走樣、出圖速度更快。延遲時間相較Images 2.0最多降低50%。

上線範圍涵蓋ChatGPT、ChatGPT Work與Codex的所有方案,桌面、行動裝置與網頁版同步推出。

Sunburst與Flare

API端兩款模型的ID分別是gpt-image-2.5-sunburstgpt-image-2.5-flare。官方給出的選型建議只有一句:注重編輯精度的工作流程用Sunburst,日常快速出圖用Flare。早期客戶實測反饋,Flare出圖速度比GPT-Image-2快兩到四倍。

這種拆分方式在圖像模型裡並不常見。過去通常一個世代就是一款模型,快慢差異靠解析度與取樣步數去調整。這次把它固定成兩個ID,等於是承認這兩類需求已經大到不共用同一套權重反而更划算。

算一筆帳

計價方式按token計算,不按張數:圖像輸入每百萬token收費8美元,命中快取為2美元;圖像輸出每百萬token收費30美元;文字輸入每百萬token收費5美元,快取為1.25美元。

對使用者來說,實際的結果是成本會隨解析度與圖像複雜度浮動,不是一張固定一個價。粗略估算,一張1024×1024的輸出圖,按常見換算落在一千多token的量級,對上每百萬30美元的價目,單張成本只有幾美分,這部分並不貴。真正把帳單推高的是編輯輪數——多輪編輯要把上一輪產出的圖再當成圖像輸入餵回去,輸入端每百萬8美元的費用就會依次數累加。快取價壓到2美元,鎖定的正是這種情境:同一張底圖反覆修改,第二輪之後的輸入理論上都能命中快取。

所以這套計價方式對兩種用法的態度是分開的。一次生成就交件的大量出圖,成本相對可控;把模型當成圖像編輯器、一張圖改十幾輪的工作流程,帳單主要會長在輸入端,跟最終出圖張數關係不大。

畫一筆當參考

產品端新增了幾項功能:Sketch讓使用者可以直接在ChatGPT裡手繪,輸入@Sketch即可叫出,畫的內容會被當成參考;Templates替海報、周邊商品、產品圖這類常見版型提供起點;生成的圖片可以直接加註解做局部修改;提示詞可以分享出去,讓其他人換上自己的照片重新執行。

這幾項功能都指向同一個方向:把「描述—生成—重來」改成「生成—指著改」。手繪與註解都是把位置資訊交給模型,而位置正是文字提示詞最難說清楚的部分。想讓某個元素往左移兩公分、讓某處的光線再壓暗一點,用文字描述得繞好幾句話,畫一筆或點一下就講完了。

提示詞分享則是另一回事。它把提示詞從個人資產變成可重複使用的範本,讓其他人拿去換上自己的素材重新跑一次。這種機制在圖像社群裡早有類似的做法,各家提示詞網站與模型社群一直都在做,差別只是這次改由平台自己內建,不必再靠第三方網站轉手。

一個對不上的數字

官方公告裡提到30億張圖這個規模數字,範圍涵蓋ChatGPT Images與API上的GPT-Image系列。不同轉述對這個數字的口徑並不一致,有的寫成累計值,有的寫成每週值,兩者差了兩個數量級。官方頁面目前無法逐字核對,這個數字暫時只能當成「規模很大」來理解,不適合拿去做任何推算。

上一代Images 2.0解決的是文字渲染問題,招牌案例是菜單與海報上的文字終於能看懂了。這一代動的是編輯環節,招牌能力是改了十遍之後主體依然認得出是同一個人。兩代的共同點在於,比拚的重點都不在「能不能畫出來」,而在「畫完之後還能不能改」。

參考來源:OpenAI發布公告、CocoLoop、Simon Willison個人部落格、Unite.AI、9to5Mac;模型ID、定價與延遲數據以官方公告及其轉述為準,單張成本為依公開價目的粗略估算。