ChatGPT Images 2.5 发布,API 拆成快慢两档

OpenAI 9 月 8 日发布 ChatGPT Images 2.5,同时在 API 里放出两个新模型。官方给这一版的定位是当前最好的图像模型,改进集中在三处:多轮编辑时更能跟住指令、参考照片里的人和物更不容易走形、出图更快。延迟相比 Images 2.0 最多降低 50%。

上线范围是 ChatGPT、ChatGPT Work 和 Codex 的全部档位,桌面、移动和网页端一起推。

Sunburst 和 Flare

API 侧两个模型 ID 是 gpt-image-2.5-sunburstgpt-image-2.5-flare。官方给的选型建议只有一句:编辑精度要紧的工作流用 Sunburst,日常快速出图用 Flare。早期客户测下来的口径是,Flare 出图比 GPT-Image-2 快两到四倍。

这个拆法在图像模型里少见。此前通常一代就是一个型号,快慢差异靠分辨率和采样步数去调。把它固化成两个 ID,等于承认这两类需求已经大到不共用一套权重更划算。

一笔账

定价按 token 计,不按张数:图像输入每百万 token 8 美元,命中缓存 2 美元;图像输出每百万 token 30 美元;文本输入每百万 token 5 美元,缓存 1.25 美元。

对调用方来说,实际后果是成本随分辨率和图像复杂度浮动,不是一张一价。粗算一下:一张 1024×1024 的输出图按常见折算落在一千多 token 的量级,对上 30 美元每百万的价目,单张成本是几分美元,这一头不算贵。会把账单推上去的是编辑轮次——多轮编辑要把上一轮的成图作为图像输入再喂回去,输入侧那 8 美元每百万开始按次数累加。缓存价打到 2 美元,针对的正是这个场景:同一张底图反复改,第二轮之后的输入应该都能命中。

所以这套定价对两类用法的态度是分开的。一次生成就交付的批量出图,成本可控;把模型当图像编辑器用、一张图改十几轮的工作流,账单主要长在输入侧,跟出图张数关系不大。

画一笔当参考

产品侧新增几项:Sketch 允许在 ChatGPT 里直接手绘,输入 @Sketch 调出,画的东西作为参考;Templates 给海报、周边、产品图这类常见版式提供起点;生成的图可以直接加批注做定点修改;提示词可以分享出去,别人换成自己的照片重跑。

这几项指向同一个方向:把”描述—生成—重来”改成”生成—指着改”。手绘和批注都是把位置信息交给模型,而位置恰恰是文字提示词最难说清的东西。想让某个元素往左挪两厘米、让某处的光再压暗一点,用文字描述要绕好几句,画一笔或者点一下就说完了。

提示词分享是另一类东西。它把提示词从个人资产变成可复用的模板,别人拿过去换成自己的素材重跑一遍。这套机制在图像社区里早有对应物,各家提示词站和模型社区一直在做,区别只是这次由平台自己内置,不必再靠第三方站点转手。

一个对不上的数字

官方公告里出现了 30 亿张图这个规模数字,范围是 ChatGPT Images 与 API 上的 GPT-Image 系列。不同转述对它的口径不一致,一处写成累计,一处写成每周,差着两个量级。官方页面眼下打不开逐字核对,这个数字暂时只能当作”规模很大”来读,不适合拿去做任何推算。

上一代 Images 2.0 解决的是文字渲染,招牌案例是菜单和海报上的字终于能看了。这一代动的是编辑环节,招牌能力是改十遍之后主体还认得出是同一个人。两代之间的共同点是,比拼的位置都不在”能不能画出来”,而在画完之后还能不能改。

参考来源:OpenAI 发布公告、CocoLoop、Simon Willison 个人博客、Unite.AI、9to5Mac;模型 ID、定价与延迟口径以官方公告及其转述为准,单张成本为按公开价目的粗算。