OpenAI 在 API 里给 GPT-Image-2 开放了透明背景,目前标注为预览。官方给出的用途描述很直接:生成可以放到任何背景上的可复用素材,用于产品图、平面设计、网站原型和营销物料。
用法只改一个参数:把 background 设成 transparent,同时把 output_format 留在默认的 png,或者换成 webp。jpeg 不承载 alpha 通道,选它等于白设。没有额外收费,价格沿用原有档位。
省掉的是流水线里的哪一环
在电商和设计的实际流程里,“生成一张图”和”拿到一张能用的图”之间隔着抠图。以往这一步靠专门的分割模型或者传统抠图工具单独跑一遍:先生成带背景的成品,再送进分割,再修边缘,再导出带透明通道的 PNG。链路长,每一环都有自己的失败率,头发丝、玻璃、半透明材质是老大难。
透明背景把这一步挪进了生成环节。模型直接在 alpha 通道上出结果,理论上省掉了一次分割推理、一次边缘修复,也省掉了两个模型之间的格式转换。对做批量素材的团队,这是把三步压成一步。
对提示词的写法也有要求。官方建议明确写出”孤立的主体、完全透明的背景”,并且点名排除风景、纯色底、棋盘格纹理和多余投影。这些都是模型见过的”透明背景”训练样本里高频出现的干扰项,不写清楚,它有可能给你画一张棋盘格出来。
三个已知的毛病
开发者社区在功能开放当天就翻出了几处问题,都不影响能不能用,但都影响能不能直接进生产:
- 不透明区域的 alpha 值停在 252 到 254,没有到满值 255。肉眼看不出来,合成到深色背景上会出现整体轻微透底。
- 透明主体外围会多出一圈没要求过的灰色边框,社区把它叫 halo。要在客户端里手动做一次去晕处理,否则叠到彩色背景上边缘发脏。
- 编辑接口不能正确保留透明遮罩。用 edits 对一张透明图做二次修改,透明信息会在过程中丢掉,后续步骤还可能给你补一个新背景回来。
第三条对工作流的杀伤最大。素材类的活儿很少一次生成到位,多数要在同一张图上改颜色、改角度、改细节。遮罩保不住,就意味着每次改动都要从头生成,之前调好的构图作废。官方文档给的规避办法是在每一步编辑的提示词里重申保留透明背景,属于打补丁的写法。
预览这个标签的分量
alpha 252 到 254 这个取值很可疑。它不像是刻意设计的结果,更像是模型输出经过某种后处理或者量化之后的残留。真正做合成的人对这种偏差很敏感:单张图看不出,一百张图叠进同一个模板,整体色调会莫名其妙偏灰,排查起来极其耗时。
灰边的问题类似。传统抠图工具处理边缘用的是 alpha matting,会算出一个连续的过渡带;生成模型直接输出 alpha 通道,边缘处的取值更像是被”猜”出来的,缺少物理依据,出现光晕不奇怪。
这两条加起来,说明透明背景现在只够当”少一道工序的草稿”,离”可以入库的成品”还差一截。做原型、做提案、做社交媒体配图,够用了;做上架用的商品主图、做要过品牌审查的物料,还得走老路子回去抠一遍。
预览这个标签本身也是提示:参数会变,输出质量会变,现在写死的处理逻辑将来可能要重写。愿意早接的团队,最好把去晕和 alpha 归一化这两步单独封装出来,等官方修好了直接摘掉,别混进主流程。
参考来源:OpenAI 开发者社区公告与跟帖、CocoLoop、GPT 图像模型提示词指南、OpenAI API 参考文档;参数用法、支持的输出格式与开发者实测的 alpha 取值区间按公开信息核对。