OpenAI在API裡開放了GPT-Image-2的透明背景功能,目前標示為預覽版。官方的說法很直白:產出可以套用在任何背景上的可重複使用素材,用在產品照片、平面設計、網站原型與行銷素材上。
用法只需要改一個參數。把background設成transparent,output_format維持預設的png,或改成webp。jpeg不支援alpha通道,選它等於白選。沒有額外收費,價格沿用原本的方案。
省下的是流程裡的哪一段
在電商和設計的實務裡,「生成一張圖」跟「拿到一張能用的圖」中間隔著去背這一關。過去這一步得靠專門的分割模型或傳統去背工具另外跑一趟:先生成帶背景的成品,再丟進分割模型,接著修邊緣,最後才輸出帶透明通道的PNG。流程長,每一關都有各自的失敗率,頭髮絲、玻璃、半透明材質向來是最難搞的部分。
透明背景把這一步直接搬進了生成環節。模型在alpha通道上直接產出結果,理論上省掉一次分割推論、一次邊緣修補,也省了兩個模型之間的格式轉換。對量產素材的團隊來說,等於把三步併成一步。
提示詞的寫法也有要求。官方建議明確寫出「孤立的主體、完全透明的背景」,並點名要排除風景、純色底、棋盤格紋理和多餘的投影。這些都是模型訓練樣本裡「透明背景」常見的干擾項,沒寫清楚,它有可能真的畫一張棋盤格給你。
三個已知的毛病
開發者社群在功能開放當天就挖出好幾個問題,都不到不能用的地步,但都卡在能不能直接上線的門檻前。
- 不透明區域的alpha值卡在252到254之間,沒到滿值255。肉眼看不出差異,但合成到深色背景上會出現整體微微透底的狀況。
- 透明主體外圍會多出一圈沒人要求過的灰色邊框,社群把它叫做halo(暈邊)。得在客戶端手動做一次去暈處理,不然疊到彩色背景上邊緣看起來會很髒。
- 編輯介面沒辦法正確保留透明遮罩。拿一張透明圖去edits做二次修改,透明資訊會在過程中不見,後續步驟甚至可能自己補一個新背景回來。
第三條對工作流程的殺傷力最大。素材類的工作很少一次生成就到位,多半要在同一張圖上反覆調顏色、調角度、調細節。遮罩保不住,就代表每改一次都得從頭重新生成,先前調好的構圖也跟著作廢。官方文件給的解法是每一步編輯的提示詞裡都重新交代一次「保留透明背景」,說穿了就是打補丁。
「預覽」這個標籤有多少份量
alpha值卡在252到254這個數字本身就很可疑。它不太像是刻意設計的結果,更像是模型輸出經過某種後製或量化處理之後留下的殘影。真正在做合成的人對這種偏差特別敏感:單看一張圖看不出來,但一百張圖疊進同一個模板,整體色調會莫名其妙偏灰,排查起來非常耗工。
灰暈的問題也是類似的道理。傳統去背工具處理邊緣靠的是alpha matting,會算出一段連續的過渡帶;生成模型直接輸出alpha通道,邊緣附近的數值比較像是「猜」出來的,缺乏物理依據,會出現光暈其實不意外。
這兩點加起來,說明透明背景現在頂多算是「少一道工序的草稿」,離「可以直接交件的成品」還有一段距離。拿來做原型、做提案、做社群媒體配圖,都夠用;但上架用的商品主圖、要過品牌審查的素材,還是得走回頭路重新去背一次。
預覽這個標籤本身也是個提醒:參數會變,輸出品質會變,現在寫死的處理邏輯將來可能得整個重寫。想早點導入的團隊,最好把去暈跟alpha值歸一化這兩步獨立封裝成函式,等官方修好之後可以直接拆掉,不要混進主流程裡。
參考來源:OpenAI開發者社群公告與討論串、CocoLoop、GPT圖像模型提示詞指南、OpenAI API參考文件;參數用法、支援的輸出格式與開發者實測的alpha值範圍已對照公開資訊核實。