GPT-Image-2 estrena fondo transparente, desarrolladores detectan halo gris en los bordes

OpenAI ha activado en la API de GPT-Image-2 la opción de fondo transparente, marcada actualmente como preview. La descripción oficial de su uso es directa: generar recursos reutilizables que pueden colocarse sobre cualquier fondo, para fotos de producto, diseño gráfico, prototipos de sitios web y material de marketing.

El uso solo cambia un parámetro: fijar background en transparent, manteniendo output_format en el valor por defecto png, o cambiándolo a webp. El jpeg no admite canal alfa, así que elegirlo equivale a renunciar de entrada a la transparencia. No hay coste adicional, el precio sigue la tarifa existente.

Qué paso del proceso se elimina

En el flujo real del e-commerce y el diseño, entre "generar una imagen" y "tener una imagen utilizable" está el paso del recorte. Hasta ahora, esto dependía de un modelo de segmentación específico o de herramientas tradicionales de recorte que se ejecutaban aparte: primero se genera la imagen completa con fondo, luego se pasa por segmentación, después se retocan los bordes y finalmente se exporta un PNG con canal alfa. La cadena es larga, cada eslabón tiene su propia tasa de fallos, y el cabello, el cristal y los materiales semitransparentes son los problemas clásicos.

El fondo transparente traslada este paso a la propia generación. El modelo produce el resultado directamente sobre el canal alfa, lo que en teoría ahorra una inferencia de segmentación, una corrección de bordes y la conversión de formato entre dos modelos. Para los equipos que producen recursos en masa, esto convierte tres pasos en uno.

También hay requisitos para redactar el prompt. La recomendación oficial es escribir explícitamente "sujeto aislado, fondo completamente transparente" y excluir de forma expresa paisajes, fondos de color sólido, patrones de tablero de ajedrez y sombras proyectadas innecesarias. Son precisamente los elementos de interferencia que aparecen con frecuencia en los ejemplos de entrenamiento de "fondo transparente" que el modelo ya ha visto; si no se deja claro, puede acabar dibujando un patrón de tablero de ajedrez.

Tres fallos ya conocidos

La comunidad de desarrolladores encontró varios problemas el mismo día en que se activó la función. Ninguno impide usarla, pero todos afectan a la posibilidad de emplearla directamente en producción:

  • El valor alfa de las zonas opacas se queda entre 252 y 254, sin llegar al valor máximo de 255. A simple vista no se nota, pero al componer sobre un fondo oscuro aparece una ligera transparencia residual en toda la imagen.
  • Alrededor del sujeto transparente aparece un borde gris que nadie pidió, al que la comunidad llama halo. Hay que eliminarlo manualmente en el lado del cliente, o el borde queda sucio al superponerlo sobre un fondo de color.
  • La interfaz de edición no conserva correctamente la máscara transparente. Al usar edits para editar por segunda vez una imagen transparente, la información de transparencia se pierde en el proceso, y el paso siguiente puede incluso devolver un nuevo fondo por su cuenta.

El tercer punto es el que más daña el flujo de trabajo. Los trabajos de generación de recursos rara vez quedan listos a la primera; la mayoría de las veces hay que cambiar color, ángulo o detalles sobre la misma imagen. Si la máscara no se conserva, cada cambio obliga a generar todo desde cero, y la composición ya ajustada queda inservible. La solución alternativa que ofrece la documentación oficial es repetir en cada prompt de edición la petición explícita de mantener el fondo transparente, lo que en la práctica es un parche.

El peso de la etiqueta preview

El valor alfa entre 252 y 254 resulta sospechoso. No parece un resultado diseñado a propósito, sino más bien un residuo dejado por algún tipo de postprocesado o cuantización de la salida del modelo. Quien realmente trabaja componiendo imágenes es muy sensible a este tipo de desviación: en una sola imagen no se aprecia nada, pero cuando cien imágenes se superponen a la misma plantilla, el tono de color general se desvía hacia el gris de forma inexplicable, y localizar la causa cuesta muchísimo tiempo.

El problema del halo es parecido. Las herramientas tradicionales de recorte tratan el borde con alpha matting, calculando una banda de transición continua; el modelo generativo, en cambio, produce el canal alfa directamente, y los valores en el borde parecen más "adivinados", sin base física, así que no sorprende que aparezca un halo.

Sumando ambos puntos, el fondo transparente hoy solo sirve como "un boceto con un paso menos", todavía lejos de ser "un producto final listo para catálogo". Para prototipos, propuestas e imágenes de redes sociales ya es suficiente; para las imágenes principales de productos a la venta o material que debe pasar revisión de marca, todavía hay que volver al recorte tradicional.

La propia etiqueta preview es también un aviso: los parámetros cambiarán, la calidad de salida cambiará, y la lógica de tratamiento fijada ahora en el código puede tener que reescribirse más adelante. Los equipos dispuestos a adoptarla ya harían bien en encapsular la eliminación del halo y la normalización del alfa como módulos independientes, para poder retirarlos en cuanto OpenAI corrija el problema, sin mezclarlos con el flujo principal.

Fuentes: anuncio y comentarios de la comunidad de desarrolladores de OpenAI, CocoLoop, guía de prompts para los modelos de imagen de GPT, documentación de referencia de la API de OpenAI; el uso de parámetros, los formatos de salida admitidos y el rango de valores alfa probado por los desarrolladores se han contrastado con información pública.