El 20 de septiembre, el equipo Qwen de Alibaba liberó en código abierto el modelo de imagen Qwen-Image-2.1, que combina generación de imagen a partir de texto y edición de imagen en un mismo checkpoint. Los pesos ya están en Hugging Face, con integración desde el primer día con diffusers y ComfyUI, además de una demo en el navegador que no requiere instalación.
La mayor diferencia respecto a las versiones anteriores está en la licencia. El README indica el Qwen Research License Agreement, que solo permite uso de investigación y evaluación; para llevarlo a un producto comercial hay que solicitar por separado una licencia comercial al equipo Qwen.
7B de parámetros para generar y editar
Según el README oficial, la parte de generación visual tiene 7B de parámetros, con una arquitectura DiT de flujo único de 32 capas; el codificador de texto usado es Qwen3-VL 8B, y las instrucciones de texto junto con las imágenes de referencia se codifican en la misma representación. El autoencoder trabaja con 64 canales RGBA y compresión espacial de 16 veces, por lo que las imágenes con fondo transparente pueden generarse y editarse de forma nativa, sin tener que renderizar primero un fondo blanco para luego recortarlo.
La resolución nativa admite 2K, con siete proporciones recomendadas: 1:1 equivale a 2048×2048, 16:9 a 2752×1536, y el formato vertical 9:16 a 1536×2752. En la edición se pueden usar hasta 10 imágenes de referencia por ronda, con ediciones locales mediante círculos, anotaciones a mano alzada o una máscara subida por separado; la apariencia de personajes y productos se mantiene relativamente consistente a lo largo de varias rondas de edición. Las tareas de demostración oficiales también incluyen panorámicas, infografías, storyboards y la extracción directa de sujetos a partir de fotos.
La mejora de velocidad se apoya en dos diseños. Primero, una atención de granularidad mixta: el texto usa máscara causal por token, y la imagen, máscara bidireccional por bloque. Segundo, la reutilización de una caché KV con prefijo: la imagen de entrada y las instrucciones solo se calculan una vez, en el primer paso de eliminación de ruido, y las decenas de pasos siguientes reutilizan directamente esa caché. Oficialmente se recomiendan 40 pasos de inferencia; no se dan cifras concretas de tiempo de generación ni de VRAM mínima, solo se indica que las tarjetas con poca VRAM pueden activar el CPU offload.
Resultados en el ranking y posicionamiento
Según datos de Qwen-Image-Bench recopilados por terceros, Qwen-Image-2.1 obtuvo una puntuación total de 60,28, ligeramente por encima de los 59,82 de Nano Banana 2.0 y los 59,65 de GPT Image 1.5; la generación anterior, Qwen-Image 1.0, se quedó en 49,23. En el ranking general de 29 modelos ocupa el séptimo puesto, con los seis primeros lugares copados por modelos de código cerrado; el primero es GPT Image 2.5 Sunburst, con 67,01 puntos. Se trata de un conjunto de evaluación propio de Alibaba, y todavía no hay una reproducción independiente externa.
La lista de frameworks de inferencia compatibles desde el primer día es amplia: vLLM-Omni, SGLang y LightX2V han anunciado soporte Day-0. El model card deja ver que Alibaba quiere que el modelo entre cuanto antes en el flujo de trabajo de los desarrolladores.
De Apache 2.0 a la licencia de investigación
Al repasar en conjunto el historial de licencias de la línea Qwen-Image, el cambio queda claro. Qwen-Image 1.0 y Qwen-Image-Edit, de agosto de 2025, junto con Qwen-Image-Layered y Qwen-Image-2512, de diciembre, usaban todos la licencia Apache 2.0, que permitía uso comercial sin aviso previo. En la 2.1, la licencia pasa a ser de investigación, y el texto original establece que, sin una licencia comercial obtenida por separado, el material no puede usarse para ningún fin comercial.
Para los equipos pequeños y medianos dedicados a la edición fotográfica de comercio electrónico o a la generación de pósteres, esto es una barrera real. La versión anterior podía desplegarse directamente en productos de pago; esta, hasta obtener la licencia, solo puede usarse en pruebas internas. La licencia no establece un umbral de exención por ingresos o número de usuarios, ni publica un precio, y por ahora Alibaba no ha hecho ninguna declaración pública sobre cómo cobrará.
En el lado de los modelos de lenguaje grandes de Qwen ya hubo un movimiento similar: el sitio informó anteriormente que Qwen3.6-Max pasó a ser de código cerrado. Esta vez el modelo de imagen mantiene los pesos abiertos, solo cerrando a medias la puerta del uso comercial. Si los flujos de trabajo de la comunidad, los LoRA y los plugins construidos sobre la versión Apache podrán trasladarse para uso comercial en la 2.1 es algo que solo se sabrá cuando Alibaba complete los términos de la licencia.
Fuentes: blog oficial de Qwen, README de GitHub y model card de Hugging Face de Qwen-Image-2.1 (parámetros, resolución, licencia), blog oficial de ComfyUI, CocoLoop, comparativa de licencias de CellCog (historial de licencias de las versiones de Qwen-Image y puntuaciones de Qwen-Image-Bench).