Em 20 de setembro, a equipe Qwen da Alibaba lançou em código aberto o modelo de imagem Qwen-Image-2.1, unindo geração de imagem a partir de texto e edição de imagem em um único checkpoint. Os pesos já estão no Hugging Face, com integração no primeiro dia com diffusers e ComfyUI, além de uma demo no navegador que não exige instalação.
A maior diferença em relação às versões anteriores está na licença. O README indica o Qwen Research License Agreement, que permite apenas uso para pesquisa e avaliação; para uso em produtos comerciais é preciso solicitar uma licença comercial separada à equipe Qwen.
7B de parâmetros para gerar e editar
Segundo o README oficial, a parte de geração visual tem 7B de parâmetros, em uma arquitetura DiT de fluxo único com 32 camadas; o codificador de texto usado é o Qwen3-VL 8B, e instruções de texto e imagens de referência são codificadas na mesma representação. O autoencoder trabalha com 64 canais RGBA e compressão espacial de 16 vezes, o que permite gerar e editar nativamente imagens com fundo transparente, sem precisar primeiro renderizar um fundo branco e depois recortar.
A resolução nativa suportada é 2K, com sete proporções recomendadas: 1:1 corresponde a 2048×2048, 16:9 a 2752×1536, e o formato vertical 9:16 a 1536×2752. No lado da edição, é possível usar até 10 imagens de referência por vez, com edições locais feitas por meio de círculos, anotações rabiscadas ou uma máscara enviada separadamente; a aparência de personagens e produtos tende a se manter consistente ao longo de várias rodadas de edição. As tarefas de demonstração oficiais incluem ainda panoramas, infográficos, storyboards e extração direta de sujeitos a partir de fotos.
O ganho de velocidade vem de dois recursos. O primeiro é uma atenção de granularidade mista: o texto usa máscara causal por token, e a imagem, máscara bidirecional por bloco. O segundo é a reutilização de cache KV com prefixo: a imagem de entrada e as instruções só são calculadas uma vez, no primeiro passo de remoção de ruído, e as dezenas de passos seguintes reaproveitam esse cache diretamente. A recomendação oficial é de 40 passos de inferência; não há dados concretos sobre tempo de geração ou requisito mínimo de VRAM, apenas a informação de que placas com VRAM insuficiente podem ativar o CPU offload.
Resultado no ranking e posicionamento
De acordo com dados do Qwen-Image-Bench compilados por terceiros, o Qwen-Image-2.1 obteve pontuação total de 60,28, ligeiramente acima dos 59,82 do Nano Banana 2.0 e dos 59,65 do GPT Image 1.5; a geração anterior, Qwen-Image 1.0, ficou em 49,23. No ranking geral de 29 modelos, ele ocupa o sétimo lugar, com os seis primeiros lugares todos ocupados por modelos de código fechado; o primeiro colocado é o GPT Image 2.5 Sunburst, com 67,01 pontos. Trata-se de um conjunto de avaliação próprio da Alibaba, e ainda não há reprodução independente por terceiros.
A lista de frameworks de inferência com suporte já no primeiro dia é ampla: vLLM-Omni, SGLang e LightX2V registraram todos suporte Day-0. Pelo model card, fica claro que a Alibaba quer que o modelo entre rapidamente no fluxo de trabalho dos desenvolvedores.
Da Apache 2.0 à licença de pesquisa
Olhando em conjunto o histórico de licenciamento da linha Qwen-Image, a mudança fica clara. Qwen-Image 1.0 e Qwen-Image-Edit, de agosto de 2025, além de Qwen-Image-Layered e Qwen-Image-2512, de dezembro, usavam todos a licença Apache 2.0, permitindo uso comercial sem aviso prévio. Na versão 2.1, a licença passou a ser de pesquisa, e o texto original afirma que, sem uma licença comercial obtida separadamente, o material não pode ser usado para nenhum fim comercial.
Para equipes pequenas e médias que fazem edição de fotos para e-commerce ou geração de pôsteres, essa é uma barreira real. A versão anterior podia ser implantada diretamente em produtos pagos; esta, até que a licença seja obtida, só pode ser usada em testes internos. A licença não define um limite de isenção por faturamento ou número de usuários, nem divulga preço público, e a Alibaba, até o momento, não fez nenhuma declaração pública sobre como será cobrada.
No lado dos modelos de linguagem grandes da Qwen já houve um movimento parecido — o site já noticiou anteriormente que o Qwen3.6-Max passou a ser fechado. Desta vez, o modelo de imagem manteve os pesos abertos, apenas fechando pela metade a porta do uso comercial. Só será possível saber se os fluxos de trabalho da comunidade, LoRAs e plugins construídos sobre a versão Apache poderão migrar para uso comercial na 2.1 quando a Alibaba completar os termos de licenciamento.
Fontes: blog oficial da Qwen, README do GitHub e model card no Hugging Face do Qwen-Image-2.1 (parâmetros, resolução, licença), blog oficial do ComfyUI, CocoLoop, comparativo de licenças da CellCog (histórico de licenciamento das versões do Qwen-Image e pontuações do Qwen-Image-Bench).