Qwen-Image-2.1公開、商用利用に別途契約必要

アリババの通義千問(Qwen)チームは9月20日、画像生成モデル「Qwen-Image-2.1」をオープンソースで公開した。テキストから画像を生成する機能と画像編集機能を1つのチェックポイントに統合している。重みはHugging Faceで公開済みで、diffusersとComfyUIへの対応も初日から用意された。インストール不要のブラウザ版デモも用意されている。

従来世代との最大の違いはライセンスにある。READMEに明記されているのは「Qwen Research License Agreement」で、研究・評価目的の利用のみを許可する内容だ。商用製品に組み込むには、Qwenチームに別途商用ライセンスを申請する必要がある。

7Bで生成と編集を両立

公式READMEによると、画像生成部分は7Bパラメータ、32層のシングルストリームDiT構成。テキストエンコーダーにはQwen3-VL 8Bを採用し、テキスト指示と参照画像を同じ表現空間にエンコードする。オートエンコーダーは64チャンネルのRGBAで空間圧縮率は16倍。そのため透明背景の画像をネイティブに生成・編集でき、白背景で生成してから切り抜くといった手順が不要になる。

解像度はネイティブで2Kに対応し、推奨アスペクト比は7種類。1:1は2048×2048、16:9は2752×1536、縦長の9:16は1536×2752となる。編集面では1回の処理で参照画像を最大10枚まで使用でき、部分的な修正は円や落書き状の注釈、あるいは個別のマスクで指定できる。人物や商品の見た目は複数回の編集を経てもなるべく一貫性を保つよう設計されている。公式デモではパノラマ画像、インフォグラフィック、絵コンテの作成のほか、写真から被写体だけを直接切り出す機能も紹介されている。

高速化を支える工夫は2つ。1つは粒度の異なるアテンション機構で、テキストはトークン単位の因果マスク、画像はブロック単位の双方向マスクを使う。もう1つはプレフィックスKVキャッシュの再利用で、入力画像と指示は最初のノイズ除去ステップでのみ計算し、以降の数十ステップではキャッシュを使い回す。公式は推論ステップ数40を推奨しているが、具体的な生成時間や必要VRAMの下限は示しておらず、メモリが足りないカードはCPUオフロードを有効にできるとだけ説明している。

ベンチマークの結果と立ち位置

第三者がまとめたQwen-Image-Benchのデータによると、Qwen-Image-2.1の総合スコアは60.28で、Nano Banana 2.0の59.82、GPT Image 1.5の59.65をわずかに上回った。前世代のQwen-Image 1.0は49.23だった。29モデルの総合ランキングでは7位につけており、上位6モデルはすべてクローズドソースで、首位はGPT Image 2.5 Sunburstの67.01点。このベンチマークはアリババ自身が用意した評価セットであり、第三者による再現結果はまだ出ていない。

初日対応の推論フレームワークは幅広く、vLLM-Omni、SGLang、LightX2VがいずれもDay-0対応を表明している。モデルカードの内容からは、アリババが開発者のワークフローへの早期組み込みを重視していることがうかがえる。

Apache 2.0から研究用ライセンスへ

Qwen-Imageシリーズのライセンス推移を追うと、変化は明確だ。2025年8月のQwen-Image 1.0とQwen-Image-Edit、12月のQwen-Image-LayeredとQwen-Image-2512は、いずれも商用利用に断りなく使えるApache 2.0だった。2.1で採用されたのは研究用ライセンスで、原文には「個別に商用ライセンスを取得しない限り、素材をいかなる商業目的にも使用してはならない」と明記されている。

ECの画像修正やポスター生成を手がける中小チームにとって、これは実質的なハードルとなる。前世代はそのまま有料プロダクトに組み込めたが、今回はライセンスを取得するまで社内検証にしか使えない。ライセンス文書には売上高やユーザー数による免除規定は記載されておらず、価格も公開されていない。アリババは現時点で課金方式について公式な説明をしていない。

通義千問の大規模言語モデル側では、すでに同様の動きがあった。当サイトでも以前、Qwen3.6-Maxがクローズドソース化したことを報じている。画像モデルは今回もオープンな重みを維持しているが、商用利用の扉は半分だけ閉じた格好だ。Apache版を前提に構築されてきたコミュニティのワークフローやLoRA、プラグインが2.1上で商用利用に移行できるかどうかは、アリババがライセンス条項を整備するのを待つ必要がある。

参考資料:Qwen公式ブログ、Qwen-Image-2.1のGitHub READMEおよびHugging Faceモデルカード(パラメータ、解像度、ライセンス)、ComfyUI公式ブログ、CocoLoop、CellCogによるライセンス比較まとめ(歴代Qwen-Imageのライセンス推移とQwen-Image-Benchスコア)。