알리바바 통이치엔원(Qwen) 팀이 9월 20일 이미지 모델 'Qwen-Image-2.1'을 오픈소스로 공개했다. 텍스트-이미지 생성과 이미지 편집 기능을 하나의 체크포인트에 통합했다. 가중치는 이미 허깅페이스(Hugging Face)에 올라와 있고, 출시 첫날부터 diffusers와 ComfyUI를 지원한다. 설치가 필요 없는 브라우저 기반 데모도 함께 제공된다.
이전 세대와 가장 크게 달라진 부분은 라이선스다. README에는 'Qwen Research License Agreement'가 명시돼 있으며, 연구와 평가 목적의 사용만 허용한다. 상업용 제품에 적용하려면 Qwen 팀에 별도로 상업용 라이선스를 신청해야 한다.
70억 파라미터로 생성과 편집을 동시에
공식 README에 따르면 이미지 생성 부분은 70억(7B) 파라미터, 32층 싱글스트림 DiT 구조다. 텍스트 인코더는 Qwen3-VL 8B를 사용하며, 텍스트 지시와 참조 이미지를 같은 표현 공간으로 인코딩한다. 오토인코더는 64채널 RGBA이고 공간 압축률은 16배다. 이 덕분에 투명 배경 이미지를 흰 배경으로 먼저 만든 뒤 잘라내는 과정 없이 네이티브로 생성·편집할 수 있다.
네이티브 해상도는 2K까지 지원하며 권장 비율은 7종이다. 1:1은 2048×2048, 16:9는 2752×1536, 세로형 9:16은 1536×2752다. 편집 기능은 한 번에 참조 이미지를 최대 10장까지 받을 수 있고, 부분 수정은 원이나 낙서 형태의 표시, 또는 별도 마스크로 지정할 수 있다. 인물이나 제품의 외형은 여러 차례 편집을 거쳐도 최대한 일관성을 유지하도록 설계됐다. 공식 데모에는 파노라마, 인포그래픽, 스토리보드 제작은 물론 사진에서 피사체만 바로 추출하는 기능도 포함됐다.
속도를 높이는 설계는 두 가지다. 하나는 혼합 단위 어텐션으로, 텍스트는 토큰 단위 인과적 마스크를, 이미지는 블록 단위 양방향 마스크를 쓴다. 다른 하나는 프리픽스 KV 캐시 재사용으로, 입력 이미지와 지시문은 첫 번째 디노이징 단계에서만 계산하고 이후 수십 단계에서는 캐시를 그대로 재사용한다. 공식적으로는 40스텝 추론을 권장하지만, 구체적인 생성 시간이나 최소 VRAM 요구량은 공개하지 않았고 메모리가 부족한 GPU는 CPU 오프로드를 켤 수 있다고만 설명했다.
벤치마크 성적과 위치
제3자가 정리한 Qwen-Image-Bench 데이터에 따르면 Qwen-Image-2.1의 총점은 60.28점으로, 나노 바나나 2.0(Nano Banana 2.0)의 59.82점과 GPT Image 1.5의 59.65점을 근소하게 앞섰다. 전 세대인 Qwen-Image 1.0은 49.23점이었다. 29개 모델 종합 순위에서는 7위를 기록했으며, 상위 6개는 모두 폐쇄형 모델이다. 1위는 67.01점을 받은 GPT Image 2.5 Sunburst다. 이 벤치마크는 알리바바 자체 평가 세트로, 외부 재현 결과는 아직 나오지 않았다.
출시 첫날 지원하는 추론 프레임워크 목록도 넓다. vLLM-Omni, SGLang, LightX2V 모두 데이(Day)-0 지원을 명시했다. 모델 카드를 보면 알리바바가 개발자 워크플로에 빠르게 편입시키려는 의도가 읽힌다.
Apache 2.0에서 연구용 라이선스로
Qwen-Image 계열의 라이선스 변화를 정리하면 흐름이 분명해진다. 2025년 8월 공개된 Qwen-Image 1.0과 Qwen-Image-Edit, 12월의 Qwen-Image-Layered와 Qwen-Image-2512는 모두 상업적 이용에 제약이 없는 Apache 2.0 라이선스였다. 2.1에서는 연구용 라이선스로 바뀌었고, 원문에는 별도의 상업용 라이선스를 취득하지 않는 한 어떤 상업적 목적으로도 자료를 사용할 수 없다고 명시돼 있다.
이커머스 이미지 보정이나 포스터 제작을 하는 중소 팀에는 실질적인 장벽이다. 이전 세대는 곧바로 유료 제품에 적용할 수 있었지만, 이번 버전은 라이선스를 확보하기 전까지 내부 테스트 용도로만 쓸 수 있다. 라이선스 문서에는 매출이나 사용자 규모에 따른 면제 조항이 없고, 가격도 공개되지 않았다. 알리바바는 현재까지 과금 방식에 대해 공식 입장을 밝히지 않았다.
통이치엔원의 대형 언어 모델 쪽에서는 이미 비슷한 움직임이 있었다. 본 매체도 앞서 Qwen3.6-Max가 폐쇄형으로 전환된 사실을 보도한 바 있다. 이미지 모델은 이번에도 가중치를 공개했지만, 상업적 이용의 문은 절반만 열어둔 셈이다. Apache 버전을 기반으로 만들어진 커뮤니티 워크플로, LoRA, 플러그인을 2.1에서 상업적으로 그대로 쓸 수 있을지는 알리바바가 라이선스 조항을 마저 채워야 알 수 있다.
참고 출처: Qwen 공식 블로그, Qwen-Image-2.1 GitHub README 및 Hugging Face 모델 카드(파라미터, 해상도, 라이선스), ComfyUI 공식 블로그, CocoLoop, CellCog 라이선스 비교 정리(역대 Qwen-Image 라이선스 변천과 Qwen-Image-Bench 점수).