20B를 7B로 줄이면서 Apache 2.0도 같이 뺐다
Qwen-Image-2.1은 상업 이용에 별도 계약이 필요하다
Qwen-Image-2.1이 9월 20일 가중치와 함께 공개됐다. 생성과 편집과 투명 배경이 한 모델에 들어왔다. 라이선스는 연구·평가 전용으로 내려왔고 상업용 가격표는 아직 없다.
클라이언트 제품 사진 마흔 장을 배경 없이 뽑아야 한다고 하자. 지난주까지는 Qwen-Image 계열 가중치를 내려받아 로컬에서 돌리면 끝났다. 9월 20일 공개된 Qwen-Image-2.1은 그 작업을 더 잘한다. 투명 배경을 네이티브로 내고 레퍼런스 이미지 10장까지 한 번에 물린다. 그런데 그 마흔 장을 이 모델로 뽑으면 라이선스 위반이다.
Qwen 팀은 2.1을 Qwen Research License Agreement 아래 냈다. 권리는 "비상업 목적 전용"으로 주어지고 약정은 비상업을 "연구 또는 평가 목적"이라고 못 박는다. 상업 이용은 이메일로 따로 신청해야 하며 공개된 가격표가 없다. 같은 계열의 Qwen-Image, Qwen-Image-2512, Qwen-Image-Edit-2511은 여전히 Apache 2.0이다. 이미 그걸로 굴러가는 파이프라인은 손댈 필요가 없다.
한 줄 정리
Qwen이 이미지 모델을 20B에서 7B로 줄이고 편집·투명 배경을 한 덩어리로 합치면서 라이선스는 Apache 2.0에서 연구 전용으로 내렸다.
한눈에 보기
| Qwen-Image (2025) | Qwen-Image-2.1 | |
|---|---|---|
| 확산 트랜스포머 | 20B 듀얼스트림 | 7B, 32층 싱글스트림 |
| 텍스트 인코더 | Qwen2.5-VL | Qwen3-VL 8B |
| 네이티브 해상도 | 1328×1328급 | 2048×2048 |
| 편집 | 별도 모델 | 같은 모델, 레퍼런스 10장 |
| 투명 배경 | 별도 Layered 모델 | 네이티브 RGBA |
| 라이선스 | Apache 2.0 | 연구 전용 |
도구함 세 칸이 한 칸으로 접혔다
작년 계열에서 생성·편집·투명 배경은 각각 다른 체크포인트였다. 셋을 다 쓰려면 가중치를 세 벌 받아 두고 작업마다 갈아 끼웠다. 2.1은 그걸 하나로 접었다. 배경을 지운 로고, 제품 컷에서 떼어낸 피사체, 사진 열 장으로 조립한 단체 사진이 전부 같은 모델 안에서 나온다.
속도를 만든 구조도 실무 쪽이다. 프롬프트와 레퍼런스 이미지를 첫 디노이징 스텝에서 한 번만 인코딩하고 나머지 39스텝은 캐시된 접두부를 재사용한다. 언어 모델의 KV 캐시를 확산 모델에 옮긴 셈이다. 레퍼런스를 다섯 장 물려도 한 장짜리 생성의 다섯 배가 들지 않는 이유가 여기 있다. 편집은 원래 한 번에 끝나지 않는다. 열 번 스무 번 돌리는 작업이라 회당 단가가 전부다.
7B라는 숫자가 감추는 33GB
"7B"만 보고 노트북을 떠올리면 어긋난다. BF16 기준 텍스트 인코더가 17.5GB, 확산 트랜스포머가 14.2GB, VAE가 1.4GB다. 합쳐서 약 33GB. 인코더가 생성 모델보다 크다. 32GB짜리 RTX 5090에 통째로 안 올라간다.
빠져나가는 길이 공개 당일 두 개 같이 나왔다. 텍스트 인코더는 프롬프트당 한 번만 도니 시스템 램에 두고 흘려보내면 된다. 이 배치에 FP8 트랜스포머를 얹은 RTX 5090 측정치가 1024×1024 40스텝 기준 생성 5.93초, 편집 7.14초다. 데이터센터급 GB300이 같은 이미지를 3.3~4.5초에 낸다. 소비자 카드가 멀리 떨어져 있지 않다.
공개된 측정치가 전부 1024×1024라는 점도 같이 기억해 둘 만하다. 네이티브 출력은 2K이고 픽셀 면적으로 네 배다. 2K에서 최대 메모리가 얼마인지 공표한 곳은 아직 없다. 제품 컷을 2K로 뽑을 계획이라면 위 숫자를 그대로 예산에 넣으면 어긋난다.
다른 길은 통째로 양자화하는 쪽이다. Comfy-Org가 같은 날 낸 INT8 리패키지는 파이프라인 전체가 16.1GiB다. 5090은 물론 24GB짜리 4090에도 아무것도 흘려보내지 않고 상주한다. 다만 INT8과 BF16의 출력 품질을 비교한 자료는 아직 없다. 용량이 맞는다는 것과 결과가 같다는 것은 별개다.
공개 당일에 붙은 것들
가중치만 던져 놓은 공개가 아니었다. Diffusers에 전용 파이프라인 클래스가 들어갔고 ComfyUI는 네이티브 노드와 템플릿 워크플로 두 벌을 붙였다. vLLM-Omni는 FP8과 CUDA 그래프로 서빙하고 SGLang은 소비자 카드까지 내려가는 설정집을 냈다. FlagOS는 엔비디아가 아닌 칩 플랫폼 여덟 개용 빌드 이미지를 배포한다.
프롬프트 리라이터 두 개도 같이 왔다. 생성용과 편집용으로 나뉘어 있고 Qwen3.5-VL 9B에서 파인튜닝됐다. 짧게 쓴 프롬프트를 모델이 학습한 긴 서술형으로 늘려 주고 가로세로 비율까지 골라 준다. 프롬프트 엔지니어링을 모델 쪽에 넘긴 셈이다. 디자인 인력이 따로 없는 팀에는 이쪽이 해상도 숫자보다 실질적이다.
이런 생태계 대응 속도가 요즘 공개의 기본값이 됐다. 그래서 "돌려 보기까지" 걸리는 시간이 예전처럼 채택의 장벽이 아니다. 장벽은 다른 데로 옮겨 갔다.
시험지를 낸 쪽이 채점도 했다
공개 글에 실린 비교는 하나다. Qwen-Image-Bench 위에서 "다른 오픈소스·클로즈드 모델"과 겨룬 차트. 그 평가 슈트는 Qwen이 2026년 5월에 직접 낸 것이다. 점수는 표가 아니라 그림으로 들어가 있고, GitHub README와 Hugging Face 모델 카드에는 벤치마크가 아예 없다. 공개 당일 기준 독립 평가는 존재하지 않는다. 타이포그래피와 인물 조명이 좋아졌다는 문구도 발표자의 말이고 예시 이미지도 발표자의 것이다.
7B에 캐시된 접두부를 붙인 설계는 품질 리더보드용이 아니라 싼 편집 반복용이다. 네이티브 RGBA와 열 장 조건부는 제품·디자인 작업용이다. 그리고 연구 라이선스는 팔기 위한 설계다.
위시클레이 관점
릴리스 문서에서 먼저 읽을 줄이 성능표가 아닌 날이 있다. 이번이 그렇다. 벤치마크는 Qwen이 만든 시험지 한 장뿐이고 독립 검증은 아직 없다. 라이선스 문구만 오늘 날짜로 확정돼 있다. 검증 안 된 건 품질이고 확정된 건 제약이다.
계산이 간단하다. 33GB 가중치를 받아 INT8로 줄여 4090에 올리고 이미지당 6초를 만들어 내는 일은 하루면 된다. 그 파이프라인으로 고객 배너를 한 장이라도 뽑는 순간 필요한 것은 가격이 안 붙은 이메일 문의다. 기술 난이도가 낮은 쪽이 아니라 답이 없는 쪽이 병목이 됐다.
그래서 실무 순서를 뒤집는 편이 낫다. 모델을 돌려 본 다음 라이선스를 확인할 게 아니라 라이선스를 먼저 읽고 돌릴지 정한다. 5분이면 읽는다. 반대 순서는 한 달 붙인 워크플로를 통째로 버리게 만든다. Apache 2.0인 2512와 Edit-2511이 그대로 남아 있다는 점도 그래서 중요하다. 2.1의 품질 우위가 독립 측정으로 확인되기 전까지, 상업 작업의 기본값은 옛 모델 쪽이다.
열린 문마다 조건이 하나씩.