
이미지: METAL
요약
- 알리바바 큐원이 9월 20일 Qwen-Image-2.1 가중치를 허깅페이스와 모델스코프에 공개했어요.
- 생성과 편집, 투명 이미지가 7B 파라미터 체크포인트 하나에 들어갔고 참조 이미지는 최대 10장까지 받아요.
- 컴피UI와 디퓨저스, vLLM-Omni, SGLang, LightX2V 가 첫날 지원을 켰고 라이선스는 Qwen Research License Agreement 예요.
- 공개
- 2026년 9월 20일 · 허깅페이스 · 모델스코프
- 크기
- 시각 생성부 7B 파라미터 · 단일 스트림 DiT 32레이어
- 구성
- 텍스트 인코더 Qwen3-VL 8B · 64채널 RGBA VAE(16배 압축)
- 기본값
- 2048×2048 · 추론 스텝 40 · 화면비 7종
- 편집
- 참조 이미지 최대 10장 · 동그라미·붓칠·마스크 국소 편집
- 첫날 지원
- 디퓨저스 · 컴피UI · vLLM-Omni · SGLang · LightX2V · FlagOS 8개 칩
- 라이선스
- Qwen Research License Agreement
알리바바 큐원 팀이 9월 20일 이미지 모델 Qwen-Image-2.1 을 공개하고 가중치를 허깅페이스와 모델스코프에 올렸어요. 시각 생성부가 7B 파라미터인 모델 하나가 글로 그림을 만드는 일과 이미 있는 그림을 고치는 일을 함께 하고, 배경이 비어 있는 투명 이미지를 곧바로 뽑아내요. 큐원 팀은 발표문에서 이 모델이 "생성 품질과 추론 효율, 비용 사이의 균형을 맞춘다" 고 적었어요.
구조는 발표문과 저장소에 그대로 적혀 있어요. 트랜스포머는 32개 레이어짜리 단일 스트림 DiT 이고 파라미터는 7B 예요. 텍스트 인코더는 Qwen3-VL 8B 가 맡아 지시문과 조건 이미지를 한 표현으로 묶고, VAE 는 공간을 16배로 압축하는 64채널 RGBA 오토인코더라 투명도가 모델 안쪽에서 처리돼요. 스케줄러는 플로 매칭에 오일러 이산 방식과 동적 시프팅을 얹었어요.
속도를 끌어올린 자리는 어텐션이에요. 텍스트는 토큰 단위 인과 마스크를 쓰고 이미지 생성은 청크 단위 마스크를 써서 입자 크기를 섞었고, 입력 이미지와 편집 지시문은 첫 스텝에서 한 번만 계산해 캐시에 두고 남은 스텝이 그대로 가져다 써요. 큐원 팀은 이 방식이 여러 장을 넣고 편집할 때 특히 추론 효율을 올리고 메모리 사용을 줄인다고 밝혔어요.
투명 이미지는 이번 판의 가장 큰 추가예요. 큐원은 2025년 12월 투명 이미지 전용 모델 Qwen-Image-Layered 를 따로 내놨는데, 이번에는 그 기능을 한 모델 안으로 넣고 알파 채널이 있는 그림을 낼지 말지를 프롬프트가 정하게 했어요. 사진 한 장을 주면 원하는 대상만 RGBA 레이어로 떼어내고, 투명 배경을 유지한 채 인물 표정을 바꾸거나 레이어 안의 글자를 다른 낱말로 갈아 끼우는 편집도 같은 체크포인트가 해요.
편집 쪽 손잡이는 네 갈래로 늘었어요. 참조 이미지는 최대 10장까지 받아서 초상 여섯 장을 한 장의 단체 사진으로 합치거나, 모델과 옷과 신발과 가방과 모자 다섯 장을 한 벌 차림으로 묶고, 가구 사진 열 장으로 방 하나를 배치해요. 고칠 자리는 색이 다른 동그라미나 붓칠 주석으로 찍고, 원본을 가리고 싶지 않으면 이미지와 마스크를 따로 넣어요. 파노라마와 인포그래픽, 스토리보드도 과제 목록에 함께 들어 있어요.
해상도는 2K 가 기본값이에요. 기본 출력이 2048×2048 이고 추론 스텝 기본값은 40 이며, 화면비는 정사각형부터 2752×1536 까지 일곱 가지를 권장 크기로 못 박아 뒀어요. 짧은 프롬프트를 길게 풀어 주는 전용 모델도 함께 나왔는데, Qwen3.5-VL 9B 를 텍스트-이미지용과 편집용으로 각각 미세조정한 두 개예요.
첫날 지원 목록은 이 모델이 어디서 돌아갈지를 보여줘요. 디퓨저스는 QwenImage21Pipeline 으로 붙었고, SGLang 은 프리픽스 캐시와 다중 GPU 병렬화를 얹었으며, vLLM-Omni 는 FP8 양자화와 스텝 단위 실행을 더했어요. 엔비디아 밖도 열려 있어요. AMD 라데온은 ROCm 으로 돌고, 이종 칩 소프트웨어 스택 FlagOS 는 여덟 개 칩 플랫폼용 사전 빌드 이미지와 가중치를 함께 냈어요.
컴피UI 는 같은 날 올린 소개 글에서 알파 채널을 가장 앞세웠어요. 글은 스프라이트와 로고, 아이콘, 제품 컷아웃이 샘플러에서 나오는 순간 합성할 준비가 끝나 있다며 "배경 제거 노드도, 매팅 모델도, 가장자리 정리도 필요 없습니다" 라고 적었어요. 이어 "다른 주요 오픈 모델 가운데 이걸 하는 건 없습니다" 라는 문장으로 차별점을 못 박았어요. 텍스트 인코더 노드는 이미지 입력 칸을 채울 때마다 다음 칸을 열어 열 장까지 받아요.
메탈이 확인한 모델 카드와 저장소에는 라이선스가 Qwen Research License Agreement 로 적혀 있어요. 발표문은 오픈소스라는 낱말을 쓰지만 가중치에 붙은 계약서는 허용형이 아니라 연구용 라이선스예요. 공개 첫날 허깅페이스에는 이 모델을 손본 파인튜닝 7종과 양자화 9종, 데모 스페이스 12개가 이미 올라와 있었어요.
큐원의 공개 속도는 이번만의 일이 아니에요. 메탈은 큐원이 실시간 동시통역 모델을 공개했다고 보도한 바 있고, 이미지 쪽은 2026년 2월 Qwen-Image 2.0 이 나온 뒤 일곱 달 만에 다음 판이 나왔어요. 중국에서는 wuli.art 가 챗박스와 캔버스에서 투명 배경 생성을 포함한 기능을 무료로 열었어요.
7B 라는 숫자가 이 발표의 요점이에요. 2K 출력과 40 스텝이 기본값인 모델이 소비자용 그래픽카드 메모리에 들어가고, 투명 배경과 열 장짜리 참조 편집이 체크포인트 하나에서 나와요. 이미지 모델을 고를 때 따지던 항목이 품질과 속도였다면 지금은 결과물이 손질 없이 다음 작업으로 넘어갈 수 있느냐로 옮겨 가고 있어요.





댓글