본문으로 이동
Image Toolkit
가중치 공개

Qwen Image 2.1

이미지를 만들고 편집하세요.
투명 레이어도 생성합니다.

하나의 모델에 텍스트와 참조 이미지를 입력해 장면을 합성하고 일부 영역을 수정하거나 투명 PNG를 생성합니다. 인물 특징과 제품 세부 정보 보존에 중점을 둡니다.

가중치 공개 · 연구용 라이선스 · 상업적 이용은 별도 허가 필요

다중 참조 · 공식 예제
인물, 의류와 액세서리를 하나의 착장 사진으로 결합
시각 생성 모델
7B매개변수
참조 이미지
10개까지
네이티브 투명도
RGBA4개 채널
기본 지원 해상도
2K공식 지원

온라인 데모

여기서 Qwen Image 2.1 체험하기

페이지를 벗어나지 않고 아래 데모에서 이미지를 만들거나 참조 이미지를 편집할 수 있습니다.

데모는 Qwen의 Hugging Face Space가 제공합니다. 입력과 생성은 해당 서비스에서 처리하며, 데모의 언어, 대기열과 이용 가능 상태도 원래 서비스에 따릅니다.

핵심 기능

참조 이미지에서 편집 가능한 소재로

Qwen 공식 예제입니다. 이미지를 선택하면 세부 사항을 확대할 수 있습니다.

투명 PNG를 바로 생성

알파 채널이 있는 이미지를 생성하고 투명 레이어를 편집하거나 사진에서 피사체를 추출합니다. 스티커, 캐릭터와 디자인 요소를 다른 배경에 겹칠 수 있습니다.

투명도는 모델이 생성합니다. 미리보기 배경을 바꿔 투명 영역과 가장자리를 확인하세요. 흰색 배경은 투명 배경이 아닙니다.

스티커제품 누끼캐릭터 일러스트
공식 투명 이미지 예제
투명도 미리보기
꽃 인물화
01

여러 참조를 한 장면으로 합성

인물, 사물과 배경을 최대 10개 이미지로 제공합니다. 입력 순서에 맞춰 각 이미지의 역할과 관계를 설명하세요.

공식 예제: 인물 사진 6장을 단체 사진 1장으로 합성

02

영역을 지정하고 변경 내용 설명

원, 그리기 표시 또는 별도 마스크로 영역을 지정하고 원하는 수정을 설명합니다. 머리 색, 의상과 특정 사물을 바꾸는 데 사용할 수 있습니다.

수정할 영역 표시
요청에 따른 편집 결과

변경할 부분과 유지할 부분을 모두 명시하세요. 단순히 이미지를 개선해 달라고 하는 것보다 편집 범위가 명확해집니다.

공식 예제: 시계 제거, 머리 색과 의상 변경

03

제품 특징을 유지하면서 배경 변경

원본 제품을 참조해 환경, 구도와 조명을 조정합니다. 제품 이미지로 사용하기 전에 로고, 포장 문구와 형태를 확인하세요.

원본 제품 참조
새로운 제품 배경

공식 예제: 손에 든 제품을 창가 테이블 위에 배치

04

인물 특징을 유지하며 구도 변경

인물 사진을 참조해 프레이밍, 의상이나 자세를 바꿉니다. 인물 보존은 주요 기능이지만 모든 결과에서 완전한 일치를 보장하지는 않습니다.

인물 참조 사진
새로운 전신 구도

공식 예제: 얼굴 근접 사진에서 야외 전신 사진으로

한 레이아웃에 텍스트와 이미지 배치

Qwen-Image 시리즈의 문자 생성 기능을 이어받아 포스터, 설명 그림과 인포그래픽에 활용할 수 있습니다. 공식 예제는 중국어 텍스트, 건축 그림과 여러 레이아웃 영역을 결합합니다.

정확한 정보가 필요하면 전체 문구를 제공하고 결과의 오탈자, 숫자와 주석을 검토하세요.

공식 문자 생성 예제

이미지 출처: Qwen Image 2.1 공식 예제. 예제는 기능을 보여주며, 실제 결과는 입력에 따라 달라집니다.

사양과 구조

7B는 시각 생성 부분이며 전체 파이프라인 크기가 아닙니다

텍스트, 참조 이미지와 투명도를 하나의 생성 파이프라인에서 처리합니다.

텍스트 + 참조내용과 편집 지시
Qwen3-VL텍스트와 이미지 통합 이해
7B DiT블록 인과 방식 노이즈 제거
RGBA VAE색상과 투명도 복원
확인된 Qwen Image 2.1 사양과 구현 기본값
항목확인된 정보사용 시 의미
시각 생성 모델약 7B · 32개 층단일 스트림 블록 인과 DiT이며, 7B에 전체 파이프라인은 포함되지 않습니다.
시각·텍스트 인코더Qwen3-VL텍스트 지시와 참조 이미지를 함께 인코딩합니다.
이미지 오토인코더64채널 RGBA VAE16배 공간 압축과 네이티브 투명도를 지원합니다.
참조 이미지최대 10개입력 순서가 이미지 1, 이미지 2 등의 지시에 대응합니다.
해상도네이티브 2K공식 권장 크기에 2048 × 2048이 포함됩니다. Diffusers 기본 목표 변 길이는 1024입니다.
스텝 / CFG40스텝 / 1.0Diffusers 기본값이며, 부정 프롬프트에는 1보다 큰 CFG가 필요합니다.
접두부 KV 캐시기본 활성화노이즈 제거 단계 사이에서 텍스트와 참조 이미지 K/V를 재사용합니다.
가중치 라이선스연구용 라이선스상업적 사용은 별도 허가가 필요합니다.

2026-09-20 확인. 네이티브 2K 지원이 모든 도구의 기본 2K 출력을 뜻하지는 않습니다. 모델 사양과 추론 기본값: 공식 저장소 · Diffusers 문서

실행 방법

필요에 맞는 실행 방식 선택

먼저 기본 설정으로 확인한 후 스텝, 해상도와 메모리 관리를 조정하세요.

01

내장 데모

위 데모에서 참조 보존과 투명도를 확인할 수 있습니다. 처리와 대기열은 Qwen Hugging Face Space가 관리합니다.

02

ComfyUI 워크플로

ComfyUI를 업데이트하고 호환 모델 파일을 받은 뒤 공식 생성 또는 편집 워크플로를 불러오세요.

03

Python / Diffusers

통합 파이프라인으로 생성과 편집을 처리합니다. 일괄 작업, 매개변수 실험과 기존 이미지 처리 흐름에 적합합니다.

Diffusers 최소 예제이미지 생성 + 다중 참조 편집코드 펼치기코드 접기

호환되는 PyTorch / CUDA 환경과 QwenImage21Pipeline을 포함하는 Diffusers main 브랜치가 필요합니다. 아래 예제는 CPU 오프로딩을 사용하지만 충분한 RAM과 GPU 메모리가 필요합니다. 공식 설치 안내

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# 구현별 기본값 차이를 피하려면 크기를 명시하세요
result = pipe(
    prompt="우주비행사 헬멧을 쓴 카피바라, 수채화 일러스트",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# 참조 순서는 이미지 목록과 일치해야 합니다
edited = pipe(
    prompt="이미지 1의 꽃을 이미지 2의 장면에 배치하고 이미지 2의 조명을 유지하세요.",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

부정 프롬프트에는 true_cfg_scale > 1이 필요합니다. Flex Attention 사용 시 모델을 컴파일하세요. 처음에는 기본 어텐션 구현을 사용할 수 있습니다.

구체적으로 지시하기

Image Toolkit이 작성한 템플릿이며, 위 공식 이미지의 원래 프롬프트는 아닙니다.

투명 스티커

우주비행사 헬멧을 쓴 카피바라의 전신 스티커를 선명한 윤곽으로 만드세요. 알파 채널이 있는 RGBA 이미지로 출력하고 배경은 완전히 투명하게 하세요. 바닥, 풍경이나 배경 그림자는 넣지 마세요.

제품 배경 변경

이미지 1의 제품을 이미지 2의 테이블 위에 놓고 이미지 2의 빛 방향에 맞추세요. 제품의 형태, 색상, 로고와 포장 문구를 유지하고 주변 환경만 바꾸세요.

여러 이미지로 착장 구성

이미지 1의 인물에게 이미지 2의 재킷과 이미지 3의 신발을 착용시키고 이미지 4의 가방을 들게 하세요. 얼굴 특징과 옷, 신발, 가방의 색상과 디자인을 유지하며 전신 사진을 만드세요.

자주 묻는 질문

실행 전에 확인하세요

설정, 출력과 이용 조건의 차이를 이해하세요.

이 페이지에서 이미지를 생성할 수 있나요?

네. 위에 내장된 Qwen Hugging Face Space에서 체험할 수 있습니다. 해당 서비스가 입력과 생성을 처리하며, 자체 언어와 이용 가능 상태를 유지합니다. Image Toolkit이 모델 추론을 실행하는 것은 아닙니다.

7B 모델이면 GPU 메모리 14GB로 충분한가요?

아닙니다. 7B는 시각 생성 부분만을 뜻합니다. Qwen3-VL, RGBA VAE와 중간 데이터도 필요합니다. 사용량은 정밀도, 해상도, 참조 수와 오프로딩에 따라 달라지며 CPU 오프로딩은 RAM과 대기 시간도 늘립니다.

투명 이미지와 흰 배경은 어떻게 다른가요?

투명 이미지에는 합성을 위한 알파 채널이 있습니다. 흰 배경은 여전히 불투명한 픽셀입니다. RGBA와 투명 배경을 요청하고 PNG로 저장하세요. 예제 3개는 원본 알파 채널을 유지합니다.

기본 출력은 1024인가요, 2048인가요?

공식 저장소는 네이티브 2K와 2048 × 2048 등의 크기를 안내합니다. 확인 당시 Diffusers 기본값은 output_resolution=1024였습니다. width와 height를 명시해 모델 능력과 도구 기본값을 구분하세요.

유료 제품에 바로 사용할 수 있나요?

Qwen Research License Agreement 제2조는 비상업적 연구·평가로 허가를 제한합니다. 상업용 라이선스는 model-business@notice.qwencloud.com으로 문의하고 정식 계약과 받은 허가를 따르세요.

10~15스텝과 7GB VRAM이 권장 설정인가요?

아닙니다. 초기 커뮤니티 테스트는 Diffusers의 기본 40스텝을 대체하지 않습니다. 저메모리 설정은 오프로딩과 타일 디코딩 등에 의존합니다. 본인 이미지로 메모리 최고 사용량, 처리 시간과 세부 변화량을 측정하세요.

GPT Image 2.5와 Qwen Image 2.1 비교