跳至內容
Image Toolkit
權重已發布

Qwen Image 2.1

生成圖片、編輯圖片,
也生成透明圖層。

將文字和參考圖交給同一個模型,完成多圖合成、局部修改與透明 PNG 生成。重點保留人物特徵和商品細節。

開放權重 · 研究授權條款 · 商用需另行授權

多圖參考 · 官方範例
參考人物與服飾,組合完整穿搭
視覺生成主體
7B參數
參考圖輸入
10張,最多
原生透明圖層
RGBA四通道
原生解析度
2K官方支援

線上體驗

在這裡體驗 Qwen Image 2.1

直接使用下方示範生成圖片或編輯參考圖,無需離開當前頁面。

示範由 Qwen 的 Hugging Face Space 提供,輸入內容與圖片生成由該服務處理。示範介面的語言、排隊和可用狀態由原服務決定。

核心能力

從參考圖,到可繼續編輯的素材

以下均為 Qwen 官方展示圖。點選圖片可放大查看細節。

直接生成透明 PNG

模型原生生成帶 Alpha 通道的影像,也支援編輯透明圖層、從照片中提取主體。貼紙、角色和設計元素可以直接疊加到其他畫面。

透明度由模型生成。切換預覽底色,可以檢查透明區域與邊緣;白色背景不等於透明背景。

貼紙素材商品主體角色插畫
查看官方透明圖範例
透明效果預覽
花卉人像
01

多張參考圖,合成同一場景

最多輸入 10 張圖片,分別提供人物、物品和場景。按圖片順序描述關係,控制各張參考圖的用途。

官方範例:六張人物參考 → 一張合照

02

圈定區域,修改指定內容

用畫圈、塗畫或單獨的遮罩選擇區域,再用自然語言說明要修改什麼。適合髮色、服飾和局部物件調整。

圈定修改區域
按指令完成修改

明確列出“要改的區域”和“要保留的內容”,比只說“最佳化這張圖”更容易控制結果。

官方範例:圈選後移除手錶、修改髮色和服裝

03

更換場景,保持商品特徵

以原商品為參考,調整擺放環境、構圖和光線。用於製作商品場景圖時,仍需逐項核對標識、包裝文字與結構。

商品參考圖
生成新的擺放場景

官方範例:手持商品 → 窗邊桌面

04

保留人物特徵,改變姿態與構圖

使用人像作為參考,生成新的取景、服裝或動作。人物保持是重點能力,但不代表每次結果都能完全一致。

近景人像參考
新的全身構圖

官方範例:近景照片 → 戶外全身照

文字與影像,放進同一版式

延續 Qwen-Image 系列的文字渲染方向,可用於海報、圖文說明和資訊圖。官方範例展示了中文、建築圖形與多區域排版的組合。

需要準確傳達資訊時,應提供完整文字,並檢查生成結果中的錯字、數值和標註。

查看官方文字範例

圖片來源: Qwen Image 2.1 官方展示. 範例用於說明能力,不代表所有輸入都能得到相同效果。

參數與架構

7B 指視覺生成主體,不是整套模型

文字、參考圖與透明度在同一生成流程中處理。

文字 + 參考圖片定義內容與編輯要求
Qwen3-VL共同理解文字與圖片
7B DiT分塊因果注意力去噪
RGBA VAE解碼顏色與透明度
Qwen Image 2.1 已核實的模型規格與實現預設值
專案已確認資訊使用時的含義
視覺生成主體約 7B · 32 層單流 Block-Causal DiT;7B 不包含完整流程。
視覺與文字編碼器Qwen3-VL共同編碼文字指令與參考圖片。
影像編解碼器64 通道 RGBA VAE16 倍空間壓縮,原生表示透明度。
參考圖片最多 10 張按輸入順序對應“圖 1、圖 2”等指令。
解析度支援原生 2K官方推薦含 2048 × 2048;Diffusers 預設目標邊長為 1024。
推理步數 / CFG40 步 / 1.0Diffusers 預設值;CFG 大於 1 時可啟用負面提示詞。
字首 KV 快取預設開啟在去噪步驟之間複用文字與參考圖的 K/V。
權重許可研究授權條款商業使用需要另行獲得授權。

核對日期:2026-09-20。原生 2K 能力不等於所有工具預設輸出 2K。模型規格與推理預設值: 官方倉庫 · Diffusers 文件

使用方式

選擇適合你的執行方式

先用預設參數建立基線,再調整步數、解析度和視訊記憶體策略。

01

內嵌示範

在上方示範中檢查參考圖保持與透明效果。處理與排隊由 Qwen 的 Hugging Face Space 提供。

02

ComfyUI 工作流

更新 ComfyUI,下載對應模型檔案,使用官方範例工作流進行文生圖或圖片編輯。

03

Python / Diffusers

透過統一流程生成和編輯圖片。適合批處理、參數實驗與接入現有圖片處理流程。

Diffusers 最小範例文生圖 + 多參考圖編輯展開程式碼收起程式碼

需要相容的 PyTorch / CUDA 環境,以及支援 QwenImage21Pipeline 的 Diffusers 主分支。下例啟用 CPU 解除安裝,仍需足夠的系統記憶體與視訊記憶體。 官方安裝說明

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# 明確指定尺寸,避免不同實現的預設值差異
result = pipe(
    prompt="一隻戴著宇航員頭盔的水豚,水彩插畫",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# 參考圖順序必須與 image 列表一致
edited = pipe(
    prompt="把圖 1 中的花放進圖 2 的場景中,保持圖 2 的光線。",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

負面提示詞需搭配 true_cfg_scale > 1;切換 Flex Attention 時應編譯模型。初次執行可保留預設注意力實現。

把要求寫具體

以下是本站編寫的提示詞模板,並非上方官方圖片的原始提示詞。

透明貼紙

生成一隻戴宇航員頭盔的水豚貼紙,全身,清晰輪廓。輸出帶 Alpha 通道的 RGBA 圖片,背景完全透明,不包含地面、場景或背景陰影。

商品換背景

將圖 1 中的商品放在圖 2 的桌面上,匹配圖 2 的光線方向。保留商品的形狀、顏色、標識和包裝文字,只改變擺放環境。

多圖穿搭

讓圖 1 中的人物穿上圖 2 的外套、圖 3 的鞋,手持圖 4 的包。保留人物面部特徵,保持衣服、鞋和包的顏色與款式,生成一張全身照片。

常見問題

執行之前,先弄清這些區別

瞭解模型的參數、輸出與使用條款。

這個頁面可以直接生成圖片嗎?

可以使用上方內嵌的 Qwen Hugging Face Space。輸入與圖片生成由該服務處理,示範保持原服務的介面語言與可用狀態。Image Toolkit 不執行此模型的推理服務。

7B 模型是不是只需要 14 GB 視訊記憶體?

不能這樣計算。7B 僅指視覺生成主體,完整流程還包括 Qwen3-VL、RGBA VAE 和推理中間資料。實際視訊記憶體取決於精度、解析度、參考圖數量及解除安裝策略;CPU 解除安裝也會增加記憶體佔用和等待時間。

透明圖片和白底圖片有什麼區別?

透明圖片包含 Alpha 通道,可以疊加到其他背景上;白底圖片仍含不透明畫素。提示詞應明確要求透明背景與 RGBA,儲存為 PNG。頁面中的三張透明範例保留了原圖的 Alpha 通道。

預設輸出是 1024 還是 2048?

官方倉庫給出原生 2K 能力和 2048 × 2048 等推薦尺寸。核對時,Diffusers 的 output_resolution 預設值為 1024。請明確傳入 width 和 height,區分模型能力與工具預設值。

可以直接用於收費產品嗎?

Qwen Research License Agreement 第 2 條將授許可權定為非商業研究或評估,商業使用須另行取得許可。申請地址為 model-business@notice.qwencloud.com,具體範圍以正式協議和取得的授權為準。

10~15 步和最低 7 GB 視訊記憶體可以當作推薦配置嗎?

不能。首批社群低步數測試不能代替 Diffusers 的 40 步預設建議。低視訊記憶體配置也依賴解除安裝、分塊解碼等設定。請使用自己的圖片評估視訊記憶體峰值、總耗時與細節偏差。

比較 GPT Image 2.5 與 Qwen Image 2.1