線上體驗
在這裡體驗 Qwen Image 2.1
直接使用下方示範生成圖片或編輯參考圖,無需離開當前頁面。
示範由 Qwen 的 Hugging Face Space 提供,輸入內容與圖片生成由該服務處理。示範介面的語言、排隊和可用狀態由原服務決定。
核心能力
從參考圖,到可繼續編輯的素材
以下均為 Qwen 官方展示圖。點選圖片可放大查看細節。
直接生成透明 PNG
模型原生生成帶 Alpha 通道的影像,也支援編輯透明圖層、從照片中提取主體。貼紙、角色和設計元素可以直接疊加到其他畫面。
透明度由模型生成。切換預覽底色,可以檢查透明區域與邊緣;白色背景不等於透明背景。
查看官方透明圖範例
多張參考圖,合成同一場景
最多輸入 10 張圖片,分別提供人物、物品和場景。按圖片順序描述關係,控制各張參考圖的用途。
官方範例:六張人物參考 → 一張合照
圈定區域,修改指定內容
用畫圈、塗畫或單獨的遮罩選擇區域,再用自然語言說明要修改什麼。適合髮色、服飾和局部物件調整。
明確列出“要改的區域”和“要保留的內容”,比只說“最佳化這張圖”更容易控制結果。
官方範例:圈選後移除手錶、修改髮色和服裝
更換場景,保持商品特徵
以原商品為參考,調整擺放環境、構圖和光線。用於製作商品場景圖時,仍需逐項核對標識、包裝文字與結構。
官方範例:手持商品 → 窗邊桌面
保留人物特徵,改變姿態與構圖
使用人像作為參考,生成新的取景、服裝或動作。人物保持是重點能力,但不代表每次結果都能完全一致。
官方範例:近景照片 → 戶外全身照
文字與影像,放進同一版式
延續 Qwen-Image 系列的文字渲染方向,可用於海報、圖文說明和資訊圖。官方範例展示了中文、建築圖形與多區域排版的組合。
需要準確傳達資訊時,應提供完整文字,並檢查生成結果中的錯字、數值和標註。
查看官方文字範例圖片來源: Qwen Image 2.1 官方展示. 範例用於說明能力,不代表所有輸入都能得到相同效果。
參數與架構
7B 指視覺生成主體,不是整套模型
文字、參考圖與透明度在同一生成流程中處理。
| 專案 | 已確認資訊 | 使用時的含義 |
|---|---|---|
| 視覺生成主體 | 約 7B · 32 層 | 單流 Block-Causal DiT;7B 不包含完整流程。 |
| 視覺與文字編碼器 | Qwen3-VL | 共同編碼文字指令與參考圖片。 |
| 影像編解碼器 | 64 通道 RGBA VAE | 16 倍空間壓縮,原生表示透明度。 |
| 參考圖片 | 最多 10 張 | 按輸入順序對應“圖 1、圖 2”等指令。 |
| 解析度 | 支援原生 2K | 官方推薦含 2048 × 2048;Diffusers 預設目標邊長為 1024。 |
| 推理步數 / CFG | 40 步 / 1.0 | Diffusers 預設值;CFG 大於 1 時可啟用負面提示詞。 |
| 字首 KV 快取 | 預設開啟 | 在去噪步驟之間複用文字與參考圖的 K/V。 |
| 權重許可 | 研究授權條款 | 商業使用需要另行獲得授權。 |
核對日期:2026-09-20。原生 2K 能力不等於所有工具預設輸出 2K。模型規格與推理預設值: 官方倉庫 · Diffusers 文件
使用方式
選擇適合你的執行方式
先用預設參數建立基線,再調整步數、解析度和視訊記憶體策略。
內嵌示範
在上方示範中檢查參考圖保持與透明效果。處理與排隊由 Qwen 的 Hugging Face Space 提供。
ComfyUI 工作流
更新 ComfyUI,下載對應模型檔案,使用官方範例工作流進行文生圖或圖片編輯。
Python / Diffusers
透過統一流程生成和編輯圖片。適合批處理、參數實驗與接入現有圖片處理流程。
Diffusers 最小範例文生圖 + 多參考圖編輯收起程式碼
需要相容的 PyTorch / CUDA 環境,以及支援 QwenImage21Pipeline 的 Diffusers 主分支。下例啟用 CPU 解除安裝,仍需足夠的系統記憶體與視訊記憶體。 官方安裝說明
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# 明確指定尺寸,避免不同實現的預設值差異
result = pipe(
prompt="一隻戴著宇航員頭盔的水豚,水彩插畫",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# 參考圖順序必須與 image 列表一致
edited = pipe(
prompt="把圖 1 中的花放進圖 2 的場景中,保持圖 2 的光線。",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")負面提示詞需搭配 true_cfg_scale > 1;切換 Flex Attention 時應編譯模型。初次執行可保留預設注意力實現。
把要求寫具體
以下是本站編寫的提示詞模板,並非上方官方圖片的原始提示詞。
透明貼紙
生成一隻戴宇航員頭盔的水豚貼紙,全身,清晰輪廓。輸出帶 Alpha 通道的 RGBA 圖片,背景完全透明,不包含地面、場景或背景陰影。
商品換背景
將圖 1 中的商品放在圖 2 的桌面上,匹配圖 2 的光線方向。保留商品的形狀、顏色、標識和包裝文字,只改變擺放環境。
多圖穿搭
讓圖 1 中的人物穿上圖 2 的外套、圖 3 的鞋,手持圖 4 的包。保留人物面部特徵,保持衣服、鞋和包的顏色與款式,生成一張全身照片。
常見問題
執行之前,先弄清這些區別
瞭解模型的參數、輸出與使用條款。
這個頁面可以直接生成圖片嗎?
可以使用上方內嵌的 Qwen Hugging Face Space。輸入與圖片生成由該服務處理,示範保持原服務的介面語言與可用狀態。Image Toolkit 不執行此模型的推理服務。
7B 模型是不是只需要 14 GB 視訊記憶體?
不能這樣計算。7B 僅指視覺生成主體,完整流程還包括 Qwen3-VL、RGBA VAE 和推理中間資料。實際視訊記憶體取決於精度、解析度、參考圖數量及解除安裝策略;CPU 解除安裝也會增加記憶體佔用和等待時間。
透明圖片和白底圖片有什麼區別?
透明圖片包含 Alpha 通道,可以疊加到其他背景上;白底圖片仍含不透明畫素。提示詞應明確要求透明背景與 RGBA,儲存為 PNG。頁面中的三張透明範例保留了原圖的 Alpha 通道。
預設輸出是 1024 還是 2048?
官方倉庫給出原生 2K 能力和 2048 × 2048 等推薦尺寸。核對時,Diffusers 的 output_resolution 預設值為 1024。請明確傳入 width 和 height,區分模型能力與工具預設值。
可以直接用於收費產品嗎?
Qwen Research License Agreement 第 2 條將授許可權定為非商業研究或評估,商業使用須另行取得許可。申請地址為 model-business@notice.qwencloud.com,具體範圍以正式協議和取得的授權為準。
10~15 步和最低 7 GB 視訊記憶體可以當作推薦配置嗎?
不能。首批社群低步數測試不能代替 Diffusers 的 40 步預設建議。低視訊記憶體配置也依賴解除安裝、分塊解碼等設定。請使用自己的圖片評估視訊記憶體峰值、總耗時與細節偏差。