在线体验
在这里体验 Qwen Image 2.1
直接使用下方演示生成图片或编辑参考图,无需离开当前页面。
演示由 Qwen 的 Hugging Face Space 提供,输入内容与图片生成由该服务处理。演示界面的语言、排队和可用状态由原服务决定。
核心能力
从参考图,到可继续编辑的素材
以下均为 Qwen 官方展示图。点击图片可放大查看细节。
直接生成透明 PNG
模型原生生成带 Alpha 通道的图像,也支持编辑透明图层、从照片中提取主体。贴纸、角色和设计元素可以直接叠加到其他画面。
透明度由模型生成。切换预览底色,可以检查透明区域与边缘;白色背景不等于透明背景。
查看官方透明图示例
多张参考图,合成同一场景
最多输入 10 张图片,分别提供人物、物品和场景。按图片顺序描述关系,控制各张参考图的用途。
官方示例:六张人物参考 → 一张合照
圈定区域,修改指定内容
用画圈、涂画或单独的蒙版选择区域,再用自然语言说明要修改什么。适合发色、服饰和局部物件调整。
明确列出“要改的区域”和“要保留的内容”,比只说“优化这张图”更容易控制结果。
官方示例:圈选后移除手表、修改发色和服装
更换场景,保持商品特征
以原商品为参考,调整摆放环境、构图和光线。用于制作商品场景图时,仍需逐项核对标识、包装文字与结构。
官方示例:手持商品 → 窗边桌面
保留人物特征,改变姿态与构图
使用人像作为参考,生成新的取景、服装或动作。人物保持是重点能力,但不代表每次结果都能完全一致。
官方示例:近景照片 → 户外全身照
文字与图像,放进同一版式
延续 Qwen-Image 系列的文字渲染方向,可用于海报、图文说明和信息图。官方示例展示了中文、建筑图形与多区域排版的组合。
需要准确传达信息时,应提供完整文字,并检查生成结果中的错字、数值和标注。
查看官方文字示例图片来源: Qwen Image 2.1 官方展示. 示例用于说明能力,不代表所有输入都能得到相同效果。
参数与架构
7B 指视觉生成主体,不是整套模型
文字、参考图与透明度在同一生成管线中处理。
| 项目 | 已确认信息 | 使用时的含义 |
|---|---|---|
| 视觉生成主体 | 约 7B · 32 层 | 单流 Block-Causal DiT;7B 不包含完整管线。 |
| 视觉与文字编码器 | Qwen3-VL | 共同编码文字指令与参考图片。 |
| 图像编解码器 | 64 通道 RGBA VAE | 16 倍空间压缩,原生表示透明度。 |
| 参考图片 | 最多 10 张 | 按输入顺序对应“图 1、图 2”等指令。 |
| 分辨率 | 支持原生 2K | 官方推荐含 2048 × 2048;Diffusers 默认目标边长为 1024。 |
| 推理步数 / CFG | 40 步 / 1.0 | Diffusers 默认值;CFG 大于 1 时可启用负面提示词。 |
| 前缀 KV 缓存 | 默认开启 | 在去噪步骤之间复用文字与参考图的 K/V。 |
| 权重许可 | 研究许可证 | 商业使用需要另行获得授权。 |
核对日期:2026-09-20。原生 2K 能力不等于所有工具默认输出 2K。模型规格与推理默认值: 官方仓库 · Diffusers 文档
使用方式
选择适合你的运行方式
先用默认参数建立基线,再调整步数、分辨率和显存策略。
内嵌演示
在上方演示中检查参考图保持与透明效果。处理与排队由 Qwen 的 Hugging Face Space 提供。
ComfyUI 工作流
更新 ComfyUI,下载对应模型文件,使用官方示例工作流进行文生图或图片编辑。
Python / Diffusers
通过统一管线生成和编辑图片。适合批处理、参数实验与接入现有图片处理流程。
Diffusers 最小示例文生图 + 多参考图编辑收起代码
需要兼容的 PyTorch / CUDA 环境,以及支持 QwenImage21Pipeline 的 Diffusers 主分支。下例启用 CPU 卸载,仍需足够的系统内存与显存。 官方安装说明
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# 明确指定尺寸,避免不同实现的默认值差异
result = pipe(
prompt="一只戴着宇航员头盔的水豚,水彩插画",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# 参考图顺序必须与 image 列表一致
edited = pipe(
prompt="把图 1 中的花放进图 2 的场景中,保持图 2 的光线。",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")负面提示词需搭配 true_cfg_scale > 1;切换 Flex Attention 时应编译模型。初次运行可保留默认注意力实现。
把要求写具体
以下是本站编写的提示词模板,并非上方官方图片的原始提示词。
透明贴纸
生成一只戴宇航员头盔的水豚贴纸,全身,清晰轮廓。输出带 Alpha 通道的 RGBA 图片,背景完全透明,不包含地面、场景或背景阴影。
商品换背景
将图 1 中的商品放在图 2 的桌面上,匹配图 2 的光线方向。保留商品的形状、颜色、标识和包装文字,只改变摆放环境。
多图穿搭
让图 1 中的人物穿上图 2 的外套、图 3 的鞋,手持图 4 的包。保留人物面部特征,保持衣服、鞋和包的颜色与款式,生成一张全身照片。
常见问题
运行之前,先弄清这些区别
了解模型的参数、输出与使用条款。
这个页面可以直接生成图片吗?
可以使用上方内嵌的 Qwen Hugging Face Space。输入与图片生成由该服务处理,演示保持原服务的界面语言与可用状态。Image Toolkit 不运行此模型的推理服务。
7B 模型是不是只需要 14 GB 显存?
不能这样计算。7B 仅指视觉生成主体,完整管线还包括 Qwen3-VL、RGBA VAE 和推理中间数据。实际显存取决于精度、分辨率、参考图数量及卸载策略;CPU 卸载也会增加内存占用和等待时间。
透明图片和白底图片有什么区别?
透明图片包含 Alpha 通道,可以叠加到其他背景上;白底图片仍含不透明像素。提示词应明确要求透明背景与 RGBA,保存为 PNG。页面中的三张透明示例保留了原图的 Alpha 通道。
默认输出是 1024 还是 2048?
官方仓库给出原生 2K 能力和 2048 × 2048 等推荐尺寸。核对时,Diffusers 的 output_resolution 默认值为 1024。请明确传入 width 和 height,区分模型能力与工具默认值。
可以直接用于收费产品吗?
Qwen Research License Agreement 第 2 条将授权限定为非商业研究或评估,商业使用须另行取得许可。申请地址为 model-business@notice.qwencloud.com,具体范围以正式协议和取得的授权为准。
10~15 步和最低 7 GB 显存可以当作推荐配置吗?
不能。首批社区低步数测试不能代替 Diffusers 的 40 步默认建议。低显存配置也依赖卸载、分块解码等设置。请使用自己的图片评估显存峰值、总耗时与细节偏差。