跳到正文
Image Toolkit
权重已发布

Qwen Image 2.1

生成图片、编辑图片,
也生成透明图层。

将文字和参考图交给同一个模型,完成多图合成、局部修改与透明 PNG 生成。重点保留人物特征和商品细节。

开放权重 · 研究许可证 · 商用需另行授权

多图参考 · 官方示例
参考人物与服饰,组合完整穿搭
视觉生成主体
7B参数
参考图输入
10张,最多
原生透明图层
RGBA四通道
原生分辨率
2K官方支持

在线体验

在这里体验 Qwen Image 2.1

直接使用下方演示生成图片或编辑参考图,无需离开当前页面。

演示由 Qwen 的 Hugging Face Space 提供,输入内容与图片生成由该服务处理。演示界面的语言、排队和可用状态由原服务决定。

核心能力

从参考图,到可继续编辑的素材

以下均为 Qwen 官方展示图。点击图片可放大查看细节。

直接生成透明 PNG

模型原生生成带 Alpha 通道的图像,也支持编辑透明图层、从照片中提取主体。贴纸、角色和设计元素可以直接叠加到其他画面。

透明度由模型生成。切换预览底色,可以检查透明区域与边缘;白色背景不等于透明背景。

贴纸素材商品主体角色插画
查看官方透明图示例
透明效果预览
花卉人像
01

多张参考图,合成同一场景

最多输入 10 张图片,分别提供人物、物品和场景。按图片顺序描述关系,控制各张参考图的用途。

官方示例:六张人物参考 → 一张合照

02

圈定区域,修改指定内容

用画圈、涂画或单独的蒙版选择区域,再用自然语言说明要修改什么。适合发色、服饰和局部物件调整。

圈定修改区域
按指令完成修改

明确列出“要改的区域”和“要保留的内容”,比只说“优化这张图”更容易控制结果。

官方示例:圈选后移除手表、修改发色和服装

03

更换场景,保持商品特征

以原商品为参考,调整摆放环境、构图和光线。用于制作商品场景图时,仍需逐项核对标识、包装文字与结构。

商品参考图
生成新的摆放场景

官方示例:手持商品 → 窗边桌面

04

保留人物特征,改变姿态与构图

使用人像作为参考,生成新的取景、服装或动作。人物保持是重点能力,但不代表每次结果都能完全一致。

近景人像参考
新的全身构图

官方示例:近景照片 → 户外全身照

文字与图像,放进同一版式

延续 Qwen-Image 系列的文字渲染方向,可用于海报、图文说明和信息图。官方示例展示了中文、建筑图形与多区域排版的组合。

需要准确传达信息时,应提供完整文字,并检查生成结果中的错字、数值和标注。

查看官方文字示例

图片来源: Qwen Image 2.1 官方展示. 示例用于说明能力,不代表所有输入都能得到相同效果。

参数与架构

7B 指视觉生成主体,不是整套模型

文字、参考图与透明度在同一生成管线中处理。

文字 + 参考图片定义内容与编辑要求
Qwen3-VL共同理解文字与图片
7B DiT分块因果注意力去噪
RGBA VAE解码颜色与透明度
Qwen Image 2.1 已核实的模型规格与实现默认值
项目已确认信息使用时的含义
视觉生成主体约 7B · 32 层单流 Block-Causal DiT;7B 不包含完整管线。
视觉与文字编码器Qwen3-VL共同编码文字指令与参考图片。
图像编解码器64 通道 RGBA VAE16 倍空间压缩,原生表示透明度。
参考图片最多 10 张按输入顺序对应“图 1、图 2”等指令。
分辨率支持原生 2K官方推荐含 2048 × 2048;Diffusers 默认目标边长为 1024。
推理步数 / CFG40 步 / 1.0Diffusers 默认值;CFG 大于 1 时可启用负面提示词。
前缀 KV 缓存默认开启在去噪步骤之间复用文字与参考图的 K/V。
权重许可研究许可证商业使用需要另行获得授权。

核对日期:2026-09-20。原生 2K 能力不等于所有工具默认输出 2K。模型规格与推理默认值: 官方仓库 · Diffusers 文档

使用方式

选择适合你的运行方式

先用默认参数建立基线,再调整步数、分辨率和显存策略。

01

内嵌演示

在上方演示中检查参考图保持与透明效果。处理与排队由 Qwen 的 Hugging Face Space 提供。

02

ComfyUI 工作流

更新 ComfyUI,下载对应模型文件,使用官方示例工作流进行文生图或图片编辑。

03

Python / Diffusers

通过统一管线生成和编辑图片。适合批处理、参数实验与接入现有图片处理流程。

Diffusers 最小示例文生图 + 多参考图编辑展开代码收起代码

需要兼容的 PyTorch / CUDA 环境,以及支持 QwenImage21Pipeline 的 Diffusers 主分支。下例启用 CPU 卸载,仍需足够的系统内存与显存。 官方安装说明

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# 明确指定尺寸,避免不同实现的默认值差异
result = pipe(
    prompt="一只戴着宇航员头盔的水豚,水彩插画",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# 参考图顺序必须与 image 列表一致
edited = pipe(
    prompt="把图 1 中的花放进图 2 的场景中,保持图 2 的光线。",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

负面提示词需搭配 true_cfg_scale > 1;切换 Flex Attention 时应编译模型。初次运行可保留默认注意力实现。

把要求写具体

以下是本站编写的提示词模板,并非上方官方图片的原始提示词。

透明贴纸

生成一只戴宇航员头盔的水豚贴纸,全身,清晰轮廓。输出带 Alpha 通道的 RGBA 图片,背景完全透明,不包含地面、场景或背景阴影。

商品换背景

将图 1 中的商品放在图 2 的桌面上,匹配图 2 的光线方向。保留商品的形状、颜色、标识和包装文字,只改变摆放环境。

多图穿搭

让图 1 中的人物穿上图 2 的外套、图 3 的鞋,手持图 4 的包。保留人物面部特征,保持衣服、鞋和包的颜色与款式,生成一张全身照片。

常见问题

运行之前,先弄清这些区别

了解模型的参数、输出与使用条款。

这个页面可以直接生成图片吗?

可以使用上方内嵌的 Qwen Hugging Face Space。输入与图片生成由该服务处理,演示保持原服务的界面语言与可用状态。Image Toolkit 不运行此模型的推理服务。

7B 模型是不是只需要 14 GB 显存?

不能这样计算。7B 仅指视觉生成主体,完整管线还包括 Qwen3-VL、RGBA VAE 和推理中间数据。实际显存取决于精度、分辨率、参考图数量及卸载策略;CPU 卸载也会增加内存占用和等待时间。

透明图片和白底图片有什么区别?

透明图片包含 Alpha 通道,可以叠加到其他背景上;白底图片仍含不透明像素。提示词应明确要求透明背景与 RGBA,保存为 PNG。页面中的三张透明示例保留了原图的 Alpha 通道。

默认输出是 1024 还是 2048?

官方仓库给出原生 2K 能力和 2048 × 2048 等推荐尺寸。核对时,Diffusers 的 output_resolution 默认值为 1024。请明确传入 width 和 height,区分模型能力与工具默认值。

可以直接用于收费产品吗?

Qwen Research License Agreement 第 2 条将授权限定为非商业研究或评估,商业使用须另行取得许可。申请地址为 model-business@notice.qwencloud.com,具体范围以正式协议和取得的授权为准。

10~15 步和最低 7 GB 显存可以当作推荐配置吗?

不能。首批社区低步数测试不能代替 Diffusers 的 40 步默认建议。低显存配置也依赖卸载、分块解码等设置。请使用自己的图片评估显存峰值、总耗时与细节偏差。

对比 GPT Image 2.5 与 Qwen Image 2.1