Qwen Image 2.1
Gere e edite imagens.
Crie também camadas transparentes.
Use texto e imagens de referência no mesmo modelo para compor cenas, fazer alterações locais e gerar PNGs transparentes, com foco em preservar pessoas e detalhes de produtos.
Pesos disponíveis · Licença de pesquisa · Autorização comercial separada
- Modelo visual
- 7Bparâmetros
- Imagens de referência
- 10no máximo
- Transparência nativa
- RGBAquatro canais
- Resolução nativa
- 2Ksuporte oficial
Demonstração
Experimente o Qwen Image 2.1 aqui
Gere imagens ou edite suas referências na demonstração integrada, sem sair desta página.
A demonstração é fornecida pelo Space da Qwen no Hugging Face. Esse serviço processa as entradas e gerações e determina o idioma da interface, a fila e a disponibilidade.
Recursos principais
De referências a elementos visuais editáveis
Exemplos oficiais da Qwen. Selecione uma imagem para examinar os detalhes.
Gere PNGs transparentes diretamente
O modelo gera imagens com canal alfa, edita camadas transparentes e extrai elementos de fotos. Adesivos, personagens e elementos gráficos podem ser sobrepostos a outros fundos.
A transparência é gerada pelo modelo. Troque o fundo da prévia para examinar áreas transparentes e bordas; fundo branco não é transparência.
Exemplos oficiais de transparência
Componha uma cena com várias referências
Envie até 10 imagens de pessoas, objetos e cenários. Descreva o papel de cada imagem de acordo com a ordem de entrada.
Exemplo oficial: seis retratos individuais reunidos em uma foto de grupo
Selecione uma região e descreva a alteração
Use círculos, marcações ou uma máscara separada para selecionar regiões. Depois descreva mudanças no cabelo, nas roupas ou em objetos específicos.
Diga o que deve mudar e o que precisa permanecer. Isso é mais preciso do que pedir uma melhoria geral da imagem.
Exemplo oficial: remover relógio e alterar cabelo e roupas
Mude o cenário, preserve o produto
Use o produto original como referência para ajustar ambiente, composição e luz. Confira logotipos, texto da embalagem e estrutura antes de usar o resultado.
Exemplo oficial: produto na mão colocado em uma mesa junto à janela
Preserve a identidade em outra composição
Use um retrato para orientar um novo enquadramento, roupa ou pose. Preservar a identidade é um foco do modelo, sem garantia de correspondência exata em cada resultado.
Exemplo oficial: de retrato próximo a foto de corpo inteiro ao ar livre
Texto e imagens no mesmo layout
O modelo mantém o foco da série Qwen-Image em texto para cartazes, explicações visuais e infográficos. O exemplo oficial combina texto chinês, ilustrações arquitetônicas e várias áreas de layout.
Para conteúdo factual, forneça o texto exato e revise ortografia, números e legendas.
Exemplos oficiais de textoImagens: Galeria oficial do Qwen Image 2.1. Os exemplos ilustram capacidades; os resultados variam conforme as entradas.
Especificações e arquitetura
7B descreve o modelo visual, não todo o pipeline
Texto, referências e transparência são processados em um mesmo pipeline de geração.
| Componente | Informação confirmada | Significado |
|---|---|---|
| Modelo visual | Cerca de 7B · 32 camadas | DiT de fluxo único com atenção causal por blocos; 7B não inclui todo o pipeline. |
| Codificador visual e textual | Qwen3-VL | Codifica instruções e referências em conjunto. |
| Autoencoder de imagens | VAE RGBA de 64 canais | Compressão espacial de 16× com transparência nativa. |
| Referências | Até 10 | A ordem corresponde a imagem 1, imagem 2 etc. |
| Resolução | 2K nativo | Tamanhos oficiais incluem 2048 × 2048; Diffusers usa lado-alvo de 1024 por padrão. |
| Passos / CFG | 40 passos / 1.0 | Padrões do Diffusers; prompts negativos exigem CFG maior que 1. |
| Cache KV de prefixo | Ativado por padrão | Reutiliza K/V de texto e referências entre os passos. |
| Licença dos pesos | Licença de pesquisa | Uso comercial exige autorização separada. |
Verificado em 20/09/2026. Suportar 2K nativo não significa que todas as ferramentas o usem por padrão. Especificações e configurações: Repositório oficial · Documentação do Diffusers
Primeiros passos
Escolha como executar o modelo
Comece pelos padrões e depois ajuste passos, resolução e gerenciamento de memória.
Demonstração integrada
Confira fidelidade às referências e transparência na demonstração acima. O Space da Qwen gerencia processamento e fila.
Workflow do ComfyUI
Atualize o ComfyUI, baixe os arquivos compatíveis e carregue um workflow oficial de geração ou edição.
Python / Diffusers
Gere e edite no mesmo pipeline, para processamento em lote, experimentos e integração aos seus fluxos de imagem.
Exemplo mínimo com DiffusersGeração e edição com várias referênciasOcultar código
Use PyTorch / CUDA compatíveis e a versão da branch principal do Diffusers com QwenImage21Pipeline. O exemplo transfere componentes para a CPU, mas ainda exige RAM e memória gráfica suficientes. Instalação oficial
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# Defina o tamanho explicitamente para evitar diferenças entre padrões
result = pipe(
prompt="Uma capivara com capacete de astronauta, ilustração em aquarela",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# A ordem das referências deve coincidir com a lista de imagens
edited = pipe(
prompt="Coloque as flores da imagem 1 no cenário da imagem 2. Preserve a iluminação da imagem 2.",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")Prompts negativos exigem true_cfg_scale > 1. Compile o modelo ao usar Flex Attention; comece pela implementação padrão de atenção.
Escreva instruções específicas
Estes modelos de prompt foram escritos pelo Image Toolkit e não são os prompts originais dos exemplos oficiais.
Adesivo transparente
Crie um adesivo de uma capivara de corpo inteiro, com capacete de astronauta e contorno definido. Gere uma imagem RGBA com canal alfa e fundo totalmente transparente, sem chão, cenário ou sombras de fundo.
Fundo de produto
Coloque o produto da imagem 1 na mesa da imagem 2 e acompanhe a direção da luz. Preserve forma, cor, logotipo e texto da embalagem. Altere apenas o ambiente.
Look com várias imagens
Vista a pessoa da imagem 1 com a jaqueta da imagem 2 e os sapatos da imagem 3, segurando a bolsa da imagem 4. Preserve traços faciais, cores e modelos das roupas e acessórios. Gere uma foto de corpo inteiro.
Dúvidas
Antes de começar
Entenda configurações, resultados e condições de uso.
Posso gerar imagens nesta página?
Sim, pelo Space da Qwen no Hugging Face integrado acima. Esse serviço processa entradas e geração, mantém seu idioma e determina sua disponibilidade. O Image Toolkit não executa a inferência do modelo.
7B significa que bastam 14 GB de memória gráfica?
Não. 7B corresponde somente ao modelo visual. O pipeline inclui Qwen3-VL, VAE RGBA e dados intermediários. A memória depende da precisão, resolução, referências e transferência para CPU, que também usa RAM e acrescenta espera.
Qual a diferença entre transparência e fundo branco?
Imagens transparentes têm canal alfa para composição. Fundos brancos ainda contêm pixels opacos. Peça RGBA com fundo transparente e salve como PNG. Os três exemplos preservam seus canais alfa originais.
A saída padrão é 1024 ou 2048?
O repositório oficial informa suporte a 2K nativo e tamanhos como 2048 × 2048. Na verificação, Diffusers usava output_resolution=1024. Defina width e height para separar capacidade do modelo e padrão da ferramenta.
Posso usá-lo em um produto pago?
A seção 2 da Qwen Research License Agreement limita a autorização a pesquisa ou avaliação não comercial. Contate model-business@notice.qwencloud.com para uma licença comercial e siga o acordo e a autorização obtidos.
10–15 passos e 7 GB de VRAM são recomendados?
Não. Testes iniciais da comunidade não substituem os 40 passos padrão do Diffusers. Configurações de pouca memória dependem de transferência de componentes e decodificação em blocos. Meça memória máxima, tempo e alterações de detalhes com suas imagens.