Ir para o conteúdo
Image Toolkit
Pesos disponíveis

Qwen Image 2.1

Gere e edite imagens.
Crie também camadas transparentes.

Use texto e imagens de referência no mesmo modelo para compor cenas, fazer alterações locais e gerar PNGs transparentes, com foco em preservar pessoas e detalhes de produtos.

Pesos disponíveis · Licença de pesquisa · Autorização comercial separada

Várias referências · Exemplo oficial
Combine pessoa, roupas e acessórios em uma foto de look completo
Modelo visual
7Bparâmetros
Imagens de referência
10no máximo
Transparência nativa
RGBAquatro canais
Resolução nativa
2Ksuporte oficial

Demonstração

Experimente o Qwen Image 2.1 aqui

Gere imagens ou edite suas referências na demonstração integrada, sem sair desta página.

A demonstração é fornecida pelo Space da Qwen no Hugging Face. Esse serviço processa as entradas e gerações e determina o idioma da interface, a fila e a disponibilidade.

Recursos principais

De referências a elementos visuais editáveis

Exemplos oficiais da Qwen. Selecione uma imagem para examinar os detalhes.

Gere PNGs transparentes diretamente

O modelo gera imagens com canal alfa, edita camadas transparentes e extrai elementos de fotos. Adesivos, personagens e elementos gráficos podem ser sobrepostos a outros fundos.

A transparência é gerada pelo modelo. Troque o fundo da prévia para examinar áreas transparentes e bordas; fundo branco não é transparência.

AdesivosRecortes de produtosPersonagens
Exemplos oficiais de transparência
Prévia de transparência
Retrato floral
01

Componha uma cena com várias referências

Envie até 10 imagens de pessoas, objetos e cenários. Descreva o papel de cada imagem de acordo com a ordem de entrada.

Exemplo oficial: seis retratos individuais reunidos em uma foto de grupo

02

Selecione uma região e descreva a alteração

Use círculos, marcações ou uma máscara separada para selecionar regiões. Depois descreva mudanças no cabelo, nas roupas ou em objetos específicos.

Regiões marcadas antes da edição
Resultado das alterações

Diga o que deve mudar e o que precisa permanecer. Isso é mais preciso do que pedir uma melhoria geral da imagem.

Exemplo oficial: remover relógio e alterar cabelo e roupas

03

Mude o cenário, preserve o produto

Use o produto original como referência para ajustar ambiente, composição e luz. Confira logotipos, texto da embalagem e estrutura antes de usar o resultado.

Produto de referência
Novo cenário do produto

Exemplo oficial: produto na mão colocado em uma mesa junto à janela

04

Preserve a identidade em outra composição

Use um retrato para orientar um novo enquadramento, roupa ou pose. Preservar a identidade é um foco do modelo, sem garantia de correspondência exata em cada resultado.

Retrato de referência
Nova composição de corpo inteiro

Exemplo oficial: de retrato próximo a foto de corpo inteiro ao ar livre

Texto e imagens no mesmo layout

O modelo mantém o foco da série Qwen-Image em texto para cartazes, explicações visuais e infográficos. O exemplo oficial combina texto chinês, ilustrações arquitetônicas e várias áreas de layout.

Para conteúdo factual, forneça o texto exato e revise ortografia, números e legendas.

Exemplos oficiais de texto

Imagens: Galeria oficial do Qwen Image 2.1. Os exemplos ilustram capacidades; os resultados variam conforme as entradas.

Especificações e arquitetura

7B descreve o modelo visual, não todo o pipeline

Texto, referências e transparência são processados em um mesmo pipeline de geração.

Texto + referênciasConteúdo e instruções
Qwen3-VLCompreensão de texto e imagens
7B DiTRemoção de ruído causal por blocos
RGBA VAEDecodificação de cor e transparência
Especificações verificadas e padrões do Qwen Image 2.1
ComponenteInformação confirmadaSignificado
Modelo visualCerca de 7B · 32 camadasDiT de fluxo único com atenção causal por blocos; 7B não inclui todo o pipeline.
Codificador visual e textualQwen3-VLCodifica instruções e referências em conjunto.
Autoencoder de imagensVAE RGBA de 64 canaisCompressão espacial de 16× com transparência nativa.
ReferênciasAté 10A ordem corresponde a imagem 1, imagem 2 etc.
Resolução2K nativoTamanhos oficiais incluem 2048 × 2048; Diffusers usa lado-alvo de 1024 por padrão.
Passos / CFG40 passos / 1.0Padrões do Diffusers; prompts negativos exigem CFG maior que 1.
Cache KV de prefixoAtivado por padrãoReutiliza K/V de texto e referências entre os passos.
Licença dos pesosLicença de pesquisaUso comercial exige autorização separada.

Verificado em 20/09/2026. Suportar 2K nativo não significa que todas as ferramentas o usem por padrão. Especificações e configurações: Repositório oficial · Documentação do Diffusers

Primeiros passos

Escolha como executar o modelo

Comece pelos padrões e depois ajuste passos, resolução e gerenciamento de memória.

01

Demonstração integrada

Confira fidelidade às referências e transparência na demonstração acima. O Space da Qwen gerencia processamento e fila.

03

Python / Diffusers

Gere e edite no mesmo pipeline, para processamento em lote, experimentos e integração aos seus fluxos de imagem.

Exemplo mínimo com DiffusersGeração e edição com várias referênciasMostrar códigoOcultar código

Use PyTorch / CUDA compatíveis e a versão da branch principal do Diffusers com QwenImage21Pipeline. O exemplo transfere componentes para a CPU, mas ainda exige RAM e memória gráfica suficientes. Instalação oficial

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# Defina o tamanho explicitamente para evitar diferenças entre padrões
result = pipe(
    prompt="Uma capivara com capacete de astronauta, ilustração em aquarela",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# A ordem das referências deve coincidir com a lista de imagens
edited = pipe(
    prompt="Coloque as flores da imagem 1 no cenário da imagem 2. Preserve a iluminação da imagem 2.",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

Prompts negativos exigem true_cfg_scale > 1. Compile o modelo ao usar Flex Attention; comece pela implementação padrão de atenção.

Escreva instruções específicas

Estes modelos de prompt foram escritos pelo Image Toolkit e não são os prompts originais dos exemplos oficiais.

Adesivo transparente

Crie um adesivo de uma capivara de corpo inteiro, com capacete de astronauta e contorno definido. Gere uma imagem RGBA com canal alfa e fundo totalmente transparente, sem chão, cenário ou sombras de fundo.

Fundo de produto

Coloque o produto da imagem 1 na mesa da imagem 2 e acompanhe a direção da luz. Preserve forma, cor, logotipo e texto da embalagem. Altere apenas o ambiente.

Look com várias imagens

Vista a pessoa da imagem 1 com a jaqueta da imagem 2 e os sapatos da imagem 3, segurando a bolsa da imagem 4. Preserve traços faciais, cores e modelos das roupas e acessórios. Gere uma foto de corpo inteiro.

Dúvidas

Antes de começar

Entenda configurações, resultados e condições de uso.

Posso gerar imagens nesta página?

Sim, pelo Space da Qwen no Hugging Face integrado acima. Esse serviço processa entradas e geração, mantém seu idioma e determina sua disponibilidade. O Image Toolkit não executa a inferência do modelo.

7B significa que bastam 14 GB de memória gráfica?

Não. 7B corresponde somente ao modelo visual. O pipeline inclui Qwen3-VL, VAE RGBA e dados intermediários. A memória depende da precisão, resolução, referências e transferência para CPU, que também usa RAM e acrescenta espera.

Qual a diferença entre transparência e fundo branco?

Imagens transparentes têm canal alfa para composição. Fundos brancos ainda contêm pixels opacos. Peça RGBA com fundo transparente e salve como PNG. Os três exemplos preservam seus canais alfa originais.

A saída padrão é 1024 ou 2048?

O repositório oficial informa suporte a 2K nativo e tamanhos como 2048 × 2048. Na verificação, Diffusers usava output_resolution=1024. Defina width e height para separar capacidade do modelo e padrão da ferramenta.

Posso usá-lo em um produto pago?

A seção 2 da Qwen Research License Agreement limita a autorização a pesquisa ou avaliação não comercial. Contate model-business@notice.qwencloud.com para uma licença comercial e siga o acordo e a autorização obtidos.

10–15 passos e 7 GB de VRAM são recomendados?

Não. Testes iniciais da comunidade não substituem os 40 passos padrão do Diffusers. Configurações de pouca memória dependem de transferência de componentes e decodificação em blocos. Meça memória máxima, tempo e alterações de detalhes com suas imagens.

Comparar GPT Image 2.5 com Qwen Image 2.1