Aller au contenu
Image Toolkit
Poids disponibles

Qwen Image 2.1

Générez et retouchez des images.
Créez aussi des calques transparents.

Associez texte et images de référence dans un même modèle pour composer des scènes, modifier des zones et produire des PNG transparents, en conservant les personnes et les détails des produits.

Poids disponibles · Licence de recherche · Autorisation commerciale distincte

Plusieurs références · Exemple officiel
Combiner une personne, des vêtements et des accessoires dans une photo
Modèle visuel
7Bparamètres
Images de référence
10au maximum
Transparence native
RGBAquatre canaux
Résolution native
2Kprise en charge officielle

Démo

Essayez Qwen Image 2.1 ici

Générez des images ou retouchez vos références avec la démo intégrée, sans quitter cette page.

La démo est fournie par le Space Hugging Face de Qwen. Ce service traite vos entrées et les générations, et détermine la langue de son interface, la file d’attente et la disponibilité.

Fonctions principales

Des références aux éléments visuels réutilisables

Exemples officiels de Qwen. Cliquez sur une image pour examiner les détails.

Générer directement des PNG transparents

Le modèle produit des images avec canal alpha, retouche des calques transparents et extrait des sujets de photos. Autocollants, personnages et éléments graphiques peuvent être superposés à d’autres fonds.

La transparence est générée par le modèle. Changez le fond de l’aperçu pour vérifier les zones transparentes et les contours ; un fond blanc n’est pas transparent.

AutocollantsProduits détourésPersonnages
Exemples officiels de transparence
Aperçu de la transparence
Portrait fleuri
01

Composer une scène avec plusieurs références

Fournissez jusqu’à 10 images de personnes, d’objets et de décors. Décrivez le rôle de chacune en suivant leur ordre d’entrée.

Exemple officiel : six portraits réunis dans une photo de groupe

02

Sélectionner une zone et décrire la retouche

Utilisez des cercles, des tracés ou un masque séparé, puis précisez la modification : couleur des cheveux, vêtements ou objets particuliers.

Zones marquées avant retouche
Résultat après modification

Précisez ce qui doit changer et ce qui doit rester. La consigne sera plus claire qu’une demande générale d’amélioration.

Exemple officiel : retrait de la montre et modification des cheveux et vêtements

03

Changer le décor en conservant le produit

Prenez le produit original comme référence pour modifier son environnement, la composition et la lumière. Vérifiez les logos, les textes et la structure avant utilisation.

Produit de référence
Nouvelle mise en scène

Exemple officiel : produit tenu en main, puis posé près d’une fenêtre

04

Conserver l’identité dans une autre composition

Utilisez un portrait pour guider un nouveau cadrage, une tenue ou une pose. La conservation de l’identité est un objectif, sans garantie de correspondance exacte à chaque résultat.

Portrait de référence
Nouvelle composition en pied

Exemple officiel : d’un portrait rapproché à une photo en pied à l’extérieur

Texte et images dans une même mise en page

Le modèle poursuit le travail de Qwen-Image sur le rendu de texte pour affiches, explications visuelles et infographies. Cet exemple officiel associe texte chinois, illustrations architecturales et plusieurs zones de mise en page.

Pour transmettre des faits précis, fournissez le texte exact et vérifiez l’orthographe, les nombres et les légendes.

Exemples officiels de rendu de texte

Images : Galerie officielle Qwen Image 2.1. Les exemples illustrent des capacités ; les résultats varient selon les entrées.

Caractéristiques et architecture

7B désigne le modèle visuel, pas toute la chaîne

Texte, références et transparence sont traités dans une même chaîne de génération.

Texte + référencesContenu et consignes
Qwen3-VLCompréhension du texte et des images
7B DiTDébruitage causal par blocs
RGBA VAEDécodage couleur et transparence
Caractéristiques vérifiées et valeurs par défaut de Qwen Image 2.1
ComposantInformation confirméeSignification
Modèle visuelEnviron 7B · 32 couchesDiT à flux unique et attention causale par blocs ; 7B exclut le reste de la chaîne.
Encodeur visuel et textuelQwen3-VLEncode conjointement les consignes et les références.
Autoencodeur d’imagesVAE RGBA à 64 canauxCompression spatiale 16× et transparence native.
RéférencesJusqu’à 10L’ordre correspond à image 1, image 2, etc.
Résolution2K natifTailles officielles incluant 2048 × 2048 ; côté cible de 1024 par défaut dans Diffusers.
Étapes / CFG40 étapes / 1.0Valeurs Diffusers ; les prompts négatifs demandent un CFG supérieur à 1.
Cache KV de préfixeActivé par défautRéutilise les K/V du texte et des références entre les étapes.
Licence des poidsLicence de rechercheUne autorisation distincte est nécessaire pour le commerce.

Vérifié le 20/09/2026. Le 2K natif ne signifie pas que chaque outil l’utilise par défaut. Caractéristiques et paramètres : Dépôt officiel · Documentation Diffusers

Prise en main

Choisissez votre mode d’utilisation

Commencez avec les paramètres par défaut, puis ajustez étapes, résolution et gestion mémoire.

01

Démo intégrée

Vérifiez les références et la transparence dans la démo ci-dessus. Le Space Qwen gère le traitement et l’attente.

03

Python / Diffusers

Générez et retouchez avec une seule chaîne, pour les traitements par lots, les essais de paramètres ou vos outils existants.

Exemple minimal avec DiffusersGénération et retouche multiréférenceAfficher le codeMasquer le code

Utilisez un environnement PyTorch / CUDA compatible et la branche principale de Diffusers avec QwenImage21Pipeline. Cet exemple décharge des composants vers le CPU, mais exige encore assez de RAM et de mémoire GPU. Instructions d’installation officielles

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# Préciser les dimensions pour éviter les différences entre valeurs par défaut
result = pipe(
    prompt="Un capybara avec un casque d’astronaute, illustration à l’aquarelle",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# Respecter le même ordre que dans la liste des images
edited = pipe(
    prompt="Place les fleurs de l’image 1 dans la scène de l’image 2. Conserve l’éclairage de l’image 2.",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

Les prompts négatifs demandent true_cfg_scale > 1. Compilez le modèle avec Flex Attention ; l’attention par défaut convient pour commencer.

Formuler des consignes précises

Ces modèles de prompts sont rédigés par Image Toolkit, pas ceux d’origine des images officielles.

Autocollant transparent

Crée un autocollant de capybara en entier, avec casque d’astronaute et contour net. Produis une image RGBA avec canal alpha et fond totalement transparent, sans sol, décor ni ombre de fond.

Fond de produit

Place le produit de l’image 1 sur la table de l’image 2, en respectant sa direction de lumière. Conserve la forme, la couleur, le logo et le texte de l’emballage. Change uniquement le décor.

Tenue à partir de plusieurs images

Habille la personne de l’image 1 avec la veste de l’image 2 et les chaussures de l’image 3, tenant le sac de l’image 4. Conserve le visage et les couleurs et modèles des vêtements et accessoires. Produis une photo en pied.

Questions

Avant de commencer

Comprenez les paramètres, les résultats et les conditions d’utilisation.

Puis-je générer des images sur cette page ?

Oui, grâce au Space Qwen Hugging Face intégré ci-dessus. Ce service traite les entrées et la génération, conserve sa propre langue et détermine sa disponibilité. Image Toolkit n’exécute pas l’inférence du modèle.

7B signifie-t-il que 14 Go de mémoire GPU suffisent ?

Non. 7B décrit seulement le modèle visuel. La chaîne inclut Qwen3-VL, le VAE RGBA et les données intermédiaires. La consommation dépend de la précision, des dimensions, des références et du déchargement CPU, qui ajoute des besoins en RAM et du temps.

Quelle différence entre transparence et fond blanc ?

Une image transparente contient un canal alpha pour la composition. Un fond blanc reste opaque. Demandez du RGBA et un fond transparent, puis enregistrez en PNG. Les trois exemples conservent leur canal alpha original.

La sortie par défaut est-elle 1024 ou 2048 ?

Le dépôt officiel indique un 2K natif et des tailles comme 2048 × 2048. Lors de la vérification, Diffusers utilisait output_resolution=1024. Précisez width et height pour distinguer les capacités du modèle des valeurs de l’outil.

Puis-je l’intégrer à un produit payant ?

L’article 2 de Qwen Research License Agreement limite la licence à la recherche ou à l’évaluation non commerciale. Contactez model-business@notice.qwencloud.com pour une licence commerciale et respectez l’accord et l’autorisation obtenue.

10–15 étapes et 7 Go de VRAM sont-ils recommandés ?

Non. Les premiers essais communautaires ne remplacent pas les 40 étapes par défaut de Diffusers. La faible mémoire dépend du déchargement et du décodage par tuiles. Testez vos images en mesurant mémoire maximale, durée et altérations des détails.

Comparer GPT Image 2.5 et Qwen Image 2.1