Qwen Image 2.1
Générez et retouchez des images.
Créez aussi des calques transparents.
Associez texte et images de référence dans un même modèle pour composer des scènes, modifier des zones et produire des PNG transparents, en conservant les personnes et les détails des produits.
Poids disponibles · Licence de recherche · Autorisation commerciale distincte
- Modèle visuel
- 7Bparamètres
- Images de référence
- 10au maximum
- Transparence native
- RGBAquatre canaux
- Résolution native
- 2Kprise en charge officielle
Démo
Essayez Qwen Image 2.1 ici
Générez des images ou retouchez vos références avec la démo intégrée, sans quitter cette page.
La démo est fournie par le Space Hugging Face de Qwen. Ce service traite vos entrées et les générations, et détermine la langue de son interface, la file d’attente et la disponibilité.
Fonctions principales
Des références aux éléments visuels réutilisables
Exemples officiels de Qwen. Cliquez sur une image pour examiner les détails.
Générer directement des PNG transparents
Le modèle produit des images avec canal alpha, retouche des calques transparents et extrait des sujets de photos. Autocollants, personnages et éléments graphiques peuvent être superposés à d’autres fonds.
La transparence est générée par le modèle. Changez le fond de l’aperçu pour vérifier les zones transparentes et les contours ; un fond blanc n’est pas transparent.
Exemples officiels de transparence
Composer une scène avec plusieurs références
Fournissez jusqu’à 10 images de personnes, d’objets et de décors. Décrivez le rôle de chacune en suivant leur ordre d’entrée.
Exemple officiel : six portraits réunis dans une photo de groupe
Sélectionner une zone et décrire la retouche
Utilisez des cercles, des tracés ou un masque séparé, puis précisez la modification : couleur des cheveux, vêtements ou objets particuliers.
Précisez ce qui doit changer et ce qui doit rester. La consigne sera plus claire qu’une demande générale d’amélioration.
Exemple officiel : retrait de la montre et modification des cheveux et vêtements
Changer le décor en conservant le produit
Prenez le produit original comme référence pour modifier son environnement, la composition et la lumière. Vérifiez les logos, les textes et la structure avant utilisation.
Exemple officiel : produit tenu en main, puis posé près d’une fenêtre
Conserver l’identité dans une autre composition
Utilisez un portrait pour guider un nouveau cadrage, une tenue ou une pose. La conservation de l’identité est un objectif, sans garantie de correspondance exacte à chaque résultat.
Exemple officiel : d’un portrait rapproché à une photo en pied à l’extérieur
Texte et images dans une même mise en page
Le modèle poursuit le travail de Qwen-Image sur le rendu de texte pour affiches, explications visuelles et infographies. Cet exemple officiel associe texte chinois, illustrations architecturales et plusieurs zones de mise en page.
Pour transmettre des faits précis, fournissez le texte exact et vérifiez l’orthographe, les nombres et les légendes.
Exemples officiels de rendu de texteImages : Galerie officielle Qwen Image 2.1. Les exemples illustrent des capacités ; les résultats varient selon les entrées.
Caractéristiques et architecture
7B désigne le modèle visuel, pas toute la chaîne
Texte, références et transparence sont traités dans une même chaîne de génération.
| Composant | Information confirmée | Signification |
|---|---|---|
| Modèle visuel | Environ 7B · 32 couches | DiT à flux unique et attention causale par blocs ; 7B exclut le reste de la chaîne. |
| Encodeur visuel et textuel | Qwen3-VL | Encode conjointement les consignes et les références. |
| Autoencodeur d’images | VAE RGBA à 64 canaux | Compression spatiale 16× et transparence native. |
| Références | Jusqu’à 10 | L’ordre correspond à image 1, image 2, etc. |
| Résolution | 2K natif | Tailles officielles incluant 2048 × 2048 ; côté cible de 1024 par défaut dans Diffusers. |
| Étapes / CFG | 40 étapes / 1.0 | Valeurs Diffusers ; les prompts négatifs demandent un CFG supérieur à 1. |
| Cache KV de préfixe | Activé par défaut | Réutilise les K/V du texte et des références entre les étapes. |
| Licence des poids | Licence de recherche | Une autorisation distincte est nécessaire pour le commerce. |
Vérifié le 20/09/2026. Le 2K natif ne signifie pas que chaque outil l’utilise par défaut. Caractéristiques et paramètres : Dépôt officiel · Documentation Diffusers
Prise en main
Choisissez votre mode d’utilisation
Commencez avec les paramètres par défaut, puis ajustez étapes, résolution et gestion mémoire.
Démo intégrée
Vérifiez les références et la transparence dans la démo ci-dessus. Le Space Qwen gère le traitement et l’attente.
Workflow ComfyUI
Mettez ComfyUI à jour, téléchargez les fichiers compatibles et chargez un workflow officiel de génération ou de retouche.
Python / Diffusers
Générez et retouchez avec une seule chaîne, pour les traitements par lots, les essais de paramètres ou vos outils existants.
Exemple minimal avec DiffusersGénération et retouche multiréférenceMasquer le code
Utilisez un environnement PyTorch / CUDA compatible et la branche principale de Diffusers avec QwenImage21Pipeline. Cet exemple décharge des composants vers le CPU, mais exige encore assez de RAM et de mémoire GPU. Instructions d’installation officielles
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# Préciser les dimensions pour éviter les différences entre valeurs par défaut
result = pipe(
prompt="Un capybara avec un casque d’astronaute, illustration à l’aquarelle",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# Respecter le même ordre que dans la liste des images
edited = pipe(
prompt="Place les fleurs de l’image 1 dans la scène de l’image 2. Conserve l’éclairage de l’image 2.",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")Les prompts négatifs demandent true_cfg_scale > 1. Compilez le modèle avec Flex Attention ; l’attention par défaut convient pour commencer.
Formuler des consignes précises
Ces modèles de prompts sont rédigés par Image Toolkit, pas ceux d’origine des images officielles.
Autocollant transparent
Crée un autocollant de capybara en entier, avec casque d’astronaute et contour net. Produis une image RGBA avec canal alpha et fond totalement transparent, sans sol, décor ni ombre de fond.
Fond de produit
Place le produit de l’image 1 sur la table de l’image 2, en respectant sa direction de lumière. Conserve la forme, la couleur, le logo et le texte de l’emballage. Change uniquement le décor.
Tenue à partir de plusieurs images
Habille la personne de l’image 1 avec la veste de l’image 2 et les chaussures de l’image 3, tenant le sac de l’image 4. Conserve le visage et les couleurs et modèles des vêtements et accessoires. Produis une photo en pied.
Questions
Avant de commencer
Comprenez les paramètres, les résultats et les conditions d’utilisation.
Puis-je générer des images sur cette page ?
Oui, grâce au Space Qwen Hugging Face intégré ci-dessus. Ce service traite les entrées et la génération, conserve sa propre langue et détermine sa disponibilité. Image Toolkit n’exécute pas l’inférence du modèle.
7B signifie-t-il que 14 Go de mémoire GPU suffisent ?
Non. 7B décrit seulement le modèle visuel. La chaîne inclut Qwen3-VL, le VAE RGBA et les données intermédiaires. La consommation dépend de la précision, des dimensions, des références et du déchargement CPU, qui ajoute des besoins en RAM et du temps.
Quelle différence entre transparence et fond blanc ?
Une image transparente contient un canal alpha pour la composition. Un fond blanc reste opaque. Demandez du RGBA et un fond transparent, puis enregistrez en PNG. Les trois exemples conservent leur canal alpha original.
La sortie par défaut est-elle 1024 ou 2048 ?
Le dépôt officiel indique un 2K natif et des tailles comme 2048 × 2048. Lors de la vérification, Diffusers utilisait output_resolution=1024. Précisez width et height pour distinguer les capacités du modèle des valeurs de l’outil.
Puis-je l’intégrer à un produit payant ?
L’article 2 de Qwen Research License Agreement limite la licence à la recherche ou à l’évaluation non commerciale. Contactez model-business@notice.qwencloud.com pour une licence commerciale et respectez l’accord et l’autorisation obtenue.
10–15 étapes et 7 Go de VRAM sont-ils recommandés ?
Non. Les premiers essais communautaires ne remplacent pas les 40 étapes par défaut de Diffusers. La faible mémoire dépend du déchargement et du décodage par tuiles. Testez vos images en mesurant mémoire maximale, durée et altérations des détails.