Qwen Image 2.1
Bilder erstellen und bearbeiten.
Auch mit transparenten Ebenen.
Text und Referenzbilder steuern ein gemeinsames Modell für Bildkomposition, gezielte Änderungen und transparente PNGs. Personenmerkmale und Produktdetails stehen dabei im Mittelpunkt.
Verfügbare Gewichte · Forschungslizenz · Separate kommerzielle Erlaubnis
- Visuelles Grundmodell
- 7BParameter
- Referenzbilder
- 10maximal
- Native Transparenz
- RGBAvier Kanäle
- Native Auflösung
- 2Koffiziell unterstützt
Demo
Qwen Image 2.1 hier ausprobieren
Erstellen Sie Bilder oder bearbeiten Sie Referenzen direkt in der eingebetteten Demo.
Die Demo stammt aus dem Hugging Face Space von Qwen. Dieser Dienst verarbeitet Eingaben und Bilder und bestimmt seine Oberflächensprache, Warteschlange und Verfügbarkeit.
Kernfunktionen
Von Referenzbildern zu bearbeitbaren Motiven
Offizielle Qwen-Beispiele. Wählen Sie ein Bild, um Details zu prüfen.
Transparente PNGs direkt erzeugen
Das Modell erzeugt Bilder mit Alphakanal, bearbeitet transparente Ebenen und extrahiert Motive aus Fotos. Sticker, Figuren und Gestaltungselemente lassen sich auf andere Hintergründe setzen.
Die Transparenz entsteht im Modell. Wechseln Sie den Vorschauhintergrund, um transparente Bereiche und Kanten zu prüfen. Ein weißer Hintergrund ist nicht transparent.
Offizielle Transparenzbeispiele
Mehrere Referenzen in einer Szene vereinen
Übergeben Sie bis zu 10 Bilder für Personen, Objekte und Umgebung. Beschreiben Sie die Rolle jedes Bildes anhand der Eingabereihenfolge.
Offizielles Beispiel: sechs Einzelporträts ergeben ein Gruppenfoto
Bereich markieren und Änderung beschreiben
Wählen Sie Bereiche mit Kreisen, Markierungen oder einer separaten Maske. Beschreiben Sie anschließend etwa eine neue Haarfarbe, Kleidung oder ein anderes Objekt.
Benennen Sie sowohl die gewünschten Änderungen als auch die unveränderten Inhalte. Das ist genauer als eine allgemeine Aufforderung zur Bildverbesserung.
Offizielles Beispiel: Uhr entfernen, Haare und Kleidung ändern
Umgebung ändern, Produktmerkmale erhalten
Nutzen Sie das Originalprodukt als Referenz und ändern Sie Umgebung, Komposition oder Licht. Prüfen Sie vor der Verwendung Logos, Verpackungstext und Form.
Offizielles Beispiel: Produkt aus der Hand auf einen Tisch am Fenster versetzen
Identität bei neuer Komposition erhalten
Ein Porträt dient als Referenz für einen neuen Ausschnitt, andere Kleidung oder eine Pose. Identitätserhalt ist ein Schwerpunkt, aber keine Garantie für jedes Ergebnis.
Offizielles Beispiel: Nahaufnahme wird zum Ganzkörperfoto im Freien
Text und Bilder in einem Layout
Das Modell führt den Schwerpunkt von Qwen-Image auf Textdarstellung für Poster, visuelle Erklärungen und Infografiken fort. Das offizielle Beispiel kombiniert chinesischen Text, Architekturzeichnungen und mehrere Layoutbereiche.
Geben Sie bei sachlichen Inhalten den genauen Wortlaut vor und prüfen Sie Schreibweise, Zahlen und Beschriftungen.
Offizielle TextbeispieleBildquelle: Offizielle Qwen Image 2.1-Beispiele. Die Beispiele zeigen Fähigkeiten; Ergebnisse hängen von der Eingabe ab.
Technische Daten und Architektur
7B bezeichnet das visuelle Grundmodell, nicht die gesamte Pipeline
Text, Referenzbilder und Transparenz werden in einer gemeinsamen Pipeline verarbeitet.
| Komponente | Bestätigte Angaben | Bedeutung |
|---|---|---|
| Visuelles Grundmodell | Etwa 7B · 32 Schichten | Single-Stream-DiT mit blockkausaler Aufmerksamkeit; 7B umfasst nicht die gesamte Pipeline. |
| Bild- und Textencoder | Qwen3-VL | Kodiert Anweisungen und Referenzbilder gemeinsam. |
| Bildautoencoder | 64-Kanal-RGBA-VAE | 16-fache räumliche Kompression mit nativer Transparenz. |
| Referenzbilder | Bis zu 10 | Die Eingabereihenfolge entspricht Bild 1, Bild 2 usw. |
| Auflösung | Natives 2K | Offizielle Größen umfassen 2048 × 2048; Diffusers verwendet standardmäßig eine Zielkante von 1024. |
| Schritte / CFG | 40 Schritte / 1.0 | Diffusers-Standardwerte; negative Prompts benötigen CFG größer als 1. |
| Präfix-KV-Cache | Standardmäßig aktiv | Verwendet K/V von Text und Referenzbildern über die Schritte hinweg erneut. |
| Gewichtelizenz | Forschungslizenz | Kommerzielle Nutzung erfordert eine separate Erlaubnis. |
Geprüft am 20.09.2026. Natives 2K bedeutet nicht, dass jedes Werkzeug standardmäßig 2K ausgibt. Spezifikationen und Standardwerte: Offizielles Repository · Diffusers-Dokumentation
Erste Schritte
Wählen Sie eine Ausführungsart
Beginnen Sie mit Standardwerten und passen Sie dann Schritte, Auflösung und Speicherverwaltung an.
Eingebettete Demo
Prüfen Sie Referenztreue und Transparenz in der Demo oben. Verarbeitung und Warteschlange übernimmt Qwens Hugging Face Space.
ComfyUI-Workflow
Aktualisieren Sie ComfyUI, laden Sie kompatible Modelldateien und öffnen Sie einen offiziellen Workflow zur Generierung oder Bearbeitung.
Python / Diffusers
Erstellen und bearbeiten Sie mit einer Pipeline. Geeignet für Stapelverarbeitung, Parameterexperimente und vorhandene Bildabläufe.
Minimales Diffusers-BeispielGenerierung und Bearbeitung mit ReferenzenCode ausblenden
Benötigt werden kompatibles PyTorch / CUDA und der Diffusers-Hauptzweig mit QwenImage21Pipeline. Das Beispiel lagert Komponenten auf die CPU aus, benötigt aber weiterhin ausreichend RAM und GPU-Speicher. Offizielle Installationsanleitung
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# Abmessungen explizit angeben, um unterschiedliche Standardwerte zu vermeiden
result = pipe(
prompt="Ein Capybara mit Astronautenhelm, Aquarellillustration",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# Die Referenzreihenfolge muss der Bildliste entsprechen
edited = pipe(
prompt="Setze die Blumen aus Bild 1 in die Szene von Bild 2. Behalte die Beleuchtung von Bild 2 bei.",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")Negative Prompts benötigen true_cfg_scale > 1. Kompilieren Sie das Modell bei Flex Attention; zum Einstieg genügt die Standardimplementierung.
Anweisungen konkret formulieren
Diese Vorlagen stammen von Image Toolkit, nicht aus den Originalprompts der offiziellen Bilder.
Transparenter Sticker
Erstelle einen Ganzkörper-Sticker eines Capybaras mit Astronautenhelm und klarer Kontur. Erzeuge ein RGBA-Bild mit Alphakanal und vollständig transparentem Hintergrund. Ohne Boden, Umgebung oder Hintergrundschatten.
Produkthintergrund
Platziere das Produkt aus Bild 1 auf dem Tisch in Bild 2 und übernimm dessen Lichtrichtung. Erhalte Form, Farbe, Logo und Verpackungstext des Produkts. Ändere nur die Umgebung.
Outfit aus mehreren Bildern
Die Person aus Bild 1 trägt die Jacke aus Bild 2 und die Schuhe aus Bild 3 und hält die Tasche aus Bild 4. Erhalte Gesichtszüge sowie Farben und Designs der Kleidung und Accessoires. Erstelle ein Ganzkörperfoto.
Fragen
Vor dem Start
Einstellungen, Ausgaben und Nutzungsbedingungen verstehen.
Kann ich auf dieser Seite Bilder erzeugen?
Ja, über den eingebetteten Qwen Hugging Face Space. Dieser Dienst verarbeitet Eingaben und Generierung, behält seine Oberflächensprache bei und bestimmt seine Verfügbarkeit. Image Toolkit führt die Modellinferenz nicht aus.
Bedeutet 7B, dass 14 GB GPU-Speicher ausreichen?
Nein. 7B beschreibt nur das visuelle Grundmodell. Qwen3-VL, RGBA-VAE und Zwischendaten kommen hinzu. Der Bedarf hängt von Präzision, Auflösung, Referenzen und Auslagerung ab. CPU-Auslagerung benötigt zusätzlichen RAM und Zeit.
Wie unterscheidet sich Transparenz von einem weißen Hintergrund?
Transparente Bilder haben einen Alphakanal zum Überlagern. Ein weißer Hintergrund enthält weiterhin undurchsichtige Pixel. Verlangen Sie RGBA und Transparenz und speichern Sie als PNG. Die drei Beispiele behalten ihre originalen Alphakanäle.
Ist die Standardausgabe 1024 oder 2048?
Das offizielle Repository nennt natives 2K und Größen wie 2048 × 2048. Bei der Prüfung verwendete Diffusers standardmäßig output_resolution=1024. Setzen Sie width und height explizit, um Modellfähigkeiten und Werkzeugvorgaben zu unterscheiden.
Darf ich das Modell in einem kostenpflichtigen Produkt verwenden?
Abschnitt 2 des Qwen Research License Agreement begrenzt die Erlaubnis auf nichtkommerzielle Forschung oder Evaluation. Fragen Sie unter model-business@notice.qwencloud.com nach einer kommerziellen Lizenz und beachten Sie die erhaltene Vereinbarung.
Sind 10–15 Schritte und 7 GB VRAM empfohlen?
Nein. Frühe Community-Tests ersetzen nicht die 40 Standardschritte von Diffusers. Speichersparende Konfigurationen hängen von Auslagerung und gekachelter Dekodierung ab. Messen Sie mit eigenen Bildern Speicherbedarf, Dauer und Detailabweichungen.