Zum Inhalt springen
Image Toolkit
Modellgewichte verfügbar

Qwen Image 2.1

Bilder erstellen und bearbeiten.
Auch mit transparenten Ebenen.

Text und Referenzbilder steuern ein gemeinsames Modell für Bildkomposition, gezielte Änderungen und transparente PNGs. Personenmerkmale und Produktdetails stehen dabei im Mittelpunkt.

Verfügbare Gewichte · Forschungslizenz · Separate kommerzielle Erlaubnis

Mehrere Referenzen · Offizielles Beispiel
Person, Kleidung und Accessoires zu einem Outfit-Foto kombinieren
Visuelles Grundmodell
7BParameter
Referenzbilder
10maximal
Native Transparenz
RGBAvier Kanäle
Native Auflösung
2Koffiziell unterstützt

Demo

Qwen Image 2.1 hier ausprobieren

Erstellen Sie Bilder oder bearbeiten Sie Referenzen direkt in der eingebetteten Demo.

Die Demo stammt aus dem Hugging Face Space von Qwen. Dieser Dienst verarbeitet Eingaben und Bilder und bestimmt seine Oberflächensprache, Warteschlange und Verfügbarkeit.

Kernfunktionen

Von Referenzbildern zu bearbeitbaren Motiven

Offizielle Qwen-Beispiele. Wählen Sie ein Bild, um Details zu prüfen.

Transparente PNGs direkt erzeugen

Das Modell erzeugt Bilder mit Alphakanal, bearbeitet transparente Ebenen und extrahiert Motive aus Fotos. Sticker, Figuren und Gestaltungselemente lassen sich auf andere Hintergründe setzen.

Die Transparenz entsteht im Modell. Wechseln Sie den Vorschauhintergrund, um transparente Bereiche und Kanten zu prüfen. Ein weißer Hintergrund ist nicht transparent.

StickerFreigestellte ProdukteFiguren
Offizielle Transparenzbeispiele
Transparenzvorschau
Blumenporträt
01

Mehrere Referenzen in einer Szene vereinen

Übergeben Sie bis zu 10 Bilder für Personen, Objekte und Umgebung. Beschreiben Sie die Rolle jedes Bildes anhand der Eingabereihenfolge.

Offizielles Beispiel: sechs Einzelporträts ergeben ein Gruppenfoto

02

Bereich markieren und Änderung beschreiben

Wählen Sie Bereiche mit Kreisen, Markierungen oder einer separaten Maske. Beschreiben Sie anschließend etwa eine neue Haarfarbe, Kleidung oder ein anderes Objekt.

Markierte Bereiche vor der Bearbeitung
Ergebnis der gewünschten Änderungen

Benennen Sie sowohl die gewünschten Änderungen als auch die unveränderten Inhalte. Das ist genauer als eine allgemeine Aufforderung zur Bildverbesserung.

Offizielles Beispiel: Uhr entfernen, Haare und Kleidung ändern

03

Umgebung ändern, Produktmerkmale erhalten

Nutzen Sie das Originalprodukt als Referenz und ändern Sie Umgebung, Komposition oder Licht. Prüfen Sie vor der Verwendung Logos, Verpackungstext und Form.

Originales Referenzprodukt
Neue Produktumgebung

Offizielles Beispiel: Produkt aus der Hand auf einen Tisch am Fenster versetzen

04

Identität bei neuer Komposition erhalten

Ein Porträt dient als Referenz für einen neuen Ausschnitt, andere Kleidung oder eine Pose. Identitätserhalt ist ein Schwerpunkt, aber keine Garantie für jedes Ergebnis.

Porträtreferenz
Neue Ganzkörperkomposition

Offizielles Beispiel: Nahaufnahme wird zum Ganzkörperfoto im Freien

Text und Bilder in einem Layout

Das Modell führt den Schwerpunkt von Qwen-Image auf Textdarstellung für Poster, visuelle Erklärungen und Infografiken fort. Das offizielle Beispiel kombiniert chinesischen Text, Architekturzeichnungen und mehrere Layoutbereiche.

Geben Sie bei sachlichen Inhalten den genauen Wortlaut vor und prüfen Sie Schreibweise, Zahlen und Beschriftungen.

Offizielle Textbeispiele

Bildquelle: Offizielle Qwen Image 2.1-Beispiele. Die Beispiele zeigen Fähigkeiten; Ergebnisse hängen von der Eingabe ab.

Technische Daten und Architektur

7B bezeichnet das visuelle Grundmodell, nicht die gesamte Pipeline

Text, Referenzbilder und Transparenz werden in einer gemeinsamen Pipeline verarbeitet.

Text + ReferenzenInhalt und Bearbeitungswünsche
Qwen3-VLText und Bilder gemeinsam verstehen
7B DiTBlockkausales Entrauschen
RGBA VAEFarbe und Transparenz dekodieren
Geprüfte Qwen Image 2.1-Spezifikationen und Standardwerte
KomponenteBestätigte AngabenBedeutung
Visuelles GrundmodellEtwa 7B · 32 SchichtenSingle-Stream-DiT mit blockkausaler Aufmerksamkeit; 7B umfasst nicht die gesamte Pipeline.
Bild- und TextencoderQwen3-VLKodiert Anweisungen und Referenzbilder gemeinsam.
Bildautoencoder64-Kanal-RGBA-VAE16-fache räumliche Kompression mit nativer Transparenz.
ReferenzbilderBis zu 10Die Eingabereihenfolge entspricht Bild 1, Bild 2 usw.
AuflösungNatives 2KOffizielle Größen umfassen 2048 × 2048; Diffusers verwendet standardmäßig eine Zielkante von 1024.
Schritte / CFG40 Schritte / 1.0Diffusers-Standardwerte; negative Prompts benötigen CFG größer als 1.
Präfix-KV-CacheStandardmäßig aktivVerwendet K/V von Text und Referenzbildern über die Schritte hinweg erneut.
GewichtelizenzForschungslizenzKommerzielle Nutzung erfordert eine separate Erlaubnis.

Geprüft am 20.09.2026. Natives 2K bedeutet nicht, dass jedes Werkzeug standardmäßig 2K ausgibt. Spezifikationen und Standardwerte: Offizielles Repository · Diffusers-Dokumentation

Erste Schritte

Wählen Sie eine Ausführungsart

Beginnen Sie mit Standardwerten und passen Sie dann Schritte, Auflösung und Speicherverwaltung an.

01

Eingebettete Demo

Prüfen Sie Referenztreue und Transparenz in der Demo oben. Verarbeitung und Warteschlange übernimmt Qwens Hugging Face Space.

02

ComfyUI-Workflow

Aktualisieren Sie ComfyUI, laden Sie kompatible Modelldateien und öffnen Sie einen offiziellen Workflow zur Generierung oder Bearbeitung.

03

Python / Diffusers

Erstellen und bearbeiten Sie mit einer Pipeline. Geeignet für Stapelverarbeitung, Parameterexperimente und vorhandene Bildabläufe.

Minimales Diffusers-BeispielGenerierung und Bearbeitung mit ReferenzenCode anzeigenCode ausblenden

Benötigt werden kompatibles PyTorch / CUDA und der Diffusers-Hauptzweig mit QwenImage21Pipeline. Das Beispiel lagert Komponenten auf die CPU aus, benötigt aber weiterhin ausreichend RAM und GPU-Speicher. Offizielle Installationsanleitung

Python
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

# Abmessungen explizit angeben, um unterschiedliche Standardwerte zu vermeiden
result = pipe(
    prompt="Ein Capybara mit Astronautenhelm, Aquarellillustration",
    width=1024, height=1024,
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
result.save("result.png")

# Die Referenzreihenfolge muss der Bildliste entsprechen
edited = pipe(
    prompt="Setze die Blumen aus Bild 1 in die Szene von Bild 2. Behalte die Beleuchtung von Bild 2 bei.",
    image=[Image.open("flowers.png"), Image.open("scene.png")],
    num_inference_steps=40,
    true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")

Negative Prompts benötigen true_cfg_scale > 1. Kompilieren Sie das Modell bei Flex Attention; zum Einstieg genügt die Standardimplementierung.

Anweisungen konkret formulieren

Diese Vorlagen stammen von Image Toolkit, nicht aus den Originalprompts der offiziellen Bilder.

Transparenter Sticker

Erstelle einen Ganzkörper-Sticker eines Capybaras mit Astronautenhelm und klarer Kontur. Erzeuge ein RGBA-Bild mit Alphakanal und vollständig transparentem Hintergrund. Ohne Boden, Umgebung oder Hintergrundschatten.

Produkthintergrund

Platziere das Produkt aus Bild 1 auf dem Tisch in Bild 2 und übernimm dessen Lichtrichtung. Erhalte Form, Farbe, Logo und Verpackungstext des Produkts. Ändere nur die Umgebung.

Outfit aus mehreren Bildern

Die Person aus Bild 1 trägt die Jacke aus Bild 2 und die Schuhe aus Bild 3 und hält die Tasche aus Bild 4. Erhalte Gesichtszüge sowie Farben und Designs der Kleidung und Accessoires. Erstelle ein Ganzkörperfoto.

Fragen

Vor dem Start

Einstellungen, Ausgaben und Nutzungsbedingungen verstehen.

Kann ich auf dieser Seite Bilder erzeugen?

Ja, über den eingebetteten Qwen Hugging Face Space. Dieser Dienst verarbeitet Eingaben und Generierung, behält seine Oberflächensprache bei und bestimmt seine Verfügbarkeit. Image Toolkit führt die Modellinferenz nicht aus.

Bedeutet 7B, dass 14 GB GPU-Speicher ausreichen?

Nein. 7B beschreibt nur das visuelle Grundmodell. Qwen3-VL, RGBA-VAE und Zwischendaten kommen hinzu. Der Bedarf hängt von Präzision, Auflösung, Referenzen und Auslagerung ab. CPU-Auslagerung benötigt zusätzlichen RAM und Zeit.

Wie unterscheidet sich Transparenz von einem weißen Hintergrund?

Transparente Bilder haben einen Alphakanal zum Überlagern. Ein weißer Hintergrund enthält weiterhin undurchsichtige Pixel. Verlangen Sie RGBA und Transparenz und speichern Sie als PNG. Die drei Beispiele behalten ihre originalen Alphakanäle.

Ist die Standardausgabe 1024 oder 2048?

Das offizielle Repository nennt natives 2K und Größen wie 2048 × 2048. Bei der Prüfung verwendete Diffusers standardmäßig output_resolution=1024. Setzen Sie width und height explizit, um Modellfähigkeiten und Werkzeugvorgaben zu unterscheiden.

Darf ich das Modell in einem kostenpflichtigen Produkt verwenden?

Abschnitt 2 des Qwen Research License Agreement begrenzt die Erlaubnis auf nichtkommerzielle Forschung oder Evaluation. Fragen Sie unter model-business@notice.qwencloud.com nach einer kommerziellen Lizenz und beachten Sie die erhaltene Vereinbarung.

Sind 10–15 Schritte und 7 GB VRAM empfohlen?

Nein. Frühe Community-Tests ersetzen nicht die 40 Standardschritte von Diffusers. Speichersparende Konfigurationen hängen von Auslagerung und gekachelter Dekodierung ab. Messen Sie mit eigenen Bildern Speicherbedarf, Dauer und Detailabweichungen.

GPT Image 2.5 mit Qwen Image 2.1 vergleichen