Qwen Image 2.1
Genera y edita imágenes.
También crea capas transparentes.
Combina texto e imágenes de referencia en un mismo modelo para componer escenas, modificar zonas y generar PNG transparentes, con especial atención a las personas y los detalles del producto.
Pesos disponibles · Licencia de investigación · Permiso comercial adicional
- Modelo visual
- 7Bparámetros
- Imágenes de referencia
- 10como máximo
- Transparencia nativa
- RGBAcuatro canales
- Resolución nativa
- 2Ksoporte oficial
Demo
Prueba Qwen Image 2.1 aquí
Genera imágenes o edita tus referencias en la demo integrada sin salir de esta página.
La demo pertenece al Space de Qwen en Hugging Face. Ese servicio procesa las entradas y la generación, y determina el idioma de su interfaz, las colas y la disponibilidad.
Funciones principales
De imágenes de referencia a recursos editables
Ejemplos oficiales de Qwen. Selecciona una imagen para ver sus detalles.
Genera PNG transparentes directamente
El modelo genera imágenes con canal alfa, edita capas transparentes y extrae sujetos de fotografías. Puedes superponer pegatinas, personajes y elementos gráficos sobre otros fondos.
El modelo genera la transparencia. Cambia el fondo de la vista previa para examinar las zonas transparentes y los bordes; un fondo blanco no es transparente.
Ejemplos oficiales de transparencia
Combina varias referencias en una escena
Utiliza hasta 10 imágenes para aportar personas, objetos y escenarios. Describe el papel de cada imagen siguiendo el orden de entrada.
Ejemplo oficial: seis retratos individuales en una foto de grupo
Selecciona una zona y describe el cambio
Marca zonas con círculos, trazos o una máscara independiente y describe la edición. Útil para cambiar el pelo, la ropa u objetos concretos.
Indica qué debe cambiar y qué debe conservarse. Es más preciso que pedir una mejora general de la imagen.
Ejemplo oficial: quitar el reloj y cambiar el pelo y la ropa
Cambia el entorno, conserva el producto
Usa el producto original como referencia y ajusta el escenario, la composición y la luz. Revisa logotipos, texto del envase y estructura antes de utilizar el resultado.
Ejemplo oficial: producto en la mano trasladado a una mesa junto a la ventana
Conserva la identidad al cambiar la composición
Usa un retrato para orientar un nuevo encuadre, vestuario o postura. Conservar la identidad es una prioridad, pero no garantiza coincidencia exacta en cada resultado.
Ejemplo oficial: de un primer plano a una foto de cuerpo entero en exteriores
Texto e imágenes en una misma composición
Continúa el trabajo de Qwen-Image en la generación de texto para carteles, explicaciones visuales e infografías. El ejemplo oficial combina texto chino, ilustraciones arquitectónicas y varias áreas de diseño.
Para transmitir información precisa, proporciona el texto completo y revisa ortografía, números y etiquetas.
Ejemplos oficiales de textoImágenes: Galería oficial de Qwen Image 2.1. Los ejemplos ilustran capacidades; los resultados dependen de las entradas.
Especificaciones y arquitectura
7B corresponde al modelo visual, no a toda la cadena
Texto, referencias y transparencia se procesan en una misma cadena de generación.
| Componente | Información confirmada | Qué significa |
|---|---|---|
| Modelo visual | Unos 7B · 32 capas | DiT de flujo único con atención causal por bloques; 7B no incluye toda la cadena. |
| Codificador visual y textual | Qwen3-VL | Codifica conjuntamente instrucciones y referencias. |
| Autocodificador de imágenes | VAE RGBA de 64 canales | Compresión espacial 16× y transparencia nativa. |
| Referencias | Hasta 10 | El orden corresponde a imagen 1, imagen 2, etc. |
| Resolución | 2K nativo | Incluye 2048 × 2048; Diffusers usa un lado objetivo de 1024 por defecto. |
| Pasos / CFG | 40 pasos / 1.0 | Valores de Diffusers; los prompts negativos requieren CFG mayor que 1. |
| Caché KV de prefijo | Activada por defecto | Reutiliza K/V del texto y las referencias entre pasos. |
| Licencia de los pesos | Licencia de investigación | El uso comercial requiere autorización adicional. |
Verificado el 20-09-2026. Soportar 2K nativo no significa que todas las herramientas lo usen por defecto. Especificaciones y valores: Repositorio oficial · Documentación de Diffusers
Primeros pasos
Elige cómo ejecutar el modelo
Empieza con los valores predeterminados y ajusta después pasos, resolución y memoria.
Demo integrada
Comprueba la fidelidad de las referencias y la transparencia en la demo superior. El Space de Qwen gestiona el procesamiento y la cola.
Flujo de ComfyUI
Actualiza ComfyUI, descarga los archivos compatibles y carga un flujo oficial de generación o edición.
Python / Diffusers
Genera y edita con una misma cadena. Adecuado para lotes, experimentos e integración con procesos de imagen.
Ejemplo mínimo de DiffusersGeneración y edición con varias referenciasOcultar código
Necesitas PyTorch / CUDA compatibles y la rama principal de Diffusers con QwenImage21Pipeline. El ejemplo descarga componentes a la CPU, pero sigue necesitando RAM y memoria gráfica suficientes. Instalación oficial
import torch
from PIL import Image
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
# Especifica el tamaño para evitar diferencias entre valores predeterminados
result = pipe(
prompt="Una capibara con casco de astronauta, ilustración en acuarela",
width=1024, height=1024,
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
result.save("result.png")
# El orden de referencias debe coincidir con la lista de imágenes
edited = pipe(
prompt="Pon las flores de la imagen 1 en la escena de la imagen 2. Conserva la iluminación de la imagen 2.",
image=[Image.open("flowers.png"), Image.open("scene.png")],
num_inference_steps=40,
true_cfg_scale=1.0,
).images[0]
edited.save("edited.png")Los prompts negativos requieren true_cfg_scale > 1. Compila el modelo al usar Flex Attention; puedes empezar con la atención predeterminada.
Escribe instrucciones concretas
Plantillas escritas por Image Toolkit; no son los prompts originales de las imágenes oficiales.
Pegatina transparente
Crea una pegatina de una capibara con casco de astronauta, de cuerpo entero y contorno definido. Genera una imagen RGBA con canal alfa y fondo completamente transparente, sin suelo, escenario ni sombras de fondo.
Fondo de producto
Coloca el producto de la imagen 1 en la mesa de la imagen 2 y conserva la dirección de su luz. Mantén la forma, color, logotipo y texto del envase del producto. Cambia solo el entorno.
Vestuario con varias imágenes
Viste a la persona de la imagen 1 con la chaqueta de la imagen 2 y los zapatos de la imagen 3, sujetando el bolso de la imagen 4. Conserva los rasgos faciales y los colores y diseños de prendas y accesorios. Genera una foto de cuerpo entero.
Preguntas
Antes de empezar
Conoce los parámetros, los resultados y las condiciones de uso.
¿Puedo generar imágenes en esta página?
Sí, mediante el Space de Qwen en Hugging Face integrado arriba. Ese servicio procesa las entradas y la generación, mantiene su propio idioma y determina su disponibilidad. Image Toolkit no ejecuta la inferencia del modelo.
¿7B significa que bastan 14 GB de memoria gráfica?
No. 7B solo corresponde al modelo visual. La cadena también incluye Qwen3-VL, VAE RGBA y datos intermedios. El uso de memoria depende de precisión, resolución, referencias y descarga a CPU, que también consume RAM y añade espera.
¿En qué se diferencia la transparencia de un fondo blanco?
Una imagen transparente tiene canal alfa y permite superposición. Un fondo blanco sigue teniendo píxeles opacos. Pide RGBA y fondo transparente y guarda como PNG. Los tres ejemplos conservan su canal alfa original.
¿La salida predeterminada es 1024 o 2048?
El repositorio oficial indica 2K nativo y tamaños como 2048 × 2048. Al verificarlo, Diffusers usaba output_resolution=1024. Especifica width y height para distinguir la capacidad del modelo de los valores de la herramienta.
¿Puedo usarlo en un producto de pago?
La sección 2 de Qwen Research License Agreement limita el permiso a investigación o evaluación no comercial. Para uso comercial, contacta con model-business@notice.qwencloud.com y respeta el acuerdo y la autorización obtenida.
¿Se recomiendan 10–15 pasos y 7 GB de VRAM?
No. Las primeras pruebas comunitarias no sustituyen los 40 pasos predeterminados de Diffusers. La baja memoria depende de descarga de componentes y decodificación por bloques. Evalúa tus imágenes y mide memoria máxima, tiempo y cambios de detalle.