GPT Diffusion

Qwen-Image-2.1: RGBA nativo (con trampa: licencia research-only)

2026-09-27 · Devs #qwen#open-weights#modelos#optimizacion#analisis

Qwen-Image-2.1: RGBA nativo y edición con 10 referencias que no podrás llevar a producción sin licencia aparte

TL;DR

  • Cotejado verbatim contra el model card, el LICENSE y el README del repo (27/09/2026): Qwen-Image-2.1 es un DiT single-stream de 32 capas y 7B parámetros (componente visual), con Qwen3-VL 8B como encoder de texto e imágenes y un VAE RGBA de 64 canales con compresión espacial 16× — ahí vive la transparencia nativa. Release el 20/09/2026 con ecosistema Day-0: diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V.
  • La trampa principal: la v1 (Qwen-Image, agosto de 2025) era Apache-2.0 — verbatim en su model card. La 2.1 baja a “Qwen RESEARCH LICENSE AGREEMENT”: §2 restringe uso, distribución y derivados a “research or evaluation purposes only”. Cualquier uso comercial exige licencia aparte (model-business@notice.qwencloud.com), los derivados deben lucir “Built with Qwen” (§4b) y no pueden llamarse “Qwen” (§4c), y el contrato se rige por ley china con jurisdicción exclusiva de Hangzhou (§8).
  • Todo lo demás es vendor-reported: generación RGBA desde texto, edición con hasta 10 imágenes de referencia, ediciones locales por anotaciones y preservación de identidad. La evidencia son showcases propios. No existe a día de hoy ningún benchmark independiente ni comparativa contra la v1, FLUX o SDXL en las fuentes primarias.
  • Adopción, no calidad: 52.804 descargas y 2.478 likes en Hugging Face (consultado el 27/09/2026), con la ficha creada el 14/09/2026. La v1 acumula 283.515 descargas. Que la gente descargue a saco no es un benchmark.
  • La salida comercial sigue abierta, pero por la puerta vieja: mientras la v1 siga siendo Apache-2.0, quien necesite producción con las capacidades clásicas tiene ahí su opción — sin RGBA nativo ni edición multi-referencia.

Qué es Qwen-Image-2.1

Es el nuevo modelo de generación y edición de imágenes de la familia Qwen, con pesos descargables en Hugging Face. La ficha se creó el 14/09/2026 y el release oficial se fechó el 20/09/2026 en la News del repo de GitHub, con soporte Day-0 de diffusers (PR #14804), ComfyUI, vLLM-Omni, SGLang (PR #39983) y LightX2V. No hay API de pago anunciada en las fuentes consultadas: de momento es un modelo para correr tú.

Dos capacidades concentran todo el marketing: generación con canal alfa real (RGBA) y edición condicionada con hasta 10 imágenes de referencia. Para la familia Qwen en texto, ya analizamos Qwen3.8-27B y su experiencia con 700 usuarios reales; este es el lado imagen de la misma estrategia de ecosistema.

La trampa: de Apache-2.0 a licencia research-only

Aquí está la parte que la ficha de Hugging Face no grita. El modelo anterior, publicado en agosto de 2025, declara license: apache-2.0 verbatim en su model card — puedes usarlo en producción, modificarlo y redistribuirlo sin pedir permiso a nadie. La 2.1 cambia de marco: el LICENSE es un “Qwen RESEARCH LICENSE AGREEMENT” con release date 20/09/2026 y firma de Hangzhou Tongyi Laboratory.

Lo que dice, en concreto:

  • §2 — solo no comercial. Uso, reproducción, distribución y creación de derivados quedan limitados a “research or evaluation purposes only”. Para cualquier uso comercial hay que solicitar una licencia separada a model-business@notice.qwencloud.com.
  • §4b — “Built with Qwen”. Si usas los outputs del modelo para entrenar o mejorar otro modelo que luego distribuyes, tu derivado debe mostrar ese crédito.
  • §4c — sin branding. No puedes usar “Qwen” como nombre principal de tu derivado.
  • §8 — ley china. El contrato se rige por la ley de la República Popular China, con jurisdicción exclusiva de los tribunales de Hangzhou. Para un equipo con departamento legal pequeño, eso no es un detalle menor: es el foro donde se resolvería cualquier disputa.

La etiqueta “open” de la ficha convive con todo esto. Pesos disponibles para descargar sí; licencia permisiva, no. Es la misma tensión que describimos en la pieza sobre el cambio de poder del open-source: el open-weights ha ganado la batalla de la distribución, pero la libertad de uso se negocia caso por caso. El paso atrás respecto a la propia v1 del mismo vendor — que sigue siendo Apache-2.0 — demuestra que no es una decisión de casa sino de modelo.

Qwen-Image (ago-2025)Qwen-Image-2.1 (20/09/2026)
Texto legalApache-2.0Qwen Research License
Uso comercialSí, sin condicionesSolo con licencia aparte
DerivadosSin restricción de marca”Built with Qwen” + sin “Qwen” en el nombre
JurisdicciónEstándar ApacheLey china, tribunales de Hangzhou

Qué dice la arquitectura (y qué implica)

Datos verbatim del README del repo — descripción del vendor, pero de la parte que se puede contrastar con el código y los pesos:

ComponenteQué esQué implica
DiT single-stream32 capas, 7B parámetros (solo el componente visual)El encoder suma aparte en memoria: no es un “7B” completo
Atención block-causalCausal por token en texto, bidireccional por chunk en imágenesLas imágenes de referencia se leen completas; el prompt, secuencial
Prefix KV cacheLa condición texto+imágenes se codifica una vez y se reutiliza en los 40 pasos (causal_condition: true por defecto)El coste de condición se amortiza; relevante sobre todo en edición multi-imagen
Text encoderQwen3-VL 8B, codifica texto E imágenes en una representación unificadaEs la pieza que hace plausible condicionar con 10 referencias
VAEAutoencoder RGBA de 64 canales, compresión espacial 16×La transparencia vive en el latente, no es un recorte posterior
SchedulerFlow Matching, Euler discreto, dynamic shifting, 40 pasos por defectoConfiguración de referencia del repo
Resolución nativa2048×2048 más 6 formatos: 4:3 (2400×1792), 3:2 (2528×1696), 16:9 (2752×1536) y sus inversas2K nativo sin upscaling

Dos lecturas en frío. Primera: la suma real no es 7B — el Qwen3-VL 8B del encoder viaja con el modelo, y ninguna fuente primaria publica cifra de VRAM mínima, así que cualquier “te cabe en X GB” que leas por ahí es aritmética ajena, no dato del vendor. Segunda: el prefix KV cache es un buen diseño de ingeniería para el caso de edición con muchas referencias, pero su ahorro es lógico por diseño, no medido por terceros.

Lo del vendor: RGBA y 10 referencias

Todo lo que viene ahora es vendor-reported; la evidencia pública son los showcases del repo y del model card, no evaluaciones independientes:

  • Generación RGBA desde texto. El prompt recomendado es literal: “This is an RGBA image with transparency. <descripción>. The image has alpha channel and the background is transparent.” También se anuncia edición de capas transparentes y extracción de sujetos.
  • Edición con hasta 10 imágenes de referencia, con preservación de identidad de personas y productos — el claim más difícil de verificar sin pruebas propias, porque “preservar identidad” no tiene métrica pública que lo respalde.
  • Ediciones locales señalando zonas con círculos, anotaciones pintadas o máscaras separadas.
  • Prompt rewriting opcional con dos checkpoints fine-tuned de Qwen3.5-VL 9B (Qwen-Image-2.1-PE-T2I y -PE-I2I).
  • Ecosistema Day-0: pipeline QwenImage21Pipeline en diffusers, pesos nativos para ComfyUI (en Comfy-Org/Qwen-Image-2.1), vLLM-Omni con FP8 y CUDA graphs, SGLang-Diffusion y LightX2V. Soporte AMD ROCm y “8 plataformas de chip” vía FlagOS, según el propio vendor.

Que no exista comparativa contra la v1 es la ausencia más elocuente: el vendor no publica todavía por qué deberías migrar más allá de las capacidades nuevas. La calidad de imagen “se ve en los ejemplos” — que es exactamente el nivel de evidencia que este sitio no da por buena.

Ecosistema y adopción, con fecha

Las métricas de Hugging Face (API consultada el 27/09/2026): 52.804 descargas y 2.478 likes en trece días desde la creación de la ficha, con un paso por el puesto 1.856 del trending el día de la señal. La v1, en sus trece meses de vida, acumula 283.515 descargas y 2.658 likes. Lectura: la adopción inicial es rápida — el soporte Day-0 de ComfyUI y diffusers hace el resto — pero la base instalada de la 2.1 es hoy el 18,6% de la de su predecesora. Las métricas se mueven rápido: si esta pieza envejece, es por estos números.

El soporte Day-0 sí es una señal de adopción verificable: diffusers, ComfyUI, vLLM-Omni y SGLang mergeando soporte el mismo día del release no es algo que pase con modelos que el ecosistema no espera. Para prototipar, la vía ComfyUI es la de menor fricción; para integrar en código, diffusers.

Cuándo te sirve y cuándo no

Dónde sí. Investigación y evaluación, que es literalmente para lo que la licencia te deja usarlo: pipelines de composición con transparencia real (sin chroma ni matting posterior), prototipos de edición de capas, R&D sobre edición multi-referencia con el KV cache amortizando el coste de condición. Si tu flujo vive en ComfyUI, probarlo cuesta poco.

Dónde no. En producción comercial sin acuerdo previo — y con la v1 Apache-2.0 disponible, el argumento “es que no había alternativa” no vale: la hay, sin RGBA ni multi-referencia. Tampoco como base de un derivado que quieras renombrar a tu marca sin el “Built with Qwen”, ni en un equipo que no pueda aceptar jurisdicción de Hangzhou en un contrato de licencia. Y si lo que necesitas es calidad medida: todavía no hay nada medido.

Qué haría yo. Si tu caso es no comercial, prototipa en ComfyUI esta semana y evalúa el RGBA en tu flujo real — es la única capacidad que ningún competidor abierto estándar da por defecto. Si tu caso es comercial, decide antes de invertir: o pides la licencia a model-business@notice.qwencloud.com y asumes el marco legal chino, o te quedas en la v1 Apache y esperas a que terceros midan si la 2.1 merece el trámite. Y en cualquier caso, no des por buena la preservación de identidad hasta probarla con tus propios sujetos.

Qué falta por medir

  1. Calidad vs v1, FLUX y SDXL. Solo showcases del vendor. Cero benchmarks independientes a 27/09/2026.
  2. VRAM mínima y throughput real. Ninguna fuente primaria publica cifras; el “7B” del titular ignora el encoder de 8B.
  3. El ahorro real del prefix KV cache en ediciones con 10 referencias: lógico por diseño, no medido por nadie de fuera.
  4. Si habrá API de pago y con qué licencia de uso: no está anunciada en las fuentes consultadas.

Fuentes

Cargando comentarios...