Qwen-Image-2.1: el nuevo modelo open source de Alibaba para crear y editar imágenes
Alibaba presenta Qwen-Image-2.1, un modelo open source de 7.000 millones de parámetros para generación y edición de imágenes, con soporte 2K, RGBA y múltiples referencias.
El 20 de septiembre, el equipo de Qwen de Alibaba publicó como open source Qwen-Image-2.1, un nuevo modelo que integra la generación de imágenes a partir de texto y la edición de imágenes en un único sistema. La parte de generación visual utiliza solo 7.000 millones de parámetros y ofrece soporte nativo para imágenes de hasta 2K, generación de imágenes transparentes en formato RGBA y edición de múltiples sujetos utilizando hasta 10 imágenes de referencia.
Los pesos del modelo ya están disponibles en GitHub, ModelScope y Hugging Face.
Qwen-Image-2.1 utiliza una arquitectura Single-Stream DiT de 32 capas, acompañada por un codificador de texto Qwen3-VL 8B. Para reducir el coste de inferencia en escenarios con múltiples imágenes de entrada, el modelo utiliza atención de granularidad mixta y reutilización de Prefix KV Cache, lo que permite reducir de forma significativa la carga computacional cuando se utilizan varias imágenes de referencia.
En el benchmark interno Qwen-Image-Bench, Qwen-Image-2.1 obtuvo una puntuación total de 60,28 puntos, superando a Nano Banana 2.0 y GPT Image 1.5. Sin embargo, la diferencia frente a ambos modelos es inferior a un punto y todavía existe una brecha respecto a GPT Image 2, por lo que estos resultados no deberían interpretarse como una superioridad clara en generación de imágenes.
El modelo se distribuye bajo la Qwen Research License, que permite únicamente usos no comerciales. Las empresas que quieran utilizarlo comercialmente deben solicitar una autorización específica.
El mismo día del lanzamiento, Qwen-Image-2.1 ya contaba con soporte en varios frameworks y herramientas del ecosistema, entre ellos Diffusers, ComfyUI y vLLM-Omni.