Qwen-Image-2.1 se convierte en el generador de imágenes de código abierto número uno con edición mejorada y transparencia

icon MarsBit
Compartir
AI summary iconResumen
Alibaba ha lanzado Qwen-Image-2.1, un generador de imágenes de código abierto que ocupa el primer lugar entre los modelos de código abierto. La herramienta de 7 mil millones de parámetros admite generación transparente, edición multi-referencia y refinamiento local. Supera a Nano Banana 2.0 en pruebas de rendimiento y mejora la eficiencia mediante inferencia optimizada. A medida que la liquidez y los mercados de criptomonedas evolucionan, herramientas regulatorias como CFT ganan popularidad. El lanzamiento de Qwen contribuye al impulso por la transparencia de la IA de código abierto.

La capacidad de la IA para escribir código a menudo permite a los desarrolladores «alejar las manos del teclado», pero para los diseñadores, las imágenes generadas por la IA aún están a varios pasos de estar listas para entregar.

En el flujo de trabajo de diseño gráfico, se necesita recortar las figuras, modificar el texto en los elementos y ajustar periódicamente la disposición de diversos productos, pero el texto en el empaque y la forma de la botella no deben cambiar. Si los requisitos siguen modificándose, aún así se deben realizar ajustes locales para mantener la coherencia general de la imagen.

Estos detalles determinan si la generación de imágenes por IA puede ingresar al verdadero proceso creativo. Para diseñadores, operadores de comercio electrónico y creadores de contenido, el cuello de botella de los modelos de imagen hoy en día radica en si cada instrucción de modificación propuesta puede completarse con precisión.

Este domingo, Alibaba Qwen Lanzamos oficialmente el modelo de generación de imágenes Qwen-Image-2.1 como código abierto, resolviendo la mayoría de los desafíos de productividad con un tamaño de modelo pequeño: integra generación de imágenes a partir de texto y edición de imágenes, admite nativamente la generación de imágenes con transparencia, acepta hasta 10 imágenes de referencia y mejora aún más la edición local, la fidelidad de retratos y productos.

Qwen

Se convirtió en Qwen La serie de imágenes es actualmente el modelo de generación de imágenes de código abierto más equilibrado y con mejor relación calidad-precio. Los resultados de evaluaciones públicas muestran que Qwen-Image-2.1 ocupa el primer lugar entre los modelos de código abierto, superando incluso a Nano Banana 2.0. Cabe destacar que la parte de generación visual de este modelo cuenta solo con 7B de parámetros.

En plataformas como X, los usuarios que obtuvieron anticipadamente acceso a la experiencia ya han publicado los resultados generados, recibiendo muchas elogios. Hay capturas de pantalla con grandes cantidades de contenido textual:

Qwen

Generar imágenes con textura de foto real:

Qwen

También se han probado diversos filtros y estilos de iluminación:

Qwen

Se considera que Qwen-Image-2.1 es impresionante en la seguimiento de instrucciones, la tasa de éxito en extracciones y los resultados prácticos. Basándonos en las capacidades del nuevo modelo, ya podemos encadenar flujos de trabajo de generación, combinación y modificación de materiales para resolver muchos problemas complejos de edición con IA.

Capacidad y eficiencia

Según se indica, la parte de generación visual de Qwen-Image-2.1 utiliza una DiT de 20 capas Single-Stream con 7B parámetros y admite nativamente 2K. El modelo logró un rendimiento superior a su tamaño en las pruebas de referencia: Qwen-Image-2.1 obtuvo una puntuación total de 60.28. En comparación, Nano Banana 2.0 obtuvo 59.82 y GPT Image 1.5 obtuvo 59.65. Ya puede competir junto a varios modelos de imagen cerrados.

Qwen

Gráficos de evaluación de Qwen-Image-Bench.

La parte de generación visual cuenta solo con 7 mil millones de parámetros, lo que hace aún más notable este nivel de capacidad: integra en un módulo de generación más pequeño las funciones de generación de imágenes, generación de elementos transparentes y edición de múltiples imágenes (flujo unificado de generación y edición), ofreciendo a los desarrolladores un punto de partida más ligero para implementar y personalizar herramientas de imagen.

Al tiempo que ofrece un buen rendimiento, Qwen-Image-2.1 también optimiza el proceso de inferencia del modelo, con el enfoque principal de reducir los cálculos repetitivos innecesarios.

En un proceso de edición de imágenes, la imagen de referencia y las instrucciones de edición no cambian con cada paso de generación. Por lo tanto, el nuevo modelo utiliza una estructura de atención de granularidad mixta: la parte textual (prefijo del sistema, instrucciones de edición) sigue una máscara causal tradicional a nivel de token, realizando cálculos secuenciales estrictos palabra por palabra para garantizar la coherencia en la comprensión semántica, mientras que la parte de generación de imágenes emplea una máscara a nivel de chunk y, mediante el mecanismo de KV Cache, almacena en caché estos contextos estáticos tras el cálculo inicial para su reutilización en pasos posteriores de generación.

Qwen

Esto significa que la IA ahora procesará primero los materiales de referencia y reutilizará los resultados existentes al generar gradualmente las imágenes objetivo; esta optimización es especialmente notable con múltiples entradas de imágenes, ayudando a mejorar la eficiencia de inferencia y reducir el consumo de memoria GPU.

Dado que Qwen-Image-2.1 ahora admite hasta 10 imágenes de referencia, esta optimización se vuelve crucial. Cuanto más rica sea la entrada, más importante será cómo manejar la información de referencia y controlar los cálculos repetidos. La cantidad exacta de tiempo y memoria GPU ahorrados dependerá del hardware, la precisión, la resolución y el número de entradas.

Generar directamente recursos transparentes utilizables

La capacidad de Qwen-Image en la nueva versión que más se aproxima a las necesidades de diseño es la generación de imágenes transparentes.

Las imágenes estándar suelen tener un fondo completo. Para utilizar el sujeto en un póster, una página de detalles de producto o otra imagen, a menudo es necesario recortar primero la imagen, procesando los contornos, grietas y bordes. Las imágenes transparentes incluyen información adicional de transparencia, lo que permite que el fondo se vea a través del sujeto o en áreas parciales, facilitando su superposición y combinación posteriores.

Qwen-Image-2.1 admite nativamente la generación de imágenes con fondo transparente y puede determinar automáticamente si se debe generar una imagen normal o una con fondo transparente según el prompt. Los usuarios pueden solicitar un fondo transparente al describir los elementos. Los ejemplos mostrados incluyen ilustraciones festivas, elementos de personajes, elementos decorativos y combinaciones complejas compuestas por múltiples objetos, todos ellos requeridos comúnmente en trabajos de diseño. También hemos intentado:

Qwen

Es una buena noticia para los creadores; ahora podemos obtener materiales listos para usar, lo que elimina varias etapas del proceso.

Claro, una vez generados estos elementos transparentes, también se pueden modificar. Por ejemplo, se puede ajustar la expresión facial del mismo personaje ilustrado y cambiar el texto en la imagen. Los objetos editables pueden ser tanto los detalles visuales del personaje como el texto dentro del elemento.

Esto se acerca mucho a las necesidades reales de modificación al diseñar: el nombre de la actividad ha cambiado, pero el diseño debe mantenerse; las expresiones deben ser más relajadas, y los personajes deben seguir siendo reconocibles como el mismo personaje. Después de integrar la generación y la edición en el mismo modelo, estos requisitos posteriores tienen una entrada unificada para su manejo.

Of course, Qwen-Image-2.1 supports processing existing photos.

Qwen

Qwen

La oficina proporcionó un ejemplo de cómo extraer el contenido necesario de una foto real para obtener una imagen transparente RGBA. La "A" representa el canal de transparencia, que describe el grado de transparencia en cada parte de la imagen.

Como se puede ver, esta función sirve tanto para generar desde cero como para reutilizar imágenes existentes. Los creadores pueden primero proporcionar una foto y luego solicitar al modelo que extraiga el sujeto deseado como material para diseños posteriores.

La serie Qwen-Image anteriormente lanzó Qwen-Image-Layered independiente para explorar capacidades relacionadas con imágenes transparentes. Ahora, Qwen-Image-2.1 integra la generación y edición nativas de imágenes transparentes dentro del modelo de imagen general, mejorando aún más la conveniencia.

Ya existen modelos de IA abiertos y precisos para la edición de múltiples imágenes

Cuando una imagen requiere input de múltiples objetos, la tarea de edición se vuelve aún más compleja.

Por ejemplo, si se desea vestir a un mismo modelo con una prenda, zapatos, bolso y sombrero específicos, cada imagen de referencia tiene un propósito diferente, y el modelo debe distinguir entre la persona y los productos, colocarlos en posiciones razonables y conservar尽可能 sus características.

Qwen-Image-2.1 admite hasta 10 imágenes de referencia. Lo probamos, haciendo que Ultraman y Dario se sentaran a hablar. Utilizamos 7 imágenes: una foto de dos personas enfrentadas (cambiando la expresión), el fondo de la habitación, un sillón individual, una taza de café (llena de café), una lámpara de pie, una chimenea eléctrica y una mesa baja, generando finalmente una imagen completa.

Qwen

Ahora también puedes ver rápidamente cómo se vería una persona con diferentes atuendos, y también puedes combinar fotos individuales para crear fotos grupales.

Técnicamente, no solo prueban cuántas imágenes puede recibir el modelo de IA, sino también si los objetos de referencia pueden colocarse correctamente en la imagen final, con proporciones, posición y estilo general coherentes.

Se ha compuesto la imagen general, y normalmente siguen ajustes locales.

Qwen-Image-2.1 ofrece funciones como selección, pincelado y máscaras independientes para que los usuarios expresen con mayor precisión las áreas a editar. Por ejemplo, puedes usar varios colores para marcar diferentes regiones y solicitar una sola modificación que elimine simultáneamente la vestimenta de la persona en la foto y cambie el color del cabello.

Qwen

Esta interacción establece una correspondencia entre la ubicación espacial y los requisitos de texto. Para ediciones que involucran múltiples áreas, el usuario puede indicar por separado dónde se necesita eliminar, dónde reemplazar y qué se desea cambiar.

El método de pintura es adecuado para marcar directamente la ubicación de los nuevos objetos, pero seleccionar o pintar directamente sobre la imagen original también puede ocultar parte de la imagen. Por ello, el modelo también admite el uso de una imagen de máscara adicional para especificar el área de edición, lo que permite que toda la información de la imagen original se ingrese al modelo. Para diseños que incluyen personas y productos, esta capacidad de conservación es especialmente clave.

Qwen

Precisión del texto, calidad visual

Cuando se cambia el peinado o el escenario, la imagen facial debe conservar las características identitarias originales; cuando se cambia el entorno de exhibición de un producto, el texto, la textura y la forma del empaque también deben mantenerse lo más consistentes posible. De lo contrario, aunque la imagen sea atractiva, podría no ser adecuada para la tarea de exhibición original. Qwen-Image-2.1 destaca especialmente la capacidad de edición de fidelidad para escenarios de retratos y productos, y los resultados parecen ser bastante buenos.

Intentamos hacerlo, por ejemplo, tomando una captura de pantalla de esta página del libro de Tecnología de la Información para tercer grado del primer semestre de primaria, DeepSeek La bienvenida «Soy DeepSeek , ¡mucho gusto en conocerte!» a «Hola, ¿en qué puedo ayudarte?», y luego cambia «Pensamiento profundo (R1)» por el botón de pensamiento profundo de la versión más reciente, y actívalo:

Qwen

Además de la generación y edición, Qwen-Image-2.1 también ha mejorado aún más el rendimiento en texto y personajes. Ya sea en páginas con texto denso, infografías o ilustraciones para artículos académicos, la precisión del contenido y la estética del diseño se han elevado a un nivel notable.

Qwen

En la parte del retrato, Qwen-Image-2.1 ha mejorado aún más la representación de la luz y los detalles. Ahora, las imágenes generadas por IA muestran una mayor coherencia en los cabellos, texturas de la ropa, detalles faciales y luz ambiental, con una textura visual más refinada.

Además, cuenta con mejores capacidades para generar imágenes panorámicas, infografías, vistas en tres proyecciones y secuencias de viñetas, lo que amplía el alcance de la generación y edición de imágenes estáticas, ofreciendo más posibilidades para tareas como la presentación de personajes y la planificación visual. Probamos esto generando una serie de ilustraciones de secuencias de viñetas con el personaje de anime Qwen creado por la comunidad:

Qwen

La combinación de estas capacidades permite que Qwen-Image-2.1 cubra una cadena de procesamiento de imágenes más completa; ahora podemos realizar una gran cantidad de tareas basadas en un solo modelo de IA: primero organizar la escena con múltiples imágenes de referencia, luego ajustar áreas específicas, mientras se conservan al máximo las características clave de personas y productos. La extensión a la que un modelo de generación visual de solo 7B abierto puede reducir los retoques será un aspecto relevante a observar en pruebas posteriores.

¿Cuál es el alcance de la aplicación?

El lanzamiento de Qwen-Image-2.1 nos muestra que los modelos de imagen están cubriendo cada vez más etapas detalladas del proceso de creación, y esta tendencia se está acelerando.

Ya sea la salida de elementos transparentes, la capacidad de referencia múltiple de imágenes, la edición local o el aumento de la fidelidad, todos estos avances aumentan la posibilidad de que los modelos de IA se integren en flujos de trabajo reales. Para los creadores, esto significa que más tareas de creación y ajuste de recursos pueden realizarse de forma más sencilla mediante modelos de generación de imágenes de código abierto; para los desarrolladores, la apertura del nuevo modelo proporciona una nueva base para construir herramientas de diseño, aplicaciones y flujos de trabajo personalizados basados en estas capacidades.

Podemos predecir con confianza que, con la apertura de modelos de imagen como Qwen-Image-2.1, la comunidad seguirá integrando capacidades de generación y edición en más escenarios de creación de contenido, permitiendo que más personas accedan a herramientas de creación adaptadas a sus necesidades. Cuando estas capacidades de IA se conviertan en funciones fácilmente disponibles en software cotidiano, la barrera entre la idea y la obra visual podría reducirse nuevamente de forma significativa.

Actualmente, los pesos abiertos de Qwen-Image-2.1 ya se han lanzado en Hugging Face y ModelScope, y el informe técnico ya se ha cargado en el repositorio de GitHub.

Blog: https://qwen.ai/blog?id=qwen-image-2.1

GitHub: https://github.com/QwenLM/Qwen-Image-2.1

Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1

Este artículo proviene del canal de WeChat "Machine Heart" (ID: almosthuman2014), autor: Zeanan

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.