Qwen-Image-2.1 devient le meilleur générateur d'images open-source avec une édition améliorée et une transparence accrue

icon MarsBit
Partager
AI summary iconRésumé
Qwen d'Alibaba a lancé Qwen-Image-2.1, un générateur d'images open-source classé premier parmi les modèles open-source. L'outil de 7 milliards de paramètres prend en charge la génération transparente, l'édition multi-références et le raffinage local. Il surpasse Nano Banana 2.0 dans les benchmarks et améliore l'efficacité grâce à une inférence optimisée. Alors que la liquidité et les marchés crypto évoluent, des outils réglementaires comme CFT gagnent en popularité. Le lancement de Qwen renforce la poussée vers la transparence de l'IA open-source.

La capacité de l'IA à écrire du code permet souvent aux développeurs de « quitter le clavier », mais pour les designers, les images générées par l'IA sont encore à plusieurs étapes de pouvoir être livrées.

Dans le flux de travail de conception graphique, les personnages doivent être isolés, les éléments graphiques doivent être modifiés, et la disposition des différents produits doit être ajustée régulièrement, mais le texte sur l'emballage et la forme du flacon ne doivent pas changer. Si les demandes continuent d'évoluer, des modifications locales doivent être apportées pour maintenir la cohérence globale de l'image.

Ces détails déterminent si la génération d'images par IA peut entrer dans le véritable processus de création. Pour les designers, les responsables e-commerce et les créateurs de contenu, le goulot d'étranglement des modèles d'images aujourd'hui réside dans la capacité à exécuter précisément chaque instruction de modification.

Ce dimanche, Alibaba Qwen Publication officielle du modèle génératif d'images Qwen-Image-2.1 en open source, qui résout la plupart des défis de productivité avec une taille de modèle réduite : il intègre la génération d'images à partir de texte et l'édition d'images, prend en charge nativement la génération d'images transparentes, accepte jusqu'à 10 images de référence, et renforce encore la modification locale, la fidélité des portraits et des produits.

Qwen

Il est devenu Qwen Le modèle open source de génération d'images le plus équilibré et le plus rentable actuellement disponible. Les résultats des évaluations publiques montrent que Qwen-Image-2.1 occupe la première place parmi les modèles open source, avec un score supérieur à celui de Nano Banana 2.0. Il faut noter que la partie de génération visuelle de ce modèle ne compte que 7 milliards de paramètres.

Sur des plateformes comme X, des utilisateurs ayant obtenu en avance un accès à l'expérience ont partagé les résultats générés, suscitant de nombreux éloges. Des captures d'écran contenant de nombreux textes :

Qwen

Générer une image avec la qualité d'une photo réelle :

Qwen

Il a également essayé divers filtres et styles d’éclairage :

Qwen

On estime que Qwen-Image-2.1 est impressionnant en matière de suivi des instructions, de taux de réussite des tirages et d'efficacité pratique. Grâce aux capacités du nouveau modèle, nous pouvons désormais chaîner les étapes de génération, de combinaison et de modification de supports pour résoudre de nombreux problèmes complexes de retouche photo grâce à l'IA.

Capacité et efficacité

Selon les informations fournies, la partie de génération visuelle de Qwen-Image-2.1 utilise un Single-Stream DiT de 20 couches, avec 7 milliards de paramètres, et prend en charge nativement une résolution de 2K. Le modèle atteint des performances supérieures à sa taille sur les benchmarks : Qwen-Image-2.1 obtient un score total de 60,28. En comparaison, Nano Banana 2.0 obtient 59,82 et GPT Image 1.5 obtient 59,65. Il est désormais capable de rivaliser avec plusieurs modèles d’images propriétaires.

Qwen

Graphiques d'évaluation Qwen-Image-Bench.

La partie de génération visuelle ne compte que 7 milliards de paramètres, ce qui rend encore plus remarquable cette capacité : elle intègre simultanément la génération d'images, la génération de éléments transparents et l'édition multi-images (pipeline unifié pour génération et édition), offrant aux développeurs un point de départ plus léger pour déployer et personnaliser des outils d'image.

Tout en offrant de bonnes performances, Qwen-Image-2.1 a optimisé le processus d'inférence du modèle, en se concentrant sur la réduction des calculs redondants inutiles.

Lors d'une édition d'image, l'image de référence et les instructions d'édition ne changent pas à chaque étape de génération. Ainsi, le nouveau modèle utilise une structure d'attention à granularité mixte : la partie texte (préfixe système, instructions d'édition) suit un masque causal traditionnel au niveau des jetons, effectuant un calcul séquentiel strict mot par mot pour garantir la cohérence de la compréhension sémantique, tandis que la partie de génération d'image utilise un masque au niveau des chunks et exploite le mécanisme KV Cache pour mettre en cache ces contextes statiques après le premier calcul, afin de les réutiliser lors des étapes de génération suivantes.

Qwen

Cela signifie que l’IA traitera d’abord les documents de référence, puis réutilisera les résultats existants lors de la génération progressive de l’image cible. Cette optimisation est particulièrement efficace avec plusieurs entrées d’images, ce qui améliore l’efficacité d’inférence et réduit la consommation de mémoire vidéo.

Étant donné que Qwen-Image-2.1 prend désormais en charge jusqu'à 10 images de référence, cette optimisation devient cruciale. Plus le contenu d'entrée est riche, plus il est important de bien gérer les informations de référence et de contrôler les calculs redondants. Quant à la quantité exacte de temps et de mémoire vidéo économisés, cela dépend de la configuration matérielle, de la précision, de la résolution et du nombre d'entrées.

Générer directement des ressources transparentes utilisables

La capacité de Qwen-Image la plus proche des besoins de conception est la génération d'images transparentes.

Les images classiques contiennent généralement un arrière-plan complet. Pour utiliser le sujet dans une affiche, une page de détail produit ou une autre image, il est souvent nécessaire de le découper d’abord, en traitant les contours, les interstices et les bords. Les images transparentes contiennent des informations de transparence supplémentaires, permettant à l’arrière-plan de se voir à travers les zones entourant ou partiellement le sujet, facilitant ainsi les superpositions et combinaisons ultérieures.

Qwen-Image-2.1 prend en charge nativement la génération d'images transparentes, et peut automatiquement déterminer si une image normale ou une image transparente doit être générée en fonction des instructions. Les utilisateurs peuvent demander un arrière-plan transparent directement lors de la description de leurs éléments. Les exemples présentés incluent des illustrations festives, des éléments de personnages, des éléments décoratifs et des compositions complexes composées de plusieurs objets — tous correspondant à des besoins courants en design. Nous avons également effectué quelques essais :

Qwen

C'est une excellente nouvelle pour les créateurs : nous pouvons désormais obtenir des supports directement utilisables, ce qui réduit considérablement le nombre d'étapes dans notre travail.

Bien sûr, ces éléments transparents peuvent être modifiés après leur génération. Par exemple, les expressions du même personnage d'illustration peuvent être ajustées, et le texte dans l'image peut être modifié. Les éléments à éditer peuvent être les détails visuels du personnage ou le texte présent dans l'élément.

Cela correspond étroitement aux besoins de modification réels lors de la conception : le nom de l'événement a changé, mais le motif doit être conservé ; les expressions doivent être plus détendues, tout en permettant de reconnaître le même personnage. Une fois les générations et les éditions intégrées dans le même modèle, ces exigences ultérieures disposent d'une entrée unique pour leur traitement.

Bien sûr, Qwen-Image-2.1 prend en charge le traitement d'images existantes.

Qwen

Qwen

L'officiel a fourni un exemple permettant d'extraire le contenu souhaité à partir de photos réelles afin d'obtenir une image transparente RGBA. Le A représente le canal de transparence, utilisé pour décrire le niveau de transparence à chaque endroit de l'image.

Il est visible que cette fonctionnalité sert à la fois à la génération à partir de zéro et à la réutilisation d’images existantes. Les créateurs peuvent d’abord fournir une photo, puis demander au modèle d’extraire le sujet souhaité, pour l’utiliser comme élément de conception ultérieur.

La série Qwen-Image a précédemment introduit Qwen-Image-Layered, une version indépendante dédiée à l'exploration des capacités liées aux images transparentes. Avec Qwen-Image-2.1, la génération et l'édition natives d'images transparentes sont désormais intégrées au modèle d'image général, améliorant ainsi davantage la praticité.

Le modèle AI open source nécessaire pour l'édition multi-images est désormais disponible.

Lorsqu'une demande d'image provient de plusieurs objets, la tâche d'édition devient encore plus complexe.

Par exemple, si l'on souhaite vêtir un même mannequin d'un vêtement, d'une paire de chaussures, d'un sac et d'un chapeau spécifiques, chaque image de référence ayant un rôle différent, le modèle doit distinguer la personne du produit, les placer à des emplacements appropriés et conserver autant que possible leurs caractéristiques respectives.

Qwen-Image-2.1 prend en charge jusqu'à 10 images de référence. Nous avons essayé de faire asseoir Ultraman et Dario pour une discussion. Nous avons utilisé 7 images : une photo des deux personnages en face à face (avec une expression modifiée), l'arrière-plan de la pièce, un fauteuil unique, une tasse de café (remplie de café), une lampe au sol, un poêle à bois mural et une table basse, pour générer finalement une image finale complète.

Qwen

Vous pouvez désormais voir rapidement à quoi ressemblerait une personne avec différents vêtements, et combiner des photos individuelles pour créer des photos de groupe.

Sur le plan technique, elles testent non seulement la capacité des modèles d'IA à traiter un grand nombre d'images en entrée, mais aussi la capacité à positionner correctement les objets de référence dans l'image finale, en assurant une cohérence des proportions, de la position et du style global.

Le tableau global est ainsi établi, suivi généralement d'ajustements locaux.

Qwen-Image-2.1 propose des fonctionnalités telles que la sélection, le dessin et les masques indépendants, permettant aux utilisateurs d'indiquer plus précisément les zones à modifier. Par exemple, vous pouvez utiliser plusieurs couleurs pour marquer différentes zones et demander une modification unique qui retire à la fois les vêtements de la personne sur la photo et change la couleur des cheveux.

Qwen

Cette interaction établit une correspondance entre les emplacements spatiaux et les exigences textuelles. Pour les éditions impliquant plusieurs zones, l'utilisateur peut indiquer séparément où supprimer, où remplacer et ce à quoi remplacer.

La méthode de peinture permet d'indiquer directement l'emplacement des nouveaux objets, mais le tracé ou le recouvrement direct sur l'image d'origine peut masquer une partie de l'image. À cet égard, le modèle prend en charge l'utilisation d'une image de masque supplémentaire pour définir la zone à modifier, permettant ainsi à l'ensemble des informations de l'image d'origine d'être entièrement fournies au modèle. Pour les conceptions contenant des personnes ou des produits, cette capacité de conservation est particulièrement cruciale.

Qwen

Précision du texte, qualité visuelle

Même après un changement de coiffure ou de décor, les caractéristiques identitaires du portrait doivent être conservées ; lorsqu’un produit est déplacé dans un nouvel environnement, les textes, textures et formes de son emballage doivent également rester aussi cohérents que possible. Sinon, même si l’image est esthétiquement plaisante, elle risque de ne pas être utilisable pour la mission d’exposition initiale. Qwen-Image-2.1 met l’accent sur la capacité de conservation du réalisme dans les scénarios de portraits et de produits, et les résultats semblent prometteurs.

Nous avons essayé, par exemple, de faire en sorte qu'il prenne une capture d'écran de cette page du manuel d'information et technologie pour le CE1, premier semestre, DeepSeek La salutation d'accueil : « Je suis DeepSeek ,很高兴见到你!»改为«你好,我能帮上什么忙吗?»,再将深度思考(R1)改为最新版本的深度思考按钮,并点亮:

Qwen

Outre la génération et l'édition, Qwen-Image-2.1 améliore également la qualité de la représentation du texte et des personnages. Que ce soit pour des pages图文 riches en texte, des infographies ou des illustrations d'articles scientifiques, la précision du contenu et la qualité esthétique de la mise en page ont été considérablement améliorées.

Qwen

Pour la partie portrait, Qwen-Image-2.1 a renforcé encore la représentation de la lumière et des détails. Les images générées par l'IA présentent désormais une meilleure cohérence pour les cheveux, les textures de vêtements, les détails du visage et l'éclairage ambiant, avec une qualité visuelle plus raffinée.

De plus, il offre de meilleures capacités de génération de vues panoramiques, d'infographies, de vues en trois vues et de storyboards, élargissant ainsi le champ d'application de la génération et de l'édition d'images statiques, et offrant davantage de possibilités pour des tâches telles que la présentation de personnages et la planification visuelle. Nous avons testé la génération d'une série d'illustrations de storyboards à l'aide d'images de personnages 2D créées par la communauté pour Qwen :

Qwen

Ces capacités combinées permettent à Qwen-Image-2.1 de couvrir une chaîne de traitement d’images plus complète : nous pouvons désormais accomplir de nombreuses tâches en se basant sur un seul modèle IA, en organisant la scène à l’aide de plusieurs images de référence, en ajustant les zones tout en préservant au maximum les caractéristiques clés des personnes et des produits. La réduction possible des retouches par un modèle open source de seulement 7B pour la génération visuelle sera un point à surveiller lors des tests pratiques ultérieurs.

Quelle est la portée de l'application ?

La sortie de Qwen-Image-2.1 montre que les modèles d'images couvrent de plus en plus d'étapes détaillées du processus de création, et cette tendance s'accélère.

Que ce soit l'export de supports transparents, la référence à plusieurs images, l'édition locale ou l'amélioration de la fidélité, ces avancées augmentent la possibilité pour les modèles IA d'être intégrés dans des flux de travail réels. Pour les créateurs, cela signifie qu'une plus grande partie de la création et de l'ajustement de contenus peut être confiée, de manière plus simple, à des modèles open source de génération d'images ; pour les développeurs, l'ouverture de ces nouveaux modèles fournit une nouvelle base pour construire des outils de conception, des applications et des flux de travail personnalisés autour de ces capacités.

Nous pouvons prévoir avec confiance qu'avec l'ouverture des modèles d'images comme Qwen-Image-2.1, la communauté intégrera encore davantage les capacités de génération et d'édition dans davantage de scénarios de création de contenu, permettant à un plus grand nombre de personnes d'utiliser des outils de création adaptés à leurs besoins. Lorsque ces capacités d'IA deviendront des fonctionnalités facilement accessibles dans les logiciels quotidiens, le seuil pour passer d'une idée à une œuvre visuelle pourrait encore être considérablement abaissé.

Les poids ouverts de Qwen-Image-2.1 sont désormais disponibles sur Hugging Face et ModelScope, et le rapport technique a été téléchargé sur le dépôt GitHub.

Blog : https://qwen.ai/blog?id=qwen-image-2.1

GitHub : https://github.com/QwenLM/Qwen-Image-2.1

Portée du modèle : https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

Hugging Face : https://huggingface.co/Qwen/Qwen-Image-2.1

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Zé Nán

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.