AI कोड लिखने की क्षमता अक्सर डेवलपर्स को 'कीबोर्ड से हाथ हटा देने' की अनुमति देती है, लेकिन डिजाइनर्स के लिए, AI द्वारा उत्पन्न चित्र जमा करने योग्य स्तर तक पहुँचने में अभी भी कई कदम पीछे हैं।
इमेज डिज़ाइन के वर्कफ्लो में, चरित्रों को बैकग्राउंड से अलग करना पड़ता है, सामग्री के टेक्स्ट को बदलना पड़ता है, और विभिन्न उत्पादों की व्यवस्था को बार-बार समायोजित करना पड़ता है, लेकिन पैकेजिंग पर टेक्स्ट और बोतल के आकार को नहीं बदलना चाहिए। यदि आवश्यकताएं लगातार बदलती रहती हैं, तो समग्र चित्र को समन्वयित रखने के लिए स्थानीय संशोधन जारी रखने पड़ते हैं।
ये विवरण यह तय करते हैं कि AI द्वारा बनाई गई छवियाँ वास्तविक सृजन प्रक्रिया में प्रवेश कर सकती हैं या नहीं। डिजाइनर, ई-कॉमर्स ऑपरेटर और कंटेंट क्रिएटर्स के लिए, आज छवि मॉडल की सीमा यह है कि प्रत्येक संशोधन निर्देश को कितनी सटीकता से पूरा किया जा सकता है।
इस सप्ताह के रविवार, अली क्विनवेन Qwen-Image-2.1 को औपचारिक रूप से ओपन सोर्स किया गया है, जो छोटे मॉडल के आकार में अधिकांश उत्पादकता समस्याओं को हल करता है: यह टेक्स्ट-टू-इमेज और इमेज एडिटिंग को एकीकृत करता है, पारदर्शी छवियों के उत्पादन को मूल रूप से समर्थन करता है, अधिकतम 10 रेफरेंस इमेजेस स्वीकार कर सकता है, और स्थानीय संपादन, चेहरा और उत्पाद फिडेलिटी को और मजबूत करता है।

यह बन गया क्विनवेन इमेज सीरीज़ वर्तमान में सबसे संतुलित और सर्वोत्तम मूल्य प्रदान करने वाला ओपन-सोर्स इमेज जनरेशन मॉडल है। खुली परीक्षणों के परिणामों के अनुसार, Qwen-Image-2.1 ने ओपन-सोर्स मॉडल्स में पहला स्थान प्राप्त किया है, और इसका स्कोर Nano Banana 2.0 से भी अधिक है। ध्यान दें कि इस मॉडल के विजुअल जनरेशन भाग के पैरामीटर्स की मात्रा केवल 7B है।
X जैसे प्लेटफॉर्म पर, पहले से अनुभव के लिए योग्यता प्राप्त उपयोगकर्ताओं ने उत्पादित परिणाम शेयर किए हैं, जिससे सभी ने बहुत सराहना की है। बहुत सारी पाठ सामग्री वाले इमेज के परिणाम हैं:

फोटो-रियलिस्टिक इमेज जनरेट करें:

विभिन्न फिल्टर और लाइटिंग स्टाइल्स के साथ प्रयास भी किए गए:

लोग मानते हैं कि Qwen-Image-2.1 निर्देशों का पालन, खींचने की सफलता और वास्तविक प्रभाव में प्रभावशाली है। नए मॉडल की क्षमताओं के आधार पर, हम अब सामग्री उत्पादन, संयोजन और संशोधन के कार्यप्रवाह को जोड़ सकते हैं और AI का उपयोग करके कई जटिल फोटो संपादन समस्याओं को हल कर सकते हैं।
क्षमता और दक्षता
बताया गया है कि Qwen-Image-2.1 का विजुअल जनरेशन भाग 20-लेयर Single-Stream DiT का उपयोग करता है, जिसमें 7B पैरामीटर हैं और यह मूल रूप से 2K का समर्थन करता है। इस मॉडल ने अपने आकार की तुलना में बेहतर प्रदर्शन किया है: Qwen-Image-2.1 का कुल स्कोर 60.28 है। इसकी तुलना में, Nano Banana 2.0 का स्कोर 59.82 है और GPT Image 1.5 का स्कोर 59.65 है। यह मॉडल कई बंद स्रोत छवि मॉडल्स के साथ प्रतिस्पर्धा करने में सक्षम है।

Qwen-Image-Bench आकलन चार्ट।
विजुअल जनरेशन घटक में केवल 7B पैरामीटर हैं, जिससे इस क्षमता को और भी अधिक महत्वपूर्ण बना देता है: यह छोटे जनरेशन मॉड्यूल में एक साथ इमेज जनरेशन, ट्रांसपेरेंट एसेट जनरेशन और मल्टी-इमेज एडिटिंग क्षमताओं को समाहित करता है (जनरेशन और एडिटिंग एकीकृत पाइपलाइन), जिससे डेवलपर्स के लिए इमेज टूल्स के डिप्लॉयमेंट और कस्टमाइजेशन के लिए एक हल्का प्रारंभिक बिंदु प्रदान किया जाता है।
क्वेन-इमेज-2.1 अच्छे प्रदर्शन के साथ-साथ मॉडल की निष्कर्षण प्रक्रिया को भी अनुकूलित करता है, जिसका मुख्य विचार अनावश्यक दोहराए गए गणनाओं को कम करना है।
एक चित्र संपादन में, इनपुट रेफरेंस इमेज और एडिटिंग निर्देश प्रत्येक पीढ़ी के चरण के साथ नहीं बदलते। इसलिए, नया मॉडल मिश्रित ग्रेन्युलैरिटी ध्यान संरचना का उपयोग करता है, जहां टेक्स्ट भाग (सिस्टम प्रीफिक्स, एडिटिंग निर्देश) पारंपरिक टोकन-स्तरीय कारणात्मक मास्क का पालन करते हैं, जिससे शब्द-दर-शब्द कठोर अनुक्रमिक गणना के माध्यम से अर्थपूर्ण तर्क की संगठित समझ सुनिश्चित होती है, जबकि चित्र उत्पादन भाग Chunk-स्तरीय मास्क का उपयोग करता है और KV Cache के मechanism के माध्यम से पहले चरण की गणना के बाद इन स्थिर संदर्भों को कैश करता है, जिसे बाद के उत्पादन चरणों में पुनः उपयोग किया जा सकता है।

इसका अर्थ है कि AI अब संदर्भ सामग्री को पहले प्रोसेस करेगा और लक्ष्य चित्र उत्पन्न करते समय पहले से प्राप्त परिणामों का पुनः उपयोग करेगा। यह अनुकूलन बहुत सारी छवियों के इनपुट के लिए अधिक स्पष्ट रूप से लाभदायक है, जिससे निष्पादन की दक्षता में वृद्धि होती है और VRAM का उपयोग कम होता है।
चूंकि अब Qwen-Image-2.1 अधिकतम 10 रेफरेंस इमेजेस का समर्थन करता है, इसलिए यह अनुकूलन अत्यंत महत्वपूर्ण हो गया है। जितना अधिक समृद्ध इनपुट होगा, उतना ही रेफरेंस जानकारी को कैसे प्रोसेस किया जाए और दोहराई गई गणनाओं को कैसे नियंत्रित किया जाए, यह महत्वपूर्ण हो जाता है। वास्तविक समय और VRAM की बचत का अनुमान हार्डवेयर, प्रेसिजन, रेजोल्यूशन और इनपुट संख्या के संयोजन पर निर्भर करता है।
सीधे उपयोग के लिए पारदर्शी सामग्री उत्पन्न करें
नए संस्करण Qwen-Image की सबसे अच्छी डिज़ाइन आवश्यकताओं के अनुरूप क्षमता पारदर्शी चित्र उत्पन्न करना है।
सामान्य चित्र सामग्री में अक्सर पूर्ण बैकग्राउंड होता है। इसमें से मुख्य वस्तु को पोस्टर, उत्पाद विवरण पृष्ठ या दूसरी छवि में उपयोग करने के लिए, अक्सर पहले इसे कटआउट करना, किनारों, अंतराल और सीमाओं को संशोधित करना आवश्यक होता है। पारदर्शी छवियों में अतिरिक्त पारदर्शिता जानकारी होती है, जो बैकग्राउंड को मुख्य वस्तु के चारों ओर या कुछ क्षेत्रों से दिखाने की अनुमति देती है, जिससे बाद में इन्हें स्तरबद्ध करना और संयोजित करना आसान हो जाता है।
Qwen-Image-2.1 ट्रांसपेरेंट इमेज जनरेशन को नेटिव सपोर्ट करता है, और प्रॉम्प्ट के आधार पर स्वचालित रूप से निर्णय लेता है कि सामान्य इमेज या ट्रांसपेरेंट इमेज जनरेट की जाए। उपयोगकर्ता अपने सामग्री का वर्णन करते समय सीधे ट्रांसपेरेंट बैकग्राउंड की मांग कर सकते हैं। वर्तमान में प्रदर्शित उदाहरणों में त्योहारी इलस्ट्रेशन, पर्सनल सामग्री, डेकोरेटिव एलिमेंट्स, और कई ऑब्जेक्ट्स से बनी जटिल कॉम्बिनेशन शामिल हैं, जो सभी डिज़ाइन कार्यों में सामान्य सामग्री की मांगों को दर्शाते हैं। हमने एक प्रयास भी किया:

क्रिएटर्स के लिए यह अच्छी खबर है, अब हमें सीधे उपयोग के लिए सामग्री मिल रही है, जिससे काम में कई चरण कम हो गए हैं।
बेशक, इन पारदर्शी सामग्रियों को बनाने के बाद भी इसे संपादित किया जा सकता है। उदाहरण के लिए, एक ही चित्रण के पात्र की भावनाएँ बदली जा सकती हैं, और चित्र में लिखा गया पाठ संशोधित किया जा सकता है। संपादन का विषय या तो पात्र के दृश्य विवरण हो सकता है, या सामग्री में लिखा गया पाठ हो सकता है।
यह डिज़ाइन के समय की वास्तविक संशोधन आवश्यकताओं के बहुत करीब है: एक्टिविटी का नाम बदल गया है, लेकिन पैटर्न को अभी भी बरकरार रखना होगा; भावनाएँ अधिक हल्की-फुल्की होनी चाहिए, लेकिन चरित्र को अभी भी एक ही व्यक्ति के रूप में पहचाना जा सकना चाहिए। जब जनरेशन और संपादन को एक ही मॉडल में डाला जाता है, तो इन बाद की आवश्यकताओं के लिए एक समान संसाधन प्रवेश बिंदु बन जाता है।
हां, Qwen-Image-2.1 पहले से मौजूद फोटोज़ को संसाधित करने का समर्थन करता है।


आधिकारिक रूप से वास्तविक फोटो से आवश्यक सामग्री निकालने और RGBA पारदर्शी चित्र प्राप्त करने का उदाहरण दिया गया है। इसमें A पारदर्शिता चैनल को दर्शाता है, जो चित्र के विभिन्न स्थानों पर पारदर्शिता के स्तर को वर्णित करता है।
दिखाई देता है कि यह क्षमता शून्य से उत्पादन के साथ-साथ मौजूदा चित्रों के पुनः उपयोग को भी कवर करती है। निर्माता पहले फोटो प्रदान कर सकते हैं, और फिर मॉडल से उसमें से आवश्यक विषय को निकालने का अनुरोध कर सकते हैं, जिसे बाद में डिज़ाइन के लिए सामग्री के रूप में उपयोग किया जा सकता है।
पहले, Qwen-Image श्रृंखला ने पारदर्शी छवियों से संबंधित क्षमताओं का परीक्षण करने के लिए एक स्वतंत्र Qwen-Image-Layered लॉन्च किया था। अब, Qwen-Image-2.1 ने मूल पारदर्शी छवि उत्पादन और संपादन को सामान्य छवि मॉडल में एकीकृत किया है, जिससे सुविधा में और वृद्धि हुई है।
अब बहु-चित्र संपादन के लिए सटीक, ओपन-सोर्स AI मॉडल उपलब्ध हैं
जब एक चित्र की आवश्यकता कई वस्तुओं से आती है, तो संपादन कार्य और भी जटिल हो जाता है।
उदाहरण के लिए, यदि एक ही मॉडल पर निर्दिष्ट कपड़े, जूते, बैग और टोपी पहनानी हैं, तो प्रत्येक संदर्भ चित्र का अलग-अलग कार्य होता है, मॉडल को व्यक्ति और उत्पाद को अलग करना होगा, उन्हें उचित स्थान पर रखना होगा, और संभवतः अपने विशेष लक्षणों को बनाए रखना होगा।
Qwen-Image-2.1 अधिकतम 10 रेफरेंस इमेजेस के साथ समर्थन करता है। हमने आजमाया कि ऑटीमैन और डेरियो को बैठकर बात करने के लिए लाया जाए। 7 छवियों का उपयोग किया गया: दो लोगों के सामने-सामने का फोटो (चेहरे का भाव बदलकर), पृष्ठभूमि कमरा, एकल सोफा, कॉफी कप (कॉफी से भरकर), फ्लोर लैंप, इलेक्ट्रिक फायरप्लेस, छोटी मेज, अंततः एक पूर्ण प्रभाव छवि उत्पन्न की गई।

अब अलग-अलग कपड़े पहनने का त्वरित प्रभाव एक व्यक्ति के लिए दिखाया जा सकता है, और आप अब अलग-अलग व्यक्तियों की फोटो को मिलाकर एक साथ की फोटो बना सकते हैं।
तकनीकी रूप से, वे केवल एआई मॉडल को कितनी तस्वीरें इनपुट के रूप में स्वीकार करनी हैं, इसकी ही जांच नहीं करते, बल्कि यह भी देखते हैं कि संदर्भ वस्तुएँ अंतिम छवि में सही स्थान पर हैं, उनका आकार, स्थिति और कुल शैली समन्वयित हैं।
पूरी छवि बन गई है, अब आमतौर पर स्थानीय समायोजन होते हैं।
Qwen-Image-2.1 चयन, स्केच और स्वतंत्र मास्क जैसे तरीके प्रदान करता है, जिससे उपयोगकर्ता संपादन स्थान को अधिक स्पष्ट रूप से व्यक्त कर सकते हैं। उदाहरण के लिए, आप विभिन्न क्षेत्रों को अलग-अलग रंगों से चिह्नित कर सकते हैं और एक ही समय में फोटो में व्यक्ति के कपड़ों को हटाने और बालों का रंग बदलने का अनुरोध कर सकते हैं।

यह इंटरैक्शन स्थानीय स्थिति और पाठ आवश्यकताओं के बीच संबंध स्थापित करता है। बहुत से क्षेत्रों के संपादन के मामले में, उपयोगकर्ता अलग-अलग बता सकते हैं कि कहाँ हटाना है, कहाँ प्रतिस्थापित करना है, और क्या बदलना है।
पेंटिंग विधि नए ऑब्जेक्ट की स्थिति को सीधे चिह्नित करने के लिए उपयुक्त है, लेकिन मूल चित्र पर सीधे घेरा बनाने या पेंट करने से कुछ दृश्य ढक जाता है। इसलिए, मॉडल अतिरिक्त मास्क छवि के माध्यम से संपादन क्षेत्र निर्दिष्ट करने का समर्थन भी करता है, जिससे मूल छवि की जानकारी पूरी तरह से मॉडल में प्रवेश कर सके। व्यक्ति और उत्पादों को शामिल करने वाले डिज़ाइन के लिए, यह संरक्षण क्षमता विशेष रूप से महत्वपूर्ण है।

टेक्स्ट की सटीकता, इमेज की गुणवत्ता
बालों का शैली या पृष्ठभूमि बदलने पर, चित्र में व्यक्ति की मूल पहचान के लक्षण बने रहने चाहिए; उत्पाद के स्थान बदलने पर, पैकेजिंग का टेक्स्ट, टेक्सचर और आकार भी संभवतः समान रहना चाहिए। अन्यथा, भले ही छवि सुंदर लगे, वह मूल प्रदर्शन के कार्य के लिए उपयुक्त नहीं हो सकती। Qwen-Image-2.1 ने चित्रों और उत्पादों के संदर्भ में संपादन की सटीकता पर विशेष ध्यान केंद्रित किया है, और परिणाम काफी अच्छे लगते हैं।
हमने इसे आजमाया, जैसे कि इसे बच्चों की प्राथमिक स्कूल की कक्षा 3 की पुस्तक "सूचना प्रौद्योगिकी, पहला सत्र" के इस पृष्ठ की स्क्रीनशॉट में, DeepSeek का स्वागत है 'मैं DeepSeek , आपसे मिलकर खुशी हुई!」 को 「नमस्ते, मैं आपकी कैसे मदद कर सकता हूँ?」 में बदलें, और डीप थिंकिंग (R1) को नवीनतम संस्करण के डीप थिंकिंग बटन से बदलें, और इसे जलाएँ:

जेनरेट और एडिट के अलावा, Qwen-Image-2.1 ने टेक्स्ट और चरित्रों पर भी प्रदर्शन में सुधार किया है। चाहे वह टेक्स्ट से भरी हुई इमेज वाली पेज, इनफोग्राफिक्स, या रिसर्च पेपर के चित्र हों, सामग्री की सटीकता और लेआउट की सुंदरता में काफी सुधार हुआ है।

चेहरे के हिस्से में, Qwen-Image-2.1 ने प्रकाश और छाया तथा विवरणों के प्रदर्शन को और बेहतर बनाया है। अब AI द्वारा उत्पन्न चित्रों में व्यक्ति के बाल, कपड़ों की बुनावट, चेहरे के विवरण और परिवेश का प्रकाश अधिक समन्वित हैं, और चित्र की बनावट अधिक सूक्ष्म है।
इसके अलावा, यह पैनोरमिक इमेज, इनफोग्राफिक्स, थ्री-व्यू और स्टोरीबोर्ड जनरेशन क्षमताओं में भी बेहतर है, जो स्टैटिक इमेज जनरेशन और एडिटिंग के अनुप्रयोग के क्षेत्र को विस्तारित करता है और किरदार प्रदर्शन, विजुअल प्लानिंग आदि कार्यों के लिए अधिक संभावनाएँ प्रदान करता है। हमने एक प्रयास किया और समुदाय द्वारा बनाए गए Qwen 2D कैरेक्टर का उपयोग करके एक सीरीज़ स्टोरीबोर्ड इलस्ट्रेशन बनाए:

इन क्षमताओं को मिलाकर, Qwen-Image-2.1 एक अधिक सम्पूर्ण छवि प्रसंस्करण श्रृंखला को कवर करता है। अब हम एक AI मॉडल के आधार पर कई कार्य कर सकते हैं: पहले कई संदर्भ छवियों का उपयोग करके दृश्य को संगठित करें, फिर क्षेत्रों में समायोजन करें, जबकि व्यक्तियों और वस्तुओं की मुख्य विशेषताओं को बनाए रखें। केवल 7B विजुअल जनरेशन पैरामीटर वाला एक ओपन-सोर्स AI कितना रीवर्क कम कर सकता है, यह भविष्य के प्रयोगात्मक परीक्षणों में दिलचस्प प्रश्न होगा।
एप्लिकेशन स्पेस कितना है?
Qwen-Image-2.1 के लॉन्च से हमें यह देखने को मिला है कि इमेज मॉडल अब सृजनात्मक प्रक्रिया के अधिक बारीक चरणों को कवर कर रहे हैं, और यह रुझान तेजी से बढ़ रहा है।
पारदर्शी सामग्री के निर्गम, बहु-चित्र संदर्भ, स्थानीय संपादन और विश्वसनीयता क्षमता में सुधार ने AI मॉडल को वास्तविक कार्य प्रवाह में शामिल करने की संभावना बढ़ा दी है। रचनाकारों के लिए, इसका अर्थ है कि अधिक सामग्री निर्माण और समायोजन के कार्यों को अब अधिक सरल तरीके से ओपन-सोर्स इमेज जनरेशन मॉडल पर सौंपा जा सकता है; और विकासकर्ताओं के लिए, नए मॉडल का ओपन-सोर्स होना इन क्षमताओं के आधार पर डिज़ाइन टूल, एप्लिकेशन और कस्टम वर्कफ़्लो बनाने के लिए एक नया आधार प्रदान करता है।
हम यह आशा कर सकते हैं कि Qwen-Image-2.1 जैसे इमेज मॉडल्स के ओपन सोर्स होने के साथ, समुदाय और अधिक कंटेंट बनाने के सीन्स में जनरेशन और एडिटिंग क्षमताओं को एकीकृत करेगा, ताकि अधिक लोग अपनी आवश्यकताओं के अनुसार क्रिएटिव टूल्स का उपयोग कर सकें। जब ये AI क्षमताएँ दैनिक सॉफ्टवेयर में सुलभ हो जाएँ, तो विचार से विजुअल कार्य तक की बाधा फिर से काफी कम हो सकती है।
अभी, Qwen-Image-2.1 के ओपन वेट्स को Hugging Face और ModelScope पर जारी कर दिया गया है, और तकनीकी रिपोर्ट GitHub रिपॉजिटरी पर अपलोड कर दी गई है।
ब्लॉग: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
मॉडल स्कोप: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
यह लेख वेचेन ग्रुप "मशीन इंटेलिजेंस" (ID: almosthuman2014) से आया है, लेखक: ज़ेनान
