ای آئی کی کوڈ لکھنے کی صلاحیت عام طور پر ڈویلپرز کو "ہاتھوں کو کیبورڈ سے الگ کرنے" کی اجازت دیتی ہے، لیکن ڈیزائنرز کے لیے، ای آئی کے جنریٹ کردہ تصاویر کبھی بھی مکمل ڈلیوری تک پہنچنے کے لیے کئی قدم پیچھے رہ جاتی ہیں۔
تصویری ڈیزائن کے عمل میں، کرداروں کو الگ کرنا پڑتا ہے، مواد کو الفاظ تبدیل کرنا پڑتا ہے، اور مختلف مصنوعات کی ترتیب بار بار تبدیل کرنی پڑتی ہے، لیکن پیکیج پر لکھے گئے الفاظ اور بوتل کی شکل تبدیل نہیں ہونی چاہئیں۔ اگر درخواستیں مستقل تبدیل ہوتی رہیں تو مقامی تبدیلیاں جاری رکھنی پڑیں گی تاکہ پوری تصویر میں تناسق برقرار رہے۔
یہ تفصیلات یہ طے کرتی ہیں کہ AI سے تخلیق کی گئی تصاویر حقیقی تخلیقی عمل میں داخل ہو سکتی ہیں یا نہیں۔ ڈیزائنرز، ای کامرس آپریٹرز اور مواد تخلیق کرنے والوں کے لیے، اب تصویری ماڈلز کا بنیادی رکاوٹ یہ ہے کہ ہر ترمیم کے حکم کو کتنی درستگی سے پورا کیا جا سکتا ہے۔
اس ہفتے کے اتوار، علی کووین Qwen-Image-2.1 کو رسمی طور پر اوپن سورس کیا گیا ہے، جو چھوٹے ماڈل کے سائز میں زیادہ تر پیداواری مسائل کو حل کرتا ہے: یہ متن سے تصویر اور تصویر ایڈیٹنگ کو ایک ساتھ حاصل کرتا ہے، شفاف تصاویر کی نیچے سپورٹ فراہم کرتا ہے، زیادہ سے زیادہ 10 ریفرنس تصاویر قبول کرتا ہے، اور لوکل ایڈیٹنگ، چہرہ اور مصنوعات کی فidelit کو مزید بہتر بنایا گیا ہے۔

یہ بن گیا کووین تصویر سیریز کا موجودہ سب سے متوازن اور بہترین قیمت کے حوالے سے دستیاب اوپن سورس ایمیج جنریشن ماڈل۔ علیحدہ جائزہ کے نتائج کے مطابق، Qwen-Image-2.1 نے اوپن سورس ماڈلز میں پہلا مقام حاصل کیا ہے، جس کا اسکور Nano Banana 2.0 سے بھی زیادہ ہے۔ توجہ دیں کہ اس ماڈل کا ویژول جنریشن حصہ صرف 7B پیرامیٹرز پر مشتمل ہے۔
X جیسے پلیٹ فارمز پر، پہلے سے تجربہ کے لیے اہل ہونے والے صارفین نے جنریٹڈ نتائج شیئر کیے ہیں، جن پر لوگوں نے بہت سراہا۔ بہت سارے متن کے ساتھ ایک ایفیکٹ کی تصویر شامل ہے:

حقیقی فوٹو کوالٹی کی تصویر بنائیں:

مختلف فلٹرز اور لائٹنگ اسٹائلز کے ساتھ بھی تجربہ کیا گیا:

لوگوں کا خیال ہے کہ Qwen-Image-2.1 کی ہدایات کی پابندی، کارڈ کھینچنے کی کامیابی اور عملی اثرات سب میں متاثر کن ہیں۔ نئے ماڈل کی صلاحیتوں کے مطابق، ہم اب مواد کی تخلیق، ترکیب اور ترمیم کے عمل کو جوڑ سکتے ہیں اور AI کا استعمال کرتے ہوئے بہت سے پیچیدہ فوٹو ایڈٹنگ مسائل کو حل کر سکتے ہیں۔
کابیلیت اور کارکردگی
بتدریج، Qwen-Image-2.1 کا ویژول جنریشن حصہ 20 لیئرز Single-Stream DiT استعمال کرتا ہے، جس کا پیرامیٹر کا حجم 7B ہے اور یہ 2K کو نیچے سے سپورٹ کرتا ہے۔ اس ماڈل نے ایوانوں کے معیاری ٹیسٹ میں اپنے سائز سے زیادہ کارکردگی دکھائی: Qwen-Image-2.1 کا کل اسکور 60.28 ہے۔ مقابلے میں، Nano Banana 2.0 کا اسکور 59.82 اور GPT Image 1.5 کا اسکور 59.65 ہے۔ یہ ماڈل کئی بند تصویری ماڈلز کے ساتھ مقابلہ کرنے کے قابل ہو چکا ہے۔

Qwen-Image-Bench جائزہ گراف۔
ویژوئل جنریشن کا حصہ صرف 7B پیرامیٹرز پر مشتمل ہے، جس سے اس کی صلاحیت مزید قابل توجہ بن جاتی ہے: یہ چھوٹے جنریشن ماڈیول میں تصویر تخلیق، شفاف مواد تخلیق اور متعدد تصاویر کی ترمیم کی صلاحیتیں ایک ساتھ شامل کرتا ہے (جنریشن اور ترمیم ایک ہی پائپ لائن میں)، جس سے ڈویلپرز کو تصویری ٹولز کو ڈپلوی اور کسٹمائز کرنے کے لیے ایک ہلکا پھلکا آغاز فراہم ہوتا ہے۔
کارکردگی کے علاوہ، Qwen-Image-2.1 نے ماڈل کے استدلال عمل کو بھی بہتر بنایا ہے، جس کا مرکزی خیال غیر ضروری دہرائی گئی حساب کتاب کو کم کرنا ہے۔
ایک تصویر ایڈٹنگ کے دوران، داخل کی گئی ریفرنس تصویر اور ایڈٹنگ ہدایات ہر ایک جنریشن اسٹیپ کے ساتھ تبدیل نہیں ہوتیں۔ اس لیے نیا ماڈل مخلوط رسی کی توجہ ساخت استعمال کرتا ہے، جس میں متن حصہ (سسٹم پریفکس، ایڈٹنگ ہدایات) روایتی ٹوکن لیول کے کاسوئل ماسک کے مطابق ہوتا ہے، جس سے معنائی منطق کی سلسلہ وار سمجھ کو یقینی بنایا جاتا ہے، جبکہ تصویر جنریشن حصہ چنک لیول ماسک استعمال کرتا ہے اور KV کیش کے مکینزم کے ذریعے پہلے اسٹیپ کے حساب کے بعد ان سٹیٹک کنٹیکسٹس کو کیش کر دیا جاتا ہے تاکہ بعد کے جنریشن اسٹیپس میں ان کا استعمال کیا جا سکے۔

اس کا مطلب یہ ہے کہ AI اب حوالہ مواد کو پہلے تیار کرے گا اور مقصدی تصاویر بناتے وقت موجودہ نتائج کو دوبارہ استعمال کرے گا، جس سے متعدد تصاویر کے ان پٹ پر اس کا اثر زیادہ واضح ہوتا ہے اور استدلال کی کارکردگی میں اضافہ ہوتا ہے جبکہ ویڈیو میموری کے استعمال میں کمی آتی ہے۔
چونکہ اب Qwen-Image-2.1 زیادہ سے زیادہ 10 ریفرنس تصاویر کی حمایت کرتا ہے، اس لیے یہ بہتری انتہائی اہم ہو گئی ہے۔ جتنا زیادہ ان پٹ مواد ہوگا، ریفرنس معلومات کو کیسے سنبھالا جائے اور دوبارہ کمپوٹیشن کو کنٹرول کیا جائے، اس کا خاص طور پر خیال رکھنا ضروری ہوگا۔ بالخصوص کتنی مقدار میں وقت اور گرافک میموری بچائی جا سکتی ہے، اس کا تعین ہارڈویئر، درجہ بندی، ریزولوشن اور ان پٹ کی تعداد کے مطابق کیا جانا چاہیے۔
فوری طور پر استعمال کے لیے شفاف سامان بنائیں
نئی ورژن Qwen-Image کی وہ صلاحیت جو ڈیزائن کی ضروریات کے سب سے قریب ہے، وہ شفاف تصویر بنانا ہے۔
عام تصویری مواد عام طور پر مکمل پس منظر کے ساتھ ہوتا ہے۔ اس کے مرکزی عنصر کو پوسٹر، مصنوعات کی تفصیل کے صفحے یا دوسری تصویر میں استعمال کرنے کے لیے، اکثر اسے پہلے الگ کرنا، اس کے کناروں، خالی جگہوں اور کناروں کو ڈھالنا پڑتا ہے۔ شفاف تصاویر میں اضافی شفافیت کی معلومات ہوتی ہیں جو پس منظر کو مرکزی عنصر کے اردگرد یا کچھ حصوں سے نکلنے دیتی ہیں، جس سے بعد میں انہیں اوپر رکھنا اور جوڑنا آسان ہو جاتا ہے۔
Qwen-Image-2.1 شفاف تصویر کی پیداوار کو نیچے سے سپورٹ کرتا ہے، جو پرامپٹ کے مطابق خودکار طور پر عام تصویر یا شفاف تصویر بنانے کا فیصلہ کر سکتا ہے۔ صارفین اپنے عناصر کی وضاحت کرتے وقت شفاف پس منظر کی درخواست کر سکتے ہیں۔ موجودہ نمونوں میں تہوار اسکیچ، شخصی عناصر، سجاؤ کے عناصر، اور متعدد اشیاء پر مشتمل پیچیدہ ترکیبات شامل ہیں، جو ڈیزائن کے کاموں میں عام طور پر درکار عناصر ہیں۔ ہم نے اس کا آزمائش بھی کیا:

ایک اچھی خبر ہے کہ اب ہمیں فوری طور پر استعمال کے قابل مواد مل رہا ہے، جس سے ہمارے کام میں کئی مراحل کم ہو گئے ہیں۔
بالکل، ان شفاف مواد کو تخلیق کے بعد بھی تبدیل کیا جا سکتا ہے۔ مثلاً، ایک ہی اسکیچ کردار کی اظہارِ حالت تبدیل کی جا سکتی ہے، یا تصویر میں موجود متن کا مواد ترمیم کیا جا سکتا ہے۔ ترمیم کا مقصد یا تو کردار کے بصری تفصیلات ہو سکتے ہیں، یا مواد میں موجود متن۔
یہ ڈیزائن کے وقت کی اصل تبدیلی کی ضرورت کے قریب ہے: ایکٹیوٹی کا نام بدل گیا ہے، لیکن ڈیزائن اب بھی برقرار رکھنا ہے؛ ایموجیز زیادہ آرام دہ ہونے چاہئیں، لیکن کردار اب بھی ایک ہی کردار کے طور پر پہچانے جانے چاہئیں۔ جب جنریشن اور ایڈٹنگ ایک ہی ماڈل میں ڈال دی جاتی ہیں، تو ان بعد کی درخواستوں کا ایک یکساں معالجہ ہوتا ہے۔
بالکل، Qwen-Image-2.1 موجودہ تصاویر کو ایڈٹ کرنے کی سہولت فراہم کرتا ہے۔


آفیشل نے حقیقی تصاویر سے درکار مواد نکال کر RGBA ٹرانسپیرنٹ تصویر حاصل کرنے کا مثال پیش کیا ہے۔ اس میں A ٹرانسپیرنسی چینل کو ظاہر کرتا ہے، جو تصویر کے مختلف حصوں کی شفافیت کی درجہ بندی کرتا ہے۔
دیکھا جا سکتا ہے کہ یہ صلاحیت صرف صفر سے تخلیق کے لیے نہیں بلکہ موجودہ تصاویر کے دوبارہ استعمال کو بھی شامل کرتی ہے۔ مصنفین پہلے فوٹو فراہم کر سکتے ہیں اور پھر ماڈل سے درخواست کر سکتے ہیں کہ وہ تصویر میں ضروری عناصر نکالے تاکہ انہیں بعد میں ڈیزائن کے لیے استعمال کیا جا سکے۔
پہلے، Qwen-Image سیریز نے الگ تھلگ Qwen-Image-Layered کو جاری کیا تھا، جس میں شفاف تصاویر کی صلاحیتوں کا جائزہ لیا گیا تھا۔ اب، Qwen-Image-2.1 میں شفاف تصاویر کی اصلی پیداوار اور ایڈٹنگ کو عام تصویر ماڈل میں ادغام کر دیا گیا ہے، جس سے آسانی مزید بڑھ گئی ہے۔
متعدد تصاویر کے ایڈیٹنگ کے لیے درست، اوپن سورس AI ماڈل بھی دستیاب ہو گیا ہے
جب کسی تصویر کی ضرورت کئی اشیاء سے آئے، تو ایڈٹنگ کا کام مزید پیچیدہ ہو جاتا ہے۔
مثلاً، اگر آپ ایک ہی مدل پر مخصوص کپڑے، جوتے، بیگ اور ٹوپی پہننا چاہتے ہیں، تو ہر ریفرنس تصویر کا الگ کردار ہوتا ہے، ماڈل کو افراد اور مصنوعات کو الگ کرنا ہوگا، انہیں مناسب جگہوں پر رکھنا ہوگا، اور ممکنہ حد تک اپنی خصوصیات برقرار رکھنا ہوگا۔
Qwen-Image-2.1 سب سے زیادہ 10 ریفرنس تصاویر کی سپورٹ کرتا ہے۔ ہم نے آزمایا کہ اوٹیمان اور ڈیریو کو بیٹھ کر بات چیت کرنے کے لیے 7 تصاویر استعمال کیں: دو افراد کی مقابلہ والی تصویر (چہرے کا اظہار تبدیل کریں)، پس منظر کا کمرہ، اکیلا سوفا، کافی کا کپ (کافی سے بھر دیا گیا)، فلور لائٹ، بجلی والی چولہہ، اور چھوٹی میز، جس سے آخر میں ایک مکمل اثرات کی تصویر تیار ہوئی۔

اب مختلف کپڑے پہننے کا اثر فوری طور پر کسی کے لیے دکھایا جا سکتا ہے، اور آپ اب مختلف افراد کی الگ تصاویر کو ملائیکر ایک گروپ فوٹو بنا سکتے ہیں۔
ٹیکنیکل طور پر، یہ صرف AI ماڈل کو کتنی تصاویر کا ان پٹ دینا نہیں بلکہ حتمی منظر میں حوالہ اشیاء کے درست موقع، نسبت اور کلیہ سازگاری کو بھی ٹیسٹ کرتے ہیں۔
پوری تصویر کا ترکیب ہو گیا، اب عام طور پر مقامی ایڈجسٹمنٹ کی ضرورت ہوتی ہے۔
Qwen-Image-2.1 صارفین کو ایڈٹ کرنے کے مقام کو زیادہ واضح طور پر ظاہر کرنے کے لیے سرکل، اسکیچ اور الگ ماسک جیسے طریقے فراہم کرتا ہے۔ مثلاً، آپ مختلف رنگوں کا استعمال کرکے مختلف علاقوں کو نشان زد کر سکتے ہیں اور ایک بار میں فوٹو میں شخص کے کپڑوں کو ہٹانے اور بالوں کا رنگ بدلنے کا مطالبہ کر سکتے ہیں۔

یہ تعامل فضائی مقامات اور متن کی درخواستوں کے درمیان مطابقت قائم کرتا ہے۔ متعدد علاقوں کے ساتھ ترمیم کے لیے، صارفین الگ الگ بتا سکتے ہیں کہ کہاں حذف کرنا ہے، کہاں تبدیل کرنا ہے، اور کیا چاہتے ہیں۔
ٹھیک طریقہ نئے آبجیکٹس کی جگہ کو براہ راست نشان زد کرنے کے لیے موزوں ہے، لیکن اصل تصویر پر گول کرنا یا رنگ بھرنا تصویر کے کچھ حصوں کو چھپا دیتا ہے۔ اس لیے، ماڈل اضافی ماسک تصویر کے ذریعہ ایڈٹنگ علاقہ متعین کرنے کی سہولت بھی فراہم کرتا ہے، جس سے اصل تصویر کی مکمل معلومات ماڈل تک پہنچ سکتی ہیں۔ انسانوں اور مصنوعات پر مشتمل ڈیزائن کے لیے یہ صلاحیت خاص طور پر اہم ہے۔

ٹیکسٹ کی درستگی، تصویر کی کوالٹی
بالکل نیا ہیئر اسٹائل یا منظر ہو، چہرے کی اصل شناخت کے خصوصیات برقرار رہنی چاہئیں؛ اگر مصنوعات کو مختلف ماحول میں رکھا جائے، تو پیکیجنگ کا متن، بناوٹ اور شکل بھی جتنی ممکن ہو اسی طرح رہنی چاہئیں۔ ورنہ، چاہے تصویر کتنا ہی خوبصورت کیوں نہ ہو، اسے اصل نمائش کے مقصد کے لیے استعمال نہیں کیا جا سکتا۔ Qwen-Image-2.1 نے چہرے اور مصنوعات کے دو اہم مناظر کی تبدیلی کے دوران اصلیت برقرار رکھنے کی صلاحیت پر زور دیا ہے، جو نتائج کے طور پر کافی اچھے لگ رہے ہیں۔
ہم نے اسے آزمایا، جیسے کہ اسے ابتدائی اسکول کی کتاب "معلوماتی ٹیکنالوجی، تیسری جماعت، پہلا سیمیسٹر" کے اس صفحے کا اسکرین شاٹ لینے کے لیے۔ DeepSeek میں DeepSeek ، میں آپ سے مل کر خوش ہوا!» کو «آپ کیسے ہیں؟ میں آپ کی کس طرح مدد کر سکتا ہوں؟» میں تبدیل کر دیں، اور گہری سوچ (R1) کو نئی ترین نسخہ کے گہری سوچ کے بٹن میں تبدیل کر دیں، اور روشن کر دیں:

تجزیہ اور ترمیم کے علاوہ، Qwen-Image-2.1 نے متن اور کرداروں پر بھی بہتری لائی ہے۔ چاہے وہ متن سے بھرپور تصویری صفحات، انفوگرافکس، یا تحقیقی مقالوں کے لیے تصاویر ہوں، معلومات کی درستگی اور ترتیب کی خوبصورتی دونوں میں قابلِ ذکر بہتری آئی ہے۔

چہرے کے حصے میں، Qwen-Image-2.1 نے روشنی اور تفصیلات کی نمائش کو مزید بہتر بنایا ہے۔ اب AI کے ذریعہ تخلیق کردہ تصاویر میں انسانی بالوں، کپڑوں کی بناوٹ، چہرے کی تفصیلات اور ماحولی روشنی سب مل کر زیادہ ہم آہنگ ہیں اور تصویر کی سطح زیادہ نرم ہو گئی ہے۔
اس کے علاوہ، بہترین پینورامک تصویر، انفوگرافک، تین منظر کی تصویر اور اسکیس بورڈ جنریشن کی صلاحیتیں بھی موجود ہیں، جو سٹیٹک تصویر جنریشن اور ایڈیٹنگ کے заастعواف کو وسعت دیتی ہیں اور کردار کے شو، ویژول پلاننگ جیسے کاموں کے لیے مزید امکانات فراہم کرتی ہیں۔ ہم نے آزمایا کہ کمیونٹی کے ذریعہ تیار کردہ Qwen 2D کردار کا استعمال کرتے ہوئے ایک سیریز اسکیس بورڈ اسٹائل اسکیچز تیار کی جائیں:

ان صلاحیتوں کو مل کر، Qwen-Image-2.1 تصویری پروسیسنگ کے زیادہ مکمل سلسلے کو کور کرتا ہے، اب ہم ایک AI ماڈل کی بنیاد پر بہت سارے کام کر سکتے ہیں: پہلے متعدد ریفرنس تصاویر کا استعمال کرتے ہوئے منظر کو ترتیب دیں، پھر علاقوں میں تبدیلی کریں، جبکہ افراد اور مصنوعات کی اہم خصوصیات کو برقرار رکھیں۔ صرف 7B کے ویژول جنریشن پر مشتمل ایک اوپن سورس AI کس حد تک دوبارہ کام کو کم کر سکتا ہے، یہ بعد کے ٹیسٹ میں دلچسپ سوال ہوگا۔
اپلیکیشن کا اسپیس کتنا ہے؟
Qwen-Image-2.1 کے اطلاق سے ہمیں یہ معلوم ہوا ہے کہ تصویری ماڈلز تخلیقی عمل کے زیادہ تفصیلی اجزاء کو کور کر رہے ہیں، اور یہ رجحان تیزی سے بڑھ رہا ہے۔
شفاف مواد کی پیداوار، متعدد تصاویر کے حوالے، مقامی ترمیم اور وفاداری کی صلاحیتوں میں اضافہ، AI ماڈلز کو عملی عمل کے راستوں میں شامل ہونے کے امکانات بڑھاتا ہے۔ مصنفین کے لیے، اس کا مطلب ہے کہ زیادہ تر مواد کی تیاری اور ترمیم کے کاموں کو اب مزید آسان طریقے سے اوپن سورس جنریٹو ماڈلز پر چھوڑا جا سکتا ہے؛ جبکہ ڈویلپرز کے لیے، نئے ماڈل کا اوپن سورس ہونا، ان صلاحیتوں کے لیے ڈیزائن ٹولز، ایپلیکیشنز اور کسٹم ورک فلوز تعمیر کرنے کے لیے نیا بنیادی ڈھانچہ فراہم کرتا ہے۔
ہم جرات سے پیش گوئی کر سکتے ہیں کہ Qwen-Image-2.1 جیسے تصویری ماڈلز کے اوپن سورس ہونے کے ساتھ، کمیونٹی مزید تخلیقی اور ترمیمی صلاحیتیں مختلف مواد تیار کرنے کے مناظر میں شامل کرے گی، تاکہ زیادہ لوگ اپنی ضروریات کے مطابق تخلیقی ٹولز استعمال کر سکیں۔ جب یہ AI صلاحیتیں روزمرہ کے سافٹ ویئر میں آسانی سے دستیاب ہو جائیں، تو خیال سے ویژوئل کام تک کا راستہ شاید دوبارہ کافی حد تک آسان ہو جائے۔
اب تک، Qwen-Image-2.1 کے کھلے وزن Hugging Face اور ModelScope پر جاری کر دیے گئے ہیں، اور ٹیکنیکل رپورٹ GitHub ریپوزیٹری پر اپ لوڈ کر دی گئی ہے۔
بلاگ: https://qwen.ai/blog?id=qwen-image-2.1
گیٹھب: https://github.com/QwenLM/Qwen-Image-2.1
ماڈل سکوپ: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
ہگنگ فیس: https://huggingface.co/Qwen/Qwen-Image-2.1
یہ مضمون ویچن گروپ "机器之心" (ID: almosthuman2014) سے ہے، مصنف: زینان
