غالبًا ما تمكن قدرة الذكاء الاصطناعي على كتابة الكود المطورين من "رفع أيديهم عن لوحة المفاتيح"، لكن الصور التي يُنتجها الذكاء الاصطناعي للمصممين لا تزال تفتقد خطوات عديدة لتكون جاهزة للتسليم.
في سير عمل تصميم الصور، يجب قص الشخصيات، وتعديل النصوص على المواد، وضبط ترتيب المنتجات المختلفة بشكل دوري، لكن النصوص على العبوة وشكل الزجاجة لا يجب أن تتغير. إذا استمرت الطلبات في التعديل، يجب مواصلة تعديل الأجزاء المحلية للحفاظ على تناسق الصورة بأكملها.
هذه التفاصيل تحدد ما إذا كان يمكن لنموذج توليد الصور بالذكاء الاصطناعي الدخول إلى عملية الإبداع الحقيقية. بالنسبة للمصممين ومشغلي التجارة الإلكترونية وصانعي المحتوى، فإن العقبة الحالية لنموذجات الصور تكمن في قدرة كل تعليمات تعديل مقدمة على التنفيذ بدقة.
الأحد هذا الأسبوع، علي Qwen إطلاق نموذج توليد الصور Qwen-Image-2.1 كمصدر مفتوح رسميًا، حيث يحل مشكلات الإنتاجية الرئيسية بحجم نموذج صغير: فهو يحقق دمج توليد الصور من النص وتحرير الصور، ويدعم بشكل أصلي توليد الصور الشفافة، ويمكنه استقبال ما يصل إلى 10 صور مرجعية، كما عزز بشكل إضافي التحرير الموضعي ودقة الصور البشرية والمنتجات.

لقد أصبح Qwen يُعدّ هذا الطراز المرئي المفتوح المصدر الأكثر توازنًا وأفضل قيمة مقابل السعر حاليًا. أظهرت نتائج التقييمات العامة أن Qwen-Image-2.1 احتل المرتبة الأولى بين النماذج المفتوحة المصدر، حيث تجاوزت درجته حتى Nano Banana 2.0. يجب ملاحظة أن عدد معلمات الجزء الخاص بإنشاء الصور في هذا الطراز لا يتجاوز 7B فقط.
على منصات مثل X، نشر المستخدمون الذين حصلوا مسبقًا على حق التجربة نتائج التوليد، فلاقت إشادة كبيرة. هناك لقطات شاشة تحتوي على محتوى نصي كبير:

إنشاء صور بجودة صور حقيقية:

كما تم تجربة مجموعة متنوعة من الفلاتر وأساليب الإضاءة:

يُعتقد أن Qwen-Image-2.1 مثير للإعجاب في اتباع الأوامر، ونجاح سحب البطاقات، والنتائج العملية. بناءً على قدرات النموذج الجديد، يمكننا الآن دمج سير العمل لإنشاء المواد ودمجها وتعديلها لحل العديد من مشكلات تحرير الصور المعقدة باستخدام الذكاء الاصطناعي.
القدرة والكفاءة
وفقًا للإفادة، يستخدم الجزء المرئي لإنشاء Qwen-Image-2.1 DiT بتدفق واحد مكون من 20 طبقة، بحجم معلمات قدره 7B، ويدعم بشكل أصلي دقة 2K. حقق هذا النموذج أداءً يفوق حجمه في معايير التقييم: بلغ إجمالي درجة Qwen-Image-2.1 60.28. بالمقارنة، بلغت درجة Nano Banana 2.0 59.82، ودرجة GPT Image 1.5 59.65. وقد أصبح قادرًا الآن على المنافسة مع عدة نماذج صورية مغلقة المصدر.

مخططات تقييم Qwen-Image-Bench.
يحتوي جزء التوليد البصري على 7 مليار معلمة فقط، مما يجعل هذا المستوى من القدرة أكثر إثارة للإعجاب: فهو يجمع بين قدرات توليد الصور، وتوليد العناصر الشفافة، وتحرير الصور المتعددة (خط أنابيب موحد للإنشاء والتحرير)، ويوفر نقطة بداية أخف وزناً للمطورين لنشر وتخصيص أدوات الصور.
في الوقت نفسه الذي تقدم فيه Qwen-Image-2.1 أداءً جيدًا، تم تحسين عملية الاستدلال الخاصة بالنموذج، حيث يكمن الفكرة الأساسية في تقليل الحسابات المتكررة غير الضرورية.
في عملية تحرير صورة، لا تتغير الصورة المرجعية المدخلة وتعليمات التحرير مع كل خطوة توليد. لذلك، يستخدم النموذج الجديد بنية انتباه بمستويات دقة مختلطة: ففي الجزء النصي (البادئة النظامية وتعليمات التحرير)، تتبع تعليمات التشفير التقليدية لقناع السببية على مستوى الرموز، وتُحسب تسلسليًا بكلمة تلو الأخرى لضمان اتساق الفهم الدلالي، بينما يستخدم جزء توليد الصورة قناعًا على مستوى الكتلة (Chunk)، ويُخزن السياق الثابت هذا بعد الحساب الأولي عبر آلية KV Cache لاستخدامه في خطوات التوليد اللاحقة.

هذا يعني أن الذكاء الاصطناعي سيقوم الآن بمعالجة المواد المرجعية أولاً، ثم يستخدم النتائج الموجودة أثناء إنشاء الصورة المستهدفة خطوة بخطوة، ويتضح تأثير هذا التحسين بشكل أكبر عند وجود مدخلات صور متعددة، مما يساعد على تحسين كفاءة الاستدلال وتقليل استهلاك ذاكرة الرسومات.
بما أن Qwen-Image-2.1 تدعم الآن ما يصل إلى 10 صور مرجعية، فإن هذا التحسين يصبح حاسمًا. كلما زادت غنى المحتوى المدخل، أصبح من الأهمية بمكان كيفية معالجة المعلومات المرجعية والتحكم في الحسابات المتكررة. أما بالنسبة للوقت والذاكرة التي يمكن توفيرها بالضبط، فسيتعين تحديدها بناءً على العتاد والدقة والدقة والعدد المدخل.
قم بإنشاء مواد شفافة جاهزة للاستخدام
أقوى قدرة في الإصدار الجديد Qwen-Image تتماشى مع متطلبات التصميم هي توليد الصور الشفافة.
غالبًا ما تحتوي مواد الصور العادية على خلفية كاملة. لاستخدام العنصر الرئيسي منها في منشورات أو صفحات تفاصيل المنتج أو صورة أخرى، غالبًا ما يتطلب ذلك أولاً استخراج العنصر ومعالجة الحواف والشقوق. تحتوي الصور الشفافة على معلومات شفافية إضافية تسمح للخلفية بالظهور من حول العنصر أو من بعض المناطق، مما يسهل التراكب والدمج اللاحق.
يدعم Qwen-Image-2.1 إنشاء الصور الشفافة بشكل أصلي، ويمكنه تلقائيًا تحديد ما إذا كان سيتم إنشاء صورة عادية أو صورة شفافة بناءً على التعليمات، حيث يمكن للمستخدم طلب خلفية شفافة أثناء وصف العناصر. تشمل الأمثلة المعروضة حاليًا رسومًا احتفالية، وعناصر بشرية، وعناصر زخرفية، بالإضافة إلى مجموعات معقدة مكونة من عدة كائنات، وهي جميعها احتياجات شائعة في أعمال التصميم. لقد حاولنا أيضًا:

هذا خبر رائع للمبدعين، حيث يمكننا الآن الحصول على مواد جاهزة للاستخدام، مما يقلل من خطوات العمل بشكل مباشر.
بالطبع، يمكن تعديل هذه المواد الشفافة بعد إنشائها. على سبيل المثال، يمكن تعديل تعبيرات نفس الشخصية المصورة، أو تغيير محتوى النص في الصورة. يمكن أن يكون الكائن المُحرَّر تفاصيل بصرية للشخصية أو النص الموجود في المادة.
هذا يقترب جدًا من متطلبات التعديل الأصلية عند التصميم: تم تغيير اسم النشاط، لكن النمط لا يزال بحاجة إلى الاحتفاظ به؛ يجب أن تكون التعبيرات أكثر استرخاءً، مع الحفاظ على أن الشخصيات لا تزال قابلة للتعرف كنفس الشخصية. بعد دمج التوليد والتحرير في نموذج واحد، أصبحت هذه المتطلبات اللاحقة لديها نقطة دخول موحدة للتعامل معها.
بالطبع، يدعم Qwen-Image-2.1 معالجة الصور الموجودة.


قدمت الشركة مثالًا على استخراج المحتوى المطلوب من صور حقيقية للحصول على صورة شفافة بتنسيق RGBA. يمثل الحرف A قناة الشفافية، والتي تُستخدم لوصف درجة الشفافية في مختلف أجزاء الصورة.
ي可以看出 أن هذه القدرة تخدم كلًا من الإنشاء من الصفر وإعادة استخدام الصور الموجودة. يمكن للمبدعين أولاً تقديم صورة، ثم طلب من النموذج استخراج العناصر المطلوبة منها كمواد لتصميمات لاحقة.
سابقًا، أُطلقت سلسلة Qwen-Image بنسخة مستقلة تُدعى Qwen-Image-Layered لاستكشاف القدرات المتعلقة بالصور الشفافة. أما في Qwen-Image-2.1، فقد تم دمج إنشاء وتحرير الصور الشفافة الأصلية داخل نموذج الصور العام، مما يعزز الراحة بشكل أكبر.
تم تطوير نموذج ذكاء اصطناعي دقيق ومفتوح المصدر مطلوب لتحرير الصور المتعددة
عندما يأتي طلب صورة من عدة كيانات، يصبح المهمة التحريرية أكثر تعقيدًا.
على سبيل المثال، إذا أردت وضع ملابس وأحذية وحقائب وقبعات محددة على نفس العارض، فكل صورة مرجعية لها وظيفة مختلفة، ويجب على النموذج التمييز بين الشخص والمنتج، ووضعهما في المواقع المناسبة، والحفاظ على خصائصهما قدر الإمكان.
يدعم Qwen-Image-2.1 ما يصل إلى 10 صور مرجعية كإدخال. جربنا ذلك، وجعلنا أوتمان وداريو يجلسان للحديث. استخدمنا 7 صور: صورة لشخصين يواجهان بعضهما البعض (تغيير التعبير)، غرفة الخلفية، كرسي فردي، كوب قهوة (مملوء بالقهوة)، مصباح أرضي، موقد جداري كهربائي، طاولة منخفضة، وأنتجنا في النهاية صورة نهائية متكاملة.

يمكن الآن أيضًا بسرعة عرض تأثير ارتداء ملابس مختلفة على شخص واحد، كما يمكنك الآن دمج صور فردية مختلفة لتكوين صورة جماعية.
تقنيًا، فإنها لا تختبر فقط عدد الصور التي يمكن لنموذج الذكاء الاصطناعي معالجتها، بل أيضًا ما إذا كانت العناصر المرجعية يمكن أن ت ocupy مواقعها المناسبة في المشهد النهائي، مع التوافق في النسب والموقع والأسلوب العام.
تم تكوين الصورة العامة، وعادةً ما يتبع ذلك تعديلات جزئية.
يوفر Qwen-Image-2.1 طرقًا مثل التحديد والتمييز والقناع المستقل، مما يسمح للمستخدمين بتحديد مواقع التحرير بدقة أكبر. على سبيل المثال، يمكنك استخدام ألوان مختلفة لتحديد مناطق مختلفة، وطلب تعديل واحد يزيل في نفس الوقت ملابس الشخص في الصورة ويغير لون الشعر.

هذا التفاعل ينشئ علاقة متطابقة بين المواقع المكانية ومتطلبات النص. بالنسبة للتحرير الذي يشمل مناطق متعددة، يمكن للمستخدم تحديد المواقع التي تحتاج إلى الحذف، والمواقع التي تحتاج إلى الاستبدال، وما الذي يرغب في تغييره إليه.
طريقة التظليل مناسبة للإشارة المباشرة إلى مواقع الكائنات الجديدة، لكن التحديد أو التظليل المباشر على الصورة الأصلية قد يغطي جزءًا من المشهد. ولذلك، يدعم النموذج أيضًا تحديد منطقة التحرير من خلال صورة قناع إضافية، مما يسمح بإدخال معلومات الصورة الأصلية بشكل كامل إلى النموذج. هذه القدرة على الحفاظ على المعلومات حاسمة خاصةً للتصميمات التي تحتوي على أشخاص ومنتجات.

دقة النص وجودة الصورة
حتى مع تغيير تسريحة الشعر أو المشهد، يجب أن تحتفظ الصورة البشرية بسمات هويتها الأصلية؛ وحتى مع تغيير بيئة عرض المنتج، يجب أن تظل النصوص والقوام والأشكال على العبوة متسقة قدر الإمكان. وإلا، فحتى لو كانت الصورة جميلة، فقد لا تكون مناسبة للمهمة العرضية الأصلية. يركز Qwen-Image-2.1 على قدرات التحرير الدقيقة في سياق الصور البشرية والمنتجات، ويبدو أن النتائج جيدة جدًا.
حاولنا ذلك، على سبيل المثال، لجعله يلتقط لقطة شاشة من هذه الصفحة في كتاب "تكنولوجيا المعلومات للصف الثالث الابتدائي، المجلد الأول"، DeepSeek مرحبًا، أنا DeepSeek ، يسعدني لقاؤك!» إلى «مرحبًا، كيف يمكنني مساعدتك؟»، ثم قم بتحديث زر التفكير العميق (R1) إلى أحدث إصدار، وقم بتفعيله:

بالإضافة إلى التوليد والتحرير، تحسّن Qwen-Image-2.1 أيضًا في التعامل مع النصوص والشخصيات. تم تحسين دقة المحتوى وجمال التنسيق بشكل ملحوظ في صفحات تحتوي على نصوص كثيفة، أو رسوم بيانية، أو صور توضيحية لأوراق بحثية.

في الجزء الخاص بالصور البشرية، عززت Qwen-Image-2.1 بشكل إضافي تمثيل الإضاءة والتفاصيل. الآن، تصبح الصور التي يولدها الذكاء الاصطناعي، سواءً من حيث شعر الشخص، أو نسيج الملابس، أو تفاصيل الوجه، أو إضاءة البيئة، أكثر انسجامًا، مع تحسّن ملحوظ في جودة السطح.
بالإضافة إلى ذلك، هناك قدرات محسّنة لإنشاء صور بانورامية، ورسوم بيانية، ورسوم من ثلاث زوايا، ورسوم تسلسلية، والتي توسع نطاق تطبيقات توليد وتحرير الصور الثابتة، وتوفر مزيدًا من الإمكانيات لمهمات عرض الشخصيات والتخطيط البصري. جربنا استخدام صور شخصيات Qwen التي أنشأها المجتمع لإنشاء سلسلة من الرسوم التسلسلية:

تجمع هذه القدرات معًا لجعل Qwen-Image-2.1 يغطي سلسلة معالجة الصور بشكل أكثر شمولاً، حيث يمكننا الآن إنجاز عدد كبير من المهام بناءً على نموذج واحد للذكاء الاصطناعي: أولاً، تنظيم المشهد باستخدام صور مرجعية متعددة، ثم تعديل المناطق مع الحفاظ قدر الإمكان على السمات الأساسية للأشخاص والمنتجات. سيكون من المهم ملاحظة مدى تقليل إعادة العمل من قبل نموذج ذكاء اصطناعي مفتوح المصدر يحتوي فقط على 7B من وحدات التوليد البصري في الاختبارات العملية القادمة.
What is the scope of the application?
إطلاق Qwen-Image-2.1 يُظهر أن نماذج الصور تغطي مزيدًا من التفاصيل في عملية الإبداع، وهذا الاتجاه يتسارع بشكل متزايد.
زيادة قدرات إخراج المواد الشفافة، والمرجعية المتعددة للصور، والتحرير الجزئي، وتحسين الدقة، تزيد من احتمالية دمج نماذج الذكاء الاصطناعي في سير العمل الفعلي. بالنسبة للمبدعين، يعني ذلك أن المزيد من مهام إنشاء وتعديل المواد يمكن تسليمها الآن إلى نماذج إنتاج الصور المفتوحة المصدر بطريقة أبسط؛ أما بالنسبة للمطورين، فإن فتح نموذج جديد للجمهور يوفر أساسًا جديدًا لبناء أدوات تصميم وتطبيقات وسير عمل مخصصة تستند إلى هذه القدرات.
يمكننا التنبؤ بثقة أنه مع فتح مصادر نماذج الصور مثل Qwen-Image-2.1، سيقوم المجتمع بدمج قدرات التوليد والتحرير في المزيد من سيناريوهات إنشاء المحتوى، مما يمكّن المزيد من الأشخاص من استخدام أدوات إبداعية تلبي احتياجاتهم. عندما تصبح هذه القدرات الذكية الاصطناعية ميزة متاحة بسهولة في البرامج اليومية، قد تنخفض الحواجز بين الفكرة والعمل البصري مرة أخرى بشكل كبير.
تم نشر الأوزان المفتوحة لـ Qwen-Image-2.1 على Hugging Face وModelScope، وقد تم رفع تقرير التقني على مستودع GitHub.
المدونة: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
نطاق النموذج: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
هذا المقال من حساب ويشات الرسمي "ماشين سينس" (ID: almosthuman2014)، الكاتب: زينان
