هل يمكن تحقيق السرعة والسعر معًا، يصبح ساحة تنافس جديدة لنماذج الصور التوليدية.مؤلف المقال، المصدر: AIBase
خلفية النشر
أطلقت مايكروسوفت رسميًا في سبتمبر النسخة المخففة من نموذجها المصمم ذاتيًا لتوليد الصور MAI-Image-2.6-Flash، وقد فُتحت مراجعتها العامة عبر Microsoft Foundry. كنسخة عالية الكفاءة من MAI-Image-2.6 الذي صعد إلى صدارة القوائم التقنية الشهر الماضي، يُعد إطلاق هذا النموذج علامة بارزة على انتشار مايكروسوفت الشامل في مجال توليد الصور بالذكاء الاصطناعي لاستهداف تطبيقات صناعية تتطلب تزامنًا عاليًا وتأخيرًا منخفضًا وحساسية للتكلفة.
Performance
أظهرت بيانات الاختبار أن سرعة توليد الصور لـ MAI-Image-2.6-Flash تصل إلى 2.8 ضعف سرعة GPT-Image-2-Medium، مع تحسين كفاءة شاملة بنسبة 72%. وفي الوقت نفسه الذي تُقلل فيه هذه النسخة بشكل كبير من تأخير الاستنتاج والتكلفة الحسابية، فإنها تحتفظ بكامل قدرات النموذج الرئيسي في التوليد والتحرير، وتدعم توليد الصور من النص بدقة عالية وتحرير الصور على مستوى الكائنات المحلية.
ترقية البنية التحتية
بالإضافة إلى ذلك، جلب سلسلة MAI-Image-2.6 بشكل عام عدة ترقيات على مستوى البنية، بما في ذلك دعم ما يصل إلى خمس صور مرجعية لضمان الاتساق في الشخصيات والمنتجات متعددة الصور، وتكامل وظيفة التحديد الشبكي مع Bing لتعزيز معلومات الصور من العالم الحقيقي، بالإضافة إلى دعم أصيل جديد لنسب العرض والارتفاع الديناميكية وإخراج دقة أعلى.
في استراتيجية التسعير التجارية، انخفض سعر كل مليون توكن للإدخال النصي والإدخال الصوري والإخراج الصوري في الإصدار Flash إلى 1.75 دولار و2.50 دولار و19 دولارًا على التوالي، مما يمثل تخفيضًا كبيرًا يزيد عن 50٪ مقارنة بالنموذج الرئيسي.
توصي مايكروسوفت باستخدام النموذج الرئيسي في التصاميم التجارية وإنتاج الأصول النهائية التي تتطلب جودة صورة وعرض نصوص عالية، بينما يُركز الإصدار Flash بدقة على التطبيقات التفاعلية، والتكثيف السريع للإبداع، وعمليات الأتمتة الواسعة النطاق. وتعكس هذه المصفوفة النماذج متعددة الوسائط التي توازن بين الأداء الفائق والقيمة الممتازة، الاتجاه الصناعي الحالي المتمثل في انتقال الذكاء الاصطناعي التوليدي من اختراق تقني فردي نحو التحول الهندسي عالي الإنتاجية ومنخفض التكلفة.
