للتو، أصدرت OpenAI GPT-Images-2.5:
تأخير التوليد يقل بنسبة تصل إلى النصف، وتحسين دقة التحرير، وإضافة ميزة إدخال الرسم اليدوي من Sketch، وفصل نماذج السرعة البطيئة والسريعة لأول مرة في واجهة برمجة التطبيقات.

https://x.com/OpenAI/status/2097394956457623964
متوفر لجميع مستخدمي ChatGPT وChatGPT Work وCodex، بما في ذلك الإصدار المجاني.
باستخدام هذا الرقم، يمرّ حوالي 430 مليون صورة يوميًا عبر هذا النظام، ويشمل تحسين السرعة تجربة مستخدم تفوق بكثير تحسينات الميزات العادية.
أعلنت OpenAI عن إجمالي عدد الصور المولدة بواسطة ChatGPT Images وGPT-Image API: 3 مليارات صورة أسبوعيًا.
التجربة التوضيحية مذهلة: لم تعد هناك أحرف صينية مشوهة
ما مدى قوة GPT-Image-2.5؟ دعونا نرى الدليل التوضيحي مباشرة.
تمت إزالة الأحرف الصينية الفوضوية!

هذه صورة مرجعية:

هذه الصورة العتيقة المخرجة:

هل لا تزال تستطيع التمييز بين الصور الحقيقية وصور الذكاء الاصطناعي؟
استخراج الصور المطبوعة القديمة وإعادة ضبطها كصور إلكترونية عالية الدقة، أمر سهل.

هل ترغب في تجربة مظهر الملابس؟ فقط اترك الأمر لـ ChatGPT:
إدخال:

Output:

أدخل الصورة الأصلية، الغطاء مبعثثر:

تم إخراج صورة للبطانية مطوية جيدًا:

تماسك المشهد شديد، ولا توجد أي علامات على الأخطاء.
أصبح أسرع بنسبة 50٪، وتم الإصلاح ليصبح أكثر انتظامًا
الأسرع من حيث السرعة. تشير OpenAI إلى أن التأخير في التوليد ينخفض بنسبة تصل إلى 50% مقارنة بـ Images 2.0.
تم تحسين جودة عرض الإضاءة والملمس في نفس الوقت، كما زادت دقة إعادة إنتاج الموضوع البشري في الصور المرجعية.
التحرير الدقيق يستهدف مشكلة قديمة في أدوات توليد الصور: عندما يطلب المستخدم تعديل جزء معين، يقوم النموذج بتعديل الأجزاء التي لم يُطلب تغييرها أيضًا.
وفقًا لـ OpenAI، يمكن لـ Images 2.5 تعديل المناطق المحددة فقط مع الحفاظ على تكوين العناصر الأخرى في المشهد، والإضاءة، وخصائص الموضوع، مع تحسين ملحوظ في الاستقرار في المشاهد ذات الخلفيات المعقدة والكائنات المتعددة.
يمكن للمستخدمين أيضًا وضع ملاحظات تعليقات مباشرة على الصورة، وتحديد المواقع التي تحتاج إلى تعديل، مع منطق تشغيل مشابه لأدوات التصميم Figma.

الاتساق في التحرير المتعدد هو التحسين الثالث.
عند تعديل نفس الصورة مرارًا وتكرارًا في محادثة طويلة، تبقى نتائج التعديل في الدورات الأولى محفوظة، ولا تنخفض جودة الصورة مع تزايد عدد الدورات.

يقول أكسولتان أليمكولوف، مدير منتج Higgsfield AI، عن Flare:
ما أثار إعجابنا أكثر هو فهمه لما لا يجب تغييره.
قم بتحرير ذي معنى، دون فقدان شخصية الصورة الأصلية وتكوينها وأسلوبها البصري.

Sketch وقوالب: من الكتابة إلى الرسم
على مستوى المنتج، جلب Images 2.5 أربع ميزات جديدة.
للدخول إلى Sketch، اكتب @Sketch في مربع محادثة ChatGPT لفتح لوحة الرسم اليدوي. يقوم المستخدم برسم مسودة، مع إضافة وصف نصي للأسلوب والتفاصيل، ثم يُنشئ ChatGPT الصورة النهائية استنادًا إلى المسودة كمرجع تكويني.
تشمل الأمثلة التي قدمتها OpenAI تحويل مخططات تخطيط الغرف إلى رسومات تصميم داخلي، وتحويل مخططات مOutline الشخصيات إلى رسوم توضيحية. العائق ليس في مهارة الرسم، بل في رسم العلاقات المكانية والنسب التقريبية لتمكين النموذج من فهم بنية الصورة.
القالب يغطي التنسيقات الشائعة مثل الملصقات، صور المنتجات، والمنشورات.
اختر قالبًا، وأدخل المعلومات وتفضيلات الأسلوب، وسيقوم النموذج بإنشاء الصورة وفقًا للهيكل المُعرَّف مسبقًا، مما يوفر عليك تجربة وخطأ كتابة مُحفِّز من الصفر.
اشترك في مشاركة الـ Prompt لتمكين المستخدمين من نشر الـ Prompt الكامل الذي تم إنشاؤه، بحيث يمكن للآخرين إدخال صورهم وتفاصيلهم الخاصة للحصول على نسخة شخصية ضمن نفس الإطار.
تم تداول مُحفّز "صورة شخصية بأسلوب الثمانينيات" على منصات التواصل الاجتماعي، حيث يمكن للمستخدمين رفع صورهم الذاتية للحصول على صور بنفس الأسلوب.

تشير الوظائف الأربع إلى تغيير واحد: عملية تحويل الصورة في العقل إلى صورة لم تعد تعتمد فقط على الكتابة!
Flare و Sunburst: تقسيم API لأول مرة
لمطوري البرمجيات، أطلقت OpenAI بالتزامن مع واجهة برمجة التطبيقات نموذجين للصور: GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst.
تُبرز Flare السرعة وإنشاء الدفعات، وتعتبرها OpenAI الخيار الافتراضي لأغلب التطبيقات.
تشمل السيناريوهات المناسبة المحتوى الاجتماعي، وصور تجربة المنتج، والنماذج الأولية السريعة، وإنتاج الصور بكثافة عالية.
قدم لوكاي لياو من فريق تقييم Manus بيانات أكثر دقة: وصلت سرعة إنتاج الصور الخاصة بـ Flare في اختباراتهم إلى ضعفين إلى أربعة أضعاف سرعة GPT-Image-2، وتحسين إنشاء الخلفيات الشفافة مفيد مباشرة لإنشاء مواد العلامة التجارية والعرض التقديمي وصور الويب التلقائية.

يُوجّه Sunburst نحو تدفقات العمل الإبداعية الفاخرة، حيث يُبادل وقت التوليد الأطول للحصول على تحكم أكثر دقة في التحرير.
السيناريو النموذجي الذي تقدمه OpenAI هو مواد تسويقية جاهزة للعلامة التجارية وصور منتجات محسّنة بدقة.
أكدت Adobe دمج نموذج Images 2.5 في Firefly.
قال مات شوتن، المدير العام المنتجات المتقدمة في Adobe، إن الإصدار 2.5 يوفر سرعة توليد أعلى واتساقًا في الدقة، حيث تظل الصور واضحة وواقعية حتى بعد التحسينات المتعددة.

تقسيم النموذجين يتوافق مع متطلبين: التردد العالي والتأخير المنخفض، والدقة العالية والتخصيص.
Flare تقدم سيناريوهات للحجم العالي، بينما Sunburst تقدم سيناريوهات متميزة، ويمكن للمطورين اختيار ما يناسب أعمالهم دون الحاجة إلى الانتظار لدقة غير مطلوبة.
هذا هو أول تقييم منتج لواجهة برمجة تطبيقات الصور الخاصة بـ OpenAI بناءً على السرعة والجودة، وهو يتماشى مع منهجية التصنيف المستخدمة في واجهة برمجة تطبيقات النماذج اللغوية.
يستمر تسمية Images 2.5 في إيقاع سلسلة منتجات OpenAI للصور: نفس البنية، مع تحسن في السرعة والدقة في الجولة الأولى.
في نهاية عام 2024، استخدم GPT-Image-1.5 نفس النهج.
الفترات بين إصدارَي 0.5 أقل من عام، ويتقارب تكرار تطوير نماذج الصور من تكرار تطوير نماذج اللغة.
هذا أقوى نموذج لإنشاء الصور في العالم، بتفوق كبير.
قد تكون القدرات متعددة الوسائط المتزايدة باستمرار لـ OpenAI وسيلة لمواجهة نماذج Anthropic من خلال تعزيز قدرات مثل استخدام الحاسوب، وبالتالي تعزيز نماذج أساسية مثل GPT-7.
المراجع:
https://openai.com/index/introducing-chatgpt-images-2-5/
هذا المقال من حساب WeChat "سينزي يوان" (ID: AI_era)، المؤلف: ASI Revelation، المحرر: ماكو
