بالکل ابھی، OpenAI نے GPT-Images-2.5 جاری کیا:
لیٹنسی کم سے کم آدھی، ایڈیٹنگ کی درستگی میں بہتری، نئی اسکیچ ہینڈ ڈرائنگ ان پٹ فنکشن شامل کی گئی، API اینڈ پر پہلی بار تیز اور سست ماڈلز الگ کیے گئے۔

https://x.com/OpenAI/status/2097394956457623964
چیٹ جی پی ٹی، چیٹ جی پی ٹی ورک اور کوڈیک کے تمام صارفین کے لیے درکار، مفت ورژن سمیت۔
اس عدد کے مطابق، روزانہ تقریباً 430 ملین تصاویر اس سسٹم سے گزرتی ہیں، جس سے تیزی کا تجربہ عام فنکشنل اپڈیٹس سے کہیں زیادہ وسیع ہے۔
اوپن اے آئی نے چیٹ جی پی ٹی ایمیجز اور جی پی ٹی-ایمیج API کے مجموعی پیداوار کا اعلان کیا: ہفتے میں 3 ارب تصاویر۔
ڈیمو حیرت انگیز: چینی کوڈنگ کا مسئلہ ختم ہو گیا
GPT-Image-2.5 کتنی طاقتور ہے؟ ہم فوراً ڈیمو دیکھتے ہیں۔
چائنیز کوڈ کا مسئلہ ختم ہو گیا ہے!

یہ حوالہ تصویر ہے:

یہ ریٹرو تصویر کا آؤٹ پٹ ہے:

کیا آپ اصل فوٹو اور AI جنریٹڈ تصاویر کے درمیان فرق کر سکتے ہیں؟
پرانی پرنٹ شدہ تصاویر کو نکال کر ہائی ڈیجیٹل تصاویر میں تبدیل کرنا، ایک چھوٹی سی بات ہے۔

کپڑے کا ویژوئل اثر آزمانا چاہتے ہیں؟ صرف ChatGPT پر چھوڑ دیں:
درج کریں

Output:

اصل تصویر درج کریں، کمبل بے ترتیب ہے:

کمبل کو ڈھیلے ڈھیلے ڈالنے کی تصویر درج کی گئی:

بہت زیادہ مطابقت، کوئی غلطی نظر نہیں آتی۔
آدھا وقت کم، تبدیلی سے بے ترتیبی ختم
سب سے زیادہ براہ راست تیزی۔ OpenAI کے مطابق، جنریشن لیٹنس Images 2.0 کے مقابلے میں حداکثر 50% کم ہو گئی۔
روشنی اور ٹیکسچر کی رینڈرنگ کی معیار ایک ساتھ بہتر ہو گیا ہے، اور فوٹو میں شخصیت کی درستی بھی زیادہ ہے۔
درستگی کا اہداف ایک پرانا مسئلہ ہے جس میں صارفین کو مخصوص حصوں میں تبدیلی کی درخواست ہوتی ہے، لیکن ماڈل وہ حصے بھی تبدیل کر دیتا ہے جنہیں چھوڑنا تھا۔
اوپن اے آئی کے مطابق، Images 2.5 صرف مخصوص علاقوں کو تبدیل کر سکتا ہے، جبکہ اسکین کے باقی عناصر کی ترتیب، روشنی اور مرکزی خصوصیات کو برقرار رکھتا ہے، اور پیچیدہ پس منظر اور متعدد موضوعات والے مناظر میں اس کی استحکام میں واضح بہتری آئی ہے۔
صارفین تصویر پر براہ راست تبصرہ نوٹس لگا سکتے ہیں اور تبدیلی کی ضرورت والے حصوں کو گھیر سکتے ہیں، جس کا عمل Figma ڈیزائن ٹول کے قریب ہے۔

تینوں بہتریوں میں سے تیسری بہتری متعدد ایڈٹس کی مطابقت ہے۔
طویل مکالمے میں ایک ہی تصویر کو بار بار تبدیل کرتے وقت، پہلے کئی راؤنڈز کی ترمیمیں برقرار رہتی ہیں اور کوالٹی راؤنڈز کے ساتھ کم نہیں ہوتی۔

ہگزفیلڈ AI کے پروڈکٹ ہیڈ اکسولتان علیمکولوف نے فلیر کے بارے میں کہا:
ہمیں اس کی اس بات کی سمجھ سب سے زیادہ متاثر کرتی ہے کہ کیا نہیں بدلنا چاہیے۔
ایک مفید ایڈیٹ کریں جس سے اصل تصویر کا کردار، ترتیب اور ویژوئل انداز ضائع نہ ہو۔

اسکیچ اور ٹیمپلیٹس: ٹائپ کرنے سے ڈرائنگ تک
پروڈکٹ لیول پر، Images 2.5 چار نئے فیچرز لاتا ہے۔
اسکیچ کا انٹری ChatGPT چیٹ باکس میں @Sketch ٹائپ کرکے کیا جاتا ہے، جس سے ہینڈڈرائنگ پینل کھل جاتا ہے۔ صارف ایک سکیچ بناتا ہے، اور اس کے ساتھ انداز اور تفصیلات کا متنی تفصیل دیتا ہے، جس کے بعد ChatGPT سکیچ کو کمپوزیشن کے حوالے سے استعمال کرتے ہوئے ایک مکمل تصویر تیار کرتا ہے۔
اوپن اے آئی کے مثالوں میں کمرے کے منصوبے کے اسکیچ سے اندر کی ڈیزائن رینڈرنگ، اور شخصیت کے اسکیچ سے ایلوسٹریشن بنانا شamil ہے۔ رکاوٹ تکنیکی مہارت نہیں بلکہ فضا کے تعلقات اور تقریبی تناسب کو ظاہر کرنا ہے تاکہ ماڈل تصویر کی ساخت سمجھ سکے۔
ٹیمپلیٹس پوسٹر، پروڈکٹ ایمجز، فلیرز جیسے اکثر استعمال ہونے والے فارمیٹس کو کور کرتے ہیں۔
ایک ٹیمپلیٹ منتخب کریں، معلومات اور انداز کی ترجیحات درج کریں، مدل پیش گئی ساخت کے مطابق تصویر تیار کرے گا، جس سے صفر سے پرامپٹ لکھنے کی غلطیوں کا اجرا نہیں ہوتا۔
پرومپٹ شیئر کریں تاکہ صارفین اپنی تخلیق کردہ تصویر کا مکمل پرومپٹ شیئر کر سکیں، جس سے دوسرے اپنی تصاویر اور تفصیلات کے ساتھ اسی فریم ورک میں اپنا ذاتی ورژن تخلیق کر سکیں۔
ایک "80s ریٹرو پورٹریٹ" پرامپٹ سوشل میڈیا پر وائرل ہو چکا ہے، جس میں صارفین اپنی خود کی تصویر اپ لوڈ کرکے اسی انداز کی تصویر حاصل کر سکتے ہیں۔

چار فنکشنز ایک ہی تبدیلی کی طرف اشارہ کرتے ہیں: ذہن میں تصویر بنانے کا عمل اب صرف ٹائپ کرنے پر منحصر نہیں رہا!
فلیئر اور سنبرسٹ: API کا پہلی بار تقسیم ہونا
ڈیولپرز کے لیے، OpenAI نے API کے ساتھ دو تصویری ماڈلز جاری کیے ہیں: GPT-Image-2.5 Flare اور GPT-Image-2.5 Sunburst.
فلیئر کی خصوصیت تیزی اور جمعی پیداوار ہے، اور اوپن اے آئی اسے زیادہ تر ایپلیکیشنز کے لیے ڈیفالٹ منتخب کے طور پر پیش کرتا ہے۔
اس کا استعمال سوشل مواد، پروڈکٹ تجربہ کی تصاویر، تیز نمونے اور اکثر تصاویر بنانے کے لیے کیا جا سکتا ہے۔
مانوس کے جائزہ ٹیم کے لکی لیاو نے مزید تفصیلی ڈیٹا فراہم کیا: فلیر کے ان کے ٹیسٹ میں تصویریں GPT-Image-2 کے 2 سے 4 گنا تیزی سے تیار ہو رہی ہیں، اور شفاف پس منظر کی پیداوار میں بہتری پروگرامیٹک طور پر برانڈ مادہ، پریزنٹیشنز اور ویب سائٹ کے تصاویر کے لیے ب безرکھت ہے۔

سنبرسٹ لو-انڈ کریٹوو ورک فلو کو ہدف بناتا ہے، جہاں زیادہ تفصیلی ایڈٹنگ کنٹرول کے لیے زیادہ وقت کا استعمال کیا جاتا ہے۔
اوپن اے آئی کی طرف سے دی گئی مثالی صورتحال برانڈ مارکیٹنگ کے لیے تیار مواد اور بہترین شدہ مصنوعات کی تصاویر ہیں۔
ایڈوب نے فائرفلی میں ایمیجز 2.5 ماڈل کو شامل کرنے کی تصدیق کر دی ہے۔
ایڈوب کے پروڈکٹ کے سینئر ڈائریکٹر میٹ چوٹن نے کہا کہ ورژن 2.5 تیز تر جنریشن اور ریزولوشن کی ایک جیسی صلاحیت لاتا ہے، جس سے تصاویر متعدد بار تفصیل کے بعد بھی واضح اور حقیقی محسوس ہوتی ہیں۔

دو ماڈلز کی تقسیم دو ضروریات کے مطابق ہے: اعلیٰ فریکوئنسی اور کم لیٹنسی، اور اعلیٰ درجہ کی کسٹمائزیشن۔
فلیئر، اسکیل کے سیناریوز کے لیے ہے، سنبرسٹ، کوالٹی سیناریوز کے لیے ہے، ڈویلپرز اپنی ضروریات کے مطابق منتخب کر سکتے ہیں اور جو درجہ بندی نہیں استعمال کرتے، ان کو اس کا انتظار نہیں کرنا پڑتا۔
یہ OpenAI تصویر API کا پہلا مرحلہ ہے جس میں فیس اور معیار کے لحاظ سے مصنوعات کو درجہ بندی کی گئی ہے، جو لینگویج ماڈل API کے گریدنگ کے منطق کے ساتھ مسلسل ہے۔
Images 2.5 کا نام OpenAI کی تصویری مصنوعات کی رفتار کو جاری رکھتا ہے: ارکٹیکچر وہی رہتا ہے، جبکہ رفتار اور درستگی پہلے سفر پر نکل جاتی ہیں۔
2024 کے آخر میں GPT-Image-1.5 اسی طریقہ کار کا استعمال کرتا تھا۔
دو .5 ورژن کے درمیان ایک سال سے کم کا فاصلہ ہے، جس سے ظاہر ہوتا ہے کہ تصویری ماڈلز کی ترقی کی رفتار زبانی ماڈلز کے مطابق ہو رہی ہے۔
یہ دنیا کا سب سے طاقتور تصویر بنانے والا ماڈل ہے، جو کہ بہت زیادہ آگے ہے۔
اوپن اے آئی کی لگاتار بہتر ہونے والی بہ متھڈ کابیلیٹیز، ایتھرک کے ماڈلز کے مقابلے میں کمپیوٹر استعمال کی صلاحیت سمیت GPT-7 جیسے بنیادی ماڈلز کی صلاحیت کو بڑھانے کا احتمال ہے۔
حوالہ جات:
https://openai.com/index/introducing-chatgpt-images-2-5/
یہ مضمون ویچن گروپ "نیوزی یوان" (ID: AI_era) سے ماخوذ ہے، مصنف: ASI وحی، ایڈیٹر: مارکو
