OpenAI ने तेज़ जनरेशन और बेहतर संपादन के साथ GPT-Image-2.5 लॉन्च किया

icon MarsBit
साझा करें
AI summary iconसारांश
OpenAI ने GPT-Image-2.5 लॉन्च किया है, जो तेज़ जनरेशन और सुधारी हुई संपादन सुविधाएँ प्रदान करता है। नया संस्करण अब तक 50% तेज़ है और एक स्केच इनपुट मोड जोड़ता है। API उपयोगकर्ता अब गति के लिए Flare और गुणवत्ता के लिए Sunburst के बीच चयन कर सकते हैं। चीनी पाठ प्रदर्शन की समस्याएँ ठीक कर दी गई हैं, और आसानी से सृजन के लिए टेम्पलेट उपलब्ध हैं। यह अपडेट BTC अपडेट के साथ आया है और आगामी समय में नए टोकन की सूचीबद्धता की ओर संकेत करता है।

अभी-अभी, OpenAI ने GPT-Images-2.5 जारी किया:

लेटेंसी अधिकतम आधी हो गई, संपादन की सटीकता में सुधार हुआ, स्केच हस्तलिखित इनपुट सुविधा जोड़ी गई, API एंड पर पहली बार तेज और धीमे मॉडल अलग किए गए।

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

ChatGPT, ChatGPT Work और Codex के सभी उपयोगकर्ताओं के लिए उपलब्ध, फ्री वर्जन सहित।

इस संख्या के अनुसार, दिनभर में लगभग 43 करोड़ छवियाँ इस प्रणाली से होकर गुजरती हैं, और उत्पादन में तेजी लाने का अनुभव सामान्य फ़ंक्शन अपग्रेड से कहीं अधिक व्यापक है।

OpenAI ने ChatGPT Images और GPT-Image API के कुल जनरेशन की घोषणा की: हफ्ते में 3 बिलियन तस्वीरें।

डेमो शानदार है: चीनी विकृत टेक्स्ट अब मौजूद नहीं है

GPT-Image-2.5 वास्तव में कितना शक्तिशाली है? आइए सीधे डेमो देखें।

चीनी विकृत वर्ण अब गायब हो चुके हैं!

GPT-Image-2.5

यह संदर्भ चित्र है:

GPT-Image-2.5

यह आउटपुट का पुराना चित्र है:

GPT-Image-2.5

क्या आप अभी भी वास्तविक फोटो और AI द्वारा बनाई गई तस्वीरों के बीच अंतर कर सकते हैं?

प्रिंट की गई पुरानी फोटो को निकालकर हाई-डी इलेक्ट्रॉनिक फोटो में रीसेट करना आसान है।

GPT-Image-2.5

कपड़े के विजुअल इफेक्ट को ट्राई करना चाहते हैं? इसे सीधे ChatGPT पर छोड़ दें:

इनपुट:

GPT-Image-2.5

Output:

GPT-Image-2.5

मूल चित्र डालें, बिस्तर बिखरा हुआ:

GPT-Image-2.5

बिस्तर को तह करके दिखाने वाली तस्वीर निकाली गई:

GPT-Image-2.5

Extremely consistent scene, no visible continuity errors.

आधा तेज़, बदला नहीं बिखरा

सबसे सीधा तरीका है गति में वृद्धि। OpenAI द्वारा दिए गए आंकड़ों के अनुसार, जनरेशन लेटेंसी Images 2.0 की तुलना में अधिकतम 50% तक कम हो गई है।

प्रकाश और बुनावट की रेंडरिंग गुणवत्ता एक साथ सुधारी गई है, और फोटो में व्यक्ति के प्रतिनिधित्व की सटीकता भी अधिक है।

प्रिसिजन एडिटिंग एक पुरानी समस्या को सुलझाती है: जब उपयोगकर्ता किसी लोकल हिस्से को बदलने के लिए कहता है, तो मॉडल उन भागों को भी बदल देता है जिन्हें बदलने के लिए नहीं कहा गया था।

OpenAI के अनुसार, Images 2.5 निर्दिष्ट क्षेत्र को केवल संशोधित कर सकता है, जबकि दृश्य के शेष तत्वों की संरचना, प्रकाश और मुख्य विशेषताओं को बनाए रखता है, और जटिल बैकग्राउंड और बहु-विषय स्थितियों में स्थिरता में स्पष्ट सुधार हुआ है।

उपयोगकर्ता चित्र पर सीधे टिप्पणी लेबल लगा सकते हैं और संशोधन की आवश्यकता वाले स्थानों को घेर सकते हैं, जिसका ऑपरेशन डिज़ाइन टूल Figma के समान है।

GPT-Image-2.5

Consistency in multi-round editing is the third improvement.

लंबी बातचीत में एक ही छवि को बार-बार संपादित करने पर, पहले के संपादन परिणाम बने रहते हैं और गुणवत्ता पीढ़ियों के साथ नहीं घटती।

GPT-Image-2.5

हिग्सफील्ड AI के उत्पाद प्रबंधक अक्सुल्तन अलिमकुलोव ने फ्लेयर के बारे में कहा:

हमें इसकी 「क्या नहीं बदलना चाहिए」 की समझ से सबसे अधिक प्रभावित हुआ।

एक अर्थपूर्ण संपादन करें, जिससे मूल चित्र के किरदार, संरचना और दृश्य शैली न खोएं।

GPT-Image-2.5

स्केच और टेम्पलेट: टाइपिंग से ड्राइंग तक

उत्पाद स्तर पर, Images 2.5 ने चार नए फ़ंक्शन लाए हैं।

स्केच का एक्सेस ChatGPT चैट बॉक्स में @Sketch टाइप करके मिलता है, जिससे स्केच पैनल खुलता है। उपयोगकर्ता एक स्केच बनाता है और उसके साथ शैली और विवरण का वर्णन लिखता है, तब ChatGPT स्केच को संरचना के आधार के रूप में लेकर एक पूर्ण चित्र बनाता है।

OpenAI द्वारा दिए गए उदाहरणों में कमरे की व्यवस्था के स्केच को इंटीरियर डिज़ाइन रेंडरिंग में बदलना और व्यक्ति के आउटलाइन के स्केच को इलस्ट्रेशन में बदलना शामिल है। बाधा चित्रकला कौशल में नहीं, बल्कि स्थानिक संबंधों और लगभग अनुपातों को चित्रित करने में है, ताकि मॉडल छवि की संरचना को समझ सके।

टेम्पलेट पोस्टर, प्रोडक्ट इमेज, फ्लायर जैसे अक्सर उपयोग होने वाले फॉर्मेट्स को कवर करता है।

एक टेम्पलेट चुनें, जानकारी और शैली की पसंद भरें, मॉडल पूर्वनिर्धारित संरचना के अनुसार चित्र बनाता है, जिससे प्रॉम्प्ट लिखने के लिए शून्य से परीक्षण और त्रुटि का समय बचता है।

Prompt साझा करें ताकि उपयोगकर्ता अपने द्वारा बनाए गए चित्र का पूरा Prompt साझा कर सकें, जिससे अन्य अपनी फोटो और विवरण के साथ इसी ढांचे में अपना व्यक्तिगत संस्करण बना सकें।

एक "80s रिट्रो पोर्ट्रेट" प्रॉम्प्ट सोशल मीडिया पर वायरल हो गया है, जहाँ उपयोगकर्ता अपनी सेल्फी अपलोड करके उसी स्टाइल में तस्वीरें प्राप्त कर सकते हैं।

GPT-Image-2.5

चार कार्य एक ही परिवर्तन की ओर इशारा करते हैं: मन में बनी छवि को तस्वीर में बदलने की प्रक्रिया अब केवल टाइप करके ही सीमित नहीं रही!

Flare और Sunburst: API का पहली बार दो भागों में विभाजन

डेवलपर्स के लिए, OpenAI API पर दो छवि मॉडल्स: GPT-Image-2.5 Flare और GPT-Image-2.5 Sunburst को समानांतर रूप से लॉन्च करता है।

Flare को गति और बैच जेनरेशन के लिए डिज़ाइन किया गया है, और OpenAI इसे अधिकांश एप्लिकेशन्स के लिए डिफ़ॉल्ट चॉइस के रूप में प्रस्तुत करता है।

उपयुक्त उपयोग के मामलों में सामाजिक सामग्री, उत्पाद अनुभव चित्र, त्वरित प्रोटोटाइप और उच्च आवृत्ति चित्रण शामिल हैं।

मैनस टीम के लकी लियाओ द्वारा दिए गए डेटा अधिक विशिष्ट हैं: फ्लेयर ने अपने परीक्षणों में GPT-Image-2 की तुलना में 2 से 4 गुना तेज छवि उत्पादन गति प्राप्त की, और पारदर्शी बैकग्राउंड जनरेशन में सुधार प्रोग्रामेटिक ब्रांडिंग मटीरियल, प्रेजेंटेशन और वेबसाइट इमेजेज के लिए सीधे उपयोगी है।

GPT-Image-2.5

Sunburst उच्च-स्तरीय रचनात्मक कार्यप्रवाह के लिए डिज़ाइन किया गया है, जो अधिक सूक्ष्म संपादन नियंत्रण के लिए अधिक समय लेता है।

OpenAI द्वारा दिए गए उदाहरण में ब्रांड मार्केटिंग के लिए तैयार उत्पाद सामग्री और प्रोफेशनली एडिट की गई उत्पाद तस्वीरें शामिल हैं।

Adobe ने Firefly में Images 2.5 मॉडल को एकीकृत करने की पुष्टि की है।

एडोबी उत्पादों के उच्च स्तरीय निदेशक मैट चोटिन ने कहा कि संस्करण 2.5 में उत्पादन गति और रिज़ॉल्यूशन समानता में सुधार हुआ है, और चित्र बहु-चरणीय सुधार के बाद भी स्पष्ट और वास्तविक लगते हैं।

GPT-Image-2.5

दो मॉडलों का विभाजन दो आवश्यकताओं के अनुरूप है: उच्च आवृत्ति और निम्न लेटेंसी तथा उच्च सटीकता के अनुकूलन।

Flare चलने वाले स्थितियों के लिए है, Sunburst उत्कृष्ट स्थितियों के लिए है, विकासक अपनी व्यावसायिक आवश्यकताओं के अनुसार चयन कर सकते हैं, और अप्रयुक्त सटीकता के लिए प्रतीक्षा नहीं करनी पड़ती।

यह OpenAI इमेज API का पहला बार है जब इसे गति और गुणवत्ता के आधार पर प्रोडक्ट टियरिंग की गई है, जो लॉजिक और लैंग्वेज मॉडल API की टियरिंग के साथ संगत है।

Images 2.5 का नामकरण OpenAI की इमेज प्रोडक्ट लाइन के रिदम को जारी रखता है: आर्किटेक्चर अपरिवर्तित, गति और सटीकता पहले उछाल पर आती हैं।

2024 के अंत में GPT-Image-1.5 ने वही तरीका अपनाया।

दो .5 संस्करणों के बीच का अंतर एक वर्ष से कम है, जिससे इमेज मॉडल के अपडेट अक्सर भाषा मॉडल की तरह हो रहे हैं।

यह दुनिया का सबसे शक्तिशाली इमेज जनरेशन मॉडल है, जो बहुत बड़े अंतर से अग्रणी है।

OpenAI की लगातार बढ़ती बहुमोडल क्षमताएँ, Anthropic के मॉडल के सामने, कंप्यूटर-उपयोग क्षमता सहित GPT-7 जैसे बेस मॉडल्स की क्षमता को बढ़ाने के लिए हो सकती हैं।

संदर्भ:

https://openai.com/index/introducing-chatgpt-images-2-5/

यह लेख वेइची ग्रुप "न्यूज़िज़यन" (ID: AI_era) से आया है, लेखक: ASI उपदेश, संपादक: माको

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।