ঠিক এখনই, OpenAI গট-ইমেজেস-2.5 প্রকাশ করেছে:
প্রসেসিং ল্যাটেন্সি অর্ধেক পর্যন্ত কমেছে, এডিটিং প্রেসিশন উন্নত হয়েছে, স্কেচ হাতে লেখা ইনপুট ফিচার যোগ করা হয়েছে, এবং API প্রান্তে প্রথমবারের মতো দ্রুত ও ধীর দুটি মডেল আলাদা করা হয়েছে।

https://x.com/OpenAI/status/2097394956457623964
ChatGPT, ChatGPT Work এবং Codex-এর সমস্ত ব্যবহারকারীদের জন্য উন্মুক্ত, ফ্রি ভার্সন সহ।
এই সংখ্যার ভিত্তিতে, দিনে প্রায় 43 কোটি ছবি এই সিস্টেম দিয়ে প্রক্রিয়াকরণ করা হয়, যার ফলে গতি বৃদ্ধির অনুভূতি সাধারণ ফিচার আপডেটের চেয়ে অনেক বেশি প্রভাবিত।
OpenAI ঘোষণা করেছে যে ChatGPT Images এবং GPT-Image API একত্রে প্রতি সপ্তাহে 30 বিলিয়ন ছবি তৈরি করে।
ডেমো অসাধারণ: চীনা অক্ষরের বিকৃতি এখন অনুপস্থিত
GPT-Image-2.5 কতটা শক্তিশালী? আসুন সরাসরি ডেমোটি দেখি।
চীনা ভাষার ক্ষতিগ্রস্ত অক্ষর এখন অদৃশ্য হয়ে গেছে!

এটি রেফারেন্স ছবি:

এটি আউটপুটের রিট্রো ছবি:

আপনি কি এখনও বাস্তব ছবি এবং এআই তৈরি ছবি পার্থক্য করতে পারেন?
প্রিন্ট করা পুরনো ফটোগুলি নিয়ে হাই-ডিফিনিশন ডিজিটাল ফটো তৈরি করা খুবই সহজ।

পোশাকের ভিজুয়াল ইফেক্ট পরীক্ষা করতে চান? সরাসরি ChatGPT-এর উপর ছেড়ে দিন:
ইনপুট:

Output:

মূল ছবিটি ইনপুট করুন, বিছানার চাদর অব্যবস্থিত:

বিছানার চাদর ভাঁজ করা ছবি আউটপুট করা হয়েছে:

খুব বেশি সামঞ্জস্যপূর্ণ দৃশ্য, কোনো ভুল বা বিচ্ছিন্নতা দেখা যায় না।
অর্ধেক দ্রুত, পরিবর্তন করে বিশৃঙ্খলা দূর করা হয়েছে
সবচেয়ে সরাসরি গতি বৃদ্ধি। OpenAI-এর দেওয়া সংখ্যা অনুযায়ী, জেনারেশন ল্যাটেন্সি Images 2.0 এর তুলনায় সর্বোচ্চ 50% কমেছে।
প্রতিচ্ছবি এবং টেক্সচারের রেন্ডারিং কোয়ালিটি একসাথে উন্নত হয়েছে, এবং প্রতিচ্ছবিতে মানুষের প্রধান বিষয়ের পুনর্নির্মাণও বেশি সঠিক।
সঠিক সম্পাদনা হল একটি পুরনো সমস্যার জন্য একটি সমাধান: ব্যবহারকারী শুধুমাত্র একটি অংশ পরিবর্তন করতে চায়, কিন্তু মডেলটি যা পরিবর্তন করার জন্য বলা হয়নি তাও পরিবর্তন করে দেয়।
OpenAI অনুসারে, Images 2.5 শুধুমাত্র নির্দিষ্ট এলাকা পরিবর্তন করতে পারে, যেখানে চিত্রের বাকি উপাদানগুলির কম্পোজিশন, আলোকসজ্জা এবং মূল বৈশিষ্ট্যগুলি সংরক্ষিত থাকে, এবং জটিল ব্যাকগ্রাউন্ড এবং একাধিক বিষয়বস্তু সহ দৃশ্যে স্থিতিশীলতা উল্লেখযোগ্যভাবে বৃদ্ধি পায়।
ব্যবহারকারীরা ছবির উপর সরাসরি মন্তব্য এবং নোট যোগ করতে পারেন, যা পরিবর্তনের প্রয়োজনীয় স্থানগুলি চিহ্নিত করে, যা Figma ডিজাইন টুলের মতো কাজের যুক্তি অনুসরণ করে।

তৃতীয় উন্নতি হল বহু সংস্করণ সম্পাদনার সামঞ্জস্যতা।
একই ছবির উপর দীর্ঘ সংলাপে বারবার সম্পাদনা করার সময়, প্রথম কয়েকটি পর্যায়ের সম্পাদনা ফলাফল বজায় থাকে এবং চিত্রের গুণমান পর্যায়ের সাথে হ্রাস পায় না।

হিগসফিল্ড এআই-এর পণ্য প্রধান আক্সুলতান আলিমকুলভ ফ্লেয়ার সম্পর্কে বলেন:
এটি কী অপরিবর্তিত রাখা উচিত তা বোঝার জন্য আমাদের সবচেয়ে বেশি প্রভাবিত হয়েছিল।
একটি অর্থপূর্ণ সম্পাদনা করুন, যাতে মূল চিত্রের চরিত্র, কম্পোজিশন এবং দৃশ্যমান শৈলী হারায় না।

স্কেচ এবং টেমপ্লেট: টাইপিং থেকে ড্রয়িং পর্যন্ত
পণ্য স্তরে, Images 2.5 চারটি নতুন ফিচার নিয়ে এসেছে।
স্কেচের প্রবেশ পথ হলো ChatGPT চ্যাট বক্সে @Sketch টাইপ করে হ্যান্ডড্রয়িং প্যানেল খোলা। ব্যবহারকারী একটি স্কেচ আঁকে, স্টাইল এবং বিস্তারিত বর্ণনা সহ লিখে দেয়, তারপর ChatGPT স্কেচটিকে কম্পোজিশনের রেফারেন্স হিসেবে নিয়ে চূড়ান্ত ছবি তৈরি করে।
OpenAI-এর উদাহরণগুলির মধ্যে রয়েছে ঘরের বিন্যাসের স্কেচ থেকে ইন্টিরিয়র ডিজাইন রেন্ডারিং, এবং চরিত্রের আউটলাইনের স্কেচ থেকে ইলাস্ট্রেশন। বাধা আঁকার দক্ষতায় নয়, বরং স্থানিক সম্পর্ক এবং প্রায় অনুপাত আঁকার মধ্যে, যাতে মডেলটি চিত্রের কাঠামো বুঝতে পারে।
টেমপ্লেটটি পোস্টার, পণ্য ছবি, প্রচারপত্র ইত্যাদি প্রায়শই ব্যবহৃত ফরম্যাটগুলিকে কভার করে।
একটি টেমপ্লেট নির্বাচন করুন, তথ্য এবং স্টাইল পছন্দ প্রবেশ করান, মডেল পূর্বনির্ধারিত কাঠামোতে চিত্র তৈরি করবে, যা শূন্য থেকে Prompt লেখার পরীক্ষা-ভুল এড়িয়ে যায়।
প্রম্পট শেয়ার করুন যাতে ব্যবহারকারীরা তৈরি করা ছবির পূর্ণাঙ্গ প্রম্পটটি শেয়ার করতে পারে, যাতে অন্যরা তাদের নিজস্ব ফটো এবং বিস্তারিত ব্যবহার করে একই কাঠামোতে নিজস্ব সংস্করণ তৈরি করতে পারে।
একটি "80-এর দশকের রিট্রো পোর্ট্রেট" প্রম্পট সোশ্যাল মিডিয়ায় ছড়িয়ে পড়েছে, ব্যবহারকারীরা নিজেদের সেলফি আপলোড করলে একই স্টাইলের ছবি পাবেন।

চারটি ফাংশন একই পরিবর্তনের দিকে ইঙ্গিত করে: মস্তিষ্কের চিত্রকে ছবিতে পরিণত করার প্রক্রিয়াটি এখন শুধুমাত্র টাইপ করার উপর নির্ভর করে না!
ফ্লেয়ার এবং সানবার্স্ট: এপিআই প্রথমবারের মতো দুটিতে বিভক্ত
ডেভেলপারদের জন্য, ওপেনএআই এপিআই প্রান্তে দুটি চিত্র মডেল চালু করেছে: GPT-Image-2.5 Flare এবং GPT-Image-2.5 Sunburst।
Flare-এর প্রধান বৈশিষ্ট্য হল গতি এবং ব্যাচ জেনারেশন, যা OpenAI এটিকে বেশিরভাগ অ্যাপ্লিকেশনের জন্য ডিফল্ট পছন্দ হিসাবে প্রস্তাব করেছে।
সামাজিক কন্টেন্ট, পণ্য অভিজ্ঞতা চিত্র, দ্রুত প্রোটোটাইপ এবং প্রায়শই চিত্র তৈরির জন্য উপযুক্ত।
ম্যানাস পরীক্ষা দলের লাকি লিয়াও প্রদান করা ডেটা আরও নির্দিষ্ট: ফ্লেয়ার তাদের পরীক্ষায় GPT-Image-2-এর চেয়ে 2 থেকে 4 গুণ দ্রুত চিত্র তৈরি করে, এবং স্বচ্ছ ব্যাকগ্রাউন্ড তৈরির উন্নতি প্রোগ্রামেটিকভাবে ব্র্যান্ডিং মেটিরিয়াল, প্রেজেন্টেশন এবং ওয়েবসাইট ইমেজ তৈরিতে সরাসরি কাজে লাগে।

সানবার্স্ট হাই-এন্ড ক্রিয়েটিভ ওয়ার্কফ্লোকে লক্ষ্য করে, এটি আরও সূক্ষ্ম এডিটিং নিয়ন্ত্রণের জন্য দীর্ঘতর জেনারেশন সময় ব্যয় করে।
OpenAI-এর প্রদত্ত প্রায়শই ব্র্যান্ড মার্কেটিংয়ের প্রস্তুত মাধ্যম এবং পরিশোধিত পণ্য ছবি।
Adobe নিশ্চিত করেছে যে ফায়ারফ্লির মধ্যে Images 2.5 মডেল একীভূত করা হয়েছে।
অ্যাডোবের প্রোডাক্ট সিনিয়র ডিরেক্টর ম্যাট চোটিন বলেছেন, 2.5 সংস্করণটি তৈরির গতি এবং রেজোলিউশন সামঞ্জস্যতা বাড়িয়েছে, যাতে চিত্রগুলি একাধিক পর্যায়ে উন্নত করার পরেও স্পষ্ট এবং বাস্তবসম্মত থাকে।

দুটি মডেলের বিভাজন দুটি প্রয়োজনীয়তার সাথে মেলে: হাই-ফ্রিকোয়েন্সি লো-ল্যাটেন্সি এবং হাই-প্রেসিশন কাস্টমাইজেশন।
ফ্লেয়ার ট্রাফিক-বেসড সিনেরিওর জন্য, সানবার্স্ট কোয়ালিটি-বেসড সিনেরিওর জন্য, ডেভেলপাররা তাদের ব্যবসায়িক প্রয়োজন অনুযায়ী বেছে নিতে পারেন, এবং যে প্রিসিশনগুলি তারা ব্যবহার করবেন না তার জন্য অপেক্ষা করার দরকার হবে না।
এটি প্রথমবারের মতো OpenAI ইমেজ API-এ গতি এবং গুণমানের ভিত্তিতে পণ্য স্তরীকরণ করা হয়েছে, যা লজিক এবং ভাষা মডেল API-এর স্তরীকরণের সাথে সামঞ্জস্যপূর্ণ।
ইমেজেস 2.5-এর নামকরণ অপেনএআই ইমেজ পণ্য লাইনের গতিকে অনুসরণ করে: আর্কিটেকচার অপরিবর্তিত রয়েছে, কিন্তু গতি এবং সঠিকতা প্রথমবারের মতো বৃদ্ধি পেয়েছে।
2024 এর শেষের দিকে GPT-Image-1.5 একই পদ্ধতি ব্যবহার করেছিল।
দুটি 0.5 সংস্করণের মধ্যে এক বছরের কম সময় লেগেছে, যা চিত্র মডেলের আপডেট ফ্রিকোয়েন্সিকে ভাষা মডেলের দিকে নিয়ে যাচ্ছে।
এটি বিশ্বের সবচেয়ে শক্তিশালী ইমেজ জেনারেশন মডেল, যা অপরিসীমভাবে এগিয়ে।
OpenAI-এর অবিরাম বৃদ্ধি পাচ্ছে এমন মাল্টিমোডাল ক্ষমতা হয়তো Anthropic-এর মডেলের সামনে কম্পিউটার-ব্যবহার ক্ষমতা সহ বিভিন্ন ক্ষমতা বাড়িয়ে GPT-7 এর মতো বেস মডেলগুলির ক্ষমতা বাড়ানোর জন্য।
প্রসঙ্গ:
https://openai.com/index/introducing-chatgpt-images-2-5/
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউজিয়ুয়ান" (ID: AI_era) থেকে এসেছে, লেখক: ASI প্রকাশনা, সম্পাদক: মা কে
