ওপেনএআই গতিশীল জেনারেশন এবং উন্নত এডিটিং সহ GPT-ইমেজ-2.5 চালু করেছে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
OpenAI গট-ইমেজ-2.5 চালু করেছে, যা দ্রুততর জেনারেশন এবং উন্নত এডিটিং প্রদান করে। নতুন সংস্করণটি প্রায় 50% দ্রুত এবং একটি স্কেচ ইনপুট মোড যোগ করেছে। API ব্যবহারকারীরা এখন গতির জন্য Flare এবং গুণমানের জন্য Sunburst-এর মধ্যে বেছে নিতে পারেন। চীনা টেক্সট রেন্ডারিংয়ের সমস্যা সমাধান করা হয়েছে, এবং সহজেই তৈরির জন্য টেমপ্লেটগুলি উপলব্ধ। এই আপডেটটি BTC-এর আপডেটের সাথে একসাথে আসছে এবং আগামীকালের জন্য নতুন টোকেন লিস্টিংয়ের ইঙ্গিত দিচ্ছে।

ঠিক এখনই, OpenAI গট-ইমেজেস-2.5 প্রকাশ করেছে:

প্রসেসিং ল্যাটেন্সি অর্ধেক পর্যন্ত কমেছে, এডিটিং প্রেসিশন উন্নত হয়েছে, স্কেচ হাতে লেখা ইনপুট ফিচার যোগ করা হয়েছে, এবং API প্রান্তে প্রথমবারের মতো দ্রুত ও ধীর দুটি মডেল আলাদা করা হয়েছে।

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

ChatGPT, ChatGPT Work এবং Codex-এর সমস্ত ব্যবহারকারীদের জন্য উন্মুক্ত, ফ্রি ভার্সন সহ।

এই সংখ্যার ভিত্তিতে, দিনে প্রায় 43 কোটি ছবি এই সিস্টেম দিয়ে প্রক্রিয়াকরণ করা হয়, যার ফলে গতি বৃদ্ধির অনুভূতি সাধারণ ফিচার আপডেটের চেয়ে অনেক বেশি প্রভাবিত।

OpenAI ঘোষণা করেছে যে ChatGPT Images এবং GPT-Image API একত্রে প্রতি সপ্তাহে 30 বিলিয়ন ছবি তৈরি করে।

ডেমো অসাধারণ: চীনা অক্ষরের বিকৃতি এখন অনুপস্থিত

GPT-Image-2.5 কতটা শক্তিশালী? আসুন সরাসরি ডেমোটি দেখি।

চীনা ভাষার ক্ষতিগ্রস্ত অক্ষর এখন অদৃশ্য হয়ে গেছে!

GPT-Image-2.5

এটি রেফারেন্স ছবি:

GPT-Image-2.5

এটি আউটপুটের রিট্রো ছবি:

GPT-Image-2.5

আপনি কি এখনও বাস্তব ছবি এবং এআই তৈরি ছবি পার্থক্য করতে পারেন?

প্রিন্ট করা পুরনো ফটোগুলি নিয়ে হাই-ডিফিনিশন ডিজিটাল ফটো তৈরি করা খুবই সহজ।

GPT-Image-2.5

পোশাকের ভিজুয়াল ইফেক্ট পরীক্ষা করতে চান? সরাসরি ChatGPT-এর উপর ছেড়ে দিন:

ইনপুট:

GPT-Image-2.5

Output:

GPT-Image-2.5

মূল ছবিটি ইনপুট করুন, বিছানার চাদর অব্যবস্থিত:

GPT-Image-2.5

বিছানার চাদর ভাঁজ করা ছবি আউটপুট করা হয়েছে:

GPT-Image-2.5

খুব বেশি সামঞ্জস্যপূর্ণ দৃশ্য, কোনো ভুল বা বিচ্ছিন্নতা দেখা যায় না।

অর্ধেক দ্রুত, পরিবর্তন করে বিশৃঙ্খলা দূর করা হয়েছে

সবচেয়ে সরাসরি গতি বৃদ্ধি। OpenAI-এর দেওয়া সংখ্যা অনুযায়ী, জেনারেশন ল্যাটেন্সি Images 2.0 এর তুলনায় সর্বোচ্চ 50% কমেছে।

প্রতিচ্ছবি এবং টেক্সচারের রেন্ডারিং কোয়ালিটি একসাথে উন্নত হয়েছে, এবং প্রতিচ্ছবিতে মানুষের প্রধান বিষয়ের পুনর্নির্মাণও বেশি সঠিক।

সঠিক সম্পাদনা হল একটি পুরনো সমস্যার জন্য একটি সমাধান: ব্যবহারকারী শুধুমাত্র একটি অংশ পরিবর্তন করতে চায়, কিন্তু মডেলটি যা পরিবর্তন করার জন্য বলা হয়নি তাও পরিবর্তন করে দেয়।

OpenAI অনুসারে, Images 2.5 শুধুমাত্র নির্দিষ্ট এলাকা পরিবর্তন করতে পারে, যেখানে চিত্রের বাকি উপাদানগুলির কম্পোজিশন, আলোকসজ্জা এবং মূল বৈশিষ্ট্যগুলি সংরক্ষিত থাকে, এবং জটিল ব্যাকগ্রাউন্ড এবং একাধিক বিষয়বস্তু সহ দৃশ্যে স্থিতিশীলতা উল্লেখযোগ্যভাবে বৃদ্ধি পায়।

ব্যবহারকারীরা ছবির উপর সরাসরি মন্তব্য এবং নোট যোগ করতে পারেন, যা পরিবর্তনের প্রয়োজনীয় স্থানগুলি চিহ্নিত করে, যা Figma ডিজাইন টুলের মতো কাজের যুক্তি অনুসরণ করে।

GPT-Image-2.5

তৃতীয় উন্নতি হল বহু সংস্করণ সম্পাদনার সামঞ্জস্যতা।

একই ছবির উপর দীর্ঘ সংলাপে বারবার সম্পাদনা করার সময়, প্রথম কয়েকটি পর্যায়ের সম্পাদনা ফলাফল বজায় থাকে এবং চিত্রের গুণমান পর্যায়ের সাথে হ্রাস পায় না।

GPT-Image-2.5

হিগসফিল্ড এআই-এর পণ্য প্রধান আক্সুলতান আলিমকুলভ ফ্লেয়ার সম্পর্কে বলেন:

এটি কী অপরিবর্তিত রাখা উচিত তা বোঝার জন্য আমাদের সবচেয়ে বেশি প্রভাবিত হয়েছিল।

একটি অর্থপূর্ণ সম্পাদনা করুন, যাতে মূল চিত্রের চরিত্র, কম্পোজিশন এবং দৃশ্যমান শৈলী হারায় না।

GPT-Image-2.5

স্কেচ এবং টেমপ্লেট: টাইপিং থেকে ড্রয়িং পর্যন্ত

পণ্য স্তরে, Images 2.5 চারটি নতুন ফিচার নিয়ে এসেছে।

স্কেচের প্রবেশ পথ হলো ChatGPT চ্যাট বক্সে @Sketch টাইপ করে হ্যান্ডড্রয়িং প্যানেল খোলা। ব্যবহারকারী একটি স্কেচ আঁকে, স্টাইল এবং বিস্তারিত বর্ণনা সহ লিখে দেয়, তারপর ChatGPT স্কেচটিকে কম্পোজিশনের রেফারেন্স হিসেবে নিয়ে চূড়ান্ত ছবি তৈরি করে।

OpenAI-এর উদাহরণগুলির মধ্যে রয়েছে ঘরের বিন্যাসের স্কেচ থেকে ইন্টিরিয়র ডিজাইন রেন্ডারিং, এবং চরিত্রের আউটলাইনের স্কেচ থেকে ইলাস্ট্রেশন। বাধা আঁকার দক্ষতায় নয়, বরং স্থানিক সম্পর্ক এবং প্রায় অনুপাত আঁকার মধ্যে, যাতে মডেলটি চিত্রের কাঠামো বুঝতে পারে।

টেমপ্লেটটি পোস্টার, পণ্য ছবি, প্রচারপত্র ইত্যাদি প্রায়শই ব্যবহৃত ফরম্যাটগুলিকে কভার করে।

একটি টেমপ্লেট নির্বাচন করুন, তথ্য এবং স্টাইল পছন্দ প্রবেশ করান, মডেল পূর্বনির্ধারিত কাঠামোতে চিত্র তৈরি করবে, যা শূন্য থেকে Prompt লেখার পরীক্ষা-ভুল এড়িয়ে যায়।

প্রম্পট শেয়ার করুন যাতে ব্যবহারকারীরা তৈরি করা ছবির পূর্ণাঙ্গ প্রম্পটটি শেয়ার করতে পারে, যাতে অন্যরা তাদের নিজস্ব ফটো এবং বিস্তারিত ব্যবহার করে একই কাঠামোতে নিজস্ব সংস্করণ তৈরি করতে পারে।

একটি "80-এর দশকের রিট্রো পোর্ট্রেট" প্রম্পট সোশ্যাল মিডিয়ায় ছড়িয়ে পড়েছে, ব্যবহারকারীরা নিজেদের সেলফি আপলোড করলে একই স্টাইলের ছবি পাবেন।

GPT-Image-2.5

চারটি ফাংশন একই পরিবর্তনের দিকে ইঙ্গিত করে: মস্তিষ্কের চিত্রকে ছবিতে পরিণত করার প্রক্রিয়াটি এখন শুধুমাত্র টাইপ করার উপর নির্ভর করে না!

ফ্লেয়ার এবং সানবার্স্ট: এপিআই প্রথমবারের মতো দুটিতে বিভক্ত

ডেভেলপারদের জন্য, ওপেনএআই এপিআই প্রান্তে দুটি চিত্র মডেল চালু করেছে: GPT-Image-2.5 Flare এবং GPT-Image-2.5 Sunburst।

Flare-এর প্রধান বৈশিষ্ট্য হল গতি এবং ব্যাচ জেনারেশন, যা OpenAI এটিকে বেশিরভাগ অ্যাপ্লিকেশনের জন্য ডিফল্ট পছন্দ হিসাবে প্রস্তাব করেছে।

সামাজিক কন্টেন্ট, পণ্য অভিজ্ঞতা চিত্র, দ্রুত প্রোটোটাইপ এবং প্রায়শই চিত্র তৈরির জন্য উপযুক্ত।

ম্যানাস পরীক্ষা দলের লাকি লিয়াও প্রদান করা ডেটা আরও নির্দিষ্ট: ফ্লেয়ার তাদের পরীক্ষায় GPT-Image-2-এর চেয়ে 2 থেকে 4 গুণ দ্রুত চিত্র তৈরি করে, এবং স্বচ্ছ ব্যাকগ্রাউন্ড তৈরির উন্নতি প্রোগ্রামেটিকভাবে ব্র্যান্ডিং মেটিরিয়াল, প্রেজেন্টেশন এবং ওয়েবসাইট ইমেজ তৈরিতে সরাসরি কাজে লাগে।

GPT-Image-2.5

সানবার্স্ট হাই-এন্ড ক্রিয়েটিভ ওয়ার্কফ্লোকে লক্ষ্য করে, এটি আরও সূক্ষ্ম এডিটিং নিয়ন্ত্রণের জন্য দীর্ঘতর জেনারেশন সময় ব্যয় করে।

OpenAI-এর প্রদত্ত প্রায়শই ব্র্যান্ড মার্কেটিংয়ের প্রস্তুত মাধ্যম এবং পরিশোধিত পণ্য ছবি।

Adobe নিশ্চিত করেছে যে ফায়ারফ্লির মধ্যে Images 2.5 মডেল একীভূত করা হয়েছে।

অ্যাডোবের প্রোডাক্ট সিনিয়র ডিরেক্টর ম্যাট চোটিন বলেছেন, 2.5 সংস্করণটি তৈরির গতি এবং রেজোলিউশন সামঞ্জস্যতা বাড়িয়েছে, যাতে চিত্রগুলি একাধিক পর্যায়ে উন্নত করার পরেও স্পষ্ট এবং বাস্তবসম্মত থাকে।

GPT-Image-2.5

দুটি মডেলের বিভাজন দুটি প্রয়োজনীয়তার সাথে মেলে: হাই-ফ্রিকোয়েন্সি লো-ল্যাটেন্সি এবং হাই-প্রেসিশন কাস্টমাইজেশন।

ফ্লেয়ার ট্রাফিক-বেসড সিনেরিওর জন্য, সানবার্স্ট কোয়ালিটি-বেসড সিনেরিওর জন্য, ডেভেলপাররা তাদের ব্যবসায়িক প্রয়োজন অনুযায়ী বেছে নিতে পারেন, এবং যে প্রিসিশনগুলি তারা ব্যবহার করবেন না তার জন্য অপেক্ষা করার দরকার হবে না।

এটি প্রথমবারের মতো OpenAI ইমেজ API-এ গতি এবং গুণমানের ভিত্তিতে পণ্য স্তরীকরণ করা হয়েছে, যা লজিক এবং ভাষা মডেল API-এর স্তরীকরণের সাথে সামঞ্জস্যপূর্ণ।

ইমেজেস 2.5-এর নামকরণ অপেনএআই ইমেজ পণ্য লাইনের গতিকে অনুসরণ করে: আর্কিটেকচার অপরিবর্তিত রয়েছে, কিন্তু গতি এবং সঠিকতা প্রথমবারের মতো বৃদ্ধি পেয়েছে।

2024 এর শেষের দিকে GPT-Image-1.5 একই পদ্ধতি ব্যবহার করেছিল।

দুটি 0.5 সংস্করণের মধ্যে এক বছরের কম সময় লেগেছে, যা চিত্র মডেলের আপডেট ফ্রিকোয়েন্সিকে ভাষা মডেলের দিকে নিয়ে যাচ্ছে।

এটি বিশ্বের সবচেয়ে শক্তিশালী ইমেজ জেনারেশন মডেল, যা অপরিসীমভাবে এগিয়ে।

OpenAI-এর অবিরাম বৃদ্ধি পাচ্ছে এমন মাল্টিমোডাল ক্ষমতা হয়তো Anthropic-এর মডেলের সামনে কম্পিউটার-ব্যবহার ক্ষমতা সহ বিভিন্ন ক্ষমতা বাড়িয়ে GPT-7 এর মতো বেস মডেলগুলির ক্ষমতা বাড়ানোর জন্য।

প্রসঙ্গ:

https://openai.com/index/introducing-chatgpt-images-2-5/

এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউজিয়ুয়ান" (ID: AI_era) থেকে এসেছে, লেখক: ASI প্রকাশনা, সম্পাদক: মা কে

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।