সেপ্টেম্বর ৩-এ অপেনএআইয়ের সর্বশেষ যুক্তিসম্পন্ন মডেল, GPT-6 Astra লঞ্চ হয়েছে, যা FrontierMath Tier 4 (v2)-এ ৯৭.৬% স্কোর অর্জন করেছে। এটি এমন একটি সংখ্যা যা আপনাকে দ্বিগুণ ভাবিয়ে তোলে, বিশেষ করে যখন আপনি জানতে পারেন যে মডেলটির একটি আগের অভ্যন্তরীণ সংস্করণ গণিত ক্ষমতা মূল্যায়নে মাত্র ১৭% করতে পারত।
অন্তর্গতভাবে 17% থেকে 47% এবং তারপর পাবলিক বেঞ্চমার্কে প্রায় পারফেকশনে যাওয়ার পথটি সাধারণত বছরের প্রগতি অনুভব করা হতো তা একটি একক ডেভেলপমেন্ট সাইকেলে সংকুচিত করে।
বেঞ্চমার্ক ব্লিটজ
ARC-AGI-3-এ, OpenAI-এর নিজস্ব মূল্যায়ন হারনেসের মধ্যে পরিমাপ করা হয়েছে, এস্ট্রা 99.9% স্কোর অর্জন করেছে। ExploitBench-এ, এটি পারফেক্ট 100% অর্জন করেছে। GPQA Diamond, যা গ্র্যাজুয়েট লেভেলের বিজ্ঞান যুক্তির বেঞ্চমার্ক, 96.0% স্কোর অর্জন করেছে। Terminal-Bench Science 0.1-এ 64.6% স্কোর পাওয়া গেছে।
তবে, ফ্রন্টিয়ারম্যাথ টিয়ার 4 (v2) ফলাফলটিই মুখ্য সংখ্যা। GPT-5.6 Sol, যা আস্ট্রার পূর্বসূরি, একই বেঞ্চমার্কে 83.0% স্কোর করেছিল। আস্ট্রার 97.6% হল একটি 14.6 পার্সেন্টেজ পয়েন্টের উন্নতি।
১৭% থেকে বিশ্বস্তরের
অস্ট্রা হওয়ার পূর্বের মডেলের প্রাথমিক সংস্করণগুলি গণিত ক্ষমতা মূল্যায়নে প্রায় ১৭% করত। পুনরাবৃত্তিমূলক উন্নতির মাধ্যমে এই সংখ্যা ৪৭% পর্যন্ত বেড়েছিল, যেখানে মডেলটি পাবলিক রিলিজের জন্য আরও উন্নত করা হয়েছিল।
ওপেনএআই এছাড়াও আস্ট্রাকে প্রাইম গ্যাপস সম্পর্কে নতুন দৃষ্টিভঙ্গি প্রদানের জন্য সম্মানিত করেছে, যা সংখ্যা তত্ত্বের একটি বিখ্যাতভাবে কঠিন ক্ষেত্র যা শতাব্দী ধরে মানুষের গণিতবিদদের ব্যস্ত রেখেছে।
কে এক্সেস পায়, এবং কখন
অস্ট্রা-এর রোলআউট একটি পর্যায়ক্রমিক পদ্ধতি অনুসরণ করেছে। লঞ্চ দিনে কিছু নির্বাচিত সংস্থাগুলি প্রবেশাধিকার লাভ করে, এবং সংক্ষিপ্ত সময়ের মধ্যে চ্যাটজিপিটি প্লাস, প্রো, বিজনেস এবং এন্টারপ্রাইজ সাবস্ক্রাইবারদের জন্যও এটি উপলব্ধ হয়। API প্রবেশাধিকার সরাসরি OpenAI-এর মাধ্যমে, এছাড়াও Azure এবং AWS Bedrock-এর মাধ্যমে উপলব্ধ।
প্রতিযোগিতামূলক পরিস্থিতি
স্বাধীন মূল্যায়নগুলি Astra-কে বর্তমানে উপলব্ধ শীর্ষ পারফর্মিং AI মডেলগুলির মধ্যে একটি হিসাবে স্থান দিয়েছে, যদিও কিছু মূল্যায়ন উল্লেখ করেছে যে Anthropic-এর কিছু Claude ভেরিয়েন্টগুলি ব্যাপক বুদ্ধিত্ব পরীক্ষাগুলিতে এটিকে ছাড়িয়ে গেছে।
একটি মডেল জেনারেশনে ফ্রন্টিয়ারম্যাথে ৮৩.০% থেকে ৯৭.৬% এ উন্নতি হওয়া বোঝায় যে এআই গাণিতিক যুক্তিবিদ্যার সীমা, যদি কোনো সীমা থাকে, এখনও পৌঁছানো হয়নি।
