اوپن اے آئی کا نئی ترین استدلالی ماڈل، GPT-6 Astra، 3 ستمبر کو لانچ ہوا، جس نے فرنٹیئر میتھ ٹائر 4 (v2) پر 97.6% سکور حاصل کیا۔ یہ وہ قسم کا اعداد و شمار ہے جو آپ کو دوبارہ سوچنے پر مجبور کر دے، خاص طور پر جب آپ جان لیں کہ ماڈل کا ایک پہلے کا اندر کا ورژن میتھ کی صلاحیت کے جائزے میں صرف 17% تک کام کر پا رہا تھا۔
اندرونی طور پر 17% سے 47% تک اور پھر عوامی بینچ مارکس پر تقریباً مکمل ہونے تک کا سفر، عام طور پر سالوں کی ترقی کو ایک منفرد ترقیاتی سائیکل میں دبادیتا ہے۔
بینچ مارک بلِٹز
ARC-AGI-3 پر، جو OpenAI کے اپنے ایوانِ تجزیہ میں پیمانہ لگایا گیا، اسٹرا نے 99.9% کا اسکور حاصل کیا۔ ExploitBench پر، اس نے مکمل 100% حاصل کیا۔ GPQA Diamond، جو ایک گریجویٹ لیول کا سائنسی استدلال بینچ مارک ہے، 96.0% پر رہا۔ Terminal-Bench Science 0.1 نے 64.6% کا اسکور دیا۔
تاہم، فرنٹیئر میت ٹائر 4 (v2) کا نتیجہ اہم ترین نمبر ہے۔ جی پی ٹی-5.6 سول، اسٹرا کا سابقہ، نے اسی بینچ مارک پر 83.0% نمبر حاصل کیے۔ اسٹرا کا 97.6% نمبر 14.6 فیصد نقطوں کی بہتری کی نمائندگی کرتا ہے۔
17% سے عالمی سطح تک
اُس ماڈل کے ابتدائی ورژن، جو اسٹرا بننا تھا، نے میتھ کی صلاحیت کے جائزہ لینے پر تقریباً 17% کا اداء کیا۔ تکراری بہتریوں کے ذریعے، یہ شرح 47% تک پہنچ گئی، جب تک کہ ماڈل کو عوامی جاری کرنے سے پہلے مزید بہتر نہیں بنایا گیا۔
اوپن اے آئی نے اسٹرا کو پرائم گیپس پر نئے جائزے فراہم کرنے کا بھی سہرا دیا ہے، جو عددی نظریہ کا ایک مشہور طور پر مشکل شعبہ ہے جس پر صدیوں سے انسانی ریاضیدان کام کر رہے ہیں۔
کسے رسائی ملتی ہے اور کب
اسٹرا کا اطلاق مرحلہ وار طریقے سے کیا گیا۔ لانچ کے دن کچھ منتخب اداروں کو رسائی حاصل ہوئی، اور جلد ہی عام رسائی ChatGPT Plus، Pro، Business اور Enterprise سبسکرائبرز تک پہنچ گئی۔ API رسائی OpenAI کے ذریعے، ساتھ ہی Azure اور AWS Bedrock کے ذریعے دستیاب ہے۔
مقابلہ کی صورتحال
مستقل جائزہ جات نے اسٹرا کو موجودہ دور کے بہترین کارکردگی والے AI ماڈلز میں شامل کیا ہے، حالانکہ کچھ جائزہ جات میں یہ نوٹ کیا گیا ہے کہ اینٹروپک کے کچھ کلاؤڈ وریئنٹس عام ذہانت کے ٹیسٹس میں اس سے آگے ہیں۔
ایک مدل جنریشن میں فرینٹیئر میتھ میں 83.0% سے بڑھ کر 97.6% ہونا ظاہر کرتا ہے کہ AI ریاضیاتی استدلال کی حد، اگر کوئی ہے، ابھی تک حاصل نہیں ہوئی ہے۔
