GPT-6 Astra فائنل فرنٹیئر میتھ ٹائر 4 مسئلہ حل کرتا ہے

icon MarsBit
بانٹیں
AI summary iconخلاصہ
AI + کرپٹو خبریں: GPT-6 Astra نے FrontierMath Tier 4 میں آخری مسئلہ حل کر لیا ہے، جس سے ایڈوانسڈ بینچ مارک میں تمام چیلنجز مکمل ہو گئے۔ ایپوک AI نے 60 سے زائد ریاضیدانوں کے ساتھ مل کر Astra کو تیار کیا ہے، جس نے 97.6% درستگی کے ساتھ آخری حل نہ ہونے والا مسئلہ حل کر لیا۔ اب یہ منصوبہ کھلے تحقیق اور فارملائزڈ چیلنجز کے نئے مرحلے میں منتقل ہو گیا ہے، جو AI کی ترقی میں ایک اہم منصوبہ اعلان ہے۔

بالکل ابھی، آخری FrontierMath ٹائر 4 کا مسئلہ GPT-6 Astra نے حل کر لیا۔

اس طرح، اس ٹیسٹ جسے کبھی بڑے ماڈل کے ریاضی کا خواب دیکھا جاتا تھا، تمام سوالات کم از کم ایک بار AI نے کامیابی سے حل کر لیے ہیں۔

ایپوک AI نے بھی اس کا اختتام کر دیا، فرینٹیئر میتھ ٹائر 4، سیر ہو چکا۔

فرنٹیئر میتھ

ہاں، اوپر کی گراف سے دیکھتے ہوئے، اسٹرا نے ابھی تک 100% تک نہیں پہنچا، اور OpenAI خود نے 97.6% کا اعلان کیا ہے۔

لیکن ایپوک کے الگورتھم کے مطابق، "تمام حل شدہ" کا مطلب ہے کہ مختلف ماڈلز اور مختلف وقت کی کوششوں کو جمع کرنے کے بعد، ٹائر 4 میں ہر سوال کا کم از کم ایک بار کامیابی سے جواب دیا جا چکا ہے۔

اور اسٹرا نے جسے ختم کیا، وہ پہلے تک واحد وہ تھا جسے AI نے ابھی تک توڑا نہیں تھا۔

بس اس کا مطلب یہ ہے کہ اسٹرا کسی ٹیسٹ میں غلطی کر سکتی ہے، لیکن اس نے جو سوال درست کیا، وہ پہلے کبھی حل نہیں ہوا تھا۔

فرنٹیئر میتھ

ایک بات ہے، یہ ترقی کی شرح کافی عجیب ہے۔

اگر آپ مدل ایوانیویشن پر نظر رکھتے ہیں، تو آپ جانتے ہیں کہ 11 جولائی 2025 کو جب ٹائر 4 کو متعارف کرایا گیا تھا، تو اس کی سب سے اعلیٰ درجہ بندی صرف تقریباً 5% تھی۔

اب تقریبا ایک سال اور دو ماہ گزر چکے ہیں، اور یہ پہلے کا “ऊंचی دیوار” اب “سیڑھی” بن چکا ہے، جس مسئلے کو AI ایک جھٹکے میں حل نہیں کر سکتا تھا، وہ بھی پار کر لیا گیا ہے۔

مارکیٹ یونیورسٹی کے ریاضی کے اسسٹنٹ پروفیسر جے پینٹون نے بھی کہا کہ پہلے AI ہمیشہ عددی راستوں کی تلاش کرتا تھا، لیکن اس بار AI کا حل اس کے قریب تھا۔

فرنٹیئر میتھ

تاہم، جبکہ حال ہی میں GPT-6 Astra نے ریاضی کے شعبے پر تیزی سے حملہ کیا اور تین دن میں دو کِلیمیم مسائل حل کر دیے، پینٹون نے کہا کہ اب وہ حیران ہونا مشکل سمجھ رہا ہے!

کہا جا سکتا ہے کہ ریاضی اسٹرا کے لیے حالیہ وقت میں سب سے زیادہ توجہ حاصل کرنے والے شعبوں میں سے ایک بن چکی ہے۔

2% سے کم سے، ایک خصوصی "ریسرچ لیول فارٹیفکیشن" شامل کرنا

فرنٹیئر میتھ کو 7 نومبر 2024 کو شائع کیا گیا تھا، اور اس کا مقصد خود یہ تھا کہ ریاضی کے بینچ مارک کو AI کے ذریعے جلدی سے گھولنا نہ ہو۔

جبکہ GSM8K، MATH جیسے روایتی ریاضی بینچ مارکس پہلے سے ہی ٹاپ ماڈلز کے درمیان فرق کو ظاہر کرنے میں مشکل ہوتے جا رہے تھے، اس لیے Epoch AI نے 60 سے زائد ریاضیدانوں کے ساتھ مل کر پہلے کبھی شائع نہ ہونے والی نئی مسائل کا ایک نیا مجموعہ تیار کیا۔

اس میں تاو زھیکسان، تیموفی گائوز، رچرڈ بورچرڈز جیسے فیلڈز انعام یافتگان بھی شامل ہیں۔

جب ٹاؤ ٹی شن نے کچھ تحقیقی سطح کے سوالات دیکھے، تو انہوں نے براہ راست کہا کہ یہ سوالات "بہت مشکل" ہیں، اور سب سے مشکل Tier 3 کو شاید AI کو اب بھی کئی سال تک پھنسا دے گا۔

فرنٹیئر میتھ

پہلے راؤنڈ کے نتائج کے مطابق، جیسا کہ توقع کیا جا رہا تھا، لیڈنگ ماڈل کی درستگی 2 فیصد سے کم تھی۔

اصل میں، فرنٹیئر میتھ کے مرکزی سوالات کے مجموعے میں 300 سوالات تھے، جو مشقت کے لحاظ سے ٹائر 1، ٹائر 2 اور ٹائر 3 کے تین سطحوں میں تقسیم کیے گئے تھے۔

فرنٹیئر میتھ

ٹیئر 1 تقریباً اعلیٰ درجے کے اسکالرشپ سوالات اور ریاضی کے اولمپیڈ کے برابر ہے، لیکن زیادہ جدید ٹولز کا استعمال کیا جا سکتا ہے؛ ٹیئر 2 اعلیٰ سال کے طلبہ کے سطح تک پہنچ جاتا ہے؛ اور ٹیئر 3 محققین کے لیے شروعاتی تحقیقی مسائل کے قریب ہے۔

لیکن استدلال ماڈلز کے ظہور کے ساتھ، یہ تینوں لیویلز بھی逐渐 کم زور پڑنے لگے، اس لیے 2025 میں، ایپوک نے ایک اور لیول، ٹائر 4، شامل کر دیا۔

ٹیئر 4 کو زیادہ تر ریاضی کے پروفیسرز اور پوسٹ ڈاکٹرل ریسرچرز نے ڈیزائن کیا ہے، جو ہر ایک اپنے تحقیقی شعبے کے گرد تقریباً کچھ ہفتے کا مختصر تحقیقی کام کرتا ہے، اور آخر میں اپنے نتائج کو ایک ایسے سوال میں دبایا جاتا ہے جسے آٹومیٹک طور پر تصدیق کیا جا سکے۔

فرنٹیئر میتھ

اصل میں، ٹیئر 4 میں 50 سوالات شامل تھے۔ ان کا دائرہ کار تجزیہ، نظریہ اعداد، ترکیبی ریاضی، ٹوپولوجی، الجبراک جیومیٹری وغیرہ پر مشتمل تھا۔

شروع میں، تمام ماڈلز کے تمام ٹیسٹس میں صرف تین سوالات ہی حل ہوئے، اور ان حل کے لیے کچھ صحیح لیکن کافی ثابت نہ ہونے والے فرضیات پر انحصار کیا گیا۔

اس کے نتیجے میں، ایپوک نے اپنی ویب سائٹ کے علیحدہ سوالات کے صفحے پر ایک بار لکھا تھا: کچھ سوالات شاید دہائیوں تک AI کے لیے حل نہ ہو سکیں۔

فرنٹیئر میتھ

(یہ جملہ اب سے دوبارہ گھسیٹا جائے گا)

لیکن جیسے جیسے ماڈلز زیادہ طاقتور ہوتے جا رہے ہیں، ایک اور مسئلہ سامنے آیا ہے: سوالات کا مجموعہ خود بھی AI کے "دبانے" کا مقابلہ نہیں کر پا رہا ہے۔

OpenAI نے ٹیسٹنگ کے دوران پایا کہ FrontierMath میں توقع سے زیادہ خطاں ہیں۔

اس کے بعد ایپوچ نے ایک مستقل آڈٹ شروع کیا، جس میں پہلے GPT-5.5 اور Claude Opus 4.7 کا استعمال کرتے ہوئے شکوک کی جانچ کی گئی، اور پھر ریاضیدانوں کو مسائل کی الگ الگ تصدیق کے لیے دیا گیا۔ آخرکار، 2026ء کے جون میں v2 ورژن جاری کیا گیا، جس میں ٹائر 4 نے 12 سوالات درست کیے، 7 سوالات خارج کیے، اور 43 سوالات برقرار رکھے۔

ایڈٹ کے بعد، ماڈل کے اسکورز مسلسل بڑھتے رہے۔

GPT-5.6 Sol نے 83.0% حاصل کیا، Claude Fable 5 نے 90.2% حاصل کیا، اور GPT-6 Astra پر یہ رقم 97.6% تک پہنچ گئی۔

فرنٹیئر میتھ

زیادہ اہم بات یہ ہے کہ اسٹرا نے اب تک کی واحد ایسی سوال کو بھی حل کر دیا جسے کبھی AI نے حل نہیں کیا تھا۔

فرنٹیئر میتھ

اس تک، ٹیئر 4 کی ہر ایک سوال کو AI نے کم از کم ایک بار کامیابی کے ساتھ چھین لیا ہے۔ یہ مخصوص طور پر سب سے طاقتور ماڈل کے لیے بنائی گئی ریسرچ لیول کی دفاعی لائن بھی ختم ہو چکی ہے۔

تاہم، اس کا مطلب یہ نہیں کہ "ریاضی کو AI نے حل کر لیا ہے"۔ بالکل اس کے برعکس، FrontierMath خود اگلے مرحلے کی طرف بڑھنے لگا ہے۔

اب پورے منصوبے میں Tiers 1-4 کے علاوہ اصل Open Problems بھی شامل کیے گئے ہیں، اور Erdős کے کھلے مسائل کو Lean میں FrontierMath Erdős کے طور پر فارمولا بند کیا گیا ہے۔

فرنٹیئر میتھ

پہلا مدل کو ایک ایسے تحقیقی مسئلہ کے ساتھ ٹیسٹ کرتا ہے جو اب تک ریاضی کی دنیا میں حل نہیں ہوا؛ دوسرا AI سے فارمل ویریفیکیشن سے گزرنے والے مکمل ثبوت لکھنے کا مطالبہ کرتا ہے۔

اس بار، اسٹرا نے فرینٹیئر میتھ ارڈوس کے 68 سوالات میں صرف 2 کو حل کیا۔

کہانی جاری ہے~

یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: henry

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔