أطلق نموذج الاستدلال الأحدث من OpenAI، GPT-6 Astra، في 3 سبتمبر بدرجة 97.6% على FrontierMath Tier 4 (v2). هذا هو النوع من الأرقام الذي يجعلك تنظر مرتين، خاصة عندما تعلم أن نسخة داخلية سابقة من النموذج لم تستطع تحقيق سوى 17% تقريبًا في تقييمات القدرة الرياضية.
المسار من 17% إلى 47% داخليًا، ثم إلى الكمال شبه الكامل على مقاييس عامة، يضغط ما يُشعر عادةً بأنه سنوات من التقدم في دورة تطوير واحدة.
السباق المرجعي
على ARC-AGI-3، والذي تم قياسه ضمن إطار تقييم OpenAI الخاص، حققت Astra درجة 99.9%. وعلى ExploitBench، حققت درجة مثالية قدرها 100%. وبلغت GPQA Diamond، وهي معيار للتفكير العلمي على مستوى الدراسات العليا، 96.0%. وحققت Terminal-Bench Science 0.1 درجة قدرها 64.6%.
نتيجة FrontierMath Tier 4 (v2) هي الرقم الرئيسي. وقد حصل GPT-5.6 Sol، سلف Astra، على 83.0% في نفس المعيار. ويمثل 97.6% لـ Astra تحسينًا قدره 14.6 نقطة مئوية.
من 17% إلى عالمي المستوى
الإصدارات المبكرة من النموذج الذي أصبح أسترا أدارت حوالي 17% في تقييمات القدرة الحسابية. ومن خلال تحسينات تدريجية، ارتفع هذا الرقم إلى حوالي 47% قبل تحسين النموذج بشكل إضافي لإطلاقه العام.
كما أشادت OpenAI بـ Astra لمساهمتها برؤى جديدة حول فجوات الأعداد الأولية، وهي منطقة صعبة للغاية في نظرية الأعداد وقد شغلت الرياضيين البشريين لقرون عديدة.
من يحصل على الوصول، ومتى
تبع إطلاق أسترا نهجًا تدريجيًا. حصلت منظمات مختارة على الوصول في يوم الإطلاق، مع توسيع التوفر ليشمل مشتركي ChatGPT Plus وPro وBusiness وEnterprise بعد فترة وجيزة. يمكن الوصول إلى واجهة برمجة التطبيقات مباشرة من خلال OpenAI، وكذلك من خلال Azure وAWS Bedrock.
مشهد المنافسة
لقد وضعت التقييمات المستقلة أسترا ضمن أفضل نماذج الذكاء الاصطناعي أداءً متاحة حاليًا، على الرغم من أن بعض التقييمات تشير إلى أن بعض إصدارات كلاود من أنثروبيك تتفوق عليها في اختبارات الذكاء الأوسع.
الانتقال من 83.0% إلى 97.6% على FrontierMath في جيل نموذج واحد يشير إلى أن السقف المحتمل للتفكير الرياضي للذكاء الاصطناعي، إن وُجد، لم يُصل إليه بعد.
