حقق GPT-6 Astra من OpenAI 97.6% في FrontierMath Tier 4

iconCryptoBriefing
مشاركة
AI summary iconملخص
حقق GPT-6 Astra من OpenAI 97.6% في FrontierMath Tier 4 (v2)، وهو تقدم كبير مقارنة بإصدار داخلي حصل على 17% في اختبارات الرياضيات. كما حقق النموذج 99.9% في ARC-AGI-3، و100% في ExploitBench، و96.0% في GPQA Diamond. وتخطى Astra سلفه GPT-5.6 Sol بفارق 14.6 نقطة مئوية على نفس المعيار. يُعد هذا الخبر على السلسلة تحديثًا رئيسيًا في دورة أخبار إطلاق الرمز المميز. أصبح Astra متاحًا الآن للمستخدمين من خطط ChatGPT Plus وPro وBusiness وEnterprise، بالإضافة إلى شركاء API.

أطلق نموذج الاستدلال الأحدث من OpenAI، GPT-6 Astra، في 3 سبتمبر بدرجة 97.6% على FrontierMath Tier 4 (v2). هذا هو النوع من الأرقام الذي يجعلك تنظر مرتين، خاصة عندما تعلم أن نسخة داخلية سابقة من النموذج لم تستطع تحقيق سوى 17% تقريبًا في تقييمات القدرة الرياضية.

المسار من 17% إلى 47% داخليًا، ثم إلى الكمال شبه الكامل على مقاييس عامة، يضغط ما يُشعر عادةً بأنه سنوات من التقدم في دورة تطوير واحدة.

السباق المرجعي

على ARC-AGI-3، والذي تم قياسه ضمن إطار تقييم OpenAI الخاص، حققت Astra درجة 99.9%. وعلى ExploitBench، حققت درجة مثالية قدرها 100%. وبلغت GPQA Diamond، وهي معيار للتفكير العلمي على مستوى الدراسات العليا، 96.0%. وحققت Terminal-Bench Science 0.1 درجة قدرها 64.6%.

إعلان

نتيجة FrontierMath Tier 4 (v2) هي الرقم الرئيسي. وقد حصل GPT-5.6 Sol، سلف Astra، على 83.0% في نفس المعيار. ويمثل 97.6% لـ Astra تحسينًا قدره 14.6 نقطة مئوية.

من 17% إلى عالمي المستوى

الإصدارات المبكرة من النموذج الذي أصبح أسترا أدارت حوالي 17% في تقييمات القدرة الحسابية. ومن خلال تحسينات تدريجية، ارتفع هذا الرقم إلى حوالي 47% قبل تحسين النموذج بشكل إضافي لإطلاقه العام.

كما أشادت OpenAI بـ Astra لمساهمتها برؤى جديدة حول فجوات الأعداد الأولية، وهي منطقة صعبة للغاية في نظرية الأعداد وقد شغلت الرياضيين البشريين لقرون عديدة.

من يحصل على الوصول، ومتى

تبع إطلاق أسترا نهجًا تدريجيًا. حصلت منظمات مختارة على الوصول في يوم الإطلاق، مع توسيع التوفر ليشمل مشتركي ChatGPT Plus وPro وBusiness وEnterprise بعد فترة وجيزة. يمكن الوصول إلى واجهة برمجة التطبيقات مباشرة من خلال OpenAI، وكذلك من خلال Azure وAWS Bedrock.

مشهد المنافسة

لقد وضعت التقييمات المستقلة أسترا ضمن أفضل نماذج الذكاء الاصطناعي أداءً متاحة حاليًا، على الرغم من أن بعض التقييمات تشير إلى أن بعض إصدارات كلاود من أنثروبيك تتفوق عليها في اختبارات الذكاء الأوسع.

الانتقال من 83.0% إلى 97.6% على FrontierMath في جيل نموذج واحد يشير إلى أن السقف المحتمل للتفكير الرياضي للذكاء الاصطناعي، إن وُجد، لم يُصل إليه بعد.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.