GPT-6 Astra تحل مشكلة المستوى 4 في الرياضيات

icon MarsBit
مشاركة
AI summary iconملخص
أخبار الذكاء الاصطناعي والعملات المشفرة: لقد حَلّت GPT-6 Astra المشكلة النهائية في FrontierMath Tier 4، وأكملت جميع التحديات في المعيار المتقدم. وتم تطوير Astra من قبل Epoch AI مع أكثر من 60 رياضيًا، وحققت دقة بنسبة 97.6% وفكّت آخر مشكلة لم تُحل. وينتقل المشروع الآن إلى مرحلة جديدة تشمل الأبحاث المفتوحة والتحديات المُصاغة رسميًا، مما يمثل إعلانًا رئيسيًا عن تقدم في مجال الذكاء الاصطناعي.

للتو، تم حل أصعب تحدٍ من مستوى FrontierMath 4 بواسطة GPT-6 Astra.

حتى الآن، تم حل جميع أسئلة هذا الاختبار البحثي الذي كان يُعتبر كابوسًا رياضيًا للنماذج الكبيرة على الأقل مرة واحدة بواسطة الذكاء الاصطناعي.

كما أصدرت Epoch AI استنتاجها الرسمي: FrontierMath Tier 4، مشبعة.

فرانتير ماث

على الرغم من أن الرسم البياني أعلاه يظهر أن أسترا لم تصل بعد إلى 100٪، فإن النتائج التي نشرتها OpenAI نفسها هي 97.6٪.

لكن وفقًا لخوارزمية Epoch، فإن "حل جميعها" يعني أن كل سؤال في المستوى 4 قد تم حلّه بنجاح بعد جمع المحاولات المختلفة من نماذج وأوقات مختلفة.

أما ما قضت عليه أسترا، فهو بالضبط تلك الميزة الوحيدة التي لم تُهزم من قبل الذكاء الاصطناعي من قبل.

ببساطة، قد يكون هناك خطأ في اختبار ما من قبل Astra، لكن السؤال الذي أجاب عنه بشكل صحيح لم يكن قد حُل من قبل.

فرانتير ماث

بصراحة، هذا التسارع في التطور لا يُصدق.

إذا كنت تتبع تقييمات النماذج، فأنت تعلم أنه عند إطلاق Tier 4 في 11 يوليو 2025، كان أعلى أداء على القائمة حوالي 5% فقط.

بعد مرور عام وشهرين فقط، تحول هذا الجدار العالي سابقًا إلى درجة، وتم تجاوز آخر مشكلة كان من الصعب على الذكاء الاصطناعي تجاوزها عبر مسارات مختصرة.

كما أشار جاي بانتون، أستاذ مساعد في الرياضيات بجامعة ماركيت، إلى أن الذكاء الاصطناعي كان يبحث دائمًا عن مسارات عددية مختصرة، لكنه هذه المرة وجد أن حلاً للذكاء الاصطناعي قريب جدًا من حله.

فرانتير ماث

لكن، في أعقاب الهجوم المكثف من GPT-6 Astra على عالم الرياضيات، حيث حلّت مشكلات الألفية باستمرار على مدار أيام قليلة، أفاد Pantone أنه صار من الصعب عليه أن يُفاجأ!

يمكن القول إن الرياضيات أصبحت واحدة من أكثر المجالات التي أظهرت فيها أسترا وجودها بقوة مؤخرًا.

من أقل من 2%، إلى إضافة خط دفاع "مستوى بحثي" خاص

تم إصدار FrontierMath لأول مرة في 7 نوفمبر 2024، وهدفه الأصلي هو تجنب تجاوز الذكاء الاصطناعي لاختبار الرياضيات بسرعة مفرطة.

في ذلك الوقت، أصبح من الصعب越來越 التمييز بين النماذج الرائدة باستخدام معايير الرياضيات التقليدية مثل GSM8K و MATH، لذا قامت Epoch AI بالتعاون مع أكثر من 60 رياضيًا بإعادة تصميم مجموعة من المسائل الأصلية التي لم تُنشر من قبل.

ومن بينهم تاو تشي هوان وتيموثي غاوزرز وريتشارد بورشردز، حائزو جائزة فيلدز.

بعد أن اطّلع تاو تشي هوان على بعض هذه المسائل البحثية، قال مباشرةً إن هذه المسائل "صعبة جدًا"، وحتى توقع أن أصعب مسائل المستوى 3 قد تُعطل الذكاء الاصطناعي لسنوات إضافية.

فرانتير ماث

بعد الاختبار الأول، كما كان متوقعًا، لم تتجاوز دقة النموذج الرائد 2%.

في البداية، يحتوي قاعدة أسئلة FrontierMath على 300 سؤال، مصنفة حسب الصعوبة إلى ثلاثة مستويات: Tier 1 وTier 2 وTier 3.

فرانتير ماث

الفئة 1 قريبة إلى حد كبير من أسئلة المرحلة الجامعية الصعبة ومسابقات الرياضيات، مع السماح باستخدام أدوات أكثر تقدمًا؛ الفئة 2 تصل إلى مستوى صعوبة طلاب الدراسات العليا المتقدمين؛ بينما الفئة 3 أقرب إلى مشكلات البحث الاستكشافي التي يواجهها طلاب الدكتوراه في مراحلهم المبكرة.

لكن مع ظهور نماذج الاستدلال، بدأت هذه الطبقات الثلاث الأولى تصبح غير كافية أيضًا، لذا في عام 2025، أضافت Epoch طبقة إضافية، Tier 4.

يتم تصميم المستوى 4 بشكل كبير من قبل أساتذة الرياضيات وما بعد الدكتوراه، حيث يقوم كل فرد بإجراء بحث قصير يستمر حوالي أسابيع حول تخصصه، ثم يُلخص النتائج في سؤال يمكن التحقق منه تلقائيًا.

فرانتير ماث

في البداية، شمل المستوى 4 ما مجموعه 50 سؤالًا. تغطي مجالات مثل التحليل ونظرية الأعداد والرياضيات التوافقيّة والطوبولوجيا والهندسة الجبرية...

في البداية، لم يتم حل سوى ثلاث أسئلة من جميع الاختبارات السابقة للموديلات، وكان حل هذه الأسئلة يعتمد على بعض الافتراضات الصحيحة ولكن غير مبررة بشكل كافٍ.

في هذا السياق، كتبت Epoch أيضًا في صفحة الأسئلة النموذجية العامة على الموقع الرسمي: قد لا تُحل بعض هذه الأسئلة بواسطة الذكاء الاصطناعي لعقود.

فرانتير ماث

(هذه الجملة تُعاد إحياؤها باستمرار الآن)

لكن مع تطور النماذج بشكل أكبر، ظهرت مشكلة أخرى: بدأ قاعدة الأسئلة نفسها لا تتحمل ضغط الذكاء الاصطناعي.

اكتشفت OpenAI أثناء عملية الاختبار أن الأخطاء في FrontierMath كانت أكثر من المتوقع.

بعد ذلك،启动了 دورة التدقيق المستقلة، حيث تم فحص النقاط المشبوهة أولاً باستخدام GPT-5.5 وClaude Opus 4.7، ثم تم تفتيش كل سؤال على يد رياضيين. وفي النهاية، تم إطلاق الإصدار v2 في يونيو 2026، حيث تم تصحيح 12 سؤالاً وإزالة 7 أسئلة من المستوى 4، لتبقى 43 سؤالاً.

بعد التحديث، استمرت نتائج النموذج في الارتفاع.

وصل GPT-5.6 إلى 83.0٪، ووصل Claude Fable 5 إلى 90.2٪، ووصل GPT-6 Astra إلى 97.6٪.

فرانتير ماث

الأهم من ذلك، أن أسترا أكملت أيضًا السؤال الوحيد الذي لم يحله الذكاء الاصطناعي من قبل.

فرانتير ماث

حتى الآن، تم اختراق كل سؤال في المستوى 4 على الأقل مرة واحدة بنجاح من قبل الذكاء الاصطناعي. تم اختراق هذا الحاجز البحثي المصمم خصيصًا لأقوى النماذج في النهاية.

لكن هذا لا يعني أن "الرياضيات قد حُلّت بالذكاء الاصطناعي". على العكس، بدأ FrontierMath بالفعل الانتقال إلى المرحلة التالية.

الآن، بالإضافة إلى المستويات 1-4، أُضيفت مشكلات مفتوحة حقيقية، كما تم تشكيل مشكلات إيردوس المفتوحة في FrontierMath Erdős باستخدام Lean.

فرانتير ماث

الأول يختبر النموذج مباشرةً باستخدام مسائل بحثية لم تُحل بعد من قبل المجتمع الرياضي؛ بينما يطلب الثاني من الذكاء الاصطناعي كتابة إثبات كامل يمكن التحقق منه بشكل رسمي.

هذه المرة، حلّت Astra فقط مسألتين من أصل 68 مسألة في FrontierMath Erdős.

القصة لا تزال مستمرة~

هذا المقال من حساب WeChat "Quantum Bit"، الكاتب: henry

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.