تسيطر نماذج الذكاء الاصطناعي العالمية على IMO 2026 بدرجات كاملة

icon MarsBit
مشاركة
AI summary iconملخص
انكسرت أخبار الذكاء الاصطناعي والعملات المشفرة عندما حصلت أربعة نماذج للذكاء الاصطناعي—Claude Fable 5 وGPT-5.6 Sol xhigh وKimi K3 وAxiomProver—على درجة 42/42 في أولمبياد الرياضيات الدولي 2026، متفوقة على 99% من المنافسين البشريين. لم يحقق سوى 30 إنسانًا درجات كاملة على مدار سبع سنوات. قام Axiom Math بترجمة المسائل إلى Lean 4 للتصحيح الآلي. تراوحت التكاليف بين 0.18 دولار و51 دولارًا. قد تشمل مناقشات السياسة العالمية للعملات المشفرة قريبًا دور الذكاء الاصطناعي في الرياضيات والمنطق.

يوليو في شنغهاي، موجة حر شديدة.

اختتمت الدورة السادسة والستون للمسابقة الدولية للرياضيات رسميًا، حيث فازت الصين برصيد 232 نقطة واحتلت المركز الأول. وحقق ثلاثة شبان درجة كاملة قدرها 42 نقطة.

أكسيوم ماث

لم تهدأ تصفيقات الجمهور بعد، ظهرت قائمة إنجازات أخرى ملحوظة على GitHub.

المهندس السابق في جوجل ديدي داس يُجري مقارنة شاملة للذكاء الاصطناعي: 7 نماذج كبيرة متقدمة تتحدى بشكل مستقل جميع المسائل الست لـ IMO 2026.

كلاود فايل 5 حصل على 42 من 42 نقطة. استغرق فقط 2.5 ساعة ونفّذ 51 دولارًا.

إصدار xhigh من GPT-5.6 Sol حصل أيضًا على درجة كاملة. استغرق 3.8 ساعة، وانخفض التكلفة إلى مستوى منخفض جدًا قدره 20 دولارًا.

كيمي ك3 تليها بتحقيق درجة كاملة. بعد معركة استمرت 17.4 ساعة، بتكاليف قدرها 31 دولارًا.

بإضافة AxiomProver المستقل، جميع القوى الأربعة تحقق الدرجة الكاملة.

أكسيوم ماث

كمقارنة، خلال الأعوام السبعة الماضية من الأولمبياد الدولي للرياضيات، شارك 4347 متسابقًا بشريًا، وحقق فقط 30 منهم درجة كاملة — بنسبة 0.69%.

أكسيوم ماث

تفوق ساحق بفارق كبير

من النتائج، لا يقتصر الفرق على 14 نقطة بين الدرجة الكاملة 42 والمركز الرابع 28، بل إن النماذج الثلاثة التي حصلت على الدرجة الكاملة احتلت الصدارة بأساليب مختلفة تمامًا.

كلاود فايل 5 أدى المهمة بدقة وسلاسة. 9 محادثات، 6 إخراجات فعالة، أطول جلسة واحدة استمرت 73 دقيقة (P3)، وأُنتج إجمالي 700,000 رمز.

يبدو أن GPT-5.6 Sol واجه بعض الصعوبات. فقد استغرق 106 دقائق على P2 لإكمال 4 جولات، وتم مقاطعته مرتين بسبب أعطال في الشبكة. لكن التحكم في القدرة الحسابية يُعد مذهلاً — فقد أنتج إجمالي 230 ألف token، وهو الأقل استهلاكاً بين الثلاثة المثاليين.

كيمي K3 مثل وحش لا يعرف التعب. نموذج MoE بـ 2.8 تريليون معلمة، أطلق فجأة 1.54 مليون رمز، وهو 6.5 مرة أكثر من Sol. فقط في سؤال P3، شنّ ست هجمات، ودارت معركة لمدة 491 دقيقة.

أكسيوم ماث

أكسيوم ماث

أكسيوم ماث

أكسيوم ماث

أكسيوم ماث

أكسيوم ماث

مواجهة مباشرة للحدس الرياضي

P1 هو أخف فاتح للشهية في المكان، ويتم حلّه من قبل جميع النماذج في دقائق قليلة، ويكاد المتنافسون البشريون لا يخطئون أبداً.

يُكتب على السبورة 2026 عددًا صحيحًا موجبًا أكبر من 1. في كل خطوة، اختر عددين m و n، امسحهما، واستبدلهما بـ gcd(m,n) و lcm(m,n)/gcd(m,n). كرر العملية حتى لا يمكن الاستمرار. أثبت أن: (أ) ستنتهي العملية بالضرورة، ويتبقى عدد واحد فقط أكبر من 1، وهو M؛ (ب) قيمة M لا تعتمد على ترتيب العمليات.

أكسيوم ماث

لتسهيل فهم هذا السؤال، دعنا نجري تجربة مصغرة.

على السبورة يوجد فقط 12 و18. 12 = 2² × 3، 18 = 2 × 3². الخطوة الأولى: gcd(12,18) = 6، lcm(12,18)/6 = 6، تصبح السبورة [6, 6]. الخطوة الثانية: gcd(6,6) = 6، lcm(6,6)/6 = 1، تصبح السبورة [6, 1]. يتبقى عدد واحد فقط أكبر من 1، لذا ينتهي اللعبة. M = 6.

مهما قمت بترتيب العمليات بشكل مختلف، فإن M دائمًا ما يكون 6. لماذا؟

The answer lies in the prime factors.

لكل عدد أولي p، خذ القاسم المشترك الأكبر لعدد مرات قسمة جميع الأعداد على p، ثم اضرب قوى الأعداد الأولية هذه معًا — هذه القيمة تبقى ثابتة من الخطوة الأولى إلى الخطوة الأخيرة.

Claude Fable 5: أنشأ مباشرة عدادًا ينخفض بالضرورة في كل خطوة.

للهذا السؤال، يُعرّف Fable 5 كمية Φ = T + N. حيث T هو مجموع عدد العوامل الأولية لجميع الأعداد على السبورة (مع التكرار)، وN هو عدد الأعداد الأكبر من 1. على سبيل المثال، إذا كانت الأعداد على السبورة [12, 18]، فإن العوامل الأولية لـ 12 هي 2 و2 و3 (إجمالي 3)، والعوامل الأولية لـ 18 هي 2 و3 و3 (إجمالي 3)، وبالتالي T = 6 وN = 2، وΦ = 8.

ثم يثبت أن كل خطوة تنفذ، تنخفض Φ بمقدار لا يقل عن 1. هناك حالتان — إذا كان gcd(m,n) > 1، فسيقل العدد الإجمالي للعوامل الأولية T؛ وإذا كان gcd(m,n) = 1، فسيبقى T ثابتًا لكن عدد الأعداد الأكبر من 1 سيقل بمقدار واحد، فينخفض N بمقدار 1. Φ عدد صحيح موجب، وكل خطوة تقلله بمقدار لا يقل عن 1، لذا يجب أن تنتهي العملية في عدد محدود من الخطوات. عداد واحد، قطع واحد.

أكسيوم ماث

GPT-5.6 Sol: تتبع المنتج، ترتيب قاموسي تنازلي.

أما سول فيراقب كميتين: P = حاصل ضرب جميع الأعداد، وK = عدد الأعداد الأكبر من 1. في كل عملية، إذا كان gcd(m,n) = d > 1، فإن حاصل ضرب العددين الجديدين هو mn/d، وهو أصغر من السابق، وبالتالي يقل P بشكل صارم. إذا كان d = 1، يبقى P كما هو، لكن K ينقص بمقدار 1.

الزوج (P, K) يتناقص بشكل صارم وفق الترتيب الدليلي: إما أن P يصغر، أو يبقى P ثابتًا بينما يصغر K. لا يمكن أن يحدث تناقص غير محدود وفق الترتيب الدليلي للأعداد الصحيحة الموجبة. الانتهاء.

أكسيوم ماث

تم حل الجزء (a) من نفس المشكلة عبر طريقتين مختلفتين تمامًا.

في الجزء (b)، تلتقي النماذج الثلاثة في النتيجة نفسها: جميعها تثبت أن القاسم المشترك الأكبر لعدد مرات قابلية قسمة كل عدد على اللوحة على عدد أولي p يبقى ثابتًا أثناء العمليات. الصيغة النهائية متطابقة تمامًا—

أكسيوم ماث

العودة إلى المثال للتحقق: 12 و18. بالنسبة لـ p=2، v₂(12) = 2، v₂(18) = 1، GCD = 1، المساهمة 2¹. بالنسبة لـ p=3، v₃(12) = 1، v₃(18) = 2، GCD = 1، المساهمة 3¹. M = 2 × 3 = 6، وهو نفس الناتج الذي تم حسابه يدويًا.

أرخص ورقة بيضاء في جميع أنحاء المنصة

تُعد مسألة P6 في نظرية الأعداد المسألة الختامية ليوم 2، وهي تطلب إثبات أن المتتالية التكرارية تصبح دورية في النهاية.

في العام الماضي، حلّ فقط 6 أشخاص من البشر المسألة P6 في IMO 2025 عالميًا.

Claude Fable: 5:26 دقيقة، جولتان، درجة كاملة. GPT-5.6 Sol: 60 دقيقة، جولتان، درجة كاملة. كيمي K3: 381 دقيقة، أربع جولات، الحد الأقصى.

يُنتج Grok 4.5 فقط 7053 رمزًا على P6، مما يجعله في المركز الأخير. ويُذكر بوضوح في ملف التقديم: Full proof: (Not yet complete.)

0.18 دولار، أقل ورقة بيضاء سعرًا في الموقع بأكمله.

مشكلات Grok لا تنتهي هنا. خلال الاختبار بأكمله، عادت مرارًا وتكرارًا إلى هلوسة غريبة: تؤكد بثقة أن "الإثبات تم كتابته في الملف"، بينما لم يلمس الخلفية أداة الكتابة على الإطلاق.

هذه ليست مشكلة في القدرة الرياضية، بل مشكلة في قدرة الوكيل. النموذج يعرف أنه يجب عليه كتابة الملف، ويدّعي أنه كتبه، لكنه لم يقم بأي إجراء على مستوى استدعاء الأداة.

ثلاث قفزات على مدار ثلاث سنوات

التطور المرعب للدماغ السيليكوني

في عام 2024، وصل AlphaProof من DeepMind لأول مرة إلى حدود الميدالية الفضية على مستوى IMO.

في عام 2025، أطلقت OpenAI وDeepMind في نفس الوقت. لم تُعلن OpenAI عن نموذجها، لكنها حلت 5 أسئلة وحصدت ميدالية ذهبية بدرجة 35، بينما وصل Gemini Deep Think إلى نفس المستوى.

في عام 2026، حصلت ثلاثة نماذج عامة كبيرة على الدرجة الكاملة مباشرة. هذه المرة، لم تخضع لأي تدريب متخصص في الرياضيات، ويمكن للجميع استخدامها. بل إن أحد النماذج مفتوح المصدر.

أكسيوم ماث

من كتب رسالة التحدي الآلية

نقطة بداية الاختبار الكامل هي شركة تُدعى Axiom Math.

ترجموا جميع المسائل الست لـ IMO 2026 حرفًا بحرف إلى صيغة رسمية Lean 4 يمكن للآلة فهمها.

بفضل هذه الأسئلة القابلة للقراءة من قبل الآلات، يمكن للذكاء الاصطناعي إنتاج إثباتات Lean مباشرة وتصحيحها تلقائيًا بواسطة المُترجم، دون الحاجة إلى مُقيّمين بشريين.

بعد الحصول على واجهة المهمة، قام ديدي داس ببناء إطار اختبار آلي بالكامل. سارت النماذج الكبرى على المسار كلها بسرعة، وأكملت جميع المراحل الست. كما حصل AxiomProver بشكل مستقل على الدرجة الكاملة.

جدير بالذكر أن مؤسسة Axiom Math، هونغ لوتونغ، تبلغ من العمر 25 عامًا فقط. وهي مولودة في قوانغتشو، وأكملت بكالوريوسًا مزدوجًا في الرياضيات والفيزياء من معهد ماساتشوستس للتكنولوجيا في ثلاث سنوات فقط، وهي أيضًا فائزة بجائزة مورغان.

في نهاية العام الماضي، حصل AxiomProver الذي أنشأته على الدرجة الكاملة في مسابقة Putnam للرياضيات. وهي المعجزة السادسة في تاريخ المسابقة الذي يمتد لـ98 عامًا.

في مارس من هذا العام، أكملت الشركة جولة تمويل من الفئة A بقيمة 200 مليون دولار أمريكي. وارتفع تقييمها إلى 1.6 مليار دولار أمريكي.

أكسيوم ماث

كيف سيتم إعادة تشكيل حياة الأشخاص العاديين؟

يمكنك كتابة نموذج مُثبت بدقة يحتوي على 4229 سطرًا، وليس لديك في يديك فقط القدرة على حل المسائل الرياضية.

ما يتحكم فيه حقًا هو الاستدلال المنطقي الطويل السلسلة، حيث لا يمكن تخطي أي خطوة، ولا يمكن أن تكون خاطئة، ولا يمكن أن تكون غامضة.

هل هناك ثغرات في شروط العقد؟ هل شروط مطالبة التأمين محققة؟ هل خطة الضرائب متوافقة؟ إن تحليل هذه الظواهر يكشف أنها جميعًا نوع واحد من المسائل: الإجابة لا يمكن أن تكون "تقريبًا صحيحة".

في الماضي، كان هذا التحقق التفصيلي يُجريه فقط المحترفون، ويُحسب الأجر بالساعة.

الآن، مع تطبيق هذه القدرة على المنتجات الاستهلاكية، كل ما عليك فعله عند مواجهة مشكلة صعبة هو فتح هاتفك.

المراجع:

https://x.com/deedydas/status/2079409461874332066

هذا المقال من حساب WeChat "New Intelligence Yuan"، المؤلف: ASI Revelation، المحرر: موسى

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.