هذا المرة، قام Claude بتفوق كبير على قائمة الذكاء الاصطناعي للبرمجة!
في قائمة تصنيف MirrorCode التي تم تحديثها للتو، تصدر Claude Fable 5 مرة أخرى بنسبة نجاح مطلقة تبلغ 64%.
GPT-5.6 Sol الذي يليه مباشرةً، لديه درجة تساوي ثلث درجته فقط!
المرتبة الرابعة GPT-5.5 أسوأ. ليس فقط أن نتيجته 10٪، بل إنها حتى تُداس من قِبل سلفها GPT-5.4.

الأمر الأكثر إثارة للدهشة هو أن معدل الحل لـ Fable 5 عند استخدام لغات عالية الموارد مثل Go كان 64٪؛ وعند التحول إلى لغة نادرة مثل Ada، ظل الأداء مرتفعًا عند 61٪.
يجب أن تعلم أنه في عالم مفتوح المصدر، فإن مادة Python تبلغ حوالي 230 ضعف مادة Ada.
لكن هنا في Fable 5، انخفض الأداء فقط بنسبة 3 بالمائة.

هذا يصبح مثيرًا للاهتمام.
إذا كان النموذج يعتمد بشكل رئيسي على حفظ قواعد اللغة الشائعة وأساليب الكتابة الشائعة، فكان ينبغي أن تنخفض النتائج بعد التحول إلى Ada.
لكن النتيجة الحالية تشير إلى احتمال آخر—
أقوى نموذج قد تحرر من قيود البيانات التدريبية المحددة، وبدأ يتعلم كيفية بناء مشروع برمجي كامل من الصفر.
عالق على خط المرور 100٪، اختبار حدود 10 مليار رمز
على وجه التحديد، يحتوي MirrorCode الكامل على 25 برنامجًا مستهدفًا، تغطي مجالات أدوات Unix، والمفسرات، واستعلامات البيانات، وعلم الأحياء الحاسوبي، وعلم التشفير، وأدوات الضغط.
هنا، يتم وضع النموذج في بيئة معزولة، بدون اتصال بالإنترنت، ولا يمكنه رؤية كود المشروع الأصلي، ولا تنزيل تبعيات طرف ثالث. ما يمكنه الحصول عليه هو الوثائق العليا، وبعض الاختبارات المرئية، بالإضافة إلى البرنامج الأصلي الذي يمكن استدعاؤه مرارًا وتكرارًا.
بعد ذلك، يجب أن تستمر في إدخال بيانات إلى البرنامج الأصلي، ومراقبة المخرجات للتنبؤ بالمنطق الداخلي، ثم انقر اكتب برنامجًا جديدًا يتمتع بسلوك متسق.
اختر 15 هدفًا متوسطًا و كبيرًا من أحدث القائمة. استخدم لغتي تنفيذ لكل هدف، وشغّل كل لغة ثلاث مرات.
كما يجب أن يصل معدل إكمال الاختبارات المرئية والاختبارات المخفية إلى 100% للنجاح، ولا يكفي 99.9%.
حتى إذا تم تخطي حالة حافة واحدة، فإن التشغيل كله يُحسب كفشل.

لإجبار النموذج على سد الفجوات الأخيرة أيضًا، رفعت MirrorCode الميزانية الفردية إلى 10 مليار رمز، مع السماح بتشغيل مستمر لأقصى حد قدره 7 أيام.
أحد المهام الأعلى تكلفة في الورقة كان أكثر إثارة للدهشة: عمل النموذج بشكل مستمر لمدة 19 يومًا، بتكاليف فردية بلغت 2600 دولارًا.
خلال هذه الأيام الـ19، سيُعيد النموذج تشغيل البرنامج الأصلي مرارًا وتكرارًا، ومقارنة النتائج، وإضافة الوظائف، ثم إعادة تشغيل الاختبارات. عند حدوث خطأ، يتحقق من السبب، وعند عدم تطابق الإخراج، يغيّر الافتراضات، وعند نجاح جزء محلي، ينتقل إلى الفجوة التالية.
العملية بأكملها تشبه أكثر عملية تطوير مستمرة لعدة أيام، وليس توليدًا واحدًا.

مثال gotree هو الأكثر وضوحًا.
كان هذا الأداة البيولوجيا الحاسوبية تحتوي في الأصل على حوالي 16 ألف سطر من كود Go وأكثر من 40 أمرًا.
استخدم Claude Opus 4.7 14 ساعة و251 دولارًا لاجتياز 2000 من أصل 2001 اختبارًا، بإنجاز بلغ 99.95%.
على الرغم من أن هناك حافة نادرة تم تجاهلها في معالجة ملاحظات التاريخ، مما أوقفها عند خط المرور بنسبة 100٪ من MirrorCode، إلا أنها قد خفضت حجم العمل الذي كان يُحسب أسبوعيًا إلى بضعة عشر ساعات فقط—
تُقدّر Epoch أن المهندسين البشريين سيحتاجون على الأقل من أسبوعين إلى 17 أسبوعًا لإكمال نفس المهمة دون استخدام الذكاء الاصطناعي.
في صحراء المواد، سقط Fable 5 بـ 3 نقاط فقط
استخدمت ورقة MirrorCode مزيج التدريب العام لـ StarCoder كمرجع.
يبلغ حصة Python حوالي 8٪، بينما تبلغ حصة Ada فقط 0.034٪، أي أن النسبة الأولى تقارب 230 ضعف النسبة الثانية.

بالطبع، لا يمكننا معرفة عدد كودات Ada التي رآها النموذج مغلق المصدر. لكن باستخدام البيئة المفتوحة كمرجع، فإن ندرة Ada واضحة تمامًا.
تُستخدم هذه اللغة بشكل رئيسي في مجالات الطيران والفضاء والدفاع وأنظمة أخرى حساسة من حيث الأمان. ولا تقارن من حيث حجم المجتمع أو عدد الدروس التعليمية أو المشاريع مفتوحة المصدر مع بايثون أو جافا سكريبت أو غو.
بينما Fable 5 ليس يترجم كود Go حرفًا إلى Ada.
إنه أكثر شبهاً بفهم كيفية عمل البرنامج الأصلي أولاً، ثم إعادة إنشاء نفس السلوك بلغة أخرى.

على العكس، نماذج أخرى لم تكن بهذه الثبات.
انخفض GPT-5.6 من 24% إلى 19%, وانخفض GPT-5.4 من 21% إلى 12%, بينما هبط GPT-5.5 من 17% إلى 5%. بمجرد تغيير اللغة، تصبح الفجوة أكثر وضوحًا.
تسليم المشروع بالكامل للذكاء الاصطناعي
حتى الآن، جعل Cursor مئات الوكلاء يعملون معًا لمدة أسبوع تقريبًا، لكتابة أكثر من مليون سطر من كود المتصفح من الصفر، موزعة على 1000 ملف.
استخدم Anthropic 16 عميلًا من Claude للتشغيل المتوازي لأكثر من 2000 جلسة، ونتيجةً لذلك بنوا مترجم C مكوّن من 100 ألف سطر قادر على ترجمة نواة Linux 6.9.
في عينة المستخدمين الفرديين لـ Codex التي كشفت عنها OpenAI حتى مايو، قام 70.2% على الأقل بإرسال مهمة تُقدّر بأنها تتطلب أكثر من ساعة من العمل البشري؛ وقام 25.6% بإرسال مهام تتجاوز ثمانية ساعات.
الوحدات التي يُسلّمها الناس للذكاء الاصطناعي تتحول من كود واحد أو خطأ واحد إلى بعد ظهر واحد، أو أسبوع، أو حتى مشروع كامل.
64% من MirrorCode هي كمية دقيقة لهذا النوع من "التفويضات على مستوى المشروع".
يوضح ذلك أنه مع تحديد الهدف بوضوح وقابلية قبول النتائج تلقائيًا، يمكن للنماذج المتقدمة إنجاز جزء من البرمجيات متوسطة وكبيرة الحجم بشكل مستقل.
لكل شخص يُفوّض عمله للذكاء الاصطناعي، التغيير أصبح على الأبواب—
سابقًا، كنت بحاجة إلى مراقبة كل سطر من الشيفرة، أما الآن، فمن المرجح أنك ستتحقق فقط من النقاط الرئيسية لمعرفة ما إذا كانت تخرج عن مسارها.
الكود سيصبح أرخص تدريجيًا.
أما أولئك الذين يستطيعون توضيح المشكلات وفحص النتائج بدقة، فسيزداد قيمتهم أكثر فأكثر.
المراجع: https://epoch.ai/MirrorCode
هذا المقال من حساب WeChat "New Intelligence Yuan"، المؤلف: ASI Revelation؛ المحرر: موسى
