حقق GPT-6 Astra من OpenAI المركز الأول في قائمة تصنيف Code Arena للتطوير الويب بدرجة 1,797، مُبتعدًا بـ 35 نقطة عن Claude Fable 5.1 من Anthropic الذي يحتل المركز الثاني بدرجة 1,762. وبعد يومين فقط من إطلاقه الرسمي في 3 سبتمبر 2026، يعيد النموذج كتابة الترتيب في مجال تطوير الويب المدعوم بالذكاء الاصطناعي.
التصنيف، الذي تديره Arena.ai، ليس معيارًا ثابتًا عاديًا. فهو يستخدم نظام تقييم على غرار Elo يعتمد على التصويت الجماعي، وهو نفس آلية التصنيف المستخدمة في الشطرنج التنافسي، حيث يصوت أعضاء المجتمع على مدى كفاءة نماذج الذكاء الاصطناعي في تنفيذ مهام برمجة واجهات المستخدم الحقيقية. وقد تم تسجيل أكثر من 650,000 صوت على 126 نموذجًا، مما يجعل هذا أحد أكثر تقييمات المجتمع قوة في مجال الذكاء الاصطناعي.
ما الذي يجعل هذا المعيار مختلفًا
تُركز المعايير التقليدية للذكاء الاصطناعي على اختبار النماذج باستخدام مجموعات بيانات ثابتة بإجابات صحيحة محددة مسبقًا. أما Code Arena فيعتمد نهجًا مختلفًا جذريًا، حيث تُقيّم النماذج بناءً على التفكير متعدد الخطوات، واستخدام الأدوات، وسير العمل التكراري في البرمجة، أي العملية الفوضوية غير الخطية التي تتضمنها تطوير الويب الحقيقي.
يمثل درجـة 1,797 الخاصة بـ GPT-6 Astra أعلى درجة حققها أي نموذج على هذه القائمة المرجعية المحددة. وكان نموذج Claude Fable 5.1، المنافس الأحدث من Anthropic، يحتفظ بدرجة قوية عند 1,762.
المشهد التنافسي يصبح مزدحمًا
OpenAI وAnthropic ليسا اللاعبين الوحيدים الذين يتنافسون على المراكز. أظهرت لقطات سابقة من قائمة الصدارة في سبتمبر نماذج من مطورين صينيين يتحدون الشركتين على المراكز العليا.
يتم تسعير كل من GPT-6 Astra (Max) وClaude Fable 5.1 (Max) بنفس السعر: 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج. وكلاهما يوفر نافذة سياقية بحجم مليون رمز.
وضعت OpenAI GPT-6 Astra كأقوى نموذج لها للهندسة البرمجية والتطبيقات ذات الصلة. النموذج متاح حاليًا للمشتركين في ChatGPT والشركاء المختارين من واجهات برمجة التطبيقات والخدمات السحابية.
