لحظة قصيرة وجميلة في يناير 2025، لحقت نماذج الذكاء الاصطناعي ذات الأوزان المفتوحة بمنافسيها ذوي المصادر المغلقة. وصل فرق تقييم Elo في قائمة الرؤوس المصنفة التي جمعها الجمهور إلى الصفر. تكافؤ.
لقد انتهى ذلك الوقت. اعتبارًا من سبتمبر 2026، اتسعت الفجوة بين أفضل نماذج الحدود المغلقة ومنافسيها المفتوحين الأقوى إلى 29 نقطة إيلو، وفقًا لبيانات تقييم Arena AI. يقع Claude Opus 5 Max عند تقييم قدره 1505، بينما يتأخر Kimi K3 Max من Moonshot AI، أقوى منافس مفتوح الوزن، بنحو 30 نقطة. كان بيتر غوستيف، قائد قدرات الذكاء الاصطناعي في Arena، في مركز تتبع وتصور هذا الانفصال.
ما الذي تعنيه هذه الأرقام فعليًا
المسار يروي قصة أكثر إثارة من أي لقطة فردية. من الصفر في يناير 2025 إلى 29 نقطة في سبتمبر 2026، فإن خط الاتجاه يتحرك في الاتجاه الخاطئ لمؤيدي النماذج المفتوحة الوزن. ويدعم تحليل Epoch AI هذه الصورة من زاوية مختلفة: فالنماذج المفتوحة الوزن تتأخر الآن عن نظيراتها المغلقة بحوالي أربعة أشهر في الأداء على المهام الأكثر صعوبة. وهذا ارتفاع من تأخر مدته ثلاثة أشهر تم ملاحظته حتى أواخر 2025.
تُجري Arena أكثر من 10 ملايين تقييم شهريًا، مستندةً إلى مجموعة ضخمة من تفاعلات المستخدمين الحقيقيين بدلاً من المعايير الاصطناعية. عندما يُفضل ملايين المستخدمين المجهولين باستمرار نتائج نموذج واحد على آخر، فإن هذا الإشارة يصعب تجاهلها.
عمل قياس الذكاء الاصطناعي
أصبحت Arena نفسها قصة عمل مثيرة للاهتمام. ما بدأ كمشروع بحثي في جامعة كاليفورنيا، بيركلي في عام 2023، قد تحول إلى مؤسسة تحقق إيرادات سنوية قدرها 100 مليون دولار. ووصلت إلى هذا المعدل خلال ثمانية أشهر فقط من إطلاق خدمات التقييم المدفوعة.
ركّز مساهمة غوستيف الخاصة على جعل نقاط ضعف النموذج واضحة. يسلط عمله الضوء على التوتر بين أداء النماذج عند تقييمها من قبل خبراء المجال مقابل المستخدمين العاديين، وهو تمييز يهم بشكل كبير في عمليات النشر المؤسسية.
الجغرافيا السياسية للنماذج المفتوحة
لقد تحول تطوير النماذج المفتوحة المصدر الأكثر نشاطًا بشكل كبير نحو المختبرات الصينية. تمثل سلسلة Kimi من Moonshot AI وGLM من Zhipu وDeepSeek وQwen من Alibaba حدود ما هو متاح للجمهور. ومع ذلك، لا يزال الفجوة قائمة. فأنثروبيك وOpenAI وGoogle DeepMind يستمرون في دفع نماذجهم المغلقة إلى الأمام بشكل أسرع وأعمق.
