لقد حصل نموذج يحتوي على 2 مليار معلمة فقط على المركز الأول بين النماذج المفتوحة تحت 4 مليارات معلمة في مؤشر الذكاء الاصطناعي Artificial Analysis Intelligence Index v4.2، بتسجيل 15 نقطة. تم تطوير MiniCPM5-2B من OpenBMB بالتعاون مع مختبر معالجة اللغة الطبيعية في جامعة تشينغهوا وModelBest، وهو مصمم للعمل على الهواتف وأجهزة الكمبيوتر المحمولة وغيرها من الأجهزة حيث تعتبر الموارد الحسابية رفاهية، وليس أمرًا مضمونًا.
ما الذي يقيسه المعيار فعليًا
أصدر Artificial Analysis الإصدار 4.2 من مؤشر الذكاء في 4 سبتمبر 2026، قبل ثلاثة أيام فقط من إطلاق MiniCPM5-2B. وقد أدخل المؤشر المحدث تغييرات ذات مغزى في طريقة تقييم نماذج الذكاء الاصطناعي.
تُمثل مجموعات الاختبار الخاصة الآن 40% من الوزن الإجمالي، بزيادة مقارنة بالإصدارات السابقة. هذا مهم لأن اختبارات خاصة أصعب في التلاعب بها. عندما لا يتمكن مطورو النماذج من رؤية أسئلة الامتحان مسبقًا، تصبح الدرجات إشارات أكثر مصداقية للقدرة الحقيقية.
أضاف تحديث الإصدار 4.2 أيضًا مكونين تقييميين جديدين: تقييم الوكيل AA-Briefcase واختبار Surge’s GDP.pdf طويل السياق. تعكس هذه الإضافات الاهتمام المتزايد في الصناعة بالنماذج التي يمكنها التصرف بشكل مستقل ومعالجة الوثائق الطويلة جدًا، وليس فقط الإجابة جيدًا على أسئلة الترفيه.
في قمة الترتيب العام، لا تزال النماذج الخاصة تهيمن. يتصدر Claude Fable 5.1 من Anthropic القائمة. لكن في فئة المعلمات الأقل من 4B، حيث تهم الكفاءة والوصولية أكثر من القوة الخام، يحتل MiniCPM5-2B المرتبة الأولى في ترتيبات الأوزان المفتوحة.
نموذج صغير، طموحات واسعة
MiniCPM5-2B هو نموذج ترانسفورمر كثيف، مما يعني أن كل معلمة نشطة أثناء الاستنتاج بدلاً من توجيهها عبر بنية مزيج من الخبراء. تميل النماذج الكثيفة إلى أن تكون أكثر قابلية للتنبؤ في استهلاكها للموارد، وهو بالضبط ما تريده عند نشر الذكاء الاصطناعي على أجهزة الحافة.
يدعم النموذج نوافذ سياق تتراوح بين 131K و512K رمزًا حسب التكوين. كمرجع، فإن 512K رمز تعادل تقريبًا معالجة كتاب مكون من 1,000 صفحة في دفعة واحدة.
قام OpenBMB بتحسين MiniCPM5-2B لشريحة AMD وIntel وMediaTek وQualcomm.
من ناحية القدرات، تدّعي الفريق أداءً رائدًا ضمن نطاق معاملاته عبر البرمجة، والرياضيات، وفهم السياقات الطويلة، واستخدام الأدوات، وسير العمل الوكيلية.
تضمنت تدريبات النموذج محاذاة التعلم المعزز وما يصفه OpenBMB كمسارات عالية الجودة، وهي تقنيات مصممة لتحسين كيفية تعامل النموذج مع اتخاذ القرارات المعقدة والتسلسلية.
سلالة MiniCPM
يُبنى MiniCPM5-2B على سجل حافل. سبق أن حقق سلفه MiniCPM5-1B درجة 17.9 على إصدار سابق من مؤشر التحليل الاصطناعي، محتلاً المركز الأول بين النماذج تحت مليارين من المعلمات.
الفرق في التقييم بين النموذجين، 17.9 للنسخة 1B و15 للنسخة 2B، يعكس تغييرات في منهجية المؤشر وليس تراجعًا. إن الاعتماد الأكبر لإصدار 4.2 على مجموعات الاختبار الخاصة والفئات الجديدة للتقييم يعني أن النقاط عبر الإصدارات ليست قابلة للمقارنة مباشرة.
ما يعنيه هذا بالنسبة للذكاء الاصطناعي على الجهاز
تزداد المنافسة في مجال النماذج الصغيرة. تتنافس سلسلة Llama من Meta، ونماذج Phi من Microsoft، ومتغيرات Gemma من Google جميعها في نطاقات معلمة مشابهة. إن التفوق في المعايير المرجعية لـ MiniCPM5-2B في فئة أقل من 4B ملحوظ، لكن التفوق في المعايير المرجعية والفوائد العملية لا يتحركان دائمًا معًا.
لم يتم توثيق التحقق المستقل من الأداء المُدَّعى للنموذج بعد بشكل عام. في تقييم الذكاء الاصطناعي، فإن إعادة إنتاج النتائج من قبل طرف ثالث هي الفرق بين بيان صحفي وقدرة مُثبتة.
