أطلقت شركة Z.ai الصينية، المعروفة سابقًا باسم Zhipu AI، GLM-5.3-Flash في 26 أغسطس، مما جعله أول نموذج متعدد الوسائط أصلي في سلسلة GLM-5. ويُعد الإطلاق ملحوظًا لأسباب تتجاوز النموذج نفسه: فهو يعمل بالكامل على وحدات تسريع ذكاء اصطناعي صينية الصنع، وهو تجسيد واضح على أن الأجهزة الصينية قادرة على التعامل مع أحمال عمل ضخمة وجادة.
التوقيت مهم. لقد قيدت ضوابط التصدير الأمريكية وصول المشترين الصينيين إلى أحدث شرائح NVIDIA، مما دفع شركات مثل Z.ai إلى البناء بناءً على ما لديها.
ما الذي يفعله النموذج فعليًا
يستخدم GLM-5.3-Flash بنية هجينة تجمع بين الانتباه النادر والخطي، وهي خيار تصميمي يقلل بشكل كبير من متطلبات الحوسبة. يحتوي النموذج على 320 مليار معلمة إجمالية، لكنه ينشط فقط 18 مليار معلمة لكل رمز، مما يعني أنه يستفيد من قاعدة معرفية ضخمة دون دفع التكلفة الحسابية الكاملة في كل استنتاج.
تبلغ نافذة السياق مليون رمز، مما يجعلها من بين أطول النوافذ المتاحة في أي نموذج مفتوح. الدعم الأصلي لمدخلات الصور والفيديو يجعلها متعددة الوسائط حقًا من مستوى البنية، وليس كميزة مُضافة لاحقًا.
في معيار البرمجة DeepSWE v1.1، حصل GLM-5.3-Flash على درجة 63.4، مقارنة بـ 46.2 لسابقه GLM-5.2. كما حصل النموذج على درجة 57 في مؤشر الذكاء التحليلي الاصطناعي.
الأسعار تنافسية. تكلفة الوصول إلى واجهة برمجة التطبيقات هي 0.15 دولار لكل مليون رمز إدخال و0.50 دولار لكل مليون رمز إخراج، مع توفر مدخلات مخزنة مؤقتًا بسعر 0.03 دولار. تصف Z.ai التكلفة بأنها تقريبًا واحد من عشرة مقارنة ببعض الخيارات المنافسة.
الرقائق الصينية تقوم بمهام حقيقية
نشرت Z.ai GLM-5.3-Flash عبر مجموعات من مbeschّرات الذكاء الاصطناعي المصنّعة محليًا، ثم بنت طوابق خدمة مخصصة وطبّقت تقنيات التكميم المُصممة خصيصًا لهذا الجهاز. كان الناتج تحسينًا بنسبة ثلاث مرات في الأداء الشامل مقارنةً بنهج نشر أكثر عمومية.
يأتي النموذج مع أوزان مفتوحة بموجب ترخيص MIT، متاح بتنسيقات FP8 وBF16 على Hugging Face وModelScope. يُعد ترخيص MIT من أكثر التراخيص سماحًا: يمكن للمطورين والشركات استخدام الأوزان وتعديلها وتوزيعها تجاريًا دون قيود.
