زهي بو تطلق نموذج GLM-5.3-Flash على 100,000 شريحة محلية، تنافس NVIDIA

iconMetaEra
مشاركة
AI summary iconملخص
أطلقت Zhipu AI نموذج GLM-5.3-Flash، والذي تم نشره الآن على مجموعة تضم أكثر من 100,000 شريحة محلية. يُعادل هذا النموذج، الذي كان معروفًا سابقًا باسم Ox Alpha، كفاءة وحدات معالجة الرسومات NVIDIA وتكلفة الرموز، مع تحقيق درجة 57 على مؤشر الذكاء AA. كما يقدم أسعارًا أقل من المنافسين الرائدين، وهو أول نموذج متعدد الوسائط أصلي في سلسلة GLM-5. تُظهر بيانات السلسلة اهتمامًا متزايدًا ببنية تحتية للذكاء الاصطناعي، مع تسليط التحليلات على السلسلة الضوء على الانتقال نحو حلول محلية فعالة من حيث التكلفة.
أطلقت Zhipu أحدث نموذج لها GLM-5.3-Flash، والذي كان متاحًا مسبقًا بشكل مجهول باسم Ox Alpha على منصة اختبارية مجانًا، وتجاوز حجم المرور 50 تريليون رمز خلال 5 أيام. تم استخدام أكثر من 100,000 وحدة معالجة من الرقائق المحلية لتقديم خدمات الاستدلال، حيث بلغت كفاءة الأجهزة وتكلفة الرمز الواحد مستوى مماثلًا لوحدات معالجة الرسومات NVIDIA. من حيث الأداء، حصل النموذج على درجة 57 في مؤشر AA الشامل للذكاء، وهو ما يعادل Claude Opus 4.8. من حيث التسعير، تبلغ تكلفة الإدخال 0.8 يوان لكل مليون رمز، و2.8 يوان للإخراج، وهي أقل بكثير من المنافسين. يستخدم النموذج تصميمًا هجينًا يجمع بين الانتباه النادر والخطي، وهو أول نموذج متعدد الوسائط أصلي في سلسلة GLM-5. في ظل موجة رفع الأسعار الجماعية للنماذج الصينية للذكاء الاصطناعي، تستغل Zhipu استراتيجية التسعير المنخفضة للاستحواذ على السوق.

كاتب المقال، المصدر:晚点LatePost

في 26 أغسطس، تأكّد Zhipu رسميًا: أن النموذج المجهول Ox Alpha (المعروف في المجتمع الصيني باسم "نيو لاي") الذي أثار جدلًا واسعًا في مجتمع المطورين، هو بالضبط GLM-5.3-Flash الذي أطلقته مؤخرًا. جاءت رمزية النموذج مستوحاة من الفيلم الصيني الشهير حديثًا "نيو لاي".

قبل الإطلاق الرسمي، تم إطلاق النموذج بشكل مجهول على OpenRouter وOpenCode للاختبار المجاني، وتجاوز إجمالي حركة المرور 50 تريليون رمز في غضون خمسة أيام، مُحطِّمًا سجلات نمو حركة المرور على المنصتين، ويتجاوز الاستخدام الحالي ضعفي استخدام DeepSeek. لكن ما أثار حقًا اهتمام السوق هو التفصيل الذي كشفته Zhipu لاحقًا: جميع هذه الحركات تم استضافتها بالكامل على شرائح صينية الصنع.

أشارت Zhipu في الوثائق الفنية الرسمية إلى أن أكثر من 100,000 وحدة معالجة مخصصة محلية تُستخدم في تجميعات لخدمة الاستدلال لهذا النموذج، "وقد وصلت كفاءة الأجهزة وتكلفة كل رمز فردي إلى مستوى مماثل لوحدات معالجة الرسومات NVIDIA الرائدة".

أصدرت مؤسسة أبحاث أشباه الموصلات SemiAnalysis تعليقًا على منصة X: "جميع حركة المرور تُدار بواسطة رقائق صينية الصنع، وقد أصبحت كفاءة الأجهزة وتكلفة كل رمز مكافئة لوحدات معالجة الرسومات NVIDIA. بعد إعلان Jalapeño (رقاقة الاستنتاج التي طورتها OpenAI) أمس، تم اختبار خندق CUDA مرة أخرى."

100,000 بطاقة محلية الصنع: من الاختبار إلى الإنتاج، وصف Zhipu تفاصيل نشر مجموعة شرائح محلية الصنع هذه في الوثائق التقنية.

القيود الرئيسية للشريحة الواحدة تكمن في سعة الذاكرة وعرض النطاق الترددي، حيث يصعب بشكل خاص دعم طول سياق يصل إلى مليون رمز. ولحل هذا، بنت Zhipu محرك استدلال مخصصًا على أساس SGLang، باستخدام تقنيات مثل التكميم W8A8، والتكميم المختلط للذاكرة المؤقتة INT8/FP8/BF16، وموازنة التنسور داخل العقدة، بالإضافة إلى إدخال بنية منفصلة من نوع Encode–Prefill–Decode (EPD) جاهزة للإنتاج، حيث تم فصل ترميز متعدد الوسائط، وملء المُحفّز المقدّم، وفك الترميز حسب الرمز الواحد إلى مجموعات عمل يمكن جدولة كل منها بشكل مستقل.

Zhipu stated that end-to-end service performance has improved by three times compared to the initial baseline on the same hardware.

وفقًا لما تعرفه "واينتشي LatePost"، قد يكون موردو هذه الشرائح من هواوي وموير تيونغ وهايغوانغ. ولم تعلّق شركة زهيتشاب رسميًا على هذا، ولم يُحدد نموذج الشريحة المحدد في الوثائق الفنية.

أشارت SemiAnalysis في تعليقها بشكل خاص إلى أن هناك رأيًا سابقًا كان يرى أن فقط المختبرات الرائدة العليا هي التي تمتلك قدرة حوسبة بحجم 100 تريليون رمز يوميًا، "بينما هنا، يتم تشغيل 100 تريليون رمز يوميًا مجانًا بالكامل على شرائح صينية."

النموذج نفسه: مقارنة بـ DeepSeek، السعر هو 1/40 من سعر Claude Opus 4.8. حجم معلمات GLM-5.3-Flash هو 320B معلمة إجمالية و18B معلمة مُفعّلة، وهو ما يعادل حوالي 40% من حجم معلمات الجيل السابق GLM-5.3، ويشبه تقريبًا حجم معلمات DeepSeek V4 Flash.

من حيث الأداء، أظهرت التقييمات الرسمية من Zhipu أن GLM-5.3-Flash حصل على 57 نقطة في مؤشر الذكاء التحليلي الاصطناعي (AA)، متفوقًا على الطراز الرائد السابق GLM-5.2، ومساويًا لنموذج Claude Opus 4.8 من Anthropic، وأعلى من النسخة الرسمية لنموذج DeepSeek الرائد V4 Pro الذي حصل على 53 نقطة.

من حيث التسعير، فإن GLM-5.3-Flash تكلف 0.8 يوان لكل مليون رمز إدخال و2.8 يوان لكل مليون رمز إخراج، مع سعر تطابق التخزين المؤقت البالغ 0.23 يوان، وهو عُشر سعر GLM-5.3. يتم تطبيق خصم 50% خلال الأسبوعين الأولين للإطلاق.

أشار زهي بو إلى أن سعر GLM-5.3-Flash هو واحد من عشرة من سعر GLM-5.3، وواحد من عشرين خلال العرض الترويجي المحدود، وهو واحد من أربعين من سعر Claude Opus 4.8.

بالمقارنة مع DeepSeek V4 Flash بعد تعديل السعر (إدخال 1.5 يوان في وقت الذروة، إخراج 4.5 يوان)، فإن GLM-5.3-Flash أرخص في معظم سيناريوهات الاستخدام العادية.

ابتكار في التصميم المعماري: تم تخفيض عدد المعلمات والطبقات تقريبًا إلى النصف. يستخدم GLM-5.3-Flash تصميمًا معماريًا مختلفًا تمامًا عن GLM-5.3، وهو ما يمثل السبب الأساسي لقدرته على تحقيق أداء أعلى بتكلفة أقل.

بالمقارنة مع GLM-4.5، فإن إجمالي عدد المعلمات في GLM-5.3-Flash مشابه (355B مقابل 320B)، لكن عدد المعلمات المُفعّلة انخفض من 32B إلى 18B، وانخفض عدد الطبقات من 92 طبقة إلى 45 طبقة، تقريبًا بنسبة النصف.

تقول Zhipu إن GLM-5.3-Flash هو أول نموذج رائد مفتوح المصدر يستخدم مزيجًا من بنية الانتباه النادر والانتباه الخطي. مقارنةً بـ GLM-5.3، انخفض حساب الانتباه وحجم ذاكرة التخزين المؤقت KV بمقدار 3.01 و4.44 مرة على التوالي.

بالإضافة إلى ذلك، فإن هذا النموذج هو أول نموذج متعدد الوسائط أصيل في سلسلة GLM-5، ويدعم إدخال الصور والفيديو، وهو أيضًا أول نموذج جديد تطلقه Zhipu يمتلك قدرات متعددة الوسائط منذ أن ركزت Zhipu استراتيجيتها على البرمجة.

إطلاق GLM-5.3-Flash يحدث بعد موجة من الزيادات العامة في سوق نماذج الذكاء الاصطناعي الصيني.

يبلغ سعر إخراج Kimi K3 ما يصل إلى 100 يوان لكل مليون رمز، وهو أكثر من ثلاثة أضعاف سعر الجيل السابق K2.6؛ وقد وصل سعر الإخراج من Zhipu في النصف الأول من العام إلى 28 يوان بعد رفع الأسعار؛ ارتفع سعر DeepSeek V4 Pro من 6 يوان إلى 13.5 يوان، ووصل إلى 27 يوان خلال فترات الذروة؛ وارتفع سعر إخراج DeepSeek V4 Flash من 2 يوان إلى 4.5 يوان، ووصل إلى 9 يوان خلال فترات الذروة.

النتيجة المباشرة للزيادة في الأسعار هي تدفق الطلب. أشارت "واي ديان لاتيبوست" إلى أنه بعد رفع أسعار DeepSeek V4 Flash، انخفض حجم الاستخدام على منصة OpenCode بنسبة النصف، وأصبح هذا الطلب مساحة نمو جديدة للشركات المصنعة للنماذج المحلية.

استراتيجية التسعير لـ GLM-5.3-Flash تستهدف بالضبط هذا الفجوة.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.