أكملت ZhipuAI نشر 100,000 وحدة تسريع ذكاء اصطناعي محلية في أسبوعين

iconMetaEra
مشاركة
AI summary iconملخص
نشرت ZhipuAI نظام الاستنتاج GLM-5.3-Flash على مجموعة تضم أكثر من 100,000 وحدة تسريع ذكاء اصطناعي محلية في غضون أسبوعين فقط، وفقًا لأخبار الذكاء الاصطناعي + التشفير. زاد إجمالي من خلال النظام من طرفه إلى طرفه بنسبة 3.2 مرات، مع إدارة عامل البنية التحتية المدعوم بالذكاء الاصطناعي لمهام التحسين التي كانت تُنفَّذ عادةً من قبل المهندسين الكبار. وتسلط أخبار السلسلة الضوء على التكامل السريع للذكاء الاصطناعي في البنية التحتية، مما يُظهر كيف يعيد التلقين تشكيل سير العمل التقني. ويعكس هذا النشر زخمًا متزايدًا في قطاع الذكاء الاصطناعي + التشفير في الصين.
في غضون أسبوعين، 100,000 وحدة تسريع ذكاء اصطناعي محلية الصنع، بداية لتحسين نموذجك الخاص.

كاتب المقال: APPSO

المصدر: وول ستريت جيزن

للتو، شارك الأستاذ تانغ جيه، العالم الرئيسي في Zhipu GLM، بحثًا حول تحسين نظام الاستدلال GLM-5.3-Flash على منصة X.

أشار إلى أن الوقت الذي استغرقه تشغيل GLM-5.3-Flash لأول مرة على مُسرّع ذكاء اصطناعي محلي، ثم إكمال تحمل كامل حركة المرور الإنتاجية، لم يتجاوز أسبوعين. خلال هذه العملية، زادت قدرة النظام على معالجة البيانات من طرف إلى طرف بنسبة 3.2 مرة.

ما أثار انطباعًا عميقًا لدى تانغ جيه هو أن فريقًا من مهندسي البنية التحتية لم يكن وحده هو الذي أنجز كمية كبيرة من التحسينات، بل أيضًا عامل بنية تحتية مدعومًا بـ GLM-5.3.

"نموذج يساعد على تحسين الخدمة نفسها." هكذا وصف تانغ جيه هذا التغيير.

في رأيه، هذا يعني أن الذكاء الاصطناعي بدأ في المشاركة في تحسين الأنظمة التي تدعم تشغيله. وعلى الرغم من أن المسافة لا تزال بعيدة عن التحسين الذاتي التكراري الحقيقي (Recursive Self-Improvement، RSI)، إلا أن شكلًا مبكرًا قد ظهر بالفعل.

كما أشار فريق ZhiPu إلى أنهم لاحظوا خلال العام الماضي أن دور GLM يشهد تغييرًا.

في البداية، استكشف الفريق قدرات GLM في فهم الكود وأمن الشبكات، بهدف مساعدة النموذج على تحليل الثغرات في الكود المعقد. لكن مع تحسن قدرات النموذج، بدأ GLM في المشاركة في بناء أنظمة الذكاء الاصطناعي نفسها.

أشار الفريق إلى أنهم لاحظوا أن النموذج أكمل مهامًا كانت تتطلب سابقًا فرقًا من مهندسي البنية التحتية ذوي الخبرة عدة أسابيع، وهذه المهام تؤثر مباشرة على طرق تدريب ونشر النماذج القادمة.

استكمال نشر مجموعة الحوسبة المحلية في أسبوعين

يتطلب نقل نموذج كبير من التشغيل الأولي على أجهزة جديدة إلى خدمة استدلال قادرة على تحمل طلبات الإنتاج بشكل مستقر، جهودًا هندسية نظامية كبيرة.

تم تشغيل GLM-5.3-Flash على تجمع يضم أكثر من 100,000 وحدة تسريع ذكاء اصطناعي محلية. وأفاد فريق Zhipu أن هذا كان توزيعًا واسع النطاق دون وجود خبرة ناضجة سابقة للمرجع.

يحتاج الفريق إلى حل عدة مشكلات، بما في ذلك قيود سعة ذاكرة الفيديو للرقائق المحلية وعرض النطاق الترددي للاتصال، وتوافق بنية النموذج الجديدة، ودعم سياق طويل يبلغ 1,000,000 رمز، ومعالجة الطلبات متعددة الوسائط، إلخ. في الوقت نفسه، لا تزال البيئة البرمجية لمسرعات الذكاء الاصطناعي المحلية في مرحلة التطوير، مع نقص في دعم بعض Kernel، كما أن العديد من المواد تحتاج إلى استكشافها من قبل فريق الهندسة بنفسه.

أشار تانغ جيه إلى أنه في ظل هذه القيود، شارك عامل Infra المدعوم بـ GLM-5.3 في عملية تحسين نظام الاستدلال، وساعد في تحليل عوائق الأداء، واقتراح حلول التحسين، وإجراء بعض تعديلات الكود.

عملية التحسين بأكملها ليست مجرد زيادة في موارد الحوسبة، بل تتمثل في إيجاد توازن جديد بين القوة الحسابية والذاكرة والاتصال والجدولة.

استخدم فريق ZhiPu مجموعة من الحلول المُحسَّنة. على سبيل المثال، استخدام ReplaySSM لاستبدال الذاكرة بحسابات، وتطبيق التوازي المتجهي داخل العقد لتقليل ضغط ذاكرة GPU، وتحسين كفاءة استخدام السعة من خلال التخزين المختلط بدقة INT8 وFP8 وBF16، مع إدخال بنية منفصلة Encode-Prefill-Decode (EPD) تسمح بجدولة أكثر مرونة لمراحل الاستنتاج المختلفة.

في النهاية، تحسّنت أداء خدمة GLM-5.3-Flash من طرف إلى طرف بنسبة حوالي 3 مرات مقارنة بالإصدار الأولي، ووصلت كفاءة استخدام العتاد وتكلفة كل رمز إلى مستوى قريب من منصات NVIDIA GPU الرئيسية.

بعد الانتهاء من النشر، دخل GLM-5.3-Flash مرحلة الاختبار في بيئة الاستخدام الفعلية. وذكر فريق Zhipu أن النموذج كان يعمل سابقًا تحت اسم نموذج مجهول Ox-Alpha على منصتي OpenCode وOpenRouter، وأصبح أحد أكثر النماذج استخدامًا على المنصتين خلال أسبوع واحد، حيث عالج أكثر من 62 تريليون رمز في ستة أيام.

لكن التغيير الحقيقي في هذه التجربة ليس فقط جعل الذكاء الاصطناعي يكتب الكود، بل تمكين الذكاء الاصطناعي من فهم أسباب تغير أداء الأنظمة المعقدة.

على سبيل المثال، عندما يُرجع النظام "انخفاض في الإنتاجية بنسبة 20٪"، فإنه لا يمكنه سوى توضيح وجود خلل في مكان ما، لكنه لا يستطيع إخبار العامل مباشرةً بأي طبقة هي المشكلة، أو ما إذا كان الافتراض الحالي خاطئًا، أو ما الذي يجب التحقق منه في الخطوة التالية.

بالنسبة للمهندسين ذوي الخبرة، يعتمد هذا التقييم على خبرة طويلة. يعرف المهندسون متى يتحققون من خط زمني التنفيذ، ومتى يشغّلون اختبارات ميكرو-أداء، وأي مكونات يجب مقارنة مخرجاتها.

يأمل فريق ZhiPu في تحويل هذه الخبرة الهندسية إلى آلية تغذية راجعة يمكن للذكاء الاصطناعي استدعاؤها، ويدعونها "dense feedback".

جوهر هذه الآلية هو تمكين الوكيل من الحصول على معلومات أقرب إلى عملية التقييم الهندسي.

عندما يحتاج النموذج إلى التحقق من صحة الحسابات، يمكنه الحصول على تغذية راجعة حول الدقة؛ عندما يحتاج النموذج إلى تحليل أسباب تدهور الأداء، يمكنه مراجعة استهلاك الوقت أثناء تشغيل النظام؛ عندما يجرب النموذج حلول تحسين جديدة، يمكنه تقييم مدى ملاءمة هذه الحلول للسيناريو الحالي من خلال التجارب.

يعتقد فريق ZhiPu أن التغذية الراجعة الفعالة حقًا يجب أن تستوفي عدة شروط: يجب أن تكون قريبة بما يكفي من المشكلة المحددة، وأن تكون قابلة للحصول عليها بسرعة، وأن تكون قابلة للتحقق من خلال تجارب موضوعية. وإلا، فقد تجعل السجلات والمؤشرات الكثيرة من الصعب على الوكلاء تحديد اتجاه الإجراء التالي.

نظام تحسين النموذج، خدمة النظام للنموذج

بمساعدة التغذية الراجعة الكثيفة، بدأ عامل البنية التحتية في المشاركة في تحديد المشكلات الخفية في نظام الاستدلال.

في سياق مسار KDA المتوازي، اكتشف العامل مشكلة تؤثر على دقة الحسابات الطويلة السياقية.

بسبب الحاجة المستمرة إلى دمج مصفوفات الحالة بين شرائح السياق المختلفة، تتراكم أخطاء التقريب الناتجة عن حسابات TF32 مع زيادة طول التسلسل، مما يؤدي في النهاية إلى انحراف في النتائج الحسابية.

قام العامل بتحديد المشكلة في معالجة الدقة خلال عملية نشر الحالة والدمج، من خلال مقارنة نتائج مسارات التنفيذ المختلفة. تم دمج الإصلاحات ذات الصلة في مشروع Flash Linear Attention، PR #1180.

يظهر مشكلة أخرى بين نقل KV وجدولة DeepEP.

خلال الاختبار، لاحظ الوكيل أن نقل KV لم يُشكل تداخلًا فعالًا مع DeepEP Dispatch، مما أدى إلى تجاوز تكاليف النقل 30% في بعض السيناريوهات.

بعد ذلك، استمر Agent في تحليل سلسلة الاستدعاءات بين Python وC++، ووجد أن مسار العقدة لم يُحرر GIL الخاص بـ Python في الوقت المناسب، مما منع تقدم مهمة النقل في الوقت المناسب.

بعد إجراء التعديلات، انخفض التكلفة الإضافية الناتجة عن KV Transfer من أكثر من 30% إلى أقل من 1%.

بالإضافة إلى ذلك، قام Agent بتحسين نواة فك الترميز.

اكتشفت أن نفس مجموعة حسابات التطبيع تُنفَّذ أربع مرات بسبب مشكلة في تقسيم Kernel. من خلال إعادة تنظيم هيكل الحسابات وتقليل الحسابات المتكررة، حقق Kernel أداءً محسّنًا بنسبة 1.71 ضعفًا.

تأتي هذه الفكرة التحسينية من تعلم العميل للـ Kernels الحالية في مشاريع مثل SGLang وFlash Linear Attention وDeepGEMM. وهي تستخلص خبرات التحسين من هذه الكودات في شكل "هيكل تحسين"، ثم تستخدم ملاحظات النظام الحالية لتحديد مدى ملاءمتها.

في الماضي، كانت تجربة التحسينات المشابهة تعتمد بشكل رئيسي على تراكم المهندسين الفرديين.

وفي هذه العملية، بدأ العامل في تعلم أساليب التحسين من الكود الموجود، ثم التحقق تجريبيًا من مدى ملاءمة هذه الأساليب للبيئات الجديدة للعتاد والنماذج.

قال تان جيي إن المهندسين البشريين لا يزالون مسؤولين عن تحديد الأهداف، وبناء بيئة التغذية الراجعة، ومراجعة التعديلات عالية المخاطر.

لكن دور المهندسين يتغير من كونهم من يحلون كل مشكلة مباشرة، إلى تصميم أنظمة التغذية الراجعة.

يعتقد فريق ZhiPu أن بيئة التغذية الراجعة القابلة للتحقق، المبنية على مهام بنية تحتية حقيقية، قد تكون أيضًا أساسًا مهمًا لتدريب النماذج من الجيل التالي. كلما أكمل العامل مهمة هندسية، قد يصبح ذلك بيانات تعلم للنموذج من الجيل التالي.

حاليًا، لا تزال حالات GLM-5.3-Flash بعيدة عن التحسين الذاتي التكراري الحقيقي. لكن تانغ جيه يعتقد أن دورة صغيرة قد ظهرت بالفعل.

يُحسّن النموذج النظام، بينما يخدم النظام النموذج.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.