زھیپوAI نے دو ہفتے میں 100,000 گھریلو AI ایکسلریٹرز کی تنصیب مکمل کر لی ہے

iconMetaEra
بانٹیں
AI summary iconخلاصہ
زھیپوAI نے اپنا GLM-5.3-Flash انفرنس سسٹم صرف دو ہفتے میں 100,000 سے زائد گھریلو AI ایکسلریٹرز کے کلسٹر پر ڈپلوی کر دیا، جیسا کہ AI + کرپٹو خبروں نے بتایا۔ اس سسٹم کی اینڈ-ٹو-اینڈ تھروپٹ 3.2 گنا بڑھ گئی، جبکہ AI ڈرائیون Infra Agent ان کاموں کو سنبھال رہا ہے جو عام طور پر سینئر انجینئرز کرتے ہیں۔ آن-چین خبروں میں AI کے انفراسٹرکچر میں تیزی سے ادماج پر زور دیا گیا ہے، جس سے ظاہر ہوتا ہے کہ آٹومیشن ٹیکنیکل ورک فلوز کو کیسے تبدیل کر رہا ہے۔ یہ ڈپلومنٹ چین کے AI + کرپٹو خبروں کے شعبے میں بڑھتی ہوئی رفتار کو ظاہر کرتا ہے۔
دو ہفتے، 100,000 چینی AI ایکسلریٹرز، ایک اپنے ماڈل کو بہتر بنانے کا آغاز۔

لکھنے والے: APPSO

ماخذ: وول سٹریٹ ویزن

بالکل ابھی، زہی پو GLM کے سربراہ سائنسدان تانگ جیہ نے X پلیٹ فارم پر GLM-5.3-Flash انفرنس سسٹم کے بہترین بنانے کے بارے میں ایک تحقیق شیئر کی۔

اس نے بتایا کہ GLM-5.3-Flash کو پہلی بار ڈومیسٹک AI ایکسلریٹر پر چلانے سے لے کر مکمل پروڈکشن ٹریفک کو سنبھالنے تک صرف دو ہفتے لگے۔ اس عمل کے دوران، سسٹم کی اینڈ تو اینڈ ٹھروٹلگ صلاحیت 3.2 گنا بڑھ گئی۔

ٹانگ جیے کو سب سے زیادہ متاثر کرنے والی بات یہ تھی کہ بہت سارے بہتریوں کو مکمل کرنے والے صرف انفراسٹرکچر انجینئرز ہی نہیں تھے، بلکہ ایک GLM-5.3 سے چلنے والے Infra Agent بھی تھے۔

"ایک ایسا ماڈل جو اپنی خود کی خدمات کو بہتر بننے میں مدد کرتا ہے۔" ٹانگ جیے نے اس تبدیلی کی تفصیل دی۔

اس کے خیال میں، اس کا مطلب ہے کہ AI اپنے خود کو چلانے والے نظام کو بہتر بنانے میں شریک ہونا شروع کر چکا ہے۔ ہاں، واقعی ریکرسیو سیلف ایمپروومنٹ (Recursive Self-Improvement، RSI) تک پہنچنا ابھی دور ہے، لیکن اس کی ابتدائی شکل پیدا ہو چکی ہے۔

زھی پو ٹیم نے بھی اشارہ کیا کہ گزشتہ سال انہوں نے ملاحظہ کیا کہ GLM کا کردار تبدیل ہو رہا ہے۔

اصل میں، ٹیم نے GLM کی صلاحیتیں کوڈ کی سمجھ اور سائبر سیکیورٹی کے شعبوں میں جانچنے کی کوشش کی، تاکہ ماڈل پیچیدہ کوڈ میں خامیوں کا تجزیہ کرنے میں مدد کر سکے۔ لیکن جیسے جیسے ماڈل کی صلاحیتیں بڑھیں، GLM نے AI سسٹم کے تعمیر میں بھی شرکت شروع کر دی۔

ٹیم نے کہا کہ انہوں نے دیکھا ہے کہ ماڈل وہ کام مکمل کر رہے ہیں جو پہلے سینئر انفراسٹرکچر انجینئرز کی ٹیم کو کئی ہفتے لگتے تھے، اور یہ کام مستقبل کے ماڈلز کی تربیت اور ڈیپلومنٹ کے طریقے پر براہ راست اثر ڈالتا ہے۔

دو ہفتے میں گھریلو کمپیوٹنگ کلسٹر کی تنصیب مکمل ہو گئی

ایک بڑے ماڈل کو نئے ہارڈویئر پر پہلی بار چلانے سے لے کر پیداواری درخواستوں کو مستقل طور پر سنبھالنے والی انفرینس سروس تک لے جانے کے لیے بہت زیادہ سسٹم انجینئرنگ کا کام درکار ہوتا ہے۔

GLM-5.3-Flash کو اب تک 100,000 سے زیادہ گھریلو AI ایکسلریٹرز پر مشتمل کلستر پر ڈپلوی کیا گیا ہے۔ زہ پو ٹیم نے کہا کہ یہ ایک ایسا بڑا ڈپلویمنٹ تھا جس کے لیے پہلے کوئی بالغ تجربہ دستیاب نہیں تھا۔

ٹیم کو کئی مسائل کا حل نکالنا ہوگا، جن میں ڈومیسٹک چپس کی ویڈیو میموری کی صلاحیت اور انٹر کنکشن بینڈ ویتھ کی پابندیاں، نئے ماڈل آرکیٹیکچر کی ایڈجسٹمنٹ، 100 ہزار ٹوکن لمبے کنٹیکس کی حمایت، اور متعدد ماڈلیٹی کے درخواستوں کا انتظام شامل ہیں۔ اس کے علاوہ، ڈومیسٹک AI ایکسلریٹرز کا سافٹ ویئر ایکوسسٹم ابھی ترقی کے مراحل میں ہے، کچھ کرنلز کی حمایت کم ہے، اور بہت سے مواد کو انجینئرنگ ٹیم کو خود تلاش کرنا پڑے گا۔

ٹانگ جیے نے کہا کہ ان پابندیوں کے تحت، GLM-5.3 چلایا گیا Infra Agent تجزیاتی نظام کے بہتر بنانے کے عمل میں شامل ہوا، جس نے پرفارمنس کی رکاوٹوں کا تجزیہ کیا، بہتری کے اقدامات تجویز کیے، اور کچھ کوڈ میں تبدیلیاں کیں۔

پورے بہتر بنانے کے عمل میں صرف کمپیوٹیشنل وسائل بڑھانا نہیں، بلکہ کمپیوٹنگ پاور، میموری، کمیونیکیشن اور شیڈولنگ کے درمیان نئی توازن تلاش کیا جا رہا ہے۔

زہ پو ٹیم نے کئی بہتریوں کا اطلاق کیا ہے۔ مثال کے طور پر، ReplaySSM کے ذریعے کمپیوٹنگ کے ذریعے میموری کی جگہ حاصل کی گئی، نوڈ اندر ٹینسر پیرللزم کے ذریعے گرافکس میموری کا دباؤ کم کیا گیا، INT8، FP8، BF16 مکسڈ پریسیژن کیش کے ذریعے کیپسیٹی کا استعمال بڑھایا گیا، اور ساتھ ہی Encode-Prefill-Decode (EPD) الگ تھلگ آرکیٹیکچر شامل کیا گیا تاکہ مختلف انفرینس مراحل کو زیادہ لچکدار طریقے سے اسکیڈول کیا جا سکے۔

آخر کار، GLM-5.3-Flash کی مکمل سروس کی کارکردگی ابتدائی ورژن کے مقابلے میں تقریباً 3 گنا بہتر ہو گئی ہے، جس سے ہارڈویئر کا استعمال اور ہر ٹوکن کی لاگت نیٹ ورک کے مقبول NVIDIA GPU پلیٹ فارم کے لیول تک پہنچ گئی ہے۔

ڈپلویمنٹ کے بعد، GLM-5.3-Flash کو حقیقی استعمال کے ماحول میں ٹیسٹ کیا گیا۔ زہ پو ٹیم نے بتایا کہ یہ ماڈل OpenCode اور OpenRouter پلیٹ فارمز پر ایک نامعلوم ماڈل کے نام Ox-Alpha کے ساتھ چلا، جس نے ایک ہفتے میں دونوں پلیٹ فارمز پر استعمال کے لحاظ سے سب سے زیادہ استعمال ہونے والا ماڈل بن گیا اور چھ دن میں 62 ٹریلین ٹوکنز کو پروسیس کیا۔

تاہم، اس تجربے کا اصل تبدیلی صرف AI کو کوڈ لکھنے کی اجازت دینا نہیں، بلکہ AI کو پیچیدہ نظاموں میں کیوں اداء میں تبدیلی آتی ہے، اسے سمجھنا ہے۔

مثال کے طور پر، جب سسٹم کا جواب "ذخیرہ کمی 20%" ہو، تو اس کا مطلب صرف یہ ہے کہ کہیں خرابی ہوئی ہے، لیکن یہ براہ راست Agent کو نہیں بتاتا کہ کون سی لیئر میں مسئلہ ہے، موجودہ فرض غلط ہے یا نہیں، اور اگلے مرحلے میں کیا جانچنا چاہیے۔

انجینئرز کے لیے، اس قسم کا فیصلہ لمبے عرصے کی تجربہ سے متعلق ہوتا ہے۔ انجینئر جانتے ہیں کہ کب اجراء کے ٹائم لائن کو دیکھنا ہے، کب مائکرو بینچ مارک چلانا ہے، اور کون سے ماڈیول کے آؤٹ پٹ کا موازنہ کرنا ہے۔

زھی پو ٹیم چاہتی ہے کہ اس انجینئرنگ کا تجربہ ایک ایسے فیڈ بیک میکنزم میں تبدیل کیا جائے جسے AI کال کر سکے، اور اسے "ڈینس فیڈ بیک" کہتا ہے۔

اس نظام کا مرکزی نقطہ یہ ہے کہ ایجنٹ کو انجینئرنگ کے فیصلے کے عمل کے قریب تر معلومات فراہم کی جائیں۔

جب ماڈل کو تصدیق کرنی ہو کہ حساب درست ہے تو وہ متعلقہ درستگی کی فیڈ بیک حاصل کر سکتا ہے؛ جب ماڈل کو پرفارمنس میں کمی کے وجوہات کا تجزیہ کرنے کی ضرورت ہو تو وہ سسٹم کے عمل کے دوران وقت کے استعمال کو دیکھ سکتا ہے؛ جب ماڈل نئے آپٹیمائزیشن کے منصوبے کی کوشش کرے تو وہ تجربے کے ذریعے یہ فیصلہ کر سکتا ہے کہ یہ منصوبہ موجودہ منظر نامہ کے لیے مناسب ہے یا نہیں۔

زہ پو ٹیم کا خیال ہے کہ اصلی طور پر موثر فیڈ بیک کے لیے کچھ شرائط پوری ہونی چاہئیں، اسے مخصوص مسئلے کے قریب ہونا چاہیے، جلدی حاصل کیا جا سکے، اور اسے ایک آبجیکٹو تجربے کے ذریعے تصدیق کیا جا سکے۔ ورنہ، بڑی مقدار میں لاگ اور اشارے ایجنٹ کو اگلے اقدام کی سمت کا فیصلہ کرنے میں مشکل پیدا کر سکتے ہیں۔

ماڈل آپٹیمائزیشن سسٹم، سسٹم سروس ماڈل

گہری فیڈ بیک کی مدد سے، انفراس ایجینٹ نے پوشیدہ مسائل کی پہچان کرنے والے نظام میں شمولیت شروع کر دی ہے۔

KDA کے سیاق و سباق میں متوازی راستے میں، ایجنٹ نے لمبے سیاق و سباق کے حسابات کی درستگی پر اثر ڈالنے والا مسئلہ دریافت کیا۔

چونکہ مختلف سیاق و سباق شارڈز کے درمیان حالت میٹرکس کو مستقل طور پر ضم کرنا پڑتا ہے، اس لیے TF32 کیلکولیشن سے پیدا ہونے والی راؤنڈنگ کی غلطیاں ترتیب کی لمبائی کے ساتھ جمع ہوتی رہتی ہیں اور آخرکار کیلکولیشن کے نتائج میں انحراف پیدا ہوتا ہے۔

ایجینٹ نے مختلف اجراء کے راستوں کے نتائج کا موازنہ کرکے مسئلہ کو حالت کے پھیلاؤ اور ادغام کے عمل میں درستگی کے معاملے تک محدود کر دیا ہے۔ متعلقہ اصلاحات کو فلیش لینیئر ایٹنشن پراجیکٹ PR #1180 میں ضم کر دیا گیا ہے۔

KV ٹرانسفر اور DeepEP شیڈولنگ کے درمیان ایک اور مسئلہ ظاہر ہوا۔

ٹیسٹنگ کے دوران، ایجینٹ نے پایا کہ KV ٹرانسفر، DeepEP ڈسپیچ کے ساتھ مؤثر طور پر اوورلیپ نہیں ہو رہا، جس کی وجہ سے کچھ صورتحال میں ٹرانسمیشن کا اخراج 30% سے زیادہ ہو گیا۔

اس کے بعد، ایجینٹ نے پائیتھن اور سی++ کال چین کے ساتھ تجزیہ جاری رکھا اور پایا کہ نوڈ کے اندر راستہ پائیتھن GIL کو وقت پر ریلیز نہیں کیا جا رہا تھا، جس کی وجہ سے ٹرانسمیشن ٹاسک وقت پر آگے نہیں بڑھ سکا۔

مکمل تبدیلی کے بعد، KV ٹرانسفر کے اضافی اخراجات 30% سے کم ہو کر 1% سے کم ہو گئے۔

اس کے علاوہ، ایجنٹ نے ایک ڈیکوڈ کرنل کو بھی بہتر بنایا۔

اس نے پایا کہ کرنل کے تقسیم کے طریقے کی وجہ سے، ایک ہی نارملائزیشن کی حسابگری چار بار دہرائی جا رہی تھی۔ حسابگری کی ساخت کو دوبارہ ترتیب دے کر، دہرائی گئی حسابگری کو کم کرتے ہوئے، اس کرنل کو 1.71 گنا بہتر پرفارمنس حاصل ہوئی۔

یہ بہتری کا خیال Agent کی طرف سے SGLang، Flash Linear Attention اور DeepGEMM جیسے منصوبوں کے موجودہ Kernel کی سیکھی گئی تجربات سے نکالا گیا ہے۔ اس نے ان کوڈ میں موجود بہتری کے تجربات کو ایک "optimization skeleton" میں تبدیل کر دیا ہے، اور پھر موجودہ سسٹم کے فیڈ بیک کے ساتھ ملا کر یہ فیصلہ کیا جاتا ہے کہ کیا یہ مناسب ہے۔

گزشتہ میں، اس قسم کے بہتری کے تجربات صرف انجینئرز کی ذاتی تجربات پر منحصر تھے۔

اس عمل کے دوران، ایجنٹ پہلے سے موجود کوڈ سے بہترین طریقے سیکھنا شروع کر دیتا ہے اور پھر ان طریقوں کو نئے ہارڈویئر اور ماڈل ماحول کے لیے مناسب ہونے کی تصدیق کے لیے تجربات کرتا ہے۔

تان جیے نے کہا کہ انسانی انجینئرز اب بھی مقاصد طے کرنے، فیڈ بیک ماحول تعمیر کرنے اور خطرناک تبدیلیوں کی جانچ کی ذمہ داری سنبھال رہے ہیں۔

لیکن انجینئرز کا کردار، ہر مسئلے کو حل کرنے والے سے، فیڈ بیک سسٹم ڈیزائن کرنے والے کی طرف تبدیل ہو رہا ہے۔

زھی پو ٹیم کا خیال ہے کہ حقیقی بنیادی ڈھانچے کے کاموں پر مبنی قابل تصدیق فیڈ بیک ماحول، اگلی نسل کے ماڈلز کے تربیت کا اہم بنیادی اصول بھی ہو سکتا ہے۔ ہر ایک ایجنٹ جب انجینئرنگ کا کام مکمل کرتا ہے، تو وہ اگلی نسل کے ماڈل کے لیے سیکھنے کا ڈیٹا بن سکتا ہے۔

ابھی، GLM-5.3-Flash کے کیسز حقیقی طور پر ریکرسیو سیلف-ایمپروومنٹ تک پہنچنے سے دور ہیں۔ لیکن ٹانگ جیے کا خیال ہے کہ ایک ننھا سا حلقوں کا چکر پیدا ہو چکا ہے۔

ماڈل آپٹیمائزیشن سسٹم، جبکہ سسٹم سروس ماڈل۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔