زھی پو نے نئی مدل GLM-5.3-Flash جاری کی ہے، جسے پہلے ایک نامعلوم نام Ox Alpha کے تحت ٹیسٹنگ پلیٹ فارم پر مفت دستیاب کیا گیا تھا، جس میں صرف 5 دن میں 50 ٹریلین ٹوکن سے زیادہ ٹریفک آیا۔ اس مدل کے لیے 100,000 سے زیادہ چینی چپس کے کلاسٹر استعمال کیے گئے ہیں، جس سے ہارڈویئر کی کارکردگی اور ہر ٹوکن کی لاگت نیوڈیا کے GPU کے برابر ہو گئی۔ پرفارمنس کے لحاظ سے، اس مدل نے AA کمپریہن سوٹ میں 57 اسکور حاصل کیا، جو Claude Opus 4.8 کے برابر ہے۔ قیمت کے لحاظ سے، ہر ملین ٹوکن کے ان پٹ کے لیے 0.8 یوان اور آؤٹ پٹ کے لیے 2.8 یوان، جو مقابلہ کرنے والے مدلز سے کافی کم ہے۔ اس کی آرکٹیکچر میں اسپارس اور لینئر توجہ کا ملٹی پل ڈیزائن استعمال کیا گیا ہے، جو GLM-5 سیریز کا پہلا نیچرل ملٹی مودل مدل ہے۔ چین میں AI مڈلز کے مجموعی قیمت میں اضافے کے باوجود، زھی پو نے منافع بخش قیمت سے مارکیٹ حاصل کرنے کا فیصلہ کیا ہے۔مضمون کے مصنف، ذریعہ: وانگڈیان لیٹ پوسٹ
26 اگست، زھی پو نے تصدیق کر دی: پہلے ڈویلپر کمیونٹی میں بحث کا مرکز بننے والی اناڈی ماڈل Ox Alpha (چینی کمیونٹی میں "نیو لائی" کہلاتی ہے)، وہ اس کی تازہ جاری شدہ GLM-5.3-Flash ہے۔ ماڈل کا کوڈ نام چین میں حالیہ طور پر ریلیز ہونے والی فلم "نیو لائی" سے متاثر ہے۔
اس ماڈل کو آفیشل لانچ سے پہلے، OpenRouter اور OpenCode پر ایک انانیماس فارمیٹ میں مفت ٹیسٹ کے لیے دستیاب کرایا گیا، جس میں 5 دن کے اندر کل 50 ٹریلین ٹوکنز کا ٹریفک جمع ہوا، جس نے دونوں پلیٹ فارمز کے ٹریفک کے اضافے کا ریکارڈ توڑ دیا، اور موجودہ استعمال کی شرح DeepSeek سے دوگنا سے زیادہ ہے۔ لیکن بازار کو حقیقی طور پر متوجہ کرنے والا نقطہ، Zhipu کے بعد سامنے آنے والا ایک تفصیل تھا: یہ تمام ٹریفک مکمل طور پر چینی چپس پر چل رہا تھا۔
زھی پو نے اپنے باضابطہ ٹیکنیکل دستاویز میں کہا ہے کہ اس ماڈل کی انفرنس سروس کے لیے 100,000 سے زائد گھریلو چپس کے کلستر کا استعمال کیا گیا ہے، "ہارڈویئر کی کارکردگی اور ہر ٹوکن کی لاگت اب معمول کے نوڈیا GPU کے برابر ہو چکی ہے"۔
سیمی اینالیسس، سیمی کنڈکٹر ریسرچ ادارہ، نے ایکس پلیٹ فارم پر جواب دیا: “تمام ٹریفک ملکی چپس پر چل رہا ہے، ہارڈویئر کی کارکردگی اور ہر ٹوکن کی لاگت اب نیوڈیا کے جی پی یو کے برابر ہو چکی ہے۔ جلپیانو (اوپن اے آئی کا خود ساختہ انفرنس چپ) کے کل کے اعلان کے بعد، کیو ڈی اے کا دفاعی خندق دوبارہ چیلنج کیا جا رہا ہے۔”

100,000 چینی کارڈ: زہی پُو نے اپنے ٹیکنیکل دستاویز میں اس چینی چپ کلัสٹر کی ڈپلویمنٹ کی تفصیلات بیان کیں۔
ایک چپ کا اہم瓶颈 میموری کی صلاحیت اور بینڈ ویتھ ہے، جس کی وجہ سے 10 لاکھ ٹوکن تک کے کنٹیکس لمبائی کی حمایت کرنا خاص طور پر مشکل ہے۔ اس کے لیے، زہی پن نے SGLang کے بنیاد پر ایک مخصوص انفرینس انجن تعمیر کیا ہے، جس میں W8A8 کوانتائزیشن، INT8/FP8/BF16 مکسڈ کیش کوانتائزیشن، اور نوڈ اندر ٹینسر پیرلیلائزیشن جیسی ٹیکنالوجیز استعمال کی گئی ہیں، اور پروڈکشن لیول Encode–Prefill–Decode (EPD) الگ تھلگ آرکیٹیکچر شامل کیا گیا ہے، جس سے ملٹی مودل اینکوڈنگ، پرامپٹ پری فل، اور ٹوکن بہ ترتیب ڈیکوڈنگ کو الگ الگ شیڈول کیے جانے والے ورک پولز میں تقسیم کیا گیا ہے۔
زھی پو کے مطابق، ایک ہی ہارڈویئر پر ابتدائی بنیادی سطح کے مقابلے میں اینڈ تو اینڈ سروس کی کارکردگی تین گنا بڑھ گئی ہے۔
ویلیپیٹ لیٹ پوسٹ کے مطابق، اس سیریز کے چپس کے فراہم کنندگان ہواوی، موئر لائن ٹین اور ہائی گوان سے ہوسکتے ہیں۔ زھی پو کی طرف سے اس بارے میں کوئی تصدیق نہیں کی گئی اور ٹیکنیکل دستاویزات میں بھی کوئی خاص چپ ماڈل واضح نہیں ہے۔
سیمی اینالیسس نے تبصرے میں خاص طور پر اشارہ کیا کہ پہلے کچھ لوگوں کا خیال تھا کہ صرف سب سے بڑے ایڈوانسڈ لیبز ہی روزانہ 100 ٹریلین ٹوکن کی کمپوٹیشنل کیپسیٹی رکھ سکتے ہیں، "جبکہ یہاں روزانہ 100 ٹریلین ٹوکن کی مفت ٹریفک، پوری طرح ملکی چپس پر چل رہی ہے۔"

ماڈل خود: DeepSeek کے مقابلے میں، قیمت Claude Opus 4.8 کی 1/40 ہے۔ GLM-5.3-Flash کا کل پیرامیٹر سائز 320B ہے، فعال پیرامیٹرز 18B ہیں، اور پیرامیٹرز کی تعداد پچھلے فلیگش GLM-5.3 کے 40% کے تقریباً برابر ہے، جو DeepSeek V4 Flash کے تقریباً مساوی ہے۔
پرفارمنس کے لحاظ سے، زھی پو کے افسرانہ جائزے کے مطابق، GLM-5.3-Flash نے Artificial Analysis Intelligence Index (AA مجموعی ذہانت انڈیکس) میں 57 نمبر حاصل کیے، جو پچھلے فلگشپ GLM-5.2 سے زیادہ ہیں، Anthropic کے Claude Opus 4.8 کے برابر ہیں، اور DeepSeek کے فلگشپ مدل V4 Pro کے رسمی ورژن کے 53 نمبروں سے بھی زیادہ ہیں۔

قیمت کے لحاظ سے، GLM-5.3-Flash کے لیے ہر ملین ٹوکن کے ان پٹ کی قیمت 0.8 یوان، آؤٹ پٹ کی قیمت 2.8 یوان، اور کیش میچنگ کی قیمت 0.23 یوان ہے، جو GLM-5.3 کی قیمت کا دہواں حصہ ہے۔ شروعات کے دو ہفتے تک نصف قیمت لاگو ہوگی۔
زھی پو کا کہنا ہے کہ GLM-5.3-Flash کی قیمت GLM-5.3 کی دسواں حصہ ہے، محدود عرصے کی چھوٹ کے دوران GLM-5.3 کی بیسویں حصہ ہے، اور Claude Opus 4.8 کی چالیسواں حصہ ہے۔
ڈیپسیک V4 Flash کے متعارف کرائے گئے درجات کے بعد (شام کے وقت داخلہ 1.5 یوان، باہر نکلنا 4.5 یوان)، GLM-5.3-Flash زیادہ تر عام استعمال کے مناظر میں سستا ہے۔

آرکیٹیکچر کا ایجادی انقلاب: پیرامیٹرز اور لیئرز تقریباً نصف ہو گئے — GLM-5.3-Flash نے GLM-5.3 سے مکمل طور پر مختلف آرکیٹیکچر ڈیزائن استعمال کیا ہے، جو اس کی کم لاگت پر بہتر کارکردگی حاصل کرنے کا بنیادی سبب ہے۔
GLM-4.5 کے مقابلے میں، GLM-5.3-Flash کے کل پیرامیٹرز تقریباً ایک جیسے ہیں (355B کے مقابلے میں 320B)، لیکن فعال پیرامیٹرز کی تعداد 32B سے گھٹ کر 18B ہو گئی ہے، اور لیئرز کی تعداد 92 سے گھٹ کر 45 ہو گئی ہے، جو تقریباً آدھی ہو گئی ہے۔
زھی پو کے مطابق، GLM-5.3-Flash پہلا اوپن سورس ایڈوانسڈ ماڈل ہے جو نایاب توجہ اور لینیئر توجہ کے مخلوط آرکیٹیکچر کا استعمال کرتا ہے۔ GLM-5.3 کے مقابلے میں، اس کی توجہ کی حسابگاری اور KV کیش کا سائز کردہ 3.01 اور 4.44 گنا کم ہے۔
اس کے علاوہ، یہ ماڈل GLM-5 سیریز کا پہلا اصلی بہ متھ مڈل ہے جو تصویر اور ویڈیو ان پٹ کو سپورٹ کرتا ہے، اور چیزپو نے کوڈنگ پر توجہ مرکوز کرنے کے بعد پہلا ایسا نیا ماڈل ہے جس میں بہ متھ صلاحیتیں شامل ہیں۔

چینی AI ماڈل مارکیٹ میں ایک ساتھ قیمتیں بڑھنے کے بعد، GLM-5.3-Flash کا اجرا کیا گیا، جس نے قیمتیں بڑھانے کے ماحول میں سستی قیمت پر چھید کیا۔
کیمی K3 کی آؤٹ پٹ قیمت ہر ملین ٹوکن کے لیے 100 یوان تک پہنچ گئی ہے، جو پچھلے ماڈل K2.6 سے تین گناں زیادہ ہے؛ زھی پو نے نصف سال کے دوران قیمت میں اضافہ کیا، جس سے آؤٹ پٹ قیمت 28 یوان تک پہنچ گئی؛ دیپ سیک V4 Pro کی قیمت 6 یوان سے بڑھ کر 13.5 یوان ہو گئی، اور شدید استعمال کے دوران 27 یوان؛ دیپ سیک V4 Flash کی آؤٹ پٹ قیمت 2 یوان سے بڑھ کر 4.5 یوان ہو گئی، اور شدید استعمال کے دوران 9 یوان۔
قیمت میں اضافے کا ب без تاثر تقاضے کا باہر نکلنا ہے۔ 《ویلن ڈیل پوسٹ》 کے مطابق، DeepSeek V4 Flash کی قیمت بڑھنے کے بعد، OpenCode پلیٹ فارم پر استعمال کی مقدار نصف ہو گئی، اور یہ تقاضہ ڈومیسٹک ماڈل فروش کے لیے نئی ترقی کا خانہ بن گیا۔
GLM-5.3-Flash کی قیمت دہانہ اس خلا کو ہدف بناتی ہے۔
