میٹا نے Muse Glimmer جاری کیا ہے، جو تقریباً 30B پیرامیٹرز والا ایک متعدد ماڈل ایجنٹ ہے جو 128K سطح کے کنٹیکس کو سپورٹ کرتا ہے اور 24GB ویڈیو میموری والے ڈیوائسز پر چل سکتا ہے۔ یہ ماڈل Apache 2.0 لائسنس کے تحت کھلا ہے، جس میں GQA کا استعمال کرکے KV Cache کا استعمال کم کیا گیا ہے، اور لمبے کنٹیکس کی حسابگاری کے اخراجات کو کم کرنے کے لیے لوکل اور جلوبل اٹینشن کا مخلوط آرکیٹیکچر استعمال کیا گیا ہے، ساتھ ہی مختلف ویڈیو میموری والے ڈیوائسز کے لیے دو قسم کے کوانتائزڈ ورژن فراہم کیے گئے ہیں۔ ویژول ماڈیول میں الگ ViT Perception Encoder شامل ہے جو اسکرین شاٹس اور اسکرین معلومات کو پروسیس کرتا ہے، اور تربیت کے دوران On Policy Distillation شامل کیا گیا ہے تاکہ لمبے ایجنٹ ٹاسکس کی حالت سے انحراف کو کور کیا جا سکے۔ DFlash ریننگ تیز کرنے والا کمپوننٹ Block Diffusion کا استعمال کرتا ہے تاکہ Token کو متوازی طور پر پیشگوئی کی جا سکے، جس سے RTX 5090 پر تقریباً 3 گنا ڈیکوڈنگ سپیڈ میں اضافہ ہوا۔ ماڈل MCP Atlas، DeepSearch QA جیسے ایجنٹ بینچ مارکس میں بہترین پرفارمنس دکھاتا ہے، لیکن OSWorld Verified جیسے صرف GUI سیناریوز میں اب بھی بہتری کی ضرورت ہے۔مضمون کا مصنف، ذریعہ: Leifengwang
کل، میٹا نے Muse Glimmer جاری کیا۔ یہ ایک تقریباً 30B پیرامیٹر والی بہ متعدد ماڈل ہے جو 128K سطح کے سیاق و سباق کو سپورٹ کرتی ہے، ٹولز کو فراہم کر سکتی ہے، کوڈ اجراء کر سکتی ہے، اور تصاویر اور اسکرین کی معلومات کو بھی سنبھال سکتی ہے۔
یہ ماڈل Apache 2.0 لائسنس کے تحت کھلا ہے، ساتھ ہی دو 4-bit کوانتائزڈ ورژنز، الگ ویژول اینکوڈر، اور DFlash انفرسٹ ایکسلریشن کمپوننٹس بھی دستیاب ہیں، اور llama.cpp، MLX، ExecuTorch جیسے لوکل ڈیپلومنٹ طریقے فراہم کیے گئے ہیں۔
ہاں، 30B پیرامیٹرز اور 128K کانٹیکسٹ آج کل عام بات ہے، لیکن مسئلہ یہ ہے کہ میٹا چاہتی ہے کہ یہ عام چیٹنگ نہ کرے، بلکہ ایک مکمل لوکل ایجنٹ رننگ پیرادائگم تعمیر کرے۔
میوز گلیمر کے لیے ڈیزائن کیے گئے طویل مدتی مقامی ایجینٹ کو سخت انجینئرنگ پابندیوں کا سامنا ہے: اسے محدود 24GB ویڈیو میموری میں، لگاتار پیدا ہونے والے اسکرین شاٹس کو پروسیس کرتے ہوئے، دہائیوں کے مرحلے تک کام کا منصوبہ بنانا ہوگا۔ ایک کام کو دہائیوں مرحلوں تک چلانے کے بعد، پچھلے ٹولز کے نتائج، کوڈ لاگ، صفحہ کی حالت اور استدلال کے مراحل مسلسل کنٹیکس میں رہتے رہیں گے۔
اس وقت، چیٹ سیناریوز میں جو مسائل واضح نہیں ہوتے، وہ تیزی سے بڑھ جاتے ہیں۔ 128K کا کنٹیکس محدود گرافک میموری میں کیسے فٹ کیا جائے، اسکرین شاٹس کے بڑھتے جانے کے ساتھ ہسٹری کی حالت کو کیسے منظم کیا جائے، ٹول کال ناکام ہونے کے بعد ماڈل آگے کیسے بڑھے، اور بہت زیادہ ریسننگ ٹوکنز ڈیکوڈ کو کتنی تیزی سے سست کر دیتے ہیں۔
میوز گلیمر کا ٹیکنیکل ڈیزائن بنیادی طور پر ان مسائل کے گرد گھومتا ہے۔ اس نے کسی ایک خاص طور پر نمایاں نئی آرکیٹیکچر کے ذریعے تمام مسائل حل نہیں کیے، بلکہ اٹینشن، KV کیش، ٹریننگ طریقہ، کمیشن اور ڈیکوڈ پر جرات کے ساتھ انتخاب کیے ہیں۔
اگر پہلے کے مقامی ماڈلز "چلنا" کا مقصد تھے، تو Muse Glimmer کا مقصد "بادل کی طرح استعمال ہونے اور لگاتار کام کرنا" ہے۔
ان حصوں کو مل کر دیکھنا، 30B یا 128K کو الگ الگ دیکھنے کے مقابلے میں میٹا کیوں اسے اس طرح بنایا گیا، اسے زیادہ اچھی طرح سمجھنے میں مدد کرتا ہے۔
128K کنٹیکس کو 24GB GPU میموری میں کیسے فٹ کیا جائے؟
یوز گلیمر 52 لیئرز ڈینس ٹرانسفارمر، 6656 کے ہائڈن سائز، 32 کیویری ہیڈ اور صرف 2 کے وی ہیڈ استعمال کرتا ہے۔
توجهہ: ہر لیئر پر مکمل سیاق و سباق کو نہیں سنبھالا جاتا، بلکہ تین مقامی توجہ کے بعد ایک عالمی توجہ کا حلقوں کا طریقہ استعمال کیا جاتا ہے۔
لوکل ایٹینشن صرف قریبی 2048 ٹوکنز کو ہی سنبھالتا ہے، جبکہ جلوبل ایٹینشن دور کی معلومات کے تبادلے کا ذمہ دار ہوتا ہے۔
یہ دونوں ڈیزائن اصل میں لمبے کانٹیکسٹ کی لاگت کو ایک ساتھ بڑھا رہے ہیں۔ جب ماڈل نئے ٹوکن کو جنریٹ کرتا ہے، تو وہ پچھلے ٹوکن کے کی اور ویلیو کو کیش کرتا ہے، جسے KV کیش کہا جاتا ہے۔ جتنا زیادہ کانٹیکسٹ ہوگا، اتنا ہی زیادہ اس حصے پر قبضہ ہوگا۔
میوز گلیمر میں ہر لیول پر صرف 2 KV ہیڈز ہیں، جن کا ہر ہیڈ ڈائیمنشن 128 ہے۔ BF16 کے مطابق تقریبی حساب لگانے پر، ایک ٹوکن ایک لیول میں KV کے لیے تقریباً 1024 باٹ کا استعمال کرتا ہے۔
اگر 52 لیئرز مکمل طور پر 128K کنٹیکس محفوظ کیے جائیں، تو KV کیش تقریباً 6.5 گیگا باٹس کی ضرورت ہوگی۔ لیکن Muse Glimmer میں دراصل 39 لوکل لیئرز اور 13 جلوبل لیئرز ہیں۔ لوکل لیئرز کو صرف تقریباً 2048 ٹوکنز کا سلائڈنگ ونڈو محفوظ رکھنا ہوتا ہے، اور صرف جلوبل لیئرز کو مکمل لمبا کنٹیکس محفوظ رکھنا ہوتا ہے۔

اسی طرح کے اندازے کے مطابق، KV کیش تقریباً 1.7 گیگابائٹ کے سطح تک کم ہو سکتی ہے۔ یہ باہر سے جاری کردہ رن ٹائم وی جی پی یادداشت نہیں ہے، بلکہ صرف علیحدہ اسکیما پیرامیٹرز کے مطابق نظریہ اندازہ ہے، لیکن یہ پوچھا جا رہا ہے کہ اس سٹرکچر کو اس طرح کیوں ڈیزائن کیا گیا ہے۔
اگر یہ 2 KV ہیڈز کے بجائے 32 ہیڈز کے لیے روایتی MHA کی طرح الگ الگ KV محفوظ کرتا ہے، تو ایک جیسی شرائط میں، KV کیش نظریہ طور پر تقریباً 16 گنا بڑھ جائے گی اور 20+ گیگا بائٹ تک پہنچ جائے گی۔
صرف KV Cache ہی ایک 24GB گرافکس کارڈ سے زیادہ ہے۔ یہاں دراصل دو طریقے استعمال کیے گئے ہیں۔ GQA ہر ٹوکن کے لیے محفوظ کیے جانے والے KV کی مقدار کو کم کرتا ہے، جبکہ Local Attention ان لیئرز کی تعداد کو کم کرتا ہے جنہیں لمبے عرصے تک مکمل KV محفوظ رکھنا پڑتا ہے۔
اس مرحلے کو مکمل کرنے کے بعد ہی وزن کی مقدار کا معنی ہوتا ہے۔ Muse Glimmer کا K Quant 17GB وزن تقریباً 16.8GB ہے، ویژول ماڈیول تقریباً 1.4GB اور DFlash تقریباً 1.6GB، جو مل کر تقریباً 20GB تک پہنچ جاتا ہے۔ یہ ورژن 24GB ویڈیو میموری والے ڈیوائسز کے لیے ہے، جبکہ دوسری سیریز، جس کا وزن تقریباً 20GB ہے، Dynamic K Quant 32GB والے ڈیوائسز کے لیے ہے۔

دو کوانتائزیشن سسٹم صرف فائل کے سائز میں فرق نہیں ہیں۔ میٹا کے ذریعہ دیے گئے 15 بینچ مارکس کی اوسط درستگی کے نقصان میں، ڈائنامک K کوانتائزیشن تقریباً 0.2% ہے، جبکہ K کوانتائزیشن 17GB تقریباً 1.0% ہے۔
یعنی، 24GB ورژن میں ویڈیو میموری مزید کم کر دی گئی ہے، جس سے زیادہ جگہ کم لگتی ہے، لیکن آپ کو تھوڑی سی واضح تر کارکردگی کی کمی قبول کرنی پڑے گی۔ 32GB ورژن میں اصل ماڈل کی کارکردگی کو زیادہ سے زیادہ برقرار رکھا گیا ہے۔
Muse Glimmer کا 128K کنٹیکس اس کمبینیشن میں کام کرتا ہے۔ ایٹنشن پہلے کمپوٹیشن کو کم کرتا ہے، GQA بعد میں KV کیش کو کم کرتا ہے، اور آخر میں کوانتائزیشن کے ذریعے ماڈل وزن کو کم کیا جاتا ہے۔
اس منصوبے کا بھی ایک قیمت ہے۔ 39 لوکل لیئرز صرف اپنے قریبی 2048 ٹوکنز تک ہی ب без رابطہ رکھ سکتے ہیں، دور کی معلومات کو جانے کے لیے گلوبل لیئر کے ذریعے پھیلنا پڑتا ہے۔ اس لیے، 128K تک کا ان پٹ دینا اور پورے 128K کا مستقل استعمال کرنا ایک بات نہیں ہے۔
میٹا کے Beam128K نتائج یہ ظاہر کرتے ہیں کہ یہ مقامی اور عالمی مخلوط ساخت اب بھی لمبی فاصلے کی معلومات کو مؤثر طریقے سے استعمال کرنے کی صلاحیت رکھتی ہے، لیکن یہ لمبے حوالہ جات (Long Context) کو حل کرتی ہے، لمبے عرصے تک کی یادداشت (Long-term Memory) نہیں۔ کون سی معلومات محفوظ رکھنی چاہئیں، کون سی زائد ہو چکی ہیں، اور کب حالت کو اپڈیٹ کرنا چاہئے — یہ سب اب بھی ایجنٹ رن ٹائم کے ذمہ ہے۔
یہ مسئلہ ویژول ایجینٹ پر زیادہ واضح ہو جائے گا۔
128K بھی لا محدود جگہ نہیں ہے
Muse Glimmer میں ایک اضافی ViT G 14 Perception Encoder ہے جس کے تقریباً 1.8 ارب پیرامیٹرز ہیں، جو اسکرین شاٹس، ویب صفحات، گرافکس اور دستاویزات کو معالجہ کرنے کے لیے استعمال ہوتا ہے۔ ایک تصویر کو زیادہ سے زیادہ 4096 ویژول ٹوکنز میں تبدیل کیا جا سکتا ہے۔
یہ ابھی تک صرف متن اور تصویر کے ان پٹ، اور متن کے آؤٹ پٹ پر مشتمل ہے، تمام ماڈلز کو ایک ہی جنریٹو ماڈل میں شامل نہیں کیا گیا ہے۔
ایجینٹ ورک فلو میں، یہ بصری صلاحیت ماحول کی حالت پڑھنے کے لیے ذمہ دار ہے۔ کمپیوٹر استعمال ایجینٹ پہلے موجودہ اسکرین دیکھتا ہے، صفحہ، بٹن اور متن کی جگہوں کا جائزہ لیتا ہے، اور پھر ایک عمل کرتا ہے۔ صفحہ تبدیل ہونے کے بعد، وہ نئی اسکرین شاٹ پڑھتا ہے اور اگلے قدم کا فیصلہ جاری رکھتا ہے۔
اس طرح، ویژوئل ان پٹ لگاتار کنٹیکس میں داخل ہوتا رہتا ہے۔ اگر دسوں قدموں کے تمام اسکرین شاٹس مکمل طور پر محفوظ رکھے جائیں، تو 128K ہونے کے باوجود، کنٹیکس جلد ہی ویژوئل ٹوکن سے بھر جائے گا۔ پرانے اسکرین شاٹس موجودہ حالت کے ساتھ تضاد بھی پیدا کر سکتے ہیں۔ صفحہ تبدیل ہو چکا ہے، لیکن پرانے بٹن اور ونڈوز اب بھی کنٹیکس میں موجود ہیں، جس کا مطلب یہ ہے کہ ماڈل کو اضافی طور پر فیصلہ کرنا پڑے گا کہ کون سا حالات تازہ ترین ہیں۔

میٹا نے OSWorld Verified کے جائزے میں بھی سکرین شاٹ کی تاریخ کو بے حد محفوظ نہیں رکھا، بلکہ صرف حالیہ سکرین شاٹس ہی محفوظ کیے۔ اس سے ثابت ہوتا ہے کہ پرسبٹشن اینکوڈر اور کنٹیکس مینجمنٹ دو الگ مسائل ہیں۔
پہلا حصہ موجودہ اسکرین کو ماڈل کے لیے قابل فہم معلومات میں تبدیل کرتا ہے، جبکہ دوسرا حصہ یہ فیصلہ کرتا ہے کہ کون سے تاریخی حالات قابلِ اہمیت ہیں اور کون سے حذف کر دیے جانے چاہئیں۔ اس لیے 128K زیادہ تر Agent کو بڑا کام کا جگہ فراہم کرتا ہے، نہ کہ حالت کے انتظام کو ختم کرتا ہے۔
jab agent مسلسل ماحول کے ساتھ تعامل کرتا رہتا ہے، تو سوالات مدل نے کیا دیکھا، سے مدل نے ابھی کیا کیا، کی طرف منتقل ہو جاتے ہیں۔
اب میوز گلیمر کے تربیتی حصے میں داخل ہو جائیں۔
ایجنت غلط راستہ اپنانے کے بعد کیسے جاری رکھیں
Muse Glimmer کو بڑے Muse Spark سے مربوط کیا گیا ہے۔
میٹا نے تربیت کو پری ٹریننگ، مڈ ٹریننگ اور پوسٹ ٹریننگ میں تقسیم کیا ہے۔ پری ٹریننگ میں لوجٹ ڈسٹلیشن استعمال کیا جاتا ہے، مڈ ٹریننگ میں زیادہ لمبے کنٹیکس، ریزننگ ٹریس اور ایجنٹ ڈیٹا شامل کیا جاتا ہے، اور پوسٹ ٹریننگ میں SFT، آن پالیسی ڈسٹلیشن اور RL شامل کیے جاتے ہیں۔
Logit Distillation اور عام طور پر بڑے ماڈل کے جوابات کو استعمال کرکے چھوٹے ماڈل کو تربیت دینے میں ایک فرق ہے۔ ٹیچر جب اگلے ٹوکن کا پیش گوئی کرتا ہے، تو مکمل ویکابولری کے لیے ایک احتمال کا تقسیم فراہم کرتا ہے۔ اسٹوڈنٹ صرف منتخب شدہ ٹوکن نہیں سیکھتا، بلکہ ٹیچر کے دیگر امیدواروں کے لیے نسبتی جائزہ بھی دیکھتا ہے۔
یہ ایجنٹ کے لیے بہت مفید ہے، کیونکہ بہت سے مناظر میں منفرد ایکشن موجود نہیں ہوتا۔ ایک ویب صفحہ کے سامنے، ماڈل مزید تلاش کر سکتا ہے، یا کسی نتیجے کو کھول سکتا ہے، یا دوسرے ٹول کا استعمال کر سکتا ہے۔ ٹیچر کی احتمالی تقسیم ان اقدامات کے لیے اس کی ترجیحات کو شامل کرتی ہے، صرف آخری آؤٹ پٹ ٹیکسٹ تک محدود نہیں۔
Mid Training تک پہنچ کر، تربیت ایک منفرد جواب سے مکمل کام کے مسیر کی طرف منتقل ہو جاتی ہے۔ ٹولز کے استعمال کے بعد، ماحول تبدیل ہو جاتا ہے۔ تلاش نئے نتائج دیتی ہے، کوڈ کے ناکام ہونے پر خطا کا پیغام آتا ہے، اور GUI پر غلط کلک کرنے سے صفحہ بدل جاتا ہے۔ یعنی، ایجنٹ کا آؤٹ پٹ اگلے ان پٹ کو ب без تبدیل کر دیتا ہے۔

فرض کریں کہ ٹیچر کا صحیح راستہ A سے B، پھر C، اور آخر میں D تک ہے۔ اگر اسٹوڈنٹ صرف ٹیچر کے ڈیٹا کو سیکھتا رہے، تو وہ بار بار A سے B اور B سے C دیکھے گا۔ لیکن حقیقی عمل میں، اسٹوڈنٹ اپنے پہلے قدم پر ہی دوسرے B حالت پر پہنچ سکتا ہے۔
اس لمحے سے، ماحول بدل چکا ہے، اور تربیتی مجموعے میں B سے C تک کا راستہ اب اسے یہ نہیں بتا سکتا کہ وہ اب کیا کرے۔ On Policy Distillation اسی جگہ کام آتی ہے۔ طالب علم پہلے اپنے آپ Rollout کرتا ہے، اپنی اصلی حالت میں داخل ہوتا ہے، اور پھر ان حالتोں پر زیادہ طاقتور ماڈل کی نگرانی کا استعمال کرتا ہے۔

اس لیے تربیت کے ڈیٹا میں صرف ٹیچر کی مثالی راہ نہیں ہے، بلکہ اب اسٹوڈنٹ کے خود بنائے گئے غلط حالات بھی شامل ہیں۔ یہ Muse Glimmer کے زور دیے گئے Failure Recovery سے جڑا ہوا ہے۔
غلط معلومات درج کرنے کے بعد، اگر ماڈل خطا کو سمجھ سکے اور ایک بار پھر ٹول کال کو درست کر سکے، تو کام جاری رہ سکتا ہے۔ اگر ویب سائٹ پر غلط راستہ اپنایا جائے، لیکن صرف موجودہ حالت کو غلط پہچان لیا جائے، تو واپس جانے یا راستہ بدلنے کا موقع ہوتا ہے۔ اصل مشکل اس وقت ہوتی ہے جب ماڈل خطا کا احساس نہ کرے اور غلط حالت پر مبنی طور پر جاری رہے، جس سے انحراف جمع ہوتا رہے۔

اس لیے ایجینٹ کی صلاحیت صرف ایک بار ٹول کال کی درستگی پر نہیں، بلکہ پورے کام کے آخری نتیجے اور درمیان میں غلطی کے بعد بحالی کے صلاحیت پر بھی منحصر ہے۔ اسی وجہ سے Muse Glimmer کچھ لمبے پروسیس ایجینٹ بینچ مارکس پر بہتر کارکردگی دکھاتا ہے۔
تاہم، ایک کام مکمل ہونا یہ نہیں کہتا کہ مقامی چل رہا ہے کوئی مسئلہ نہیں۔ اگر ایک پیچیدہ کام بہت زیادہ Reasoning Token پیدا کرے تو نیا瓶颈 جلد ہی Decode بن جائے گا۔

دو سوالات، ایک کے بعد ایک
Muse Glimmer low، medium، high، اور xhigh چار سطحوں کی Reasoning Strength کی حمایت کرتا ہے۔ اس سیٹنگ کو رن ٹائم ریزننگ بجٹ کے طور پر سمجھا جا سکتا ہے۔
اُچھے درجے عام طور پر ماڈل کو زیادہ Reasoning Token تخلیق کرنے کی اجازت دیتے ہیں، جس سے پیچیدہ کوڈنگ اور ایجنٹ کے کاموں پر کامیابی کا امکان بڑھتا ہے، لیکن اس کی قیمت بھی واضح ہے۔ کنٹیکس تیزی سے بڑھتا ہے اور ڈیکوڈ کرنے میں زیادہ وقت لگتا ہے۔
میٹا نے علیحدہ بینچ مارک میں high Reasoning Strength کا استعمال کیا، جس سے DFlash کا خاکہ پیش آیا۔
ٹرانسفارمر کا ڈیکوڈ خود بخود ہے۔ دوسرا ٹوکن کو پہلے ٹوکن کا انتظار کرنا پڑتا ہے، تیسرا ٹوکن دوسرے پر منحصر ہوتا ہے۔ کچھ سو ٹوکنز کے جواب کے لیے قابل قبول ہے، لیکن ایجنٹ ایک کام کے دوران ہزاروں یا حتیٰ کہ لاکھوں ٹوکنز تک پیدا کر سکتا ہے۔
سپیکولیٹو ڈیکوڈنگ کا طریقہ، ایک چھوٹا ڈرافٹر شامل کرتا ہے۔ ڈرافٹر پہلے مستقبل کے کچھ ٹوکنز کا پیش گوئی کرتا ہے، اور پھر بنیادی ماڈل انہیں ایک بار میں تصدیق کرتا ہے۔ اگر کئی امیدوار ٹوکنز لگاتار قبول ہو جائیں، تو 30B بنیادی ماڈل کے ڈیکوڈ اسٹیپ کے عمل کی تعداد کم ہو جاتی ہے۔
قدیمی حل کا مسئلہ یہ ہے کہ Drafter خود بخود ایک خود بخودی ماڈل ہوتا ہے۔ اگر اسے 16 ٹوکن ڈرافٹ کرنے ہوں، تو ابھی بھی ایک ایک کر کے پیدا کرنے پڑیں گے۔
DFlash نے اس حصے کو Block Diffusion سے بدل دیا۔
Muse Glimmer کا DFlash Block Size 16 ہے، جو ایک ساتھ کئی کینڈیڈیٹ ٹوکنز کا پیش گوئی کرنے کی اجازت دیتا ہے۔ لیکن Drafter صرف تیز ہونا کافی نہیں۔ اگر اندازہ غلط ہو، تو مین ماڈل کئی کینڈیڈیٹس کو مسترد کر دے گا، جس سے پہلے کا سپیڈ فائدہ جلد ہی ختم ہو جائے گا۔
اس لیے DFlash Muse Glimmer کی 1، 13، 25، 37، اور 49ویں لیyer کے Hidden Feature کو براہ راست پڑھتا ہے اور ان مڈل ریپریزنٹیشنز کو صرف 5 لیyers والے Drafter کو بھیجتا ہے۔ اس طرح Drafter کو مکمل Context کو دوبارہ سمجھنے کی ضرورت نہیں ہوتی، بلکہ وہ 30B مین ماڈل کے پہلے سے وجود رکھنے والے اندر کے ریپریزنٹیشنز کا فائدہ اٹھاتا ہے۔
یہ خصوصیات صرف ان پٹ پر ایک بار استعمال نہیں ہوتیں، بلکہ ڈرافٹر کی تمام لیئرز میں کلی اور ویلیو کے طور پر مستقل طور پر شامل کی جاتی ہیں تاکہ نیٹ ورک کے گہرے ہونے کے ساتھ کمزور نہ ہو جائیں۔
ٹریننگ کے دوران ایک اور تفصیل ہے۔ ایک 16 ٹوکن بلاک میں، شروع کے ٹوکنز آخری ٹوکنز سے زیادہ اہم ہوتے ہیں۔ اگر پہلا ٹوکن غلط ہو جائے، تو چاہے باقی کا اندازہ صحیح ہو، مسلسل قبول کی لمبائی بہت کم ہوگی۔
اس لیے DFlash Block کے پہلے والے Token کو زیادہ Loss Weight دیتا ہے اور بعد کے Token کے ساتھ ساتھ یہ کم ہوتا جاتا ہے۔ یہ 16 پوزیشنز کی اوسط درستگی کی بجائے، جتنا ممکن ہو اتنا لمبا قابل قبول پیشونکس تلاش کرتا ہے۔ Meta کے K Quant 17GB ڈیٹا میں، RTX 5090 پر Decode Speed تقریباً 74.9 Token/s سے بڑھ کر 233.4 Token/s ہو گئی۔

اگر ایک Agent Task نے کل 10,000 ٹوکنز جنریٹ کیے ہوں، تو صرف Decode کو دیکھتے ہوئے، پہلا تقریباً 134 سیکنڈ لے گا، جبکہ دوسرا تقریباً 43 سیکنڈ۔ اصل کام میں Prefill، ٹولز کا استعمال اور نیٹ ورک کا انتظار بھی شamil ہوگا، لیکن اعلیٰ Reasoning Strength والے Agent کے لیے یہ فرق مکمل کام کے تجربے پر واضح اثر ڈالتا ہے۔
ہائی ریزننگ اسٹرینگتھ ٹوکن کی پیداوار بڑھاتی ہے، DFlash اس عرصے کو کم کرتا ہے۔ لمبا کانٹیکس KV کیش بڑھاتا ہے، GQA اور لوکل ایٹینشن میموری کو کم کرتے ہیں۔ کوانتائزیشن مدل وزن کو صرف صارفین کے گرافکس کارڈ کے دائرے میں رکھتی ہے۔
اس کے علاوہ، Muse Glimmer MCP Atlas، DeepSearch QA، اور Gaia2 جیسے Agent Benchmark پر اچھا پرفارم کرتی ہے۔ ان کاموں کے لیے لمبی ایکزیکشن چین کی ضرورت ہوتی ہے۔
MCP Atlas کو متعدد MCP سرورز کے درمیان ٹولز کا انتخاب اور فراہمی کرنے کی ضرورت ہے۔ DeepSearch QA کو لگاتار تلاش کرنا، صفحات کھولنا، معلومات ڈھونڈنا، اور نئے نتائج کے مطابق جاری رکھنا ہے۔ Gaia2 ای میل، کیلنڈر، رابطہ وغیرہ جیسے اسٹیٹ فول ایپلیکیشنز کا محاکمہ کرتا ہے، اور ماحول خود ہی کام کے دوران تبدیل ہوتا رہتا ہے۔

یہ کام اور Muse Glimmer کی تربیت کا طریقہ زیادہ مطابقت رکھتے ہیں۔ لیکن OSWorld Verified، TerminalBench اور SWE Bench Verified پر، یہ اسی فائدے کو برقرار نہیں رکھتا۔ مثلاً، OSWorld Verified پر Muse Glimmer کا اسکور 65.9 ہے، جبکہ Qwen3.6 27B کا 75.6 ہے۔ TerminalBench 2.1 پر Muse Glimmer کا اسکور 51.7 ہے، جبکہ دوسرے کا 60.7 ہے۔
اس لیے اس کی صلاحیتوں کا تقسیم واضح ہے۔ ریسرچ ایجنٹ، ٹول کو آرڈینیٹ اور لمبے پروسیس کے اسٹیٹس ٹاسکز زیادہ طاقتور ہیں، جبکہ صرف GUI، ٹرمینل اور کچھ کوڈنگ ایجنٹ کے سیناریوز میں اب بھی بہتری کا بڑا امکان ہے۔ ان اسکورز کو روایتی ماڈل رینکنگ کے مطابق بالکل نہیں سمجھنا چاہیے۔
ایجینٹ بینچ مارک کے نتائج سسٹم پرامپٹ، ٹول ڈیفینیشن، اسکافولڈ، زیادہ سے زیادہ اجراء کے مراحل، سیمپلنگ پیرامیٹرز اور یہاں تک کہ جج ماڈل کے اثرات سے بھی متاثر ہوتے ہیں۔ میٹا خود بھی واضح کرتا ہے کہ تیسری طرف کے ماڈلز کے استعمال کردہ ایجینٹ ٹولز اور سسٹم پرامپٹ ضروری نہیں کہ ان کے لیے بہترین طریقے سے بہتر بنائے گئے ہوں۔
اس لیے ایجنٹ مرحلے تک پہنچ کر، چیکپوائنٹس کا الگ تھلگ موازنہ مکمل صورتحال کو ظاہر کرنا مشکل ہوتا جا رہا ہے۔ سیکورٹی بھی اسی قسم کا مسئلہ ہے۔
مقامی طور پر چلانے سے فائلیں، اسکرین شاٹس اور نجی معلومات کو بار بار کلاؤڈ پر بھیجنے کی ضرورت کم ہو جاتی ہے، لیکن یہ صرف ڈیٹا کے راستے کو حل کرتا ہے۔ پرامپٹ انجیکشن، غلط ٹول کال، اجازتوں کی حد سے تجاوز اور غیر قابل واپسی کارروائیاں اب بھی موجود ہیں۔ میٹا نے الگ طور پر ایجنٹک خطرہ، خصوصیات اور پرامپٹ انجیکشن کا جائزہ لیا ہے اور تجویز کی ہے کہ حقیقی ڈپلومنٹ میں گارڈریل اور ضروری انسانی مداخلت کو مزید بڑھایا جائے۔

ایک واضح صلاحیت کا راستہ
میوز گلیمر کی مکمل ٹیکنیکل پیش رفت آخرکار ایک نسبتاً واضح سلسلہ بناتی ہے۔
ماڈل کا سائز تقریباً 30B پر محدود رکھیں، GQA اور Local Attention کے ذریعے 128K Context کے لیے گرافکس میموری کا خرچ کم کریں، کوانتائزیشن کے ذریعے ماڈل کو 24GB اور 32GB ڈیوائسز میں داخل کریں، Perception Encoder ویژوئل ماحول کو پڑھنے کے لیے ذمہ دار ہے، On Policy Distillation لمبے ایکشنز میں انحراف کی حالت کو کور کرتا ہے، Reasoning Strength ڈویلپرز کو استدلال بجٹ پر کنٹرول دیتا ہے، DFlash بڑی تعداد میں Reasoning Token کی وجہ سے ہونے والی Decode تاخیر کو دوبارہ پروسیس کرتا ہے۔
میوز گلیمر نے ثابت نہیں کیا کہ مقامی 30B ماڈل کلبی فرانتیئر ماڈل کی جگہ لے سکتا ہے، لیکن اس نے ثابت کیا کہ مقامی 30B ماڈل کا اختتام صرف سائز پر نہیں، بلکہ مختلف سخت پابندیوں کے خلاف نظام سطحی انجینئرنگ کے مجموعی ہیڈج پر منحصر ہے۔ اس نے مقامی ایجنٹ میں سب سے مشکل چار پابندیوں — ویڈیو میموری، کنٹیکسٹ، ماحولیاتی حالت کا شعور اور استدلال کی رفتار — کو ایک ہی سسٹم ڈیزائن میں شامل کر دیا ہے۔
میوز گلیمر ابھی تک کلاؤڈ کے فلگشپ ماڈل کی مکمل جگہ نہیں لے سکتا، لیکن "ہر کوئی اپنا ذاتی ایجنٹ رکھے" کے مقصد کے لیے ایک صنعتی سطح پر عملی شدہ راستہ فراہم کر چکا ہے۔
