بہت زیادہ مقابلہ۔
سپتمبر کے صرف تین دن گزر چکے ہیں، اور پانچ ایڈوانسڈ ماڈلز جاری کر دیے گئے ہیں!
Anthropic کا Fable 5.1 اور Mythos 5.1، گوگل کا Gemini 3.8 Flash اور Cyber، اور Meta کا Muse Spark1.3… RSI، بے شک آ چکا ہے۔
گزشتہ رات، جب گوگل کا Gemini 3.8 Flash ہلکا بادشاہ بن گیا، تو میٹا نے چیلنج کر دیا۔
زک برگر نے ایکس پر بااختیار طور پر اعلان کیا: میوز اسپارک 1.3 آج متعارف کرایا گیا ہے، جو اعلیٰ کارکردگی کے ساتھ تقریباً قیمت کے بغیر تجربہ فراہم کرتا ہے۔ یہ ہم نے تکنیک اور ایجنٹ کاموں میں اب تک کی سب سے بڑی قدم ہے!

میٹا کے سپر انتہائی ذہین لیب کے سربراہ الیکسانڈر وانگ نے بھی تین X پوسٹس کیں، جن میں انہوں نے اس "مین ڈیل" کے مرکزی ہتھیار کا انکشاف کیا۔
اس نے کہا کہ Muse Spark 1.3، Muse Spark 1.2 کے مقابلے میں بے فائدہ راؤنڈز کو کم کرتا ہے، ٹول کالز میں ~20% کی کمی آتی ہے، ٹوکن کی استعمال میں ~25% کی کمی آتی ہے، اور لمبے دور کے کاموں میں ضروریات کو بہتر طریقے سے برقرار رکھتا ہے، "صارفین اس قدم میں واضح فرق محسوس کریں گے"۔

میوز اسپارک 1.3 کے فوری جاری ہونے کے بعد، کل رات جاری ہونے والی جیمنی 3.8 فلیش پر سایہ پڑ گیا۔
پرفارمنس کے مطابق، اس بار Muse Spark 1.3 میں زیادہ بہتری ہوئی ہے۔
یہ صرف GPT-5.6 Sol اور Fable 5 کو پرفارمنس پر پیچھے چھوڑنے تک محدود نہیں، بلکہ Max انفرنس طاقت کے تحت Artificial Analysis ذہنی اندیکس 62 تک پہنچ گیا ہے، جو واضح طور پر موجودہ پہلے گروپ میں داخل ہو گیا ہے۔

پانچ ماہ میں، میٹا نے چار Muse Spark ورژنز کو بغیر توجہ دیے اپ ڈیٹ کر لیا ہے۔
الیکسنڈر بادشاہ نے گوگل کو مزاح کیا، "دوسروں کے ماڈل کی دھوئیں سانس لینا"
ہالیا وقت میں، AI کی پہلی ٹیم بہت سرگرم ہے۔ GPT-5.6 تخت پر قابض ہے، Fable 5.1 پیچھے سے آ رہا ہے، اور Gemini 3.8 Flash منحنی راستے سے آ رہا ہے۔
میوز اسپارک 1.3 کے ظہور نے سب کے منصوبوں کو الٹ دیا۔
DeepSWE v1.1 بینچ مارک میں، جہاں ماڈل کی حقیقی لمبی مدتی پروگرامنگ صلاحیت کا جائزہ لیا جاتا ہے، Muse Spark 1.3 نے Opus 5 اور GPT-5.6 Sol کو پیچھے چھوڑ دیا اور تازہ جاری Gemini 3.8 Flash کو بھی پیچھے چھوڑتے ہوئے موجودہ بلند ترین اسکور حاصل کیا۔
میوز اسپارک 1.3: 75.4 نمبر
کلود اوپس 5: 74.0 نمبر
GPT-5.6 Sol: 73.0 امتیاز

اس کے علاوہ، دیگر کلیدی ڈویلپر میٹرکس میں بھی Muse Spark 1.3 نے نمایاں کارکردگی دکھائی۔
SWEAtlas CodeBase QnA میں، اس نے 59.4 اسکور حاصل کیا، جو GPT-5.6 Sol اور Opus 5 کو پیچھے چھوڑ دیا۔
ٹرمینل-بینچ 2.1 میں اس نے 88.8 اسکور حاصل کیا۔
MRCR 512K-1M پر، اس نے حیرت انگیز 98.1 اسکور حاصل کیا! (مقابلہ کے لیے، GPT-5.6 Sol کا اسکور صرف 73.8 تھا، جو بالکل دبانا ہے)۔

ایجینٹ کی صلاحیتوں میں، یہ بھی سب سے اگرے کے سطح تک تقریباً پہنچ گیا ہے، جہاں JobBench، OSWorld جیسے ٹیسٹوں میں یہ Opus 5 سے صرف کچھ فیصد کا فرق رکھتا ہے۔

Artificial Analysis پر، Muse Spark 1.3 نے Gemini 3.8 Flash کو واضح طور پر پیچھے چھوڑ دیا۔
سمارٹ انڈیکس پر، اس نے 62 اسکور حاصل کیا، جو کلاؤڈ فیبل 5 کے برابر ہے اور ٹاپ لیگ میں شامل ہو گیا۔

اور وہ تفصیل جس پر ڈیولپرز سب سے زیادہ توجہ دیتے ہیں، وہ ہے لاگت: میوز کی ان پٹ لاگت فیبل 5 سے 8 گنا کم ہے اور آؤٹ پٹ لاگت تقریباً 12 گنا کم ہے، جس سے قیمت اور مفیدیت کا تناسب بہترین ہو جاتا ہے۔
اس شاندار کارکردگی کے سامنے، میٹا کے سربراہ AI ایلیکسنڈر وانگ نے کہا: "آرٹیفیشل اینالسس اسمارٹ انڈیکس پر، جیمنی کچھ بھی نہیں ہے، صرف دوسرے ماڈلز کی گاڑیوں کے اخراجات کا سانس لے رہا ہے۔"
گوگل واقعی اپنی سلطنت کھو چکا ہے۔

کسی نے مزاحیہ طور پر کہا: "گوگل نے چار ماہ میں چار جیمنی فلیش ورژن جاری کیے، جبکہ میٹا نے پانچ ماہ میں چار میوز اسپارک plس کو اپ ڈیٹ کر دیا۔ لیکن گوگل صرف کچھ گھنٹوں کے لیے لیڈ کر پایا، جبکہ میٹا نے اسے پیچھے چھوڑ دیا — یہ منظر بہت دلچسپ ہے۔"

کم ہے زیادہ: 2 گھنٹے کے لیے صرف 1 ڈالر کی پرفارمنس جنگلی
اچھی پرفارمنس ضروری ہے، لیکن آج کے AI دنیا میں، ڈیولپرز کو ہمیشہ اچھی طرح کام کرنے والی اور سستی چیزیں دلچسپ لگتی ہیں۔
Muse Spark 1.3 کو قیمت اور کارکردگی کا بادشاہ کہا جاتا ہے کیونکہ یہ نہ صرف تیز چلتی ہے بلکہ بہت زیادہ بچت بھی کرتی ہے۔
الیکسانڈر وانگ کے الفاظ میں، Muse Spark 1.3 "ان کے لیے ناچیز قیمت" ہے، "اگرچہ اس کی سرحدی کارکردگی ہے، لیکن اس کی لاگت صرف ایک چھوٹا سا حصہ ہے۔"


یہ ایک ایسی راہ پر چلی جو پہلے کے بڑے ماڈلز کی "بڑی کوشش سے معجزہ، پیرامیٹرز کا پاگل پن سے اضافہ" کے طریقے سے مکمل طور پر الگ ہے — کم کرنا۔
لمزید لمبے دور کے پروگرامنگ اور بہتر حکم کی پابندی کے لیے، Muse Spark 1.3 کو خصوصی طور پر تربیت دی گئی ہے تاکہ غیر ضروری انٹرایکشن کے راؤنڈز کو کم کیا جا سکے اور آؤٹ پٹ زیادہ مختصر ہو سکے۔

یہ زیادہ ذکی اور چست ہو گیا، کوڈ کا انداز صاف ہو گیا، اور بے معنی باتیں کم ہو گئیں۔
اور اس تفریق کا ب без تاثر یہ ہے کہ لاگت میں اچانک کمی آئی۔
یہ ایک بہت ہی حیرت انگیز حقیقی ٹیسٹ کیس ہے۔
ڈیولپر @SPAC89 نے Muse Spark 1.3 Ultra Contributor موڈ کا استعمال کرتے ہوئے Fable 5.1 xHigh کے ساتھ موازنہ کیا۔

اس نے اپنے پرامپٹ میں ایک سخت "خود کو بہتر بنانے کا قاعده" شامل کیا ہے: اگر مستقل جج کا اسکور 9.5/10 سے کم ہو، تو اسٹیٹ کو کوڈ میں مزید بہتری لانی چاہیے اور دوبارہ کوشش کرنی چاہیے۔
دونوں ماڈلز تقریباً 2 گھنٹے تک چلے، جس کا نتیجہ حیران کن تھا۔
میوز اسپارک 1.3 ایک بے تھک سپر ورکر کی طرح ہے، جو کبھی رکتا نہیں اور 20 راؤنڈ خود بہتری کے سائکلز مکمل کرتا ہے، جس میں ہر بار 3 انسٹنسز شروع ہوتے ہیں—یعنی 2 گھنٹوں میں 60 سے زیادہ انسٹنس رن ہوئے۔
لیکن اس بہت بڑے، پیچیدہ لمبے مراحل کے استدلال کا کل اخراج صرف 1 ڈالر سے کم تھا!

اس ڈیولپر نے چیخ کر کہا: "یہ میری توقع سے کہیں زیادہ ہے، یہ چیز بالکل ایک فن کا کام ہے!"
میکرو پرائسنگ کے حوالے سے، میٹا نے بڑی عزم کا مظاہرہ کیا ہے۔ نئے ماڈل میں مقدار میں اضافہ کیا گیا ہے لیکن قیمت میں کوئی تبدیلی نہیں کی گئی، جس میں ہر ملین ٹوکن کے ان پٹ کے لیے 1.25 امریکی ڈالر اور آؤٹ پٹ کے لیے 4.25 امریکی ڈالر کی قیمت برقرار رکھی گئی ہے۔

قیمت کے لحاظ سے، Muse Spark 1.3 کا کنٹریبیوٹر ورژن "muse-spark-1.3-contributor" عالمی ماڈلز کی قیمت کی حد سے کم ہے۔ (اس کا ادھار یہ ہے کہ ڈیٹا کو Meta کے پروڈکٹس کو بہتر بنانے کے لیے استعمال کیا جائے۔)

کوڈڈمن کے بانی اور ڈویلپر میہول موہن کہتے ہیں:
Muse Spark 1.3 کے کنٹریبیوٹر لیول کی قیمتیں بےحد غیر منطقی ہیں، یہی امریکی AI لیب کا „ DeepSeek قیمت تعین کا وقت۔

آرٹیفیشل اینالیسس کے اعداد و شمار کے مطابق، ایک جیسے ذہنی سطح (59 سے زیادہ اسکور) والے ماڈلز میں، یو ایس ڈالر 0.55 کے صرف ایک منفرد کام کی لاگت کے ساتھ، یو ایس ڈالر 1.3 مکمل طور پر بہترین حل ہے۔
مقابلہ کے طور پر، ایک جیسی ذہانت (61 نمبر) والے Grok 4.6 کی قیمت 0.94 امریکی ڈالر ہے، GPT-5.6 Sol کی قیمت 0.95 امریکی ڈالر ہے، اور Claude Opus 5 کی قیمت 1.23 امریکی ڈالر تک پہنچ جاتی ہے۔
حتی کہ ڈویلپر کرٹک نے اشارہ کیا کہ Muse Spark 1.3 میں Sol اور Fable جیسی "سلائیکل دیپتھ" استدلال کی صلاحیت نظر آتی ہے۔
یہ جواب کو ایک لمحے میں نہیں بناتا، بلکہ اندر کی منطقی استدلال کو سمجھتا ہے، جس سے اس کی ٹوکن کارکردگی حیرت انگیز طور پر زیادہ ہوتی ہے۔

الیکساندر وانگ کی تیز رفتاری، چھوٹے زا کی آخری خواہش
میوز اسپارک 1.3 کا ابھرنا اس کے پیچھے کے ٹریڈر کی وجہ سے ممکن ہوا۔
جولائی 2024 میں، میٹا نے میوز اسپارک 1.1 جاری کیا، جس کا مرکزی خصوصیت 1M لمبا کنٹیکس اور کمپیوٹر آپریشنز ہے۔
صرف دو مہینوں سے کم کے عرصے میں، ورژن 1.3 نے لمبی مدتی کوڈنگ کی صلاحیت کو GPT-5.6 کے سطح تک پہنچا دیا ہے۔
یہ اتنی تیز ترین ترقی، الیکسندر وانگ نے میٹا سپر انسٹیلنس لیب کا ہاتھ سنبھالنے کے بعد حاصل کیا ہے۔
ان کا نہایت مقصد کیا ہے؟ جیسا کہ چھوٹا زا اور ایلیکسنڈر وانگ نے دو الفاظ کو بار بار زور دے کر کہا ہے: "ایجنٹ" اور "ایسا سستا کہ نظرانداز کیا جا سکے"۔
یعنی، میٹا اگلے ASI کے موسم کو — "ایجینٹ انجینئرنگ" — دیکھ رہا ہے۔
میٹا AI کے سربراہ الیکسانڈر وانگ نے ایکسیوس کے ساتھ ایک انٹرویو میں واضح کیا کہ تمام دستیابی میں بہتری کا مقصد چھوٹے زک کی بار بار اشارہ کی گئی بڑی منصوبہ بندی — 7×24 گھنٹے آن لائن ذاتی ایجنٹ بنانا — کو پورا کرنا ہے۔

ایک ایجنٹ کو 24 گھنٹے آپ کے لیے ای میلز کا انتظام، کوڈ لکھنا اور ڈیٹا کا تجزیہ کرنے کے لیے، اسے دو شرائط پوری کرنی ہوں گی۔
1. بہت ذکی اور مستقل: اسے بہت لمبی ڈائیلاگ تھریڈس (لمبی تھریڈس) کو برقرار رکھنا ہوگا، اور متعدد ورک فلوز کو متوازی طور پر سنبھالنا ہوگا۔
جب حکم واضح نہ ہو تو اسے فعال طور پر سوال کرنا چاہیے؛ جب رکاوٹ کا سامنا ہو تو اسے انسانوں سے مدد مانگنی چاہیے؛ اہم کارروائیوں کو انجام دینے سے پہلے اسے تصدیق کرنا چاہیے۔ سب سے اہم بات، وہ خیالی باتیں نہ بنائے۔
2. بہت سستا: اگر ذاتی ذہین ایجینٹ کے ایک دن کا استعمال ڈالروں کی دہائیوں کی لاگت پر آتا ہے، تو یہ کبھی بھی صرف کچھ لوگوں کا کھلونا رہے گا۔
میوز اسپارک 1.3 کا ظہور بنیادی طور پر 7×24 گھنٹے ذاتی اسائنٹس کے لیے راستہ ہموار کرتا ہے۔
یہ ایک پختہ اور تجربہ کار انجینئر کی طرح ہے، آپ ایک مقصد دیتے ہیں، اور وہ خود منصوبہ بندی کرتا ہے، خود اپنی غلطیوں کو درست کرتا ہے، اور خود ڈیلیوری کرتا ہے۔
اس کے لیے، پکنگ یونیورسٹی کے ایلومنی اور میٹا ریسرچر سُن زہیچنگ نے بتایا کہ میٹا ٹیم نے پہلے کے ایووکاڈو ماڈل کو دوبارہ ٹرین کیا ہے، جس سے ٹیسٹ سکیلنگ میں بہتری آئی ہے۔

مہک کے پیچھے: کیا ہم کو «رینکنگ میں دھوکہ» دیا گیا؟
تاہم، میوز اسپارک 1.3 کو بھی سوالات کا سامنا ہوا۔
مشہور AI ادارہ BridgeMind نے ایک غور طلب بات شیئر کی:
جیمنی 3.8 فلیش اور میوز اسپارک 1.3 آج ایک ساتھ جاری کیے گئے ہیں۔ دونوں بنچ مارکس پر بہت اچھے لگ رہے ہیں۔
Muse Spark 1.3 اب فیصلہ کن اندیکس پر Fable 5 کے ساتھ برابر ہے… مجھے خوشی محسوس کرنا چاہیے۔ لیکن میں نہیں کر رہا۔
کیونکہ اس ماہ کے AI اجراٹو ایک جیسے تھے، اسکورز میں اضافہ ہوا، لیکن حقیقی دنیا کے تجربے میں کوئی بہتری نہیں آئی۔
یہ ناگوار ہے۔ میں بینچ مارک پر اپنا اعتماد ہر ہفتے کم کر رہا ہوں، اور جن لیبز کے ساتھ بینچ مارکس کھیلے جاتے ہیں، ان پر میرا اعتماد تقریباً ختم ہو چکا ہے۔

یہ جملہ موجودہ بڑے ماڈل صنعت کے مسائل کو درست طور پر ہدف بناتا ہے۔
کچھ صارفین نے میوز اسپارک 1.3 اور جیمنی فلیش 3.8z کو بیک اینڈ لیول 3D کنسترینٹس کے تحت اسٹریس ٹیسٹ کیا، جس کے نتائج میں دونوں ماڈلز کی اصل حالت سامنے آ گئی:
Muse Spark 1.4 اتنی اچھی نہیں ہے، جبکہ Gemini Flash 3.5 صرف رینکنگ میں جھوٹ بول رہا ہے۔

اب، تمام لیبز "اسکور کے لیے تربیت" کے چکر میں پھنس چکے ہیں۔ ایک ماڈل جب جاری ہوتا ہے، تو اس کے ساتھ ضرور کچھ ریڈار چارٹس اور رینکنگ سکرین شاٹس آ جاتے ہیں جو دوسرے کمپنیوں کو شکست دیتے ہیں۔
DeepSWE، Tau3-Bench، GPQA، تمام کمپنیوں کے لیے پریکٹس کرنے کے اہم مقاصد بن گئے۔
اور Muse Spark 1.3 بھی اپنا راز کھول چکا ہے۔
آرٹیفیشل اینالسس کی گہری رپورٹ میں، ہم اس کی ایک چھوٹی سی پیچیدگی بھی دیکھ سکتے ہیں۔
مثلاً، AA-Omniscience ٹیسٹ میں، xhigh اور max ورژن دونوں میں کمی آئی۔ اس کی وجہ اس کی "عدم شرکت کی شرح" میں اضافہ ہے — جب یہ بے یقین ہوتا ہے، تو یہ جھوٹ بولنے کے بجائے جواب دینے سے گریز کرتا ہے۔
یہ幻覺 کی شرح کو کم کرتا ہے، لیکن اس کے ساتھ یہ بھی ظاہر ہوتا ہے کہ اس کا مطلق علمی ذخیرہ اتنے زیادہ نہیں بڑھا جتنا اس کا اسکور بہتر ہوا۔

بڑے ماڈل کے دوسرے نصف میں، بالآخر کیا مقابلہ ہے؟
آج میوز اسپارک 1.3 اور جیمنی 3.8 فلیش کے اطلاق سے ہم درج ذیل جائزے کر سکتے ہیں۔
سب سے پہلے، بنیادی ماڈل کا "پیرامیٹر بونس" اپنی چوٹی پر پہنچ چکا ہے۔
صرف پیرامیٹر سائیز کو بڑھا کر ذہانت میں اضافہ کرنے کا طریقہ اب تدریجی فائدہ کم ہوتا جا رہا ہے۔
مستقبل میں، جو کوئی Muse Spark 1.3 کی طرح سسٹم آرکیٹیکچر میں "سلائیک ڈیپتھ" جیسے استدلالی مکینزم کو شامل کرے اور ٹول کالز پر انتہائی "کمی" کرے، وہ حقیقی تجربے میں کھچڑی لائے گا۔
اس کے علاوہ، "ایجینٹ انجینئرنگ" ہی فیصلہ کن عنصر ہے۔
بڑے ماڈلز کی جدوجہد، "جو زیادہ اچھا بولتا ہے" سے "جو زیادہ کام کرتا ہے" کی طرف منتقل ہو چکی ہے۔
مستقبل کا بنیادی رکاوٹ صرف ایک ہی اسکور نہیں ہے، بلکہ بہت کم لاگت پر لمبے مدتی کاموں کی حقیقی انجام دہی کی صلاحیت ہے۔
میوز اسپارک 1.3 جیسے ماڈل، جو 60 بار ٹرائل اینڈ ایرر سائکل کو ایک ڈالر سے کم میں چلا سکتے ہیں، بالکل تجارتی ماڈل کو دوبارہ شکل دیں گے۔
حوالہ جات:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
یہ مضمون ویچن گروپ "نیوزی یوان" سے ہے، مصنف: ASI Revalation
