چینی اسٹارٹ اپ مائنڈ لیب نے 748B پیرامیٹرز کے ساتھ میکارون-V1 ماڈل شروع کیا، جو کوڈ کے کاموں میں Opus 4.8 سے بہتر کارکردگی دکھاتا ہے

iconMetaEra
بانٹیں
AI summary iconخلاصہ
آن-چین خبروں کا اظہار ہوا جب چینی اسٹارٹ اپ مائنڈ لیب نے میکارون-V1 کا اعلان کیا، جو 748B پیرامیٹر والی ایک ماڈل ہے جس میں مکسچر-آف-LoRA ڈیزائن استعمال کیا گیا ہے۔ AI + کرپٹو خبروں کے اسپاٹ لائٹ ماڈل نے SWE-bench Verified پر 85.6 کا سکور حاصل کیا، جو DeepSeek-V4-Pro اور Kimi-K2.6 سے بہتر ہے۔ میٹوان کی قیادت میں $50 ملین کے A-راؤنڈ سے سپورٹ کیا جانے والا، لیب کا دعویٰ ہے کہ ریل ورلڈ لرننگ اس ماڈل کو چلاتی ہے۔ دو ہفتے میں ARR $10 ملین تک پہنچ گیا۔
مائنڈ لیب نے میکارون-V1 ماڈل جاری کیا، جس میں 748B پیرامیٹرز کے ساتھ 4 الگ LoRA کا Mixture-of-LoRA آرکیٹیکچر استعمال کیا گیا ہے، جس نے SWE-bench Verified ایوان میں 85.6 اسکور کے ساتھ کوڈنگ کے شعبے میں پہلی جگہ حاصل کی۔ اس چینی لیب نے، جو اب تک ایک سال سے بھی کم عرصہ ہوا ہے، 50 ملین امریکی ڈالر کے فنڈنگ کے ذریعے سلیکون ویلی کے 2 بلین امریکی ڈالر والے ٹیم کے برابر ٹیکنالوجی حاصل کر لی ہے، اور ان کے LoRA رینفورسمنٹ لرننگ کے راستے کو ٹورنگ ایوارڈ وصول کنندہ رچرڈ سٹٹن، ڈیپسیک کے لیانگ وین فینگ سمیت صنعت کے رہنماؤں نے سپورٹ کیا ہے۔ مائنڈ لیب نے "مستقل سیکھنا" اور "گروہی ذہانت" کے تصورات بھی پیش کیے ہیں، جس میں کہا گیا ہے کہ ماڈل لیب سے باہر نکلنے کے بعد بھی حقیقی ماحول میں مستقل طور پر سیکھتا اور تعاون کرتا رہے گا۔ صرف دو ہفتے میں تجارتی طور پر 10 ملین امریکی ڈالر کا ARR حاصل کر لینا، اس ٹیکنالوجی کے راستے کو حقیقی مسائل حل کرنے کا ثبوت ثابت ہوا۔

مضمون کے مصنف، ذریعہ: نئی بُدھی

گزشتہ هفتہ AI کے دائرے میں ایک بات پر بحث ہو رہی تھی، لیکن زیادہ تر لوگوں نے صرف ایک آدھا پہلو دیکھا۔

15 جولائی کو، سابقہ OpenAI CTO Mira Murati نے سن فرانسسکو میں Thinking Machines Lab کا پہلا ماڈل Inkling جاری کیا۔

20 ارب ڈالر کی فنڈنگ، 975B پیرامیٹرز، 100 افراد کی ایلیٹ ٹیم — سلیکون ویلی کی سب سے زیادہ توجہ حاصل کرنے والی AI اسٹارٹ اپ، آخرکار اپنا کھلاڑی پیش کر چکی ہے۔

تقریباً ایک ہی دن، تقویتی سیکھنے کے باپ رچرڈ سٹن، 2024 کے ٹیورن انعام یافتہ، جو تقریباً ساتھ سال کے ہیں، نے اوک لیب کی بنیاد رکھنے کا اعلان کیا۔

بزرگ کا اصل کلام یہ تھا: " موجودہ ڈیپ لرننگ طریقے کمزور اور ناکارہ ہیں، جن کے لیے مرمت و ترمیم کی ضرورت نہیں، بلکہ بنیادی طور پر دوبارہ شروع کرنے کی ضرورت ہے۔"

صرف سٹن ہی نہیں، ڈیپسیک کے بانی لیانگ وینفینگ نے تقریباً ایک جیسا جائزہ دیا۔

اس نے AI کے ترقی کو ایک ایک کر کے سیڑھیوں کی طرح بیان کیا: زبانی ماڈل، CoT، ایجینٹ… اور ایجینٹ کے بعد، اگلا ضروری سیڑھی مستقل سیکھنا ہے۔

اس کا خیال ہے کہ اگلی نسل کے ماڈل کی بنیادی صلاحیت یہ ہونی چاہیے کہ اس میں مستقل سیکھنے کی صلاحیت ہو، ورنہ اسے اگلی نسل کا ماڈل نہیں کہا جا سکتا۔ اگر پہلے مستقل سیکھنا ممکن کر دیا جائے، تو جامع ذہانت آسان ہو سکتی ہے۔

جب ایک ٹیکنالوجی کا راستہ ٹیورن انعام یافتہ، سلیکون ویلی کی سب سے زیادہ توجہ حاصل کرنے والی AI اسٹارٹ اپ اور چین کے سب سے نوآورانہ مڈل مڈل کے بانیوں کے ذریعہ ساتھ لگایا جائے، تو یہ صرف ایک ٹیکنالوجی کا انتخاب نہیں رہ جاتا، بلکہ ایک صنعتی اتفاق رائے بن جاتا ہے۔

ہوا کی سمت بدل چکی ہے۔

جب سب کچھ سلیکون ویلی پر توجہ مرکوز کر رہے تھے، اسی ریل پر، ایک ایسا چینی لیب جس کی تشکیل اب تک ایک سال سے بھی کم عرصہ ہوا تھا، نے ایک حیرت انگیز جواب پیش کیا۔

Mind Lab، Macaron-V1 کا باہری اعلان کرتا ہے۔

مائنڈ لیب 2025ء کے اکتوبر میں قائم کیا گیا، جو مائنڈورس (مند ویس ٹیکنالوجی) کا ایک پیشگام تحقیقی لیب ہے۔ پوری ٹیم تیس سے زائد افراد پر مشتمل ہے، جن کی پس منظر میں xAI، DeepMind، DeepSeek، بائٹڈانس سیڈ، MIT اور تسوہوا ہیں۔ سال کے آغاز میں 50 ملین امریکی ڈالر کا A سیریز فنڈنگ مکمل ہوا، جس کی قیادت میٹوان نے کی، اور انتھو، سیکوائر چائنہ، زین گو وغیرہ نے ساتھ دیا۔

اس عدد کو نوٹ کریں: 50 ملین امریکی ڈالر، جس کا استعمال بعد میں بھی کیا جائے گا۔

748B پیرامیٹر کے ساتھ مستقیم طور پر تقویتی سیکھنا

چار LoRA، ہر ایک اپنا کام کرتا ہے

سب سے پہلے ماڈل دیکھیں۔

ماکارون-V1 دو ورژنز میں ہے:

  • فلاگشپ وینٹی، 748B پیرامیٹرز، 744B کے GLM-5.2 بیس پر مبنی اور چار 1B LoRA کے ساتھ، اصلی 2M لمبے کنٹیکس کے ساتھ؛
  • معیاری نسخہ Tall، 35B، Qwen-3.7 پر مبنی پس از تربیت، میک پر چل سکتا ہے۔

لیکن اہم بات پیرامیٹرز میں نہیں، بلکہ ان 4 LoRA میں ہے۔

گزشتہ زمانے میں، LoRA مکمل پیرامیٹر فائن ٹیوننگ کا "سستا متبادل" تھا۔ بچت تو ہوتی تھی، لیکن کوالٹی کم ہوتی تھی۔

Mind Lab نے اسے دوبارہ تعریف کیا ہے: بیس ماڈل "عام خصوصیات" ہے، اور LoRA "خصوصی خصوصیات" ہے۔

اس کا کیا مطلب ہے؟ جیسے تمام آئی فون ایک ہی iOS سسٹم استعمال کرتے ہیں، لیکن آپ نے جو ایپس انسٹال کی ہیں، آپ کی کی بورڈ کی عادات، اور آپ کے اکثر استعمال کیے جانے والے عمل آپ کے آئی فون کو «آپ کا آئی فون» بناتے ہیں۔

بات چیت قدرتی اور ہم خیال ہونی چاہیے، پروگرامنگ سخت اور درست ہونی چاہیے، ایجینٹ کو متعدد مراحل کی منصوبہ بندی کی ضرورت ہوتی ہے، جنریٹو UI کو انٹرایکشن ڈیزائن کیا جانا چاہیے — ان سب کو ایک ہی پیرامیٹر میں ٹرین کرنے سے وہ آپس میں لڑنے لگیں گے۔

ماکارون-V1 کا طریقہ سادہ اور بے رحم ہے: ٹوٹنا۔

چار الگ الگ LoRA، جو چیٹ، ایجنٹ، پروگرامنگ اور GenUI کے لیے مخصوص ہیں، جن کی الگ الگ تربیت، الگ الگ جائزہ اور الگ الگ واپسی ہوتی ہے۔

چلائے جانے والے روتر کا ڈائنانک تبدیلی — جب آپ کہیں "میری شیڈول بنائیں" تو Agent LoRA استعمال ہوتا ہے؛ جب آپ کہیں "اس کوڈ میں بگ ہے" تو Coding LoRA پر سوئچ ہو جاتا ہے۔ صارف کے لیے مکمل طور پر شفاف۔

اس ڈھانچے کا ایک عرفی نام ہے: Mixture-of-LoRA (MoL) — مختلف صلاحیتیں مشترکہ بنیاد کے اوپر الگ الگ تربیت یافتہ، لچکدار طور پر مجموعہ، اور ضرورت کے مطابق استعمال کی جاتی ہیں۔ ایک ماڈل کو مکمل ماہر بنانے کے بجائے، کئی ماہرین مل کر کام کرتے ہیں۔

عملی طور پر، Macaron-V1 ابھی تک تمام صلاحیتوں میں سب سے طاقتور بند ماڈل کے سطح تک نہیں پہنچا ہے۔ لیکن تمام جائزہ ٹیسٹس میں، یہ زیادہ تر کاموں پر Opus 4.8، GPT-5.5 اور Gemini 3.1 Pro کے برابر یا ان سے آگے نکل گیا ہے — خاص طور پر روزمرہ کے مناظر، کوڈنگ کی صلاحیت اور جنریٹو UI کے شعبوں میں۔

SWE-bench تصدیق شدہ — صنعت کے سب سے سخت کوڈنگ صلاحیتوں کے جائزے میں سے ایک، Macaron-V1-Venti نے 85.6 اسکور کے ساتھ پہلی جگہ حاصل کی، جو دوسرے نمبر پر والے سے 3 اسکور زیادہ ہے، اور DeepSeek-V4-Pro (80.6)، MiniMax-M3 (80.5)، Kimi-K2.6 (80.2) کو پیچھے چھوڑ دیا۔

مزید شدید بات یہ ہے کہ Deep-SWE لمبی اور پیچیدہ سافٹ ویئر انجینئرنگ کے کاموں کے لیے ٹیسٹ کیا جاتا ہے۔ Macaron-V1-Venti نے 58.4 اسکور حاصل کیا، جبکہ دوسرے نمبر پر اس کا بنیادی ماڈل GLM-5.2 تھا—46.2 اسکور۔ ایک ہی بنیادی ماڈل، جسے LoRA ری انفورسمنٹ لرننگ کے ذریعے ٹرین کیا گیا، فوراً 12 اسکورز زیادہ حاصل کر گیا۔ یہی وہ اضافی قیمت ہے جو پوسٹ ٹریننگ لائے سکتی ہے۔

زیادہ اہم بات یہ ہے: اوپن ویٹ، ذاتی طور پر ڈیپلوی کی جا سکتی ہے۔ بند سورس ماڈل جتنا بھی طاقتور ہو، اپنا ڈیٹا دوسرے سرور پر گزرنے دے گا۔ Macaron-V1 آپ کو ماڈل کو اپنے گھر واپس لانے کی اجازت دیتا ہے، اور آپ کا ڈیٹا ایک بائٹ بھی باہر نہیں جاتا۔

انڈریو نے WAIC پر ایک کیس پیش کیا: صارف ایک بکھری ہوئی مکعب کی تصویر لیتے ہیں اور بھیج دیتے ہیں، ماڈل حالت کی شناخت کرتا ہے، الگورتھم حل کرتا ہے، اور ا tươngاتی 3D ریسٹور گائیڈ جنریٹ کرتا ہے — اس کے لیے وژول سمجھ، الگورتھم، ایجینٹ ٹول کال اور جینیو کی چار صلاحیتیں مل کر کام کرنی پڑتی ہیں۔

ایک اور ایسا ڈیزائن جسے عام طور پر نظر انداز کیا جاتا ہے لیکن بہت ہی جدید ہے: ماڈل اور ہارنیس کا مشترکہ ڈیزائن۔

کیا مطلب ہے؟ زیادہ تر ماڈلز کی تربیت اور عملی طور پر ڈیپلویمنٹ دو الگ الگ ماحول ہوتے ہیں — تربیت کے دوران استعمال کی جانے والی ٹولز اور ایکیوشن پروسیجرز، اور لائیو کے بعد کا اصل ماحول مطابقت نہیں رکھتے، جس سے پرفارمنس کم ہو جاتی ہے۔

میکارون-V1 نے شروع سے ہی ماڈل اور پروڈکشن ماحول کے ہارنیس کو ایک ساتھ تربیت دی اور آپٹیمائز کیا، جیسے تربیت کے دوران ٹولز کو کیسے کال کیا جائے، ٹرمینل کو کیسے آپریٹ کیا جائے، اور لمبے مدتی کاموں کو کیسے چلایا جائے، ویسے ہی لائیو ہونے کے بعد بھی۔

متعلقہ REPL Harness کے ذریعے ماڈل ٹولز کو کوڈ کے ذریعہ جوڑ سکتا ہے، درمیانی حالتیں محفوظ کر سکتا ہے، اور موثر عمل کو دوبارہ استعمال کر سکتا ہے — ہر بار شروع سے نہیں، جس سے دہرائے گئے کالز اور سیٹنگ کا ضیاع کم ہوتا ہے۔

یہ صرف بات چیت کرنے والا مدل نہیں ہے، یہ ایک کام کرنے والا ذکی ایجینٹ ہے۔

یہ کیوں "دنیا بھر میں صرف دو" ہے؟

آپ کہہ سکتے ہیں: LoRA فائن ٹیوننگ کیا بات ہے؟ یہ تو ہر جگہ دستیاب ہے۔

بہت بڑی بات دو الفاظ میں ہے: پیمانہ۔

30B ماڈل پر LoRA ری انفورسمنٹ لرننگ کرنا، بہت سے ٹیمیں کر سکتی ہیں۔ لیکن جب پیرامیٹرز کی تعداد تریلین کے سطح تک پہنچ جائے، تو مشکل کا درجہ اس طرح بڑھ جاتا ہے۔

مرکزی مشکل "ٹریننگ اور انفرنس میں عدم تطابق" ہے۔ تقویتی سیکھنے کے لیے ٹریننگ اور انفرنس کے دوران فیڈ بیک جمع کیا جاتا ہے، جب ٹریلین پیرامیٹرز والے MoE ماڈل کو کئی دہائیوں میں GPU پر تقسیم کیا جاتا ہے، تو ٹریننگ اور انفرنس کی درستگی میں تھوڑا سا فرق بھی گریڈینٹ کو بھٹکا دیتا ہے، جس سے ٹریننگ کا کریو براہ راست اپنے مقصد تک نہیں پہنچتا۔

ایک مثال دیں: 30 افراد کا ایک انڈور آرکیسٹرا ایک ساتھ بجاتا ہے، تو تھوڑی سی تال میں فرق ہونے پر بھی اسے سنبھالا جا سکتا ہے۔ لیکن اگر یہی 100 افراد کا اورکیسٹرا ہو جائے، تو کسی بھی ایک آلات کی تال میں تھوڑا سا انحراف پورے پرفارمنس کو تباہ کر دے گا۔

دُنیا بھر میں صرف دو ٹیمیں ہیں جو تریلین پیرامیٹر سائز پر LoRA تقویت سیکھنے کو کامیابی کے ساتھ چلا سکتی ہیں۔

ایک میرا موراتی کا Thinking Machines Lab ہے۔ ایک Mind Lab ہے۔

کوئی تیسری نہیں۔

دسمبر 2025 میں، Mind Lab نے Kimi K2 — جو کہ 1.04 تریلین پیرامیٹرز کا ایک بہت بڑا اسپارس MoE ماڈل ہے — پر LoRA تقویت سیکھنے کا عمل کیا۔ کمپوٹیشنل طاقت صرف مکمل پیرامیٹرز کے فائن ٹیوننگ کا دسواں حصہ تھی، اور ٹریننگ کریو مسلسل اور مستحکم طور پر مکمل ہو گئی۔

اس ماہ کا LongStraw، ثابت GPU کی کمپوٹنگ پاور کے تحت ری انفورسمنٹ لرننگ کے بعد کی تربیت کو 2M کنٹیکس تک مزید بڑھا چکا ہے۔ Macaron-V1، یہ تمام تر ترقیات کا ایک مرکزی اظہار ہے۔

یہ راستہ صرف Mind Lab ہی نہیں چل رہا۔ TML کے سربراہ سائنسدان جان شولمان — OpenAI کے ماسہل، PPO الگورتھم کے موجد — نے 2025 میں "LoRA without Regret" شائع کیا، جس میں تجرباتی ثبوت ہے کہ LoRA زیادہ تر پوسٹ ٹریننگ سیناریوز میں مکمل فائن ٹیوننگ کے برابر پرفارمنس دیتی ہے۔ اسے وہ "لو ریگریٹ زون" کہتے ہیں۔

صنعت بھی اصل سونے اور چاندی کے ذریعے ووٹ دے رہی ہے۔ گزشتہ هفتہ 15 ارب ڈالر کی D راؤنڈ مکمل کرنے والی Fireworks AI کی قیمت 175 ارب ڈالر ہے، جو سینکڑوں LoRA کو ہوسٹ کر سکتی ہے؛ Together AI نے 8 ارب ڈالر کی C راؤنڈ مکمل کر لی ہے اور اب LoRA کو ڈیفالٹ فائن ٹیوننگ طریقہ بنادیا ہے۔

سیلیکون ویلی نے 20 ارب کا بنیادی ڈھانچہ تعمیر کیا، اس نے اس کا صرف ایک دہائی استعمال کرکے جھاڑیوں پر کھڑا ہو گیا

یہاں ایک بہت دلچسپ تقابل ہے۔

Mind Lab اور TML ایک ہی ٹیکنالوجی راستہ اپناتے ہیں، لیکن بنیادی حکمت عملی مکمل طور پر الگ ہے۔

TML نے مختلف وجوہات کی بناء پر خود ہی ایک بنیادی ماڈل کو صفر سے تربیت دینے کا فیصلہ کیا۔ Inkling، 975B پیرامیٹرز، 45 ٹریلین ٹوکن—لیکن Murati نے خود بھی علنی طور پر تسلیم کیا: «یہ اب تک کا سب سے طاقتور ماڈل نہیں ہے۔»

جائزہ کے مطابق، Inkling، GLM، Kimi جیسے چینی اوپن سورس ماڈلز کے مقابلے میں واضح طور پر کمزور ہے۔ صفر سے بنیادی ڈھانچہ تیار کرنے کے لیے انہوں نے بہت زیادہ توانائی اور کمپیوٹنگ طاقت خرچ کی۔

Mind Lab اُلٹا کام کرتا ہے۔ یہ اپنا بنیادی ماڈل خود تربیت نہیں کرتا، بلکہ چینی اوپن سورس ماڈل ایکوسسٹم کے کندھوں پر کھڑا ہوتا ہے۔

کیمی K2 نے ٹریلین پیرامیٹرز کے LoRA RL کی تصدیق کی، V1-Preview GLM-5.1 پر مبنی ہے، رسمی ورژن Venti GLM-5.2 استعمال کرتا ہے، Tall Qwen-3.7 استعمال کرتا ہے — ہر بار بنیادی ماڈل کے اپگریڈ کے ساتھ، بعد کی تربیت کی شروعات کی سطح ایک مرحلہ بلند ہو جاتی ہے۔

چین کے اوپن سورس ماڈلز اب عالمی سطح پر تقریباً SOTA کے درجے تک پہنچ چکے ہیں۔ ان تقریباً حد تک پہنچے ہوئے بنیادی ماڈلز کو LoRA ری انفورسمنٹ کے ذریعے اہم صلاحیتیں حقیقی SOTA تک پہنچایا جا رہا ہے۔

آپ کو گندم اُگانے کی ضرورت نہیں ہے تاکہ بہترین روتی بنا سکیں۔

کتنا کریم ہے؟

TML: 2 بلین امریکی ڈالر کی فنڈنگ، 100 افراد کی ٹیم، نوویدا کے ساتھ گیگاواٹ کی کمپوٹنگ کا تعاون — لیکن Inkling کی صلاحیتیں GLM-5.2 سے پیچھے ہیں۔

مائنڈ لیب: تیس سے زائد افراد، 50 ملین امریکی ڈالر سے کم کی فنڈنگ — چیٹ، ایجینٹ، کوڈنگ سمیت کئی شعبوں میں زیادہ طاقتور ماڈل تیار کیے گئے۔

LoRA ری انفورسمنٹ لرننگ کے معاملے میں، مائنڈ لیب شاید دنیا کا سب سے زیادہ سرمایہ کاری اور پیداوار کا تناسب رکھنے والا ٹیم ہے۔ کوئی دوسرا نہیں۔

مستقل سیکھنا: کیوں مدلز استعمال کرتے ہوئے زیادہ ذکی ہوتے جاتے ہیں؟

ٹیکنالوجی اور تقابل کے بعد، سب سے اہم سوال یہ ہے کہ مائنڈ لیب بالکل کیا چل رہا ہے؟

جواب Richard Sutton اور AlphaGo کے سابق چیف ریسرچر David Silver کے مل کر لکھے گئے ایک مقالے کے عنوان میں چھپا ہوا ہے — Welcome to the Era of Experience.

پہلے سے تربیت "ڈیٹا کے دور" ہے: ماڈل انسانوں کے موجودہ متن سے سیکھتا ہے۔

اگلا دور "تجربہ کا دور" ہوگا: AI کی صلاحیتیں صرف موجودہ ڈیٹا سے نہیں، بلکہ ایجنٹس کے حقیقی ماحول میں طویل مدتی اقدامات، فیڈ بیک اور مستقل سیکھنے سے حاصل ہوں گی۔

آج بڑے ماڈل کا بنیادی تنازع یہی ہے — تربیت کے بعد اسے جمادی حالت میں چھوڑ دیا جاتا ہے۔

ایک صارف نے ایک ہی غلطی کو دس بار درست کیا، اگلی بار مدل کو چیٹ کی تاریخ دوبارہ پڑھنی پڑے گی۔ ایک کوڈنگ ایجینٹ ایک ہی کوڈ بیس میں بار بار ناکام ہوتا ہے، ناکامی نئی صلاحیت نہیں بن جاتی۔ مدل روزانہ لاکھوں کام کرتا ہے، لیکن اس کا تجربہ ضائع ہو جاتا ہے۔

یہ صرف ایک بے حد دہرائی جانے والی استدلالی مشین ہے، ایک نہیں جو ترقی کر رہا ہے۔

مائنڈ لیب کا مقصد یہ ہے کہ اس مہلک حلقوں کو توڑ دیا جائے۔ ان کا ہدف ایک "تجرباتی ذہانت مشین" تیار کرنا ہے — جس کا مدل لیب سے باہر نکل کر بھی حقیقی دنیا میں مستقل سیکھتا رہے۔

تجربہ نئی صلاحیت میں تبدیل ہوتا ہے، نئی صلاحیت اسے مشکل ترین مسائل کو حل کرنے کی اجازت دیتی ہے، اور مشکل ترین مسائل مزید غنی تجربہ لاتے ہیں۔

سمارٹنس ایک بار کی تربیت کا نتیجہ نہیں، بلکہ مستقل نمو کا عمل بن جاتا ہے۔

یہاں LoRA اب "پیسے بچانے کا ٹول" نہیں بلکہ ایک قابل لکھنا، قابل واپسی، اور مستقل طور پر ترقی کرنے والی حالت ہے۔

بنیادی ڈھانچہ جامع علم کو برقرار رکھتا ہے، جبکہ LoRA آپ کی ترجیحات، آپ کا کوڈنگ انداز، اور آپ کا کاروباری منطق کو برقرار رکھتا ہے۔ یہ ایک سٹیٹک پیچ نہیں، بلکہ تعامل کے ساتھ بڑھتی ہوئی یادداشت ہے۔

تجربی ثبوت سے ثابت ہوا ہے کہ ہلکا ایڈاپٹر ماڈیول جو بنیادی ماڈل کے پیرامیٹرز کے 0.5% سے کم ہے، ابھی بھی مستقل اور قابل اعتماد ہے — جتنا بنیادی ماڈل زیادہ طاقتور ہوگا، اتنی ہی کم تعداد میں اپڈیٹس زیادہ موثر ہوں گی۔

Mind Lab نے اس راستے پر تین سال گزارے۔ 2023 میں، بانی اینڈریو نے GPT-1 کے مصنف کارٹھک نارسیمنہن اور یاو شونیو کے ساتھ مل کر FireAct شائع کیا — پیرامیٹر سیکھنے کے ذریعے ایجنٹ کی صلاحیت بڑھانے والی پہلی تحقیق۔ ایجنٹ کے ٹریک کو پیرامیٹرز میں محفوظ کرنے کے بعد، ایک بار کا انجام دینا 9.0 سیکنڈ سے گھٹ کر 2.7 سیکنڈ ہو گیا۔

ایک بار ادائیگی کریں، اور ہر استعمال سے منافع حاصل کریں۔ فائر ایکٹ سے لے کر میکارون-وی تک، یہ منطق تریلین پیرامیٹرز کے سائز تک بڑھا دیا گیا ہے۔

گروہی بہتی: تیسری اسکیلنگ کریو

مستقل سیکھنا کہانی کا صرف نصف حصہ ہے۔ میکارون-V1 میں ظاہر ہونے والا دوسرا مرکزی خیال، جو زیادہ انقلابی ہو سکتا ہے، وہ گروہی بہتی ہے۔

ہر ماڈل اپنے تجربات کے ساتھ مستقل سیکھتا رہتا ہے، جس سے مختلف اشیاء مختلف راستوں پر چل پڑتی ہیں۔ مختلف صارفین کی فیڈ باک، مختلف کام، اور مختلف ڈیٹا، مختلف صلاحیتیں تشکیل دیتے ہیں۔ ایک ہی بنیاد سے شروع کرتے ہوئے، وقت کے ساتھ وہ "الگ افراد" بن جاتے ہیں۔

یہ تنوع، بگ ہے یا فیچر؟ تجرباتی نتائج بہت زبردست ہیں۔

ایک ہی Qwen3-30B بنیادی ماڈل سے شروع کرتے ہوئے، تربیت کا مقصد اور الگورتھم مکمل طور پر ایک جیسا ہے، صرف ڈیٹا کا ترتیب اور ماسکنگ بدل دیا گیا ہے۔

AIME24 پر ایک ایڈاپٹر کی درستگی: 36.44%۔ 198 مختلف ایڈاپٹرز کا بیشتری ووٹ: 48.67%۔ ایک ہی ایڈاپٹر کو 198 بار دوبارہ نمونہ لینا، زیادہ سے زیادہ: 43.78%۔

مختلف "تجربوں" نے ایک منفرد ماڈل کے ذریعے نہیں دیے جانے والے مکمل کرنے والے فوائد پیدا کیے۔ یہ "کئی بار کوشش کرنا" نہیں ہے — بلکہ متنوع سیکھنے کے راستوں کے درمیان اصل تعاونی اثرات پیدا ہوئے ہیں۔

انڈریو نے WAIC میں اسے تیسری اسکیلنگ کریو کہا۔

پہلا نکتہ: GPT-3 جیسا سکیل پیرامیٹر — بڑے پیرامیٹرز سے زیادہ ذہانت حاصل ہوتی ہے۔

دوسرا: DeepSeek R1 کی طرح Scale Thinking Tokens — زیادہ استدلال ٹوکنز سے زیادہ ذہانت۔

تیسری شرط: ماڈلز کی تعداد کو بڑھائیں — زیادہ ماڈلز کے درمیان تعاون سے زیادہ ذہانت کی حد حاصل ہوتی ہے۔

تجربے میں، ماڈلز کی تعداد کو کچھ سے بڑھا کر 200 کر دیا گیا، اور لگارتھمک اکسز پر کارکردگی لکیری طور پر بہتر ہوئی۔ اگر یہ منحنی درست ہے، تو اگلے مرحلے میں 200 سے 20,000 اور 2,000,000 تک جانا ہوگا۔

مائنڈ لیب کا اپنے طور پر تیار کیا گیا MinT پلیٹ فارم ملین سطح کے قابل تلاش LoRA ڈائریکٹری کو شامل کر چکا ہے۔ ایک تریلین پیرامیٹر کے بنیادی ڈھانچے کو 10 لاکھ LoRA شیئر کرتے ہیں۔

نوٹ — یہ 100 ہزار چھوٹے ماڈلز نہیں ہیں، بلکہ 100 ہزار ایک تریلین پیرامیٹرز والے بڑے ماڈلز ہیں۔

انسانوں کے درمیان 99 فیصد سے زیادہ جینوم مشترک ہوتا ہے، لیکن تقریباً ایک جیسا زندہ بنیادی ڈھانچہ ایک جیسا ذہن نہیں بناتا۔ ذہنی تنوع اور اس کی تعاون کی وجہ سے انسانی تمدن کی بڑی ترین کامیابیاں حاصل ہوئیں۔

2 ہفتے میں 10 ملین امریکی ڈالر کا ARR: سب سے تیز تجارتی تصدیق

ٹیکنیکل روسٹ کتنا ہی اچھا کیوں نہ ہو، اگر مارکیٹ خرید نہ کرے تو وہ صرف پی پی ٹی ہے۔ مائنڈ لیب نے جولائِ کے شروع میں ای پی آئی کا تجارتی استعمال شروع کیا۔

دو ہفتے کے نتیجے میں، 10 ملین امریکی ڈالر کا سالانہ تکرار آمدنی۔

یہ شاید تمام مدل کمپنیوں کے درمیان پہلے مدل کے اطلاق سے لے کر کروڑ ڈالر ARR حاصل کرنے کا سب سے تیز ریکارڈ ہو۔

انگوں کا اہمیت تو ہے، لیکن زیادہ اہمیت تیزی کی ہے۔ ایک ٹیکنالوجی کا راستہ جسے صارفین نے اتنی جلدی اپنے اصل پیسے سے ووٹ دے دیا، یہ ثابت کرتا ہے کہ یہ اصل مسائل اور درد کے مسائل کو حل کر رہا ہے۔

مائنڈ لیب صرف ٹوکن نہیں بیچتی۔ اس کا مرکزی کاروباری منطق یہ ہے کہ صارفین اپنے اپنے منظر میں ماڈل کی لگاتار سیکھنے اور ترقی دینے کی صلاحیت خریدتے ہیں۔

موبائل فون کے اسکرینز اپنی مصنوعات کی معلومات کو اپنے خصوصی LoRA میں ٹرین کرتے ہیں، اور ہیڈفون کمپنیاں اپنے انٹرایکشن کے ترجیحات کو ماڈل کی حالت میں شامل کرتی ہیں — مرکزی ڈیٹا کو بنیادی ماڈل کمپنیوں کو دینے کی ضرورت نہیں ہوتی، صارفین خود کنٹرول کا مالک ہوتے ہیں۔

شاوین ٹیکنالوجی، AI ہارڈویئر اسٹارٹ اپ Odyss، اور ایک ٹاپ موبائل فون فریم ورک پہلے ہی تعاون کی فہرست میں شامل ہیں۔

API کال کی ساخت بھی مسئلہ کو واضح کرتی ہے: 20% چیٹ، 30% ایجنٹ ورک فلو، 30% کوڈ جنریشن، باقی GenUI سے آتے ہیں — منظر کا توازن ہے، ایک منفرد وائرل پر منحصر نہیں۔

فلیٹ ورژن 6 امریکی ڈالر فی ملین ٹوکن، معیاری ورژن 4 امریکی ڈالر، ایکسپریس ورژن 2 امریکی ڈالر۔

مائنڈ لیب کا منظر صرف ایک جملہ ہے: ٹوکن استعمال کرنا آپ کو ٹوکن تربیت دے سکتا ہے۔

ماڈل کو تربیت دینا، آخرکار ماڈل کو بلانے جتنا آسان ہونا چاہیے۔ زیادہ سیلز پری سیل کی ضرورت نہیں، نہ ہی کسٹم مانی پاور کی۔ مستقل سیکھنا خود، قابلِ توسیع ماڈل کی صلاحیت ہے۔

دروازہ کھل گیا

رچرڈ سٹنٹن نے ٹورونٹو میں "تجربے کی دور" کا اعلان کیا۔ لیانگ وینفینگ کا خیال ہے کہ اگلی نسل کے ماڈل کو بلانے کے لیے مستقل سیکھنے کی صلاحیت ضروری ہے۔ میرا موراتی نے سین فرانسسکو میں تریلین پیرامیٹرز والی LoRA ری انفورسمنٹ لرننگ انفراسٹرکچر بنائی۔ Fireworks AI کی قیمت 175 ارب ڈالر ہے۔

سب کو ایک ہی سمت میں شرط لگانی ہے: ماڈل کو ڈپلوی کرنے کے بعد بھی سیکھنا چاہیے۔ LoRA اس بات کو تریلین پیرامیٹر سطح پر ممکن بنانے والی اہم تکنیک ہے۔

مائنڈ لیب اس ریس میں سب سے نوجوان مقابلہ کرنے والے ہیں۔ لیکن ان کا شروعاتی انداز شاید سب سے زیادہ کارآمد ہے — بنیاد نہیں بناتے، چینی اوپن سورس ایکوسسٹم پر کھڑے ہوکر، تیس سے زائد افراد اور 50 ملین امریکی ڈالر سے کم کے فنڈنگ کے ساتھ، سلیکون ویلی کے دس بلین ڈالر والے ٹیم کے برابر ٹیکنالوجی کی صلاحیت حاصل کر لی۔

اس کے پیچھے ایک سادہ لیکن گہرا فیصلہ ہے:

بڑے ماڈلز کی مقابلے کا اختتام اس بات پر نہیں ہے کہ "کون سب سے بڑا بنیادی ماڈل تربیت دیتا ہے"، بلکہ اس بات پر ہے کہ "کون ماڈل کو مستقل طور پر زیادہ ذکی بناتا ہے".

پہلے سے تربیت ایک مرتبہ کی بنیادی ڈھانچہ ہے۔ مستقل سیکھنا، اصل دفاعی دیوار ہے۔

مائنڈ لیب کا مقصد ایک تجرباتی ذہانت کی مشین بنانا ہے — جس مدل کا لیب سے باہر نکلنے کے بعد بھی حقیقی دنیا میں مستقل سیکھنا جاری رہے، جتنا استعمال کیا جائے اتنا ہی زیادہ ذہین بنے۔ جب کافی زیادہ ایسی ذہانتیں مل کر تعاون کرنے لگیں، تو ایک نئی راہ بڑی ذہانت کی طرف کھل جائے گی۔

مُراتی نے سان فرانسیسکو میں 20 ارب ڈالر اور 100 افراد کی ٹیم کے ساتھ اس دروازے کو کھولا۔

اور جو پہلے دروازہ ایک جھنجھلاہٹ سے کھول رہا ہے، وہ امن سمندر کے اس پار، چین کے اوپن سورس ایکوسسٹم کے کندھوں پر کھڑی ایک نوجوان لیب ہے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔