ہم نے حالیہ وقت میں "مستقل سیکھنا" کی طرف موزوں کئی اسٹارٹ اپس اور تحقیقی نتائج کی رپورٹ کی ہے، جیسے کہ "Mind Lab نے LoRA کی تازہ ترین ترقیات جاری کر دیں، بڑے ماڈلز کے لیے مستقل سیکھنا کا نیا طریقہ ظاہر ہوا"، "KV Cache کے بوجھ سے آزاد ہو جائیں، لمبے کنٹیکس کو وزن میں دبایا جائے، کیا مستقل سیکھنے والے بڑے ماڈلز کے لیے امید ہے؟"، "ICML 2026 | حدود کو توڑ دیا! ہانگ کانگ یونیورسٹی نے پہلا ایسا مستقل سیکھنا اسکیما پیش کیا جو 300+ ٹاسکس کے لیے موزوں ہے، بھول جانے کے مسئلے کا حل"، "جو DeepSeek خود بہ خود ترقی کرتا ہوا Harness! LlamaFactory کے مصنف نے نیا ٹول جاری کیا: 0.2 یوان میں خودکار Agent تخلیق کریں۔، جب "بڑا ہونا" اکیلا راستہ نہیں رہا، تو ایک اور چینی ماڈل کو اوپن سورس کر دیا گیا۔
ہاں، کافی مزیدار، "مستقل سیکھنا" بھی ایک ایسا کلیدی لفظ بن چکا ہے جسے ہم بار بار سامنے لاتے ہیں۔ اور اس کے پیچھے ایک ایسا جائزہ چھپا ہوا ہے جس کا دہرایا جا رہا ہے۔
2025ء کے اکتوبر میں، اینڈری کارپاتھی نے دوارکیش پیٹل کے پوڈکاسٹ میں کہا: " موجودہ بڑے ماڈلز میں مستقل سیکھنے کی صلاحیت نہیں ہے۔ آپ اسے کچھ بتا سکتے ہیں، لیکن اس کی توقع نہیں کر سکتے کہ وہ اسے یاد رکھے گا"۔ اس نے سوچا کہ ان جاننے کی کمیوں کو دور کرنے میں لگ بھگ دس سال لگ جائیں گے۔ دو ماہ بعد، اس نے اپنے سالانہ جائزے میں اس جملے کو بڑے منظر میں شامل کیا: 2025ء میں ماڈل کی صلاحیتوں میں ترقی کا بنیادی ذریعہ قابل تصدیق انعام والی تقویت سیکھنے (RLVR) تھا، لیکن LLM ٹیکنالوجی اسٹیک میں، یادداشت، متعدد ماڈلٹی کا احساس، مستقل سیکھنا، اور کمپیوٹر کا استعمال کرنے کی صلاحیت اب بھی واضح کمزوریاں ہیں، "ہمارے پاس پروٹو ٹائپ ہیں، لیکن ابھی تک ایسا انسان جیسا ذہن نہیں جو ہمارا ساتھی بن سکے"۔

مسلسل سیکھنا (Continual Learning، جسے زندگی بھر سیکھنا / Lifelong Learning بھی کہا جاتا ہے) اس لیے گزشتہ سال کا ایک سب سے زیادہ چرچا ہونے والا تصور بن گیا۔
اس کا مطلب ہے کہ ماڈل کو ڈیپلوی کرنے کے بعد بھی، وہ نئے کاموں، نئی معلومات اور نئے تجربات سے لگاتار سیکھ سکے اور پہلے سیکھے گئے چیزوں کو نہ بھول سکے۔
یہ بات سننے میں آسان لگتی ہے، لیکن اسے کرنا بہت مشکل ہے، اتنا مشکل کہ یہ "AI ساتھی" تک کے راستے کا سب سے سخت چٹان بن جاتی ہے۔ اور اوپر کی یہ سیریز خبریں یہ بھی ظاہر کرتی ہیں کہ یہ راستہ صرف ایک سمت نہیں، بلکہ کئی الگ الگ راستے ایک ساتھ آگے بڑھ رہے ہیں۔
اس سال، اکیڈمک اور صنعتی دنیا نے ماڈل کو "استعمال کرتے ہوئے سیکھنے" کے لیے کئی مختلف ٹیکنالوجی کے راستے اپنائے ہیں۔ کچھ نے ماڈل کے باہر میموری جوڑی، کچھ نے وزن کو مستقل طور پر تبدیل کیا، کچھ نے دوبارہ پری ٹریننگ کی، اور کچھ نئے خیالات نے "سیکھنا" کو دوبارہ تعریف کرنے کی کوشش کی ہے۔ اس مضمون میں ہم ان تمام راستوں کو ایک ایک کرکے پیش کرتے ہیں اور ہر راستے پر کیا خطرہ ہے اور کہاں رکاوٹ ہے، اس کی وضاحت کرتے ہیں۔
سب سے پہلے واضح کر دیں: مشکل بات "سیکھنا" نہیں، "یاد رکھنا" ہے
سلسلہ وار سیکھنے کا مرکزی رکاوٹ ایک خاص نام رکھتا ہے: بھاری بھرکم بھولنا (catastrophic forgetting)۔ نیورل نیٹ ورک کی معلومات دس بلین وزن میں محفوظ ہوتی ہیں، جب آپ نئے ڈیٹا کے ساتھ ماڈل کو فائن ٹیون کرتے ہیں اور ان وزن کو اپڈیٹ کرتے ہیں، تو ماڈل نئے کام سیکھنے کے ساتھ ساتھ پرانی صلاحیتوں کو برقرار رکھنے والے پیرامیٹرز کو اووررائٹ کر دیتا ہے، جس کی وجہ سے پہلے کامیاب ہونے والے کاموں میں اس کی کارکردگی میں اچانک کمی آ جاتی ہے۔

سیلی سی یادداشت کا ایک ڈایاگرام۔ جب انسانی گہری نیورل نیٹ ورکس کو دو کاموں پر ترتیب سے تربیت دی جاتی ہے، تو وہ دوسرے کام کی تربیت کے دوران پہلے کام کو جلدی اور مکمل طور پر بھول جاتے ہیں۔
یہ ظاہری پہلو چھوٹے ماڈلز کے دور میں بھی بہت تحقیق کا موضوع رہا، لیکن LLMs پر اس کے نئے مسائل ظاہر ہوئے۔ TRACE، جو LLMs کی لگاتار سیکھنے کا جانچنے کے لیے خصوصی طور پر ڈیزائن کیا گیا بینچ مارک ہے، نے پایا کہ ایک پہلے سے ہم آہنگ ماڈل پر لگاتار فائن ٹیوننگ کرنے سے نہ صرف وہ پرانے کاموں کو بھول جاتا ہے، بلکہ عام صلاحیتوں اور حکمات کی پابندی کرنے کی صلاحیت بھی متاثر ہوتی ہے۔ دوسرے الفاظ میں، اگر آپ ماڈل کو کچھ نیا سکھانا چاہتے ہیں، تو اس کی قیمت یہ ہو سکتی ہے کہ وہ مجموعی طور پر کم ذہین اور کم تابعدار ہو جائے۔
چونکہ وزن کو براہ راست تبدیل کرنے کا خطرہ اتنے زیادہ ہے، "مستقل سیکھنا" کئی مکاتب فکر میں تقسیم ہو گیا۔ ان کا بنیادی اختلاف اصل میں "وزن تبدیل کرنا یا نہ کرنا" اور "نئی معلومات کہاں محفوظ کرنا ہے" کے معاملات پر مختلف فیصلوں کے نتیجے میں ہے۔
یادداشت کو ماڈل کے باہر لٹکائیں
سب سے سیدھا اور سب سے تیز عملی طریقہ یہ ہے: ماڈل کے وزن کو مکمل طور پر نہ بدلیں، بلکہ نئی معلومات کو ماڈل کے باہر ایک ڈیٹا بیس میں محفوظ کریں اور جب ضرورت ہو تو اسے حوالہ کے ساتھ دوبارہ حاصل کریں۔ یہ راستہ RAG (ریٹریول اینہینسڈ جنریشن) سے شروع ہوا اور اب ایک الگ شعبہ بن چکا ہے: ایجنٹ میموری (Agent Memory)۔
نمائندہ کام MemGPT ہے (جو اس کے پیچھے والی کمپنی اب Letta کہلائی جاتی ہے)۔ یہ LLM کے کنٹیکس مینجمنٹ کو آپریٹنگ سسٹم کے میموری مینجمنٹ کے ساتھ موازنہ کرتا ہے، جس میں محدود «کام کا کنٹیکس» اور بڑا «بیرونی اسٹوریج» کو الگ کیا جاتا ہے، تاکہ ماڈل آپریٹنگ سسٹم کی طرح خود فیصلہ کر سکے کہ کیا کنٹیکس میں لایا جائے اور کیا فائل میں محفوظ کیا جائے۔
اس سوچ کے مطابق، کچھ سسٹمز کا اپنا اپنا مرکز ہے: Mem0 پیداواری، قابل اسکیل ہونے والی لمبی مدتی یادداشت کے ایکسیس پر زور دیتا ہے؛ Zep ریٹریول پر وقتی جانکاری کے گراف کو جوڑتا ہے تاکہ سیشن کے درمیان وقتی استدلال کیا جا سکے؛ A-MEM کارڈ باکس نوٹس (Zettelkasten) کو اپناتا ہے، جس میں ہر یادداشت کو ساختی لیبل دیا جاتا ہے اور خودکار طور پر متعلقہ پرانے آئٹمز سے جوڑا جاتا ہے تاکہ ریٹریول زیادہ سند کے مطابق ہو۔
کارپاتھی خود بھی اس سمت میں دستک دے رہے ہیں۔ وہ بار بار زور دے رہے ہیں کہ مستقبل میں "بڑے ہارڈ ڈرائیو" جیسا ذخیرہ نہیں، بلکہ ایک مختصر "شفافیت کا مرکز" (کگنٹو کور، جس کے لیے وہ صرف ایک یا دو بیلین پیرامیٹرز کا تخمینہ لگا رہے ہیں) اور ایک ایسی ساختی خارجی یادداشت کی ضرورت ہوگی جو خود بخود مرکب ہوتی رہے۔
اس خیال کے مطابق، اس نے گٹھب پر "LLM Wiki" نامی ایک ماڈل جاری کیا: ہر سوال پر RAG کا استعمال کرکے اصل ٹیکسٹ بلاکس کو نہیں ڈھونڈنا، بلکہ ایجنٹ کو معلومات کو ایک مستقل اپڈیٹ ہوتے، آپس میں لنکڈ علمی ذخیرہ میں ترتیب دینے کے لیے فعال طور پر مجبور کرنا، اور پھر اس کا جائزہ لینا۔

کارپاتھی کا LLM ویکی دستاویز تقریباً 45,000 ستارے حاصل کر چکا ہے اور 9,000 سے زیادہ بار فورک کیا جا چکا ہے
لیٹا نے اسے "ٹوکن اسپیس میں مستقل سیکھنا" کے نظریہ تک بلند کر دیا۔ انہوں نے واضح کیا کہ آج کے معیاری طریقہ کار میں "سب سے پہلے شامل کریں، پھر خلاصہ کریں" ہے، یعنی اصل تجربات کو تب تک جمع کیا جاتا ہے جب تک کہ سیاق و سباق نہ بھر جائے، اور پھر اسے خلاصہ میں دبایا جاتا ہے؛ جس میں دو خامیاں ہیں: شامل کرنا تمام نمائندگی کا کام استدلال کے وقت تک موڑ دیتا ہے، جس سے ہر فوروارڈ پروپیگیشن میں اصل لاگز کو دوبارہ پروسیس کرنا پڑتا ہے؛ اور خلاصہ کرنا نقصان دہ اور اچانک ہوتا ہے، جس سے اہم تفصیلات بغیر کسی انتباہ کے غائب ہو جاتی ہیں۔ لیٹا کا دعویٰ ہے کہ مستقبل میں ٹوکن اسپیس میں سیکھا گیا ذخیرہ، ماڈل وزن سے زیادہ قیمتی ہوگا۔
اس راستے کی طاقتیں محفوظ، قابل کنٹرول اور قابل تشریح ہیں، اور اگر غلطی ہو جائے تو آپ اسے فوراً حذف کر سکتے ہیں؛ کمزوری یہ ہے کہ یہ بنیادی طور پر علم کو ماڈل میں "انڈر کر" نہیں پاتا، اور ہر بار کوئی جانچ اور سیاق و سباق کے اس تنگ دروازے پر منحصر رہتا ہے، جبکہ اگر میموری بڑھ جائے تو جانچ کی درستگی اور لاگت دونوں پابندیوں میں تبدیل ہو جائیں گی۔
اس context کو خود بخود "گائیڈ بک" میں تبدیل کریں
بیرونی یادداشت سے آگے بڑھنا، ایک زیادہ پیچیدہ خیال ہے: وزن تبدیل نہ کرنا، بلکہ ماڈل کے ان پٹ کے حوالہ کو خود بخود ترقی دینا۔ اسے حوالہ ہندسہ (Context Engineering) کہا جاتا ہے۔
2025ء کے اکتوبر میں، اسٹنفورڈ، سامبا نووا اور یو سی بیکلی کی طرف سے پیش کیا گیا ACE (Agentic Context Engineering) اس کا نمایاں مثال ہے۔ یہ حوالہ کو ایک لگاتار ترقی کرتی ہوئی “گائیڈ بُک” کے طور پر سمجھتا ہے، جسے تین مخصوص کرداروں کے ذریعے برقرار رکھا جاتا ہے: جنریٹر استدلال کے راستے تخلیق کرتا ہے، ریفلیکٹر کامیابیوں اور ناکامیوں سے عملی تجربات استخراج کرتا ہے، اور کیوریٹر ان تجربات کو ساختی طور پر اضافی اپڈیٹس کے طور پر ترتیب دے کر بُک میں ضم کرتا ہے۔

ACE وہ دو عام خامیوں کو حل کرنا چاہتا ہے جو اسی قسم کے طریقوں میں پائی جاتی ہیں۔ ایک تو "اختصار کی ترجیح" (brevity bias) ہے: جب LLM کو مسلسل ماحول کو دوبارہ لکھنے کے لیے کہا جائے، تو وہ دائرہ کار کی تفصیلات کو دبائے اور چھوڑ دیتا ہے؛ دوسرا "ماحول کا تھوڑا ہونا" (context collapse) ہے: مسلسل دوبارہ لکھنے سے تفصیلات آہستہ آہستہ ضائع ہوتی جاتی ہیں۔
ACE اس دو نکات سے بچنے کے لیے مکمل دوبارہ لکھنے کے بجائے ڈیلٹا اپڈیٹس کا استعمال کرتا ہے۔ اس کے مطابق، ACE ایجنٹ کے کاموں میں 10.6% اور فنانشل ریزننگ میں 8.6% کا بہتری لایا ہے، جبکہ ایڈاپٹیشن لیٹنسی میں تقریباً 86.9% کی کمی آئی ہے؛ AppWorld لسٹ میں، چھوٹے اوپن سورس ماڈلز کے ساتھ DeepSeek -V3.1 کے ساتھ ACE کا استعمال کرتے ہوئے، اوسط اسکور GPT-4.1 پر مبنی پروڈکشن لیول انسٹیگنٹ IBM CUGA کے برابر ہو جاتا ہے۔
یہ قابل ذکر ہے کہ ACE زور دیتا ہے کہ وہ بنا کسی لیبل والی نگرانی کے کام کرتا ہے؛ یہ اپنے عمل کے دوران خود بخود پیدا ہونے والے فیڈبیک سگنلز (جیسے کوڈ چل رہا ہے یا ایرر دے رہا ہے) کی مدد سے تفکر اور تنظیم کی ہدایت کرتا ہے۔ اس سے وہ "ایجینٹ اپنے تجربات سے سیکھتا ہے" والی بڑی کہانی سے جُڑ جاتا ہے۔
مستقل تربیت: وزنز کو تبدیل کریں، لیکن ذکاوت سے
بیرونی یادداشت اور سیاق و سباق کی تعمیر وزن تبدیل کرنے کے خطرے سے بچتی ہے، لیکن اصل علم کو اندر کرنا بھی چھوڑ دیتی ہے۔ دوسرے محققین کا خیال ہے کہ طویل مدت میں، کچھ علم اور مہارتیں ضرور پیرامیٹرز میں لکھ دی جانی چاہئیں۔ یہی مستقل پوسٹ ٹریننگ (Continual Post-training) ہے، جو بنیادی طور پر مستقل ہدایات کی فائن ٹیوننگ، مستقل ترجیحات کا مطابقت وغیرہ کے مراحل پر مشتمل ہے۔
thinking machines کے جان شولمن نے ایک سطحی نقطہ نظر پیش کیا: انہوں نے سیکھنے کا موازنہ نفسیات میں حرکتی سیکھنا، سیاقی یادداشت اور عملی یادداشت کی قسموں سے کیا، اور یہ سمجھا کہ سیاق کا سیکھنا مختصر مدتی سیکھنے کے کاموں کو اچھی طرح سے نبھائے گا، جبکہ پیرامیٹر فائن ٹیوننگ (LoRA جیسے طریقوں سمیت) اس کے اوپر ڈالی جائے گی، خاص طور پر ان کاموں کے لیے جن کے لیے بڑا کیپسٹی ضروری ہو اور حقیقی طور پر علم حاصل کرنا ہو— جب وقت لمبا ہو جائے، تو سیاق کا سیکھنا کافی نہیں ہوتا، اور پیرامیٹر فائن ٹیوننگ فتح پا جاتا ہے۔
اس راستے کا سب سے بڑا دشمن اب بھی تباہ کن بھول جانا ہے، اور حالیہ میں Thinking Machines کے Tinker سے ایک دلچسپ حل آیا ہے۔

ٹنکر ان کا 2025ء کے اکتوبر میں جاری کیا جانے والا پہلا پروڈکٹ ہے، جو LoRA پر مبنی ایک فائن ٹیوننگ API ہے جو ڈسٹریبیوٹڈ ٹریننگ کی پیچیدگیوں کو ختم کر دیتی ہے اور صرف فور ورڈ_بیک ورڈ، اپٹم_سٹیپ جیسے بنیادی اصولوں کو ظاہر کرتی ہے تاکہ تحقیق کار صرف ڈیٹا اور الگورتھمز پر توجہ مرکوز کر سکیں۔
مستقل سیکھنے پر، وہ ایک "خود تخلیقی فائن ٹیوننگ" (SDFT) کے نام سے جانے جانے والے ریسیپ کو ترجیح دیتے ہیں: مرکزی خیال یہ ہے کہ عام نگرانی فائن ٹیوننگ "آف پالیسی" ہے، جس میں ماڈل کو ایسے ٹوکنز کی نقل کرنے کے لیے مجبور کیا جاتا ہے جو وہ خود کبھی نہیں بنائے گا، اس لیے ہر نئے مہارت سیکھنے سے پرانی صلاحیتیں متاثر ہوتی ہیں؛ SDFT ماڈل کو اپنا اپنا استاد بناتا ہے، جس سے وہ نمونوں سے نئی مہارتیں سیکھتا ہے اور پرانی مہارتیں نہیں بھولتا۔ ایک کمپنی "Trajectory" نے Tinker کو اپنے مستقل سیکھنے کے پلیٹ فارم کی بنیادی ڈھانچہ بنایا ہے۔
ایک بات یاد رکھیں، ٹنکر LoRA کا استعمال کرتا ہے، مکمل فائن ٹیوننگ نہیں، جس کا ایک عملی فائدہ یہ ہے کہ کئی فائن ٹیوننگ کاموں کا ایک ہی کمپوٹنگ پول شیئر کیا جا سکتا ہے، جس سے لاگت تقسیم ہو جاتی ہے۔ اسی لیے "مستقل سیکھنا مین سروس" اب ایک کاروبار بن رہا ہے: بار بار ماڈل اپڈیٹس کو ایک آن ڈیمانڈ API کے طور پر فراہم کرنا صنعت کا موجودہ تجربہ ہے۔
دوبارہ تربیت اور مسلسل تربیت
اگر فائن ٹیوننگ مدل کے "سطحی" لیyers پر کام کرتا ہے، تو لگاتار پری ٹریننگ (Continual Pre-training, CPT) بنیادی سطح پر واپس جاتا ہے اور نئے متن کے ساتھ مدل کو دوبارہ پری ٹرین کرتا ہے تاکہ وہ نئے شعبوں، نئی زبانوں یا وقت کے ساتھ بدلتی ہوئی جانکاری کی تقسیم کے لیے موزوں ہو سکے۔ نئے اور پرانے ڈیٹا کو ملا کر دوبارہ شروع سے ٹرین کرنے کے بجائے، CPT موجودہ مدل پر مبنی ہوتا ہے اور اس میں کمپوٹیشنل طور پر زیادہ سود مند ہوتا ہے۔
اس کے تین عام استعمال کے شعبے ہیں: وقت کے ساتھ علم کا تبدیل ہونا، بین الاقوامی وسعت، اور شعبہ جاتی ایڈجسٹمنٹ۔ لیکن قیمت بھی واضح ہے: متعدد تجرباتی مطالعات نے دہرایا ہے کہ مستقل پری ٹریننگ کا حسابی اخراج بہت زیادہ ہوتا ہے اور پہلے سیکھے گئے علم کے لیے مہلک بھول جانے کا خطرہ پیدا ہوتا ہے۔ اس لیے، اکادمیا LLM کے سائز پر بھولنے کے بغیر مستقل پری ٹریننگ کے طریقے تلاش کرتی رہی ہے، جو دوبارہ پلٹنے اور اسکورنگ کی ضرورت نہ ہوں۔
زیادہ تر کمپنیوں کے لیے، ایک جدید ماڈل کو دوبارہ پہلے سے تربیت دینے کا خرچہ ناپید ہے، جس کی وجہ سے کارپاتری کا کہنا ہے کہ "بڑے ماڈلز کو بار بار دوبارہ تربیت نہیں دی جا سکتی"۔ اس لیے، سخت معنوں میں "دوبارہ پہلے سے تربیت" زیادہ تر جدید لیبز کے اندر کا انتخاب ہے، جبکہ مسلسل پہلے سے تربیت ایک زیادہ عملی راستہ ہے۔
اپڈیٹڈ خیال: ماڈل کو خود کو تبدیل کرنے کی سیکھنا
پچھلے چار راستے، تھوڑا بہت "بیرونی اوزار بمقابلہ وزن تبدیل کرنا" کے دو طرفہ فریم ورک میں گھوم رہے ہیں۔ لیکن پچھلے سال کے دوران ظاہر ہونے والی نئی تحقیق کی ایک لہر، اس فریم ورک سے باہر نکل کر سیکھنے کو دوبارہ تعریف کرنے کی کوشش کر رہی ہے۔
ایک خیال یہ ہے کہ ماڈل خود ٹریننگ ڈیٹا پیدا کرے اور خود فیصلہ کرے کہ کیسے اپنے آپ کو اپڈیٹ کرے۔
MIT کا SEAL (Self-Adapting Language Models) ایک مثال ہے۔ ایک نیا ان پٹ دیا جانے پر، ماڈل ایک "خود ایڈٹ" (self-edit) تخلیق کرتا ہے؛ یہ ایک قدرتی زبان کی ہدایت ہوتی ہے جو بتاتی ہے کہ معلومات کو کیسے دوبارہ تشکیل دیا جائے، وزن کو اپڈیٹ کرنے کے لیے کون سے ہائپر پیرامیٹرز استعمال کیے جائیں، اور ڈیٹا ایونسمنٹ کے لیے کون سا ٹول بلایا جائے؛ پھر ماڈل اس کے مطابق خود کو فائن ٹیون کرتا ہے اور مستقل وزن کے اپڈیٹس کو تشکیل دیتا ہے۔ اور "کون سا خود ایڈٹ موثر ہوگا" اس بات کو ایک باہری تقویت سیکھنے والے حلقوں نے تربیت دی ہے، جس میں انعام کا سگنل اپڈیٹ شدہ ماڈل کی نچلے ٹاسک پر پرفارمنس ہوتا ہے۔

نیورIPS 2025 کے اس ورژن نے مزید ثابت کیا ہے کہ یہ خود کو ایڈجسٹ کرنے کی صلاحیت ماڈل کے سائز بڑھنے کے ساتھ بہتر ہوتی ہے، اور تقویت سیکھنے کے ذریعہ بھولنے کو کم کیا گیا ہے۔ اس کے مصنفین ایسے ماڈل کی توقع رکھتے ہیں جو استدلال کے درمیان خود یہ فیصلہ کر سکے کہ "کیا اب میں سیکھ لوں؟" اور ایک مرتبہ کی سوچ کی زنجیر کو مستقل صلاحیت میں تبدیل کر دے۔
دیگر ایک زیادہ جرأت کا خیال Google کے نیسٹڈ لرننگ سے آیا، جو NeurIPS 2025 میں شائع ہوا۔ اس کا مرکزی خیال ایک ماڈل کو ایک سیٹ کے طور پر دوبارہ سمجھنا ہے جس میں ایک دوسرے میں گھلے ہوئے، متعدد سطحیں ہیں، جن میں سے ہر ایک کے پاس اپنا "کنٹیکس فلو" اور اپنا اپڈیٹ فریکوئنسی ہوتا ہے — اس نظریے میں آرکیٹیکچر اور آپٹیمائزیشن الگورتھم ایک ہی چیز کے مختلف لیولز کے طور پر ایک ساتھ مل جاتے ہیں۔

ایک مفہومی ثبوت کے طور پر، انہوں نے ایک "ہوپ" نامی خود تبدیل ہونے والی ساخت بنائی، جو Titans لمبے مدتی یادداشت کی ساخت پر دو اضافے کرتی ہے: بے حد نیسٹڈ سیکھنے والے لیولز، اور ایک "مسلسل یادداشت سسٹم" (CMS)۔ آسان الفاظ میں، مختصر مدتی/لمبی مدتی یادداشت کے دوہرے تقسیم کے بجائے، یہ ایک پورا وقتی سیل کے ذریعے اپڈیٹ ہونے والی یادداشت ماڈیول کا سلسلہ ہے۔

تجربے میں، Hope زیرِ تحقیق ٹرانسفارمر اور جدید ریکریسیو ماڈلز کے مقابلے میں زبان کے ماڈلنگ، لمبے حوالہ متن کی استدلال اور مستقل سیکھنے کے کاموں میں بہتر ہے۔ دلچسپ بات یہ ہے کہ اس قسم کے آرکیٹیکچر کے لیے بعد میں کاموں نے "نیند" کے مراحل کو شامل کیا ہے — جیسے انسان نیند میں اپنی یادداشت کو مضبوط کرتا ہے، اسی طرح ماڈل فعال بات چیت کے درمیان کمپوٹیشنل طاقت کو الگ کرکے مفید تجريدات کو زیادہ مستقل پیرامیٹر میموری میں ڈال دیتا ہے۔
مزید انتزاعی سطح پر، ڈیوڈ سلور اور رچرڈ سٹنٹن نے "تجربے کا دور" (Era of Experience) کا نریٹیو پیش کیا۔

ان کا خیال ہے کہ ریاضی، کوڈنگ، اور سائنس جیسے اہم شعبوں میں انسانی ڈیٹا سے حاصل کی جانے والی معلومات کی حد قریب پہنچ چکی ہے، اور آگے بڑھنے کے لیے AI کو اپنے اور اپنے ماحول کے درمیان تفاعل سے حاصل ہونے والے تجربات سے لگاتار سیکھنا ہوگا، جس سے ایک خود کو ڈیٹا فراہم کرنے والا حلقوں کا گردش بن جائے۔ انہوں نے 2024 میں DeepMind کے AlphaProof کو (جو "فورمل پرووف سسٹم کے ساتھ لگاتار تفاعل" کے ذریعے IMO کا انعام جیتتا ہے) اس دور کا آغاز سمجھا۔ یہ روایت لگاتار سیکھنا، تقویتی سیکھنا، اور ایجینٹ کی خود مختار تلاش کو جوڑتی ہے، اور ایک ابھی تک حل نہ ہونے والا سوال بھی چھوڑتی ہے: وہ ان انعام فنکشنز کو کون ڈیزائن کرے گا جو اصل سگنلز کو مفید ہدایات میں تبدیل کرتے ہیں؟
ایک اور قریبی سمت جو سیکھنے کے لگاتار عمل سے الگ ہے لیکن اس کا مقصد مختلف ہے: جانکاری کی ترمیم (Knowledge Editing)۔ ROME، MEMIT جیسے طریقوں کے ذریعے، یہ خاص حقائق کو محفوظ کرنے والی MLP لیئرز کو تلاش کرکے اور انہیں تبدیل کرکے، مکمل دوبارہ تربیت کی ضرورت کے بغیر منفرد یا گروہ بند حقائق کو درست کرتا ہے۔ لیکن اس کا مقصد لگاتار سیکھنے سے مختلف ہے — جانکاری کی ترمیم ایک خاص حقیقت کو درست طور پر اووررائٹ کرنے پر مرکوز ہے، جس میں لگاتار، مسلسل ترمیم کے دوران، بار بار پیرامیٹرز میں تبدیلیاں ایک دوسرے سے تداخل کرتی ہیں اور وقت کے ساتھ "سم" جمع ہوتا ہے جس سے ماڈل کا خراب ہونا شروع ہو جاتا ہے، جس نے WISE، AlphaEdit جیسے متعدد طریقے جو ترتیب وار ترمیم کا مقابلہ کرتے ہیں، کو جنم دیا۔

اختتام
ان ساتھ کئی سمتیں ایک ساتھ دیکھنے پر، آپ دیکھیں گے کہ وہ ایک "علم کہاں موجود ہے" کے محور کے ساتھ ترتیب دی گئی ہیں۔

سب سے باہر والی پرت باہری یادداشت اور کنٹیکس انجینئرنگ ہے، جہاں معلومات مدل کے باہر ٹوکن سپیس میں محفوظ ہوتی ہیں، جو محفوظ اور کنٹرولڈ ہیں لیکن حقیقی طور پر اندر نہیں گھل مل جاتیں؛ درمیانی پرت مسلسل پوسٹ ٹریننگ اور مسلسل پری ٹریننگ ہے، جہاں معلومات وزن میں لکھ دی جاتی ہیں، جس کی صلاحیت کا حد بڑھتا ہے لیکن کارسٹروفک فورگٹن سے سامنا کرنا پڑتا ہے؛ اور سب سے اندر والی، اور سب سے آگے کی پرت، وہ نئے خیالات ہیں جو مدل کو خود کو تبدیل کرنے اور خود کو ترقی دینے کی اجازت دیتے ہیں، جو "سیکھنا" کے عمل کو خود مدل کی صلاحیت بنانے کی کوشش کرتے ہیں۔
ایک عملی مشاہدہ یہ ہے کہ یہ راستے زیادہ تر ایک دوسرے کے منافی نہیں ہوں گے، بلکہ طبقاتی طور پر تعاون کریں گے۔ شولمن کا طبقاتی سیکھنے کا نقطہ نظر اور کارپاتھی کا "شناختی مرکز + بیرونی یادداشت" کا خیال، بنیادی طور پر ایک ہی بات کہ رہے ہیں: مختصر مدتی، متغیر معلومات کو سندھ و بیرونی یادداشت کے لیے چھوڑ دیا جائے، جبکہ لمبی مدتی، گہرائی سے سیکھنے کی ضرورت والی صلاحیتیں پیرامیٹر فائن ٹیوننگ کے لیے مختص کی جائیں، اور ہر ایک اپنا کام کرے۔ ACE غیر مراقب طریقے سے انجام دینے کے ردعمل کے ذریعے ترقی کرتا ہے، جبکہ SEAL خود کو اڈٹ کرنے کے لیے تقویت سیکھنے کا استعمال کرتا ہے — دونوں اس مشترکہ رجحان کو ظاہر کرتے ہیں کہ مستقبل کا مستقل سیکھنا بہت احتمال ہے کہ ماڈل خود "کیا سیکھنا ہے اور کیسے سیکھنا ہے" کا تعین کرے گا۔
تو کارپاتھی کے اس جملے “ابھی اور دس سال” پر واپس آتے ہیں، مستقل سیکھنے کا مسئلہ کیا حل ہو گیا؟ جواب شاید یہ ہے — ابھی تک نہیں، لیکن اب یہ بالکل خالی نہیں رہ گیا۔ " catastrophc forgetting " کا بنیادی رکاوٹ اب تک مکمل طور پر حل نہیں ہوا، SDFT، نیسٹڈ لرننگ جیسے طریقے اسے "ختم" کرنے کے بجائے صرف "کم" کر رہے ہیں۔ کیا صرف بہتر کنٹیکس مینجمنٹ اور فائن ٹیوننگ سے مستقل سیکھنے کا مسئلہ حل ہو سکتا ہے، یا اس کے لیے بالکل نئے خیالات درکار ہیں؟ یہ زیادہ بنیادی سوال شولمن خود بھی تسلیم کرتے ہیں کہ ابھی تک اس کا کوئی واضح جواب نہیں ہے۔
یہ قطعی طور پر یقینی ہے کہ 2025 سے 2026 تک کے دوران، مستقل سیکھنا ایک ایسی "کمی" بن گیا ہے جس کے بارے میں بار بار بات کی جاتی رہی، اور اب یہ ایک زندہ میدان بن چکا ہے جہاں کئی نئی راستے نکل رہے ہیں اور کچھ کاروبار شروع کرنے والے اس پر مصنوعات بنا رہے ہیں۔ جو راستہ "AI ساتھی" کو پروٹو ٹائپ سے حقیقت میں تبدیل کر دے گا، اس پر نظر رکھنا ضروری ہے۔
حوالہ لنک
https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits
https://karpathy.bearblog.dev/year-in-review-2025/
https://www.letta.com/blog/continual-learning/
https://arxiv.org/abs/2510.04618
https://arxiv.org/abs/2402.01364
https://thinkingmachines.ai/tinker/
https://arxiv.org/pdf/2604.05096
https://arxiv.org/pdf/2606.03979
یہ مضمون ویچن گروپ "机器之心" (ID: almosthuman2014) سے ہے، مصنف: مستقل سیکھتی ہوئی ماشین之心، ایڈیٹر: Panda
