সাম্প্রতিক সময়ে আমরা বিভিন্ন স্টার্টআপ এবং গবেষণার কথা প্রতিবেদন করেছি যেগুলি স্থায়ী শিক্ষা দিকে মনোনিবেশ করে, যেমন: 《Mind Lab লোরা-এর সর্বশেষ অগ্রগতি প্রকাশ করেছে, বড় মডেলের স্থায়ী শিক্ষার নতুন প্যারাডাইম উদ্ভাবিত》, 《KV Cache-এর বন্ধন থেকে মুক্তি, দীর্ঘ কনটেক্সটকেওয়েটে চাপিয়ে দেওয়া হচ্ছে, কি স্থায়ী শিক্ষা বড় মডেলের জন্য আশা জাগিয়েছে?》, 《ICML 2026 | সীমানা ভাঙল! হংকং বিশ্ববিদ্যালয় 300+ টাস্কের জন্য অপ্টিমাইজড স্থায়ী শিক্ষা আর্কিটেকচার প্রস্তাব করেছে, ভুলে যাওয়ার সমস্যা সমাধান করা হয়েছে》, 《যা পারে ডিপসিক স্বয়ং বিকাশশীল হারনেস! LlamaFactory-এর লেখক একটি নতুন টুল ওপেন-সোর্স করেছেন: 0.2 ইউয়ানে অটোমেটিক এজেন্ট তৈরি করুন》, 《যখন “বড় হওয়া” একমাত্র পথ নয়, আবার একটি চীনা মডেল ওপেন-সোর্স করা হয়েছে》……
হ্যাঁ, খুব ঘনঘন, "অবিরাম শেখা" এখন আমাদের সবচেয়ে বেশি দেখা শব্দগুলির মধ্যে একটি হয়ে উঠছে। এর পিছনেও একটি পুনরাবৃত্তি হওয়া বিচার লুকিয়ে আছে।
2025 সালের অক্টোবরে, আন্দ্রেজ কারপাথি ড্বার্কেশ প্যাটেলের পডকাস্টে বলেন: বর্তমান বড় মডেলগুলির “কোনও ধারাবাহিক শিক্ষা নেই। আপনি এটিকে কিছু বলতে পারেন, কিন্তু এটি মনে রাখবে বলে আশা করতে পারবেন না”। তিনি মনে করেন, এই জ্ঞানগত ত্রুটিগুলি পূরণ করতে আরও প্রায় দশটি বছর লাগবে। দুই মাস পর, তিনি বার্ষিক পর্যালোচনায় এই বক্তব্যটিকে একটি বড় চিত্রের অংশ হিসেবে উপস্থাপন করেন: 2025 সালের মডেলের ক্ষমতার বিপ্লবটি মূলত যাচাইযোগ্য পুরস্কার-ভিত্তিক শক্তিশালীকরণ শিক্ষা (RLVR) থেকে এসেছে, তবে LLM টেকস্ট্যাকের মধ্যে, স্মৃতি, বহুমাধ্যমিক অনুভূতি, ধারাবাহিক শিক্ষা, এবং কম্পিউটার চালনার ক্ষমতা 여전ই স্পষ্টভাবে দুর্বলতা, “আমাদের প্রোটোটাইপ আছে, কিন্তু এখনও এমন এজেন্টগুলির অভাব আছে যা আমরা সহকর্মীরূপে ব্যবহার করতে পারি।”

কন্টিনুয়াল লার্নিং (যা লাইফলং লার্নিং নামেও পরিচিত) গত বছরের সবচেয়ে জনপ্রিয় ধারণাগুলির একটি হয়ে উঠেছে।
এটি বোঝায় যে মডেলটি ডিপ্লয় করার পরেও মানুষের মতো নতুন কাজ, নতুন জ্ঞান এবং নতুন অভিজ্ঞতা থেকে ক্রমাগত শিখতে পারে এবং আগে শেখা জিনিসগুলি ভুলে যায় না।
এটি শুনতে স্বাভাবিক মনে হলেও, এটি করা অত্যন্ত কঠিন, যা "AI সহকারী"-এর পথে সবচেয়ে কঠিন বাধা হয়ে দাঁড়ায়। এবং উপরের এই সিরিজটি দেখায় যে, এই পথটি এখন শুধুমাত্র একটি দিক নয়, বরং একাধিক শাখা একসাথে এগিয়ে যাচ্ছে।
মডেলকে “ব্যবহার করতে করতে শেখানো” নিয়ে গত বছর শিক্ষাগত ও শিল্প ক্ষেত্রে বিভিন্ন পৃথক প্রযুক্তিগত পথ বেরিয়েছে। কেউ মডেলের বাইরে মেমোরি যোগ করছেন, কেউ ওজন নিয়মিত পুনর্লিখন করছেন, কেউ সরাসরি পুনরায় প্রি-ট্রেনিং করছেন, আবার কিছু নতুন ধারণা এমনকি “শেখা”-এর সংজ্ঞাই পুনর্ব্যাখ্যা করার চেষ্টা করছে। এই নিবন্ধটি এই সব দিকগুলোকে একেবারে পরিষ্কারভাবে উপস্থাপন করে, প্রতিটি পথের উপর কীভাবে জুয়াখেলা হচ্ছে এবং কোথায় বাধা পড়ছে, তা ব্যাখ্যা করে।
প্রথমে পরিষ্কার করে বলি: কঠিন বিষয় হলো 'শেখা' নয়, বরং 'ভুলে যাওয়া না'
শিক্ষার মূল বাধা হল একটি বিশেষ নাম দিয়ে পরিচিত: দুর্ভোগজনক ভুলে যাওয়া (catastrophic forgetting)। নিউরাল নেটওয়ার্কের জ্ঞান বিলিয়ন বিলিয়ন ওজনে সংরক্ষিত থাকে, যখন আপনি নতুন ডেটা ব্যবহার করে মডেলকে ফাইন-টিউন করেন এবং এই ওজনগুলি আপডেট করেন, তখন মডেলটি নতুন কাজ শিখতে পারে, কিন্তু প্রায়শই পুরানো ক্ষমতা বহনকারী প্যারামিটারগুলি ওভাররাইট করে, যার ফলে আগের কাজগুলিতে এর পারফরম্যান্স হঠাৎ করে কমে যায়।

ক্ষতিকর ভুলে যাওয়ার চিত্র। যখন কৃত্রিম গভীর স্নায়ু জাল দুটি কাজের উপর ক্রমানুসারে প্রশিক্ষণ পায়, তখন দ্বিতীয় কাজের প্রশিক্ষণের সময় এটি প্রথম কাজটি দ্রুত এবং সম্পূর্ণভাবে ভুলে যায়।
এই ঘটনাটি ছোট মডেলের যুগে অনেক গবেষণা হয়েছিল, কিন্তু LLM-এর ক্ষেত্রে এটি নতুন সমস্যার সৃষ্টি করেছে। TRACE, যা LLM-এর ধারাবাহিক শিক্ষার জন্য বিশেষভাবে ডিজাইন করা একটি বেঞ্চমার্ক, পাওয়া গেছে যে একটি ইতিমধ্যে অ্যালাইনড মডেলকে ধারাবাহিকভাবে ফাইন-টিউন করলে এটি পুরনো টাস্কগুলি ভুলে যায় এবং সাধারণ ক্ষমতা এবং নির্দেশ অনুসরণের ক্ষমতাকেও ক্ষতি করে। অর্থাৎ, আপনি যদি মডেলকে একটি নতুন বিষয় শেখানোর চেষ্টা করেন, তবে এর মূল্য হতে পারে যে এটি সামগ্রিকভাবে বোকা এবংঅবাধ্য হয়ে যায়।
যেহেতু সরাসরি ওজন পরিবর্তন করার ঝুঁকি এত বেশি, তাই "স্থায়ী শেখা" বিভিন্ন প্রবাহে বিভক্ত হয়েছে। এদের মূল পার্থক্য আসলে "ওজন পরিবর্তন করা হবে কি না" এবং "নতুন জ্ঞান কোথায় সংরক্ষণ করা হবে" — এই দুটি প্রশ্নের উপর ভিন্ন ভিন্ন সিদ্ধান্ত নেওয়ার ফলে।
মেমোরি মডেলের বাইরে ঝুলিয়ে রাখুন
সবচেয়ে সরাসরি এবং দ্রুততম পদ্ধতি হল: মডেলের ওজনগুলি অপরিবর্তিত রাখুন, নতুন জ্ঞানটি মডেলের বাইরে একটি ডাটাবেসে সংরক্ষণ করুন, এবং প্রয়োজনে প্রসঙ্গে ফিরিয়ে আনুন। এই পথটি RAG (রিট্রিভাল-অ্যাডভান্সড জেনারেশন) থেকে বিকশিত হয়েছে এবং এখন একটি বিশেষ ক্ষেত্রে পরিণত হয়েছে: এজেন্ট মেমোরি (Agent Memory)।
এর প্রতিনিধিত্বকারী কাজ হলো MemGPT (যার পিছনের কোম্পানি এখন Letta নামে পরিচিত)। এটি LLM-এর কনটেক্সট ম্যানেজমেন্টকে অপারেটিং সিস্টেমের মেমোরি ম্যানেজমেন্টের সাথে তুলনা করে, সীমিত «কার্যকরী কনটেক্সট» এবং বড় «বাহ্যিক স্টোরেজ»-এর মধ্যে পার্থক্য করে, যাতে মডেলটি অপারেটিং সিস্টেমের মতো মেমোরি স্কিডিউলিংয়ের মাধ্যমে নিজেই সিদ্ধান্ত নিতে পারে যে কী কনটেক্সটে আনা উচিত এবং কী আর্কাইভে লেখা উচিত।
এই ধারণার সাথে সামঞ্জস্যপূর্ণভাবে, বিভিন্ন সিস্টেম বিভিন্ন দিকে ফোকাস করে: Mem0 প্রোডাকশন-লেভেল, স্কেলযোগ্য দীর্ঘমেয়াদী মেমরি অ্যাক্সেসকে প্রাধান্য দেয়; Zep রিট্রিভালের উপর সময়কালীন জ্ঞান গ্রাফ যোগ করে, যা সেশন-পারস্পরিক সময়-ভিত্তিক যুক্তি পরিচালনা করে; A-MEM কার্ডবক্স নোটিং (Zettelkasten) পদ্ধতির অনুপ্রেরণা নিয়ে, প্রতিটি মেমরিকে স্ট্রাকচারড ট্যাগ দেয় এবং স্বয়ংক্রিয়ভাবে সংশ্লিষ্ট পুরনো এন্ট্রিগুলির সাথে সংযুক্ত করে, যাতে রিট্রিভালটি প্রসঙ্গের সাথে আরও ভালভাবে মেলে।
কারপাথি নিজেও এই দিকে বেট বসিয়েছেন। তিনি বারবার জোর দিয়েছেন যে, ভবিষ্যতে প্রয়োজন হবে বড় হার্ড ড্রাইভের মতো মেমোরি নয়, বরং একটি সংক্ষিপ্ত “সংজ্ঞানাত্মক কোর” (cognitive core, তিনি অনুমান করেন এক-দুই বিলিয়ন প্যারামিটারই যথেষ্ট) এবং একটি নিজের থেকে সম্পদ বৃদ্ধি করতে পারে এমন স্ট্রাকচার্ড এক্সটার্নাল মেমোরি।
এই ধারণার ভিত্তিতে, তিনি GitHub-এ একটি "LLM Wiki" মডেল প্রকাশ করেন: প্রতিবার জিজ্ঞাসা করার সময় RAG ব্যবহার করে মূল টেক্সট ব্লকগুলি খুঁজে বের করার বদলে, এজেন্টটি সক্রিয়ভাবে তথ্যগুলিকে একটি নিয়মিত আপডেট এবং পরস্পরের সাথে লিঙ্কযুক্ত জ্ঞানভাণ্ডারে সংকলন করে, এবং তারপর এটির উপর জিজ্ঞাসা করে।

কারপাথির LLM উইকি ডকুমেন্টে প্রায় 45,000 স্টার এবং 9,000 এরও বেশি ফর্ক জমা হয়েছে।
লেটা নিজে এই সবকিছুকে “টোকেন স্পেসে স্থায়ী শিক্ষা” হিসাবে উত্থাপন করেছে। তারা উল্লেখ করেছে যে, আজকের ডিফল্ট পদ্ধতি হল “প্রথমে যোগ করুন, তারপর সারাংশ করুন”, অর্থাৎ মূল অভিজ্ঞতাকে কনটেক্সট ওভারফ্লো হওয়া পর্যন্ত স্তূপিত করা হয়, তারপর এটিকে সারাংশে চাপা দেওয়া হয়; এর দুটি সমস্যা রয়েছে: যোগ করা প্রতিটি ফরওয়ার্ড প্রোপাগেশনে মূল লগগুলি পুনরায় প্রক্রিয়াকরণের সমস্ত প্রতিনিধিত্বকারী কাজকে ইনফারেন্সের সময়ে ঠেলে দেয়; আর সারাংশকরণ ক্ষতিকর এবং হঠাৎ, গুরুত্বপূর্ণ বিস্তারিতগুলি অপ্রত্যাশিতভাবে অদৃশ্য হয়ে যায়। লেটা-এর দাবি হল, ভবিষ্যতে টোকেন স্পেসে শেখা মেমোরি, মডেলেরওয়েটসের চেয়েও বেশি মূল্যবান হবে।
এই পদ্ধতির সুবিধা হলো নিরাপদ, নিয়ন্ত্রণযোগ্য এবং ব্যাখ্যাযোগ্য; ভুল হলে যেকোনো সময় মুছে ফেলা যায়। কিন্তু এর অসুবিধা হলো, এটি মূলত জ্ঞানকে মডেলের ভিতরে অন্তর্ভুক্ত করে না, প্রতিবারই রিট্রিভাল এবং কনটেক্সটের মাধ্যমেই এটি কাজ করে; যখন মেমোরি বড় হয়ে যায়, তখন রিট্রিভালের সঠিকতা এবং খরচ উভয়ই বাধা হয়ে দাঁড়ায়।
প্রসঙ্গকে নিজেকে একটি গাইডবুকে পরিণত করতে দিন
বাহ্যিক মেমোরির চেয়ে এগিয়ে যাওয়ার একটি আরও পরিষ্কার ধারণা হলো: ওজন পরিবর্তন না করে মডেলের ইনপুটের কনটেক্সটকে নিয়মিত উন্নত করা। এটিকে কনটেক্সট ইঞ্জিনিয়ারিং (Context Engineering) বলা হয়।
2025 সালের অক্টোবরে, স্ট্যানফোর্ড, সামবা নোভা এবং ইউসি বার্কলি দ্বারা প্রস্তাবিত ACE (Agentic Context Engineering) এর উদাহরণ রয়েছে। এটি প্রসঙ্গকে একটি নিয়মিত বৃদ্ধি পাওয়া প্লেবুক হিসাবে বিবেচনা করে, যা তিনটি ভূমিকার মাধ্যমে রক্ষণাবেক্ষণ করা হয়: Generator যুক্তিসঙ্গত ট্রেজেক্টরি তৈরি করে, Reflector সফলতা এবং ব্যর্থতা থেকে বিশদ অভিজ্ঞতা বের করে, Curator এই অভিজ্ঞতাগুলিকে সংগঠিত, বৃদ্ধিমান আপডেটে রূপান্তরিত করে এবং প্লেবুকের সাথে একীভূত করে।

ACE এর লক্ষ্য হল একই ধরনের পদ্ধতিগুলির দুটি সাধারণ সমস্যা সমাধান করা। প্রথমটি হল "সংক্ষিপ্ততার প্রতি প্রবণতা" (brevity bias): LLM কে প্রাসঙ্গিক বিষয়বস্তুকে পুনরায় লিখতে বললে, এটি সংকুচিত করে ফেলে এবং বিষয়গত বিস্তারিত তথ্যগুলি বাদ দিয়ে দেয়; দ্বিতীয়টি হল "প্রাসঙ্গিক বিষয়বস্তুর পতন" (context collapse): পুনরায় লিখলে বিস্তারিত তথ্যগুলি ধীরে ধীরে হারিয়ে যায়।
ACE এই দুটি বিষয় এড়ানোর জন্য পুরোপুরি পুনর্লিখনের পরিবর্তে ডেল্টা আপডেট ব্যবহার করে। পেপারের ডেটা অনুযায়ী, ACE এজেন্ট টাস্কে বেসলাইনের তুলনায় 10.6% উন্নতি এবং ফাইন্যানশিয়াল রিজনিং-এ 8.6% উন্নতি করেছে, একইসাথে অ্যাডাপ্টেশন ল্যাটেন্সি প্রায় 86.9% কমিয়েছে; AppWorld র্যাঙ্কিং-এ, ছোট ওপেন-সোর্স মডেল ব্যবহার করে ডিপসিক ACE-এর সাথে V3.1 ব্যবহার করে, গড় স্কোর IBM CUGA-এর সাথে সমান হয়ে যায় যা GPT-4.1-এর উপর ভিত্তি করে তৈরি।
এটি উল্লেখযোগ্য যে, ACE এটি লেবেলযুক্ত সুপারভাইজড পরিস্থিতিতে কাজ করতে পারে বলে জোর দেয়; এটি কোড সফলভাবে চলে কিনা বা ত্রুটি দেয় ইত্যাদি প্রক্রিয়ার সময় স্বাভাবিকভাবেই উৎপন্ন ফিডব্যাক সংকেতের উপর নির্ভর করে পুনর্বিচার এবং সংগঠনকে নির্দেশিত করে। এটি এটিকে “এজেন্টগুলি তাদের নিজস্ব অভিজ্ঞতা থেকে শেখে” এই বড় বর্ণনার সাথে সংযুক্ত করে।
Continued post-training: Adjust weights, but do it wisely
বাহ্যিক মেমোরি এবং কনটেক্সট ইঞ্জিনিয়ারিং ওজন পরিবর্তনের ঝুঁকি এড়ায়, কিন্তু প্রকৃত জ্ঞান অন্তরীণকরণও এড়িয়ে যায়। অন্যদিকে, কিছু গবেষক মনে করেন যে, দীর্ঘমেয়াদে, কিছু জ্ঞান এবং দক্ষতা শেষপর্যন্ত প্যারামিটারের মধ্যে লেখা হতে হবে। এটিই হলো সামঞ্জস্যপূর্ণ পোস্ট-ট্রেনিং (Continual Post-training), যা প্রধানত সামঞ্জস্যপূর্ণ ইনস্ট্রাকশন ফাইন-টিউনিং, সামঞ্জস্যপূর্ণ পছন্দ-সমন্বয় ইত্যাদি পর্যায়ে বিভক্ত।
থিংকিং মেশিনেসের জন শুলম্যান একটি স্তরবদ্ধ দৃষ্টিভঙ্গি প্রদান করেছেন: তিনি শেখার কথাটিকে মনোবিজ্ঞানের গতিশীল শেখা, পরিস্থিতিগত স্মৃতি এবং প্রক্রিয়াগত স্মৃতির মতো কয়েকটি শ্রেণিতে তুলনা করেন, এবং মনে করেন যে প্রসঙ্গ-ভিত্তিক শেখা সংক্ষিপ্ত-সময়ের শেখার কাজগুলির সাথে ভালভাবে কাজ করবে, যখন প্যারামিটার ফাইন-টিউনিং (LoRA-এর মতো পদ্ধতি সহ) এর উপরে স্তরযুক্ত হবে, বিশেষত যেসব কাজগুলির জন্য বড় ক্ষমতা এবং প্রকৃতপক্ষে জ্ঞান গ্রহণের প্রয়োজন—যখন সময়কাল দীর্ঘতর হয়, তখন প্রসঙ্গ-ভিত্তিক শেখা অপর্যাপ্ত হয়ে পড়ে, এবং প্যারামিটার ফাইন-টিউনিংই বিজয়ী হয়।
এই রুটের সবচেয়ে বড় শত্রু এখনও দুর্ভোগজনক ভুলে যাওয়া, এবং সাম্প্রতিক একটি আকর্ষণীয় সমাধান এসেছে Thinking Machines-এর Tinker থেকে।

টিঙ্কার হল তাদের ২০২৫ সালের অক্টোবরে প্রকাশিত প্রথম পণ্য, যা একটি LoRA-ভিত্তিক ফাইন-টিউনিং API, যা ডিস্ট্রিবিউটেড ট্রেনিংয়ের জটিলতা বিলুপ্ত করে শুধুমাত্র forward_backward, optim_step এর মতো নিম্নস্তরের প্রিমিটিভগুলি প্রকাশ করে, যাতে গবেষকদের ডেটা এবং অ্যালগরিদমের উপর মনোনিবেশ করতে হয়।
তারা নিয়মিত শেখার জন্য একটি স্ব-বিনিয়োগ সূক্ষ্ম-সামঞ্জস্য (SDFT) পদ্ধতির প্রচার করে: মূল অনুমান হল সাধারণ পরিদর্শন-ভিত্তিক সূক্ষ্ম-সামঞ্জস্য একটি "অফ-পলিসি" প্রক্রিয়া, যেখানে মডেলকে এমন টোকেনগুলির অনুকরণ করতে বাধ্য করা হয় যেগুলি এটি নিজেই কখনই উৎপাদন করবে না, ফলে প্রতিটি নতুন দক্ষতা শেখা পুরনো দক্ষতাগুলিকে ক্ষয় করে; SDFT মডেলকে নিজেকেই শিক্ষক হিসাবে কাজ করতে দেয়, যাতে এটি উদাহরণগুলি থেকে নতুন দক্ষতা শিখতে পারে এবং পুরনোগুলি ভুলে যায় না। Trajectory নামের একটি স্টার্টআপ Tinker-কে তাদের নিয়মিত শেখার প্ল্যাটফর্মের মূল অবকাঠামো হিসাবে ব্যবহার করছে।
একটি বিষয় উল্লেখ্য যে, টিঙ্কার সম্পূর্ণ ফাইন-টিউনিংয়ের পরিবর্তে LoRA ব্যবহার করে, যার একটি ব্যবহারিক সুবিধা হল: একাধিক ফাইন-টিউনিং টাস্ক একই কম্পিউটেশনাল পুল শেয়ার করতে পারে, যার ফলে খরচ বণ্টিত হয়। এটিই ব্যাখ্যা করে যে কেন “কন্টিনিউয়াস লার্নিং অ্যাস সার্ভিস” একটি ব্যবসা হয়ে উঠছে: প্রায়শই মডেল আপডেটকে একটি অন-ডিমান্ড API-এ পরিণত করা হচ্ছে, যা শিল্পের বর্তমান চেষ্টার দিক।
পুনর্প্রশিক্ষণ এবং অবিরাম প্রশিক্ষণ
যদি পোস্ট-ট্রেনিং মডেলের "পৃষ্ঠস্তরে" কাজ করে, তবে কন্টিনুয়াল প্রি-ট্রেনিং (CPT) হল সবচেয়ে নিচের স্তরে ফিরে যাওয়া, যেখানে নতুন কর্পাস ব্যবহার করে মডেলকে আবার প্রি-ট্রেন করা হয়, যাতে এটি নতুন ডোমেইন, নতুন ভাষা বা সময়ের সাথে পরিবর্তিত জ্ঞানের বণ্টনকে অনুকূলিত করতে পারে। নতুন এবং পুরানো ডেটা একসাথে মিশিয়ে পুনরায় শুরু থেকে ট্রেন করার তুলনায়, CPT বিদ্যমান মডেলের উপর ভিত্তি করে কাজ করে, যা কম্পিউটেশনালভাবে অনেক বেশি দক্ষ।
এর প্রধান ব্যবহার তিনটি: সময়ের সাথে জ্ঞানের সরে যাওয়া, বহুভাষিক বিস্তার, এবং ক্ষেত্রান্তরে অভিযোজন। কিন্তু এর মূল্যও স্পষ্ট: অনেকগুলি পরীক্ষামূলক গবেষণা পুনরাবৃত্তি করে দেখিয়েছে যে, নিরন্তর প্রিট্রেইনিংয়ের গণনা খরচ অত্যন্ত বেশি এবং এটি ইতিমধ্যে শেখা জ্ঞানের প্রতি দুঃসাহসিক ভুলের সম্ভাবনা বাড়ায়। এজন্য, শিক্ষাবিদরা LLM-এর স্কেলে ভুলে যাওয়ার সমস্যা ছাড়াই নিরন্তর প্রিট্রেইনিংয়ের জন্য “পুনরাবৃত্তি-মুক্ত, টাস্ক-অ্যানোটেশন-মুক্ত” পদ্ধতির অনুসন্ধান চালিয়ে যাচ্ছেন।
অধিকাংশ কোম্পানির জন্য, একটি অগ্রণী মডেলকে শূন্য থেকে পুনরায় প্রি-ট্রেন করার খরচ অবাস্তব পর্যায়ে উঁচু, যা কার্পাথির বিখ্যাত বক্তব্য "বড় মডেলগুলি প্রায়শই পুনরায় ট্রেন করা উপযুক্ত নয়"-এর মূল কারণ। তাই, কঠোরভাবে বলতে গেলে, "পুনরায় প্রি-ট্রেনিং" হল অগ্রণী ল্যাবগুলির অভ্যন্তরীণ বিকল্প, যখন ধারাবাহিক প্রি-ট্রেনিং হল একটি বেশি বাস্তবসম্মত মধ্যম পথ।
আপডেটেড ধারণা: মডেলকে নিজেকে সংশোধন করতে শেখানো
পূর্বের চারটি দিক কিছুটা এখনও "চিট বনাম ওজন পরিবর্তন" এই দ্বিমাত্রিক কাঠামোর মধ্যে ঘুরছে। কিন্তু গত বছরে উঠে আসা কিছু নতুন কাজ এই কাঠামোকে ছেড়ে শেখার নিজস্ব সংজ্ঞা পুনর্সংজ্ঞায়িত করার চেষ্টা করছে।
একটি ধারণা হলো মডেলটিকে নিজেই প্রশিক্ষণ ডেটা তৈরি করতে এবং নিজেকে আপডেট করার উপায় নির্ধারণ করতে দেওয়া।
MIT-এর SEAL (Self-Adapting Language Models) একটি উদাহরণ। একটি নতুন ইনপুট দেওয়া হলে, মডেলটি একটি “স্ব-সম্পাদন” (self-edit) তৈরি করে; এটি একটি প্রাকৃতিক ভাষার নির্দেশনা যা বলে যে কীভাবে তথ্য পুনর্গঠন করবে, ওজন আপডেট করতে কোন হাইপারপ্যারামিটার ব্যবহার করবে, এমনকি ডেটা অগমেন্টেশনের জন্য কোন টুল কল করবে; তারপর মডেলটি এই নির্দেশনা অনুযায়ী নিজেকে ফাইন-টিউন করে, যা স্থায়ী ওজন আপডেট তৈরি করে। “কোন স্ব-সম্পাদন কার্যকর” তা একটি বাহ্যিক রিইনফোর্সমেন্ট লার্নিং চক্র দ্বারা প্রশিক্ষিত হয়, যার পুরস্কার সংকেত হলো আপডেটের পরে মডেলটির ডাউনস্ট্রিম টাস্কের পারফরম্যান্স।

নিউরIPS 2025 সংস্করণটি প্রমাণ করে যে এই সামঞ্জস্যযোগ্য ক্ষমতা মডেলের আকার বড় হওয়ার সাথে সাথে বৃদ্ধি পায় এবং শিখে ফেলা সমস্যা প্রতিরোধে শক্তিশালী শিক্ষা ব্যবহার করে। এর লেখকগণ এমন একটি মডেলের দিকে তাকান যা যুক্তির মধ্যেই নিজেই সিদ্ধান্ত নিতে পারবে "এখনই কি শিখে নেওয়া উচিত", এবং একবারের চিন্তার শৃঙ্খলকে স্থায়ী ক্ষমতায় রূপান্তরিত করবে।
নেউرIPS ২০২৫-এ প্রকাশিত গুগলের নেস্টেড লার্নিংয়ের একটি আরও আক্রমণাত্মক দৃষ্টিভঙ্গি রয়েছে। এর মূল বিষয় হল একটি মডেলকে একটি সেট হিসাবে পুনরায় বুঝতে হবে—যেখানে পরস্পরের মধ্যে নিহিত, বহুস্তরীয়, প্রতিটির নিজস্ব 'কনটেক্সট ফ্লো' এবং ভিন্ন আপডেট ফ্রিকোয়েন্সি রয়েছে—এই দৃষ্টিভঙ্গির অধীনে আর্কিটেকচার এবং অপটিমাইজেশন অ্যালগরিদমকে একই বিষয়ের বিভিন্ন স্তর হিসাবে একীভূত করা হয়।

একটি ধারণার প্রমাণ হিসাবে, তারা একটি নিজেকে পরিবর্তনকারী আর্কিটেকচার তৈরি করেছে যার নাম Hope, যা Titans-এর দীর্ঘমেয়াদী মেমোরি আর্কিটেকচারের উপর দুটি বিস্তার করেছে: অসীম নেস্টেড লার্নিং লেভেল এবং একটি "কন্টিনুয়াস মেমোরি সিস্টেম" (CMS)। সহজ কথায়, শুধুমাত্র শর্ট-টার্ম/লং-টার্ম মেমোরির দ্বৈত বিভাজনের বদলে, এটি একটি সম্পূর্ণ টাইম-স্কেল-ভিত্তিক আপডেটের মেমোরি মডিউল স্পেকট্রাম।

পরীক্ষায়, Hope স্ট্যান্ডার্ড Transformer এবং আধুনিক রিকারেন্ট মডেলগুলির চেয়ে ভাষা মডেলিং, দীর্ঘ কনটেক্সট রিজনিং এবং ধারাবাহিক শেখার কাজগুলিতে উত্তম পারফরম্যান্স দেখিয়েছে। আকর্ষণীয় বিষয় হলো, এই আর্কিটেকচারগুলিতে পরবর্তী গবেষণাগুলি "ঘুম" পর্যায় যোগ করেছে—যেমন মানুষ ঘুমের মধ্যে স্মৃতি শক্তিশালী করে, মডেলটি সক্রিয় সেশনের মধ্যে কম্পিউটেশনাল শক্তি ব্যয় করে, উপযুক্ত বিমূর্ততা প্রতিস্থাপনের জন্য দীর্ঘস্থায়ী প্যারামিটার মেমরিতে সংক্ষিপ্ত করে।
আরও উপরের স্তরে, ডেভিড সিলভার এবং রিচার্ড সাটন দ্বারা প্রস্তাবিত «অভিজ্ঞতার যুগ» (Era of Experience) বর্ণনা।

তাদের মতে: গণিত, কোডিং, বিজ্ঞান এই কী ক্ষেত্রগুলিতে, মানব ডেটা থেকে প্রাপ্ত জ্ঞানের সীমা প্রায় পৌঁছে গেছে; এগিয়ে যাওয়ার জন্য, AI-কে তার নিজের এবং পরিবেশের মধ্যে প্রতিক্রিয়ার অভিজ্ঞতা থেকে নিরন্তর শিখতে হবে, যাতে একটি আত্ম-সরবরাহকারী ডেটা সম্পূর্ণ চক্র গঠিত হয়। তারা 2024 সালে DeepMind-এর AlphaProof (যা “ঔপচারিক প্রমাণ সিস্টেমের সাথে নিরন্তর মিথস্ক্রিয়া”র মাধ্যমে IMO পুরস্কার অর্জন করেছে)কে এই যুগের শুরু হিসাবে বিবেচনা করে। এই বর্ণনা নিরন্তর শিক্ষা, শক্তিশালী শিক্ষা, এবং বুদ্ধিমত্তার স্বাধীন অনুসন্ধানকে একত্রিত করে, এবং একটি অসমাধান প্রশ্নও রেখে যায়: মূল সংকেতগুলিকে উপযোগী নির্দেশনায় রূপান্তরিত করার জন্য পুরস্কার ফাংশনগুলির ডিজাইনাররা কে?
একটি নিকটবর্তী দিক রয়েছে যা ধারাবাহিক শেখার সাথে বিভ্রান্ত হওয়ার সম্ভাবনা রয়েছে, কিন্তু এর লক্ষ্য ভিন্ন: জ্ঞান সম্পাদনা (Knowledge Editing)। ROME, MEMIT-এর মতো পদ্ধতিগুলি নির্দিষ্ট তথ্য সংরক্ষণকারী MLP স্তরগুলির অবস্থান চিহ্নিত করে এবং সেগুলি সম্পাদনা করে, যার ফলে সম্পূর্ণ পুনর্প্রশিক্ষণের প্রয়োজন ছাড়াই একক বা ব্যাচ-ভিত্তিক তথ্য আপডেট করা যায়। তবে এটি ধারাবাহিক শেখারের লক্ষ্যের সাথে পুরোপুরি মেলে না—জ্ঞান সম্পাদনা একটি নির্দিষ্ট তথ্যকে সঠিকভাবে ওভাররাইট করার উপর জোর দেয়; ধারাবাহিক, চিরস্থায়ী সম্পাদনার পরিস্থিতিতে, পুনঃপুনঃ প্যারামিটারের পরিবর্তনগুলি পরস্পরকে বিঘ্নিত করে, ধীরে ধীরে ‘বিষক্রিয়া’ জমা হয়ে ‘মডেল কলাপ’-এর দিকে নিয়ে যায়, যা WISE, AlphaEdit-এর মতো ধারাবাহিক সম্পাদনার জন্য বিশেষভাবে ডিজাইনকৃত পদ্ধতিগুলির উৎপত্তিরও কারণ হয়েছে।

শেষ কথা
এই কয়েকটি দিককে একসাথে দেখলে বোঝা যায় যে এগুলো আসলে একটি “জ্ঞান কোথায় অবস্থিত” অক্ষের সাথে সারিবদ্ধ।

সবচেয়ে বাইরের স্তরটি এক্সটার্নাল মেমোরি এবং কনটেক্সট ইঞ্জিনিয়ারিং, যেখানে জ্ঞান সম্পূর্ণরূপে মডেলের বাইরের টোকেন স্পেসে থাকে, নিরাপদ এবং নিয়ন্ত্রিত কিন্তু বাস্তবিকভাবে অভ্যন্তরীণকরণ করা হয়নি; মধ্যবর্তী স্তরটি হল কন্টিনিউয়াস পোস্ট-ট্রেনিং এবং কন্টিনিউয়াস প্রিট্রেনিং, যেখানে জ্ঞান ওজনে লেখা হয়, যার ক্ষমতার সীমা বেশি কিন্তু ক্যাটাস্ট্রফিক ফরগেটফুলনেসের সাথে সরাসরি মোকাবিলা করতে হয়; সবচেয়ে ভিতরের, এবং সবচেয়ে অগ্রণী, হল মডেলকে নিজেকেই পরিবর্তন এবং নিজেকেই উন্নত করতে দেওয়ার নতুন ধারণা, যা “শেখা” ক্রিয়াটিকেই মডেলের ক্ষমতার অংশ হয়ে উঠতে চায়।
একটি বাস্তবসম্মত পর্যবেক্ষণ হল: এই দিকগুলি সম্ভবত পরস্পরবিরোধী নয়, বরং স্তরবদ্ধভাবে সহযোগিতা করবে। শুলম্যানের স্তরবদ্ধ শিক্ষার দৃষ্টিভঙ্গি এবং কারপাথির “সংজ্ঞানাত্মক কোর + বাহ্যিক মেমোরি” ধারণা মূলত একই বিষয়টি বলছে: সংক্ষিপ্ত-সময়কালীন, পরিবর্তনশীল জ্ঞানকে প্রসঙ্গ এবং বাহ্যিক মেমোরির উপর ছেড়ে দিন, দীর্ঘ-সময়কালীন, গভীরভাবে অধিগত দক্ষতাগুলিকে প্যারামিটার ফাইন-টিউনিংয়ের উপর ছেড়ে দিন, প্রতিটি তাদের কাজে নিয়োজিত। ACE অনুপস্থিত শিক্ষার মাধ্যমে কার্যক্রমের ফিডব্যাকের ভিত্তিতে উন্নতি লাভ করতে পারে, SEAL পুনরায় সংশোধনকে শক্তিশালীকরণ শিক্ষা দিয়ে অপটিমাইজ করে, এটি একটি সাধারণ প্রবণতা ইঙ্গিত করে: ভবিষ্যতের ধারাবাহিক শিক্ষা, খুবই সম্ভবত, মডেলকেই “কী শিখবে, কীভাবে শিখবে”—এই সিদ্ধান্তগুলি নেওয়ার নেতৃত্ব দেওয়ার।
সুতরাং কারপাথির সেই “আরও দশ বছর” বিচারে ফিরে যাই, ধারাবাহিক শিক্ষা কি সমাধান করেছে? উত্তরটি হয়তো—এখনও না, কিন্তু এখন এটি আর একদম খালি নয়। দুর্ভোগজনক ভুলে যাওয়া এই মূল বাধা এখনও সম্পূর্ণরূপে দূর করা হয়নি, SDFT, নেস্টেড লার্নিং এইসব পদ্ধতিগুলি এটিকে “দূর করছে” নয়, “কমিয়েছে”। শুধুমাত্র ভালো কনটেক্সট ম্যানেজমেন্ট এবং ফাইন-টিউনিং দিয়েই কি ধারাবাহিক শিক্ষা সমাধান করা যাবে, নাকি এর জন্য সম্পূর্ণ নতুন ধারণা প্রয়োজন? এই আরও মৌলিক প্রশ্নটির উত্তর এখনও Schulman-এরও নিজের মতে অনিশ্চিত।
নিশ্চিতভাবে বলা যায় যে 2025 থেকে 2026 এর মধ্যে, পুনরাবৃত্তি হওয়া একটি "অভাবপূর্ণ দক্ষতা" হিসাবে পরিচিত অবিচ্ছিন্ন শিক্ষা, একটি বাস্তবিকভাবে বহু পথে বিভক্ত এবং কিছু স্টার্টআপ পণ্য তৈরি করতে নেমে আসা একটি সক্রিয় মঞ্চে পরিণত হয়েছে। কোন পথটি "AI সহকারী"কে প্রোটোটাইপ থেকে বাস্তবতায় পরিণত করবে, তা অব্যাহতভাবে পর্যবেক্ষণযোগ্য।
রেফারেন্স লিঙ্ক
https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits
https://karpathy.bearblog.dev/year-in-review-2025/
https://www.letta.com/blog/continual-learning/
https://arxiv.org/abs/2510.04618
https://arxiv.org/abs/2402.01364
https://thinkingmachines.ai/tinker/
https://arxiv.org/pdf/2604.05096
https://arxiv.org/pdf/2606.03979
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "মেশিন সিন্টিস" (ID: almosthuman2014) থেকে, লেখক: কন্টিনিউয়াস লার্নিং মেশিন সিন্টিস, সম্পাদক: Panda
