বড় ফলাফলের জন্য এমবডিড ইন্টেলিজেন্স আসছে!!!
গেনারালিস্ট গত সপ্তাহে জেন ১.৫ নামক একটি এমবডিড ব্রেন প্রকাশ করেছে যা ৩ থেকে ১২ সেকেন্ডের অ্যাকশন শিখতে পারে~
সাম্প্রতিক সময়ে, উত্তর আমেরিকার শরীরসংবলিত স্টার্টআপ Skild AI একটি নতুন রোবট বেস মডেল S1 প্রকাশ করেছে, যা রোবটের কনটেক্সট লার্নিং টাস্কের দৈর্ঘ্যকে ১০ মিনিটের ঊর্ধ্বে নিয়ে গেছে।

এই এস১-এর মুখ্য বিষয় হল প্রেক্ষাপট শিক্ষা (in-context learning, ICL):
নতুন অপারেশন ডেটা ট্রেনিংয়ের প্রয়োজন নেই, শুধু একটি মানব প্রদর্শনী ভিডিও দেখেই এটি একটি অপরিচিত জটিল অপারেশন প্রক্রিয়া সম্পূর্ণ করতে পারে।
অফিসিয়াল ডেমোতে, রোবট প্যানকেক বানানো, কফি বানানো, গাছের পাত্র বদলানো এবং সরঞ্জাম সংযোগ করা সহ দীর্ঘ পরিসরের কাজ সম্পন্ন করেছে। এছাড়াও, অপরিচিত কাজগুলিতে, এটি 66% সফলতার হার অর্জন করেছে, যা ভাষাভিত্তিক প্রম্পটের উপর ভিত্তি করে তৈরি VLA-এর (কেবল 9%) চেয়ে অনেক বেশি।
অন্যদিকে, পারম্পরিক পোস্ট-ট্রেনিং ফাইন-টিউনিং পথ অনুসরণ করলেও S1-এর একবার ডেমো দেখার ফলাফল অর্জন করতে প্রায় 380 বার টাস্ক ডেমো দিতে হবে।
খুব অসাধারণ!
সাম্প্রতিক এই প্রেক্ষাপট শিক্ষায় কেন্দ্রীভূত ঢালাওয়া অনেকের জন্য শরীরী বুদ্ধিতে আবার আশা জাগিয়েছে।
একজন টুইটার ব্যবহারকারী বলেছেন যে সাধারণ রোবট দুই বছরের মধ্যেই আসতে পারে, সাত বছর নয়।

অন্যান্য ব্যবহারকারীরা বলেছেন, রোডা থেকে গত সপ্তাহের জেনারালিস্ট, এবং এখন স্কিল্ড S1-এর ১০ মিনিটের টাস্ক পর্যন্ত, রোবটের প্রকৃত GPT মুহূর্তটি আসছে বলে মনে হচ্ছে।

কারণ এই ক্ষমতা যদি সত্যিই সাধারণীকরণ করা হয়, তাহলে ভবিষ্যতে রোবট দক্ষতা বিকাশ করা সত্যিই ChatGPT-এর জন্য প্রম্পট লেখার মতো হয়ে যাবে।

এটা কি সত্যিই এতটাই অসাধারণ? চলুন একসাথে দেখি।
বার্ট যুগ থেকে জিপিট যুগে
এস১-এর এই কনটেক্সট লার্নিং বুঝতে হলে, আমাদের প্রথমে দেখতে হবে যে প্রাচীন রোবটগুলি কিভাবে একটি নতুন দক্ষতা শিখে।
প্রাচীন পাইপলাইনে, রোবট শেখা আসলে বড় মডেলের সাথে প্রায় একই:
প্রথমে বিপুল পরিমাণ ডেটার উপর প্রি-ট্রেনিং করুন, যাতে কিছু মৌলিক দক্ষতা শিখতে পারে; তারপর নির্দিষ্ট পরিস্থিতিতে, কোনো নির্দিষ্ট কাজের জন্য ডেটা সংগ্রহ করুন এবং পোস্ট-ট্রেনিংয়ের মাধ্যমে বটটিকে বিশেষ দক্ষতা শেখান।

কিন্তু সমস্যা হলো, রোবট এবং বড় মডেল যদিও প্রক্রিয়া প্রায় একই, তবে ডেটা খরচ সম্পূর্ণ ভিন্ন।
বড় মডেলের প্রাক-প্রশিক্ষণ ডেটা ব্যাপকভাবে ইন্টারনেট থেকে আসে; প্রোগ্রামিং, এজেন্ট এই বিশেষ পরিস্থিতিতেও, অনেক পোস্ট-ট্রেনিং ডেটা অনলাইনে দ্রুত পাওয়া যায়, এমনকি স্বয়ংক্রিয়ভাবে তৈরি করা যায়।
কিন্তু রোবটদের জন্য তো আরও খারাপ। প্রি-ট্রেনিং ডেটা বাস্তব জগতে সংগ্রহ করতে হবে, আর পোস্ট-ট্রেনিং ডেটাও বাস্তব জগতেই সংগ্রহ করতে হবে।
সুতরাং, টেকনিক্যাল ব্লগে, স্কিল্ড এআই সরাসরি মুখ খুলে দিল:
যদি একটি রোবট বেস মডেল প্রতিটি নতুন কাজ শেখার জন্য এখনও দশক বা শতাধিক ঘন্টার বাস্তব ডেটা প্রয়োজন হয় এবং পুনরায় ট্রেনিং করতে হয়, তাহলে আমি জিজ্ঞাসা করছি, এই “বেস মডেল”-টির বেস কোথায়?
তারা পূর্ববর্তী গবেষণাগুলির উল্লেখ করে বলেছে যে যদি একটি নতুন কাজের জন্য পর্যাপ্ত ডেটা থাকে, তবে শূন্য থেকে প্রশিক্ষিত মডেলটি পূর্ব-প্রশিক্ষিত এবং সূক্ষ্ম-সামঞ্জস্যপূর্ণ বেস মডেলের সাথে সমান পারফরম্যান্স দেখাতে পারে।
তাহলে, এমবডিড প্রি-ট্রেনিংয়ের গুরুত্ব কী?
এর জন্য স্কিল্ডের উত্তর হল: কনটেক্সট লার্নিং।
একটি রেফারেন্স কোঅর্ডিনেট হিসাবে, স্কিল্ড বড় মডেলের বিকাশ পথকে তুলনামূলকভাবে নিয়েছে।
প্রাথমিক BERT ই খুব শক্তিশালী ছিল, কিন্তু প্রতিবার নতুন কোনো কাজের সম্মুখীন হলে, প্রায়শই ডেটা পুনরায় প্রস্তুত করে আবার ফাইন-টিউন করতে হত।
GPT-3-এর পর ধীরে ধীরে প্রকাশ পাওয়া কনটেক্সট লার্নিং ক্ষমতাই খেলার নিয়ম বদলে দিয়েছে:
মডেলের ওজন পরিবর্তন করার প্রয়োজন নেই, শুধু প্রম্পটে কয়েকটি উদাহরণ দিলে মডেলটি অস্থায়ীভাবে একটি নতুন কাজ শিখে ফেলবে।

এর ভিত্তিতে, স্কিল্ড মনে করেন যে বর্তমানে রোবটগুলি এখনও একই ধরনের BERT যুগে আটকে আছে, এবং তাদের প্রকৃত ইচ্ছা হলো রোবটগুলিকেও একই ধরনের প্যারাডাইম শিফট সম্পন্ন করতে দেওয়া।
অর্থাৎ, প্রি-ট্রেনিংয়ের প্রকৃত মূল্য শুধুমাত্র পরবর্তী ট্রেনিংয়ের জন্য কম ডেটা সংগ্রহ করা নয়, বরং রোবটকে চূড়ান্তভাবে "প্রেক্ষাপট থেকে সরাসরি শেখার" ক্ষমতা অর্জন করতে হবে।
কনটেক্সট লার্নিং
তাহলে, S1 এবার কনটেক্সট থেকে কী শিখল?
স্কিল্ড মনে করেন, রোবটের কনটেক্সট লার্নিং ক্ষমতা পরীক্ষা করার জন্য বাস্তবে শুধুমাত্র দুটি মাত্রা রয়েছে:
একটি হলো, কি করে প্রশিক্ষণের সময় কখনও দেখা না গেলেও নতুন দক্ষতা শিখতে পারে; অন্যটি হলো, কি করে বিদ্যমান দক্ষতাগুলোকে পুনর্বিন্যাস করে একটি দীর্ঘ এবং খুব জটিল নতুন কাজ সম্পন্ন করতে পারে।
উদাহরণস্বরূপ, রোবটকে শুধুমাত্র একটি প্যানকেক ফ্লিপ করার ভিডিও দেখালেই সে প্যানকেক বানানোর কৌশল শিখে ফেলবে—
যদিও এই দক্ষতাটি আগে কখনও এর প্রশিক্ষণ ডেটাতে উপস্থিত হয়নি।
এর মধ্যে, গত সপ্তাহে Gen-1.5 দ্বারা প্রদর্শিত সেকেন্ড-স্তরের ভিডিওর তুলনায়, S1 এবার কনটেক্সট শিক্ষাকে সর্বোচ্চ 10 মিনিটে নিয়ে এসেছে।
পাতার প্রতিস্থাপনের মতো কাজগুলিতে, প্রতিটি কাজে দশগুলো ধাপ ক্রমাগতভাবে সম্পন্ন করতে হয়। এই দীর্ঘ-পরিসরের কাজের প্রদর্শনগুলিতে, রোবটকে শুধুমাত্র অনুকরণ করতে হবে না, এটিও জানতে হবে:
আমি এখন কোন ধাপে আছি, পরবর্তী ধাপটি কী, দক্ষতাগুলো কীভাবে সংযোগ করব, মাঝে মাঝে ভুল হয়ে গেলে কীভাবে এগিয়ে যাব।
অর্থাৎ, রোবটকে ভিডিও ডেমোতে কাজ-কর্মের উদ্দেশ্য বুঝতে হবে, শুধু আচরণ অনুকরণ নয়, পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানাতে হবে।
এছাড়াও, উদ্ভিদ পুনরায় পটে কাজে, ডেমো শুরু থেকে রোবটের নিজস্ব কাজ শুরু হওয়া পর্যন্ত মাত্র ১১ মিনিট সময় লাগল, যা পারফরম্যান্সের ক্ষেত্রে পারম্পরিক পোস্ট-ট্রেনিংকে সহজেই ছাড়িয়ে গেল।
শেষ পর্যন্ত, সম্পূর্ণ প্রক্রিয়ার মধ্যে, S1 কোনো ফাইন-টিউনিং বা পোস্ট-ট্রেনিং ব্যবহার করেনি, মডেলেরওয়েটস সম্পূর্ণরূপে অপরিবর্তিত রেখে, একই সেটের ওয়েটস ব্যবহার করে ব্লগে উপস্থাপিত সমস্ত কাজ সম্পন্ন করা হয়েছে।
বেসিকভাবে, বড় মডেলগুলি বার্টের মতো নির্দিষ্ট স্কেনারিওর জন্য ফাইন-টিউনিংয়ের প্রয়োজনীয়তা থেকে GPT-3-এর মতো শুধুমাত্র ডেমো দেখে OOD টাস্ক সম্পন্ন করার পর্যায়ে পৌঁছেছে।
একমাত্র পার্থক্য হলো, প্রম্পট হিসাবে ভাষা ব্যবহার না করে ডাউনস্ট্রিম টাস্কের সাথে ভালোভাবে অ্যালাইন করতে পারে এমন অ্যাকশন ভিডিও ব্যবহার করা হয়েছে।

পরীক্ষা: ICL কি আসলে বেশি স্কেল করতে পারে?
পরীক্ষামূলক অংশে, স্কিল্ড প্রশিক্ষণ ডেটাতে দেখা এবং অদেখা কাজগুলিতে ICL ভিডিও প্রম্পট এবং পারম্পরিক ভাষাগত প্রম্পট VLA-এর তুলনা করেছে।

পরীক্ষার ফলাফল দেখায় যে যখন প্রশিক্ষণ ডেটা মাত্র 1000 ঘন্টা ছিল, তখন ভাষাগত প্রম্পট বেশি ভালো কাজ করেছিল, কিন্তু ডেটা পরিসর বাড়ার সাথে সাথে ICL আবার এগিয়ে যায়।
10 লাখ ঘন্টার পর, প্রশিক্ষণের সময় দেখা কাজগুলিতে: ICL 96%, ভাষা প্রম্পট 89%।
আসল গুরুত্বপূর্ণ OOD টাস্কে: ICL 66%, ভাষাগত প্রম্পট মাত্র 9%, যা 7 গুণের বেশি পার্থক্য তৈরি করে।
S1-এর সাধারণীকরণ যাচাইয়ের জন্য, স্কিল্ড বিভিন্ন পরীক্ষামূলক শর্তে পরীক্ষা করেছে।

ফলাফল দেখায় যে, ভাষা প্রম্পট VLA-এর পারফরম্যান্স হ্রাস ICL-এর সর্বোচ্চ তিনগুণ।
অর্থাৎ, ICL শিখেছে শুধু নির্দিষ্ট পরিস্থিতিতে কাজ পুনরাবৃত্তি করা নয়, বরং বর্তমান পরিবেশের সাথে খাপ খাইয়ে নতুনভাবে কীভাবে এগিয়ে যাবে তা পুনর্নির্ধারণ করা।
শেষ হিসেবে, ওয়ান শট লার্নিংয়ের ক্ষেত্রে।
S1 নতুন টাস্কে কোনো পোস্ট-ট্রেনিং করে না, শুধু একটি ভিডিও ডেমো দেখে 66% সফলতার হার অর্জন করে।

তুলনায়, প্রাচীন VLA একই স্তরে পৌঁছাতে প্রায় 380টি প্রদর্শনের পর-প্রশিক্ষণ পার করে।
অবশ্যই, 2000 বার প্রদর্শনের পর পারম্পরিক পোস্ট-ট্রেনিং চূড়ান্তভাবে 86% পৌঁছাতে পারে।
সুতরাং উপসংহার হতে পারে “ভবিষ্যতে রোবটদের প্রশিক্ষণের প্রয়োজন হবে না” নয়, বরং:
আগে একটি নতুন দক্ষতা শেখানোর জন্য শত শতবার প্রশিক্ষণ দিতে হত, এখন শুধু একবার দেখলেই সরাসরি ৬০-৭০ পাওয়া যায়।
এটি স্কিল্ডের বলা আইসিএল স্কেলিং ল ও বলা হয়:
যত বেশি ডেটা, মডেল শুধু আরও বেশি দক্ষতা অর্জন করবে না, বরং এটি ক্রমাগত "প্রদর্শন থেকে দক্ষতা শিখতে" শিখবে।
Skild AI কে?
স্কিল্ড ২০২৩ সালে প্রতিষ্ঠিত হয়েছে, যার পেছনে দুজন সিএমইউ রোবোটিক্স সম্প্রদায়ের পরিচিত ব্যক্তি: ডিপাক পাথক এবং অভিনব গুপ্তা।

উভয়েই কার্নেগি মেলন বিশ্ববিদ্যালয়ের রোবোটিক্স ইনস্টিটিউটের অধ্যাপক, ডিপাক মূলত রোবোটিক্স লার্নিং, রিইনফোর্সমেন্ট লার্নিং এবং কম্পিউটার ভিশনে গবেষণা করেন, আর অভিনব হলেন কম্পিউটার ভিশন এবং সেলফ-সুপারভাইজড লার্নিং-এর একজন বিশেষজ্ঞ।
2022 সালেই তারা WHIRL-এ একসাথে কাজ করেছিল, যেখানে রোবটগুলি মানুষের ভিডিও দেখে one-shot imitation শিখেছিল, তাই S1 এই পথটি হঠাৎ পাথরের ফাঁক থেকে বেরিয়ে আসেনি।

উত্তর আমেরিকার এমবডিড সম্প্রদায়ের একটি স্টার কোম্পানি হিসেবে, 2024 সালে স্কিল্ড তার অদৃশ্য মোড থেকে বেরিয়ে আসে এবং 3 বিলিয়ন ডলারের A-রাউন্ড ফান্ডিং এবং 15 বিলিয়ন ডলারের ভ্যালুয়েশন অর্জন করে;
এই বছর জানুয়ারিতে, 14 বিলিয়ন ডলারের সি রাউন্ড ফান্ডিং সম্পন্ন হয়, যার ফলে মূল্যায়ন সরাসরি 140 বিলিয়ন ডলারের ঊর্ধ্বে চলে যায়, যেখানে SoftBank নেতৃত্ব দেয় এবং NVIDIA, Bezos ইত্যাদি আরও অংশগ্রহণ করে। দুই বছরেরও কম সময়ে, মূল্যায়ন প্রায় দশগুণ হয়ে যায়।
উল্লম্ব তুলনায়, স্কিল্ডের উত্তর আমেরিকার এমবডিড কমিউনিটিতে অবস্থান খুবই বিশেষ।
PI-এর তুলনায় বেশি "রোবট GPT" এর মতো, Generalist সম্প্রতি one-shot learner এবং Genesis AI, Sunday-এর সম্প্রতির ফুল-স্ট্যাক প্রবণতাকে জোর দিয়েছে, যেখানে Skild সর্বদা একটি বাক্য জোর দিয়েছে: Any robot, any task, one brain।
এটি বিভিন্ন শরীরের উপর একই Skild Brain চালানোর দিকে বেশি জোর দেয়, যেমন মেকানিক্যাল আর্ম, চার পায়ে চলা যন্ত্র এবং মানুষের মতো শরীর।
সহজ ভাষায়, এটি হল রোবোট যুগের অ্যান্ড্রয়েড হওয়ার ইচ্ছা: একটি স্মার্ট লেয়ার, যা বিভিন্ন ধরনের শরীরের মধ্যে ঢুকিয়ে দেওয়া হয়।
এটি স্কিল্ডের ডেটা কৌশলকে নির্ধারণ করে: সবকিছু।
স্কিল্ড রোবট ডেটাকে হার্ডওয়্যার প্রক্সিমিটি, বৈচিত্র্য এবং স্কেলেবিলিটি তিনটি মাত্রায় দেখে:
বাস্তব ডিভাইস দিয়ে দূরবর্তী নিয়ন্ত্রণ হার্ডওয়্যারের সবচেয়ে কাছাকাছি, কিন্তু মহঙ্গা; প্রথম দৃষ্টিভঙ্গির মানুষের ভিডিও সহজেই স্কেল করা যায়, কিন্তু রোবটের শরীরের থেকে অনেক দূরে; সিমুলেশন সস্তা এবং দ্রুত উৎপাদনযোগ্য, কিন্তু sim-to-real gap আছে।

সুতরাং তারা রোবট টেলিওপ, UMI, এগোসেন্ট্রিক ভিডিও এবং সিমুলেশনের জন্য প্রায়শই সবকিছু ব্যবহার করার পদ্ধতি অনুসরণ করে।
এবং S1-এর ICL আসলে এই পথের প্রাকৃতিক প্রসার:

2025 সালের সেপ্টেম্বরে LocoFormer → 2026 সালের ফেব্রুয়ারিতে প্রথম In-Domain ICL → মেতে প্রথম ফ্লিপ করা → আগস্টে S1 প্রকাশ, যা সরাসরি কনটেক্সট লার্নিংকে দীর্ঘতম 10 মিনিটের OOD দীর্ঘ-পরিসর টাস্কে নিয়ে যায়।
সুতরাং এখন সত্যিকারের মনোযোগ দেওয়ার মতো প্রশ্নটি হয়ে উঠেছে যে, রোবটগুলি আরও বেশি দক্ষতা শিখতে পারবে কিনা নয়, বরং:
একটি রোবটের একটি নতুন দক্ষতা শেখার খরচ কি সত্যিই “শত শতবার শেখানো” থেকে “তুমি একবার করো, এটি একবার দেখে নেয়”-এ পরিণত হতে পারে?
যদি এই স্কেলিং আইনটি আরও কার্যকর থাকে, তবে রোবটের GPT মুহূর্ত শুধুমাত্র আরেকটি মার্কেটিং জিনিস নাও হতে পারে।
রেফারেন্স লিঙ্ক: [1]https://www.skild.ai/blogs/s1
এই লেখাটি ওয়েইচ্যান পাবলিক অ্যাকাউন্ট "Quantum Bit" থেকে এসেছে, লেখক: henry
