جسمانی ذہانت کا بڑا نتیجہ، آنے والا ہے!!!
گزشتہ هفتے جنرلسٹ نے 3 سے 12 سیکنڈ کے ایکشن سیکھنے والا جسمانی دماغ جن 1.5 جاری کیا ہے~
توہیں، شمالی امریکہ کے جسمانی اسٹارٹ اپ Skild AI نے نیا روبوٹ بنیادی ماڈل S1 جاری کیا ہے، جس نے روبوٹ کے حوالہ سیکھنے کے کام کی لمبائی 10 منٹ سے زیادہ تک بڑھا دی ہے۔

اس S1 میں مرکوز توجہ ماحولیاتی سیکھنا (in-context learning، ICL) پر ہے:
نئے عمل کے ڈیٹا کو تربیت کے بعد کے مرحلے میں الگ سے سیکھنے کی ضرورت نہیں، صرف ایک انسانی نمونہ ویڈیو دیکھ کر، وہ فوراً ایک مکمل، پہلے کبھی نہ دیکھے گئے پیچیدہ عمل کو انجام دے سکتا ہے۔
آفیشل ڈیمو میں، روبوٹ نے پینکیک بنانا، کافی بنانا، پودوں کو برتن بدلنا اور ڈیوائس اسیمبلي جیسے لمبے کام کیے۔ اور نئے کاموں پر، کامیابی کی شرح 66% تک پہنچ گئی، جو زبانی ہدایات پر مبنی VLA (صرف 9%) سے کہیں زیادہ ہے۔
اس کے علاوہ، اگر آپ روایتی پوسٹ ٹریننگ فائنٹیوننگ کے راستے پر چل رہے ہیں، تو S1 کے صرف ایک بار کے ڈیمو کے اثر کو حاصل کرنے کے لیے تقریباً 380 بار ٹاسک ڈیموز دینے کی ضرورت ہوگی۔
بہت عالی!
کہا جا سکتا ہے کہ حالیہ دور میں سیکھنے کے حوالے سے مرکوز کام نے کئی لوگوں میں جسمانی کے لیے دوبارہ امید کی شمع جلا دی ہے۔
ایک ٹویٹر صارف نے کہا کہ جنرل روبوٹ دو سال کے اندر ظاہر ہو سکتے ہیں، نہ کہ سات سال میں۔

اور صارفین نے کہا کہ رودا سے لے کر گزشتہ هفتوں جنرلسٹ تک، اور اب سکلڈ S1 کے 10 منٹ کے کام تک، روبوٹ کا اصل GPT لمحہ آ رہا ہے۔

کیونکہ اگر یہ صلاحیت حقیقت میں عام ہو گئی، تو مستقبل میں روبوٹ کے مہارتیں تیار کرنا واقعی ChatGPT کو پرامپٹ لکھنے جیسا ہو جائے گا۔

کیا یہ اتنی عجیب بات ہے؟ آئیے ایک ساتھ دیکھتے ہیں۔
BERT کے عہد سے GPT کے عہد کی طرف
S1 کے اس بار کے سیکھنے کے ماحول کو سمجھنے کے لیے، ہمیں پہلے یہ دیکھنا ہوگا کہ روایتی روبوٹ ایک نئے مہارت کو کیسے سیکھتے ہیں۔
روایتی پائپ لائن میں، روبوٹ سیکھنا اصل میں بڑے ماڈل کے قریب ہوتا ہے:
سب سے پہلے بڑے پیمانے پر ڈیٹا پر پیشگی تربیت دی جاتی ہے تاکہ بنیادی صلاحیتیں سیکھی جائیں؛ پھر مخصوص منظر کے لیے، کسی خاص کام کے لیے ڈیٹا جمع کیا جاتا ہے اور بعد کی تربیت کے ذریعے روبوٹ کو مخصوص مہارتیں سکھائی جاتی ہیں۔

صرف اس بات کا مسئلہ ہے کہ روبوٹ اور بڑے ماڈلز کے عمل تقریباً ایک جیسے ہیں، لیکن ڈیٹا کی لاگت بالکل الگ ہے۔
بڑے ماڈلز کے پری ٹریننگ ڈیٹا کا بڑا حصہ انٹرنیٹ سے آتا ہے؛ یہاں تک کہ پروگرامنگ، ایجنٹ جیسے خاص سیناریوز تک میں، بہت سے پوسٹ ٹریننگ ڈیٹا آن لائن تیزی سے حاصل کیے جا سکتے ہیں، یا خودکار طور پر تیار کیے جا سکتے ہیں۔
لیکن روبوٹ کی حالت زیادہ بدتر ہے۔ پری ٹریننگ ڈیٹا کو حقیقی دنیا سے اکٹھا کرنا پڑتا ہے، اور پوسٹ ٹریننگ ڈیٹا بھی حقیقی دنیا سے اکٹھا کرنا پڑتا ہے۔
تو، ٹیکنیکل بلاگ میں، Skild AI نے براہ راست بات شروع کر دی:
اگر ایک روبوٹ بنیادی ماڈل ہر نیا کام سیکھنے کے لیے پھر بھی دہاڑوں یا سوویں گھنٹوں کے حقیقی ڈیٹا کی ضرورت رکھتا ہے اور دوبارہ ٹرین کیا جاتا ہے، تو میں پوچھنا چاہوں گا، اس "بنیادی ماڈل" کی بنیاد کہاں ہے؟
وہ موجودہ تحقیق کا حوالہ دیتے ہوئے کہتے ہیں کہ اگر نئے کام کے لیے کافی ڈیٹا دستیاب ہو، تو صفر سے تربیت دیا گیا ماڈل پیش ٹرینڈ اور فائن ٹیونڈ بنیادی ماڈل کے برابر ہو سکتا ہے۔
تو، جسمانی پیش تربیت کا مقصد کیا ہے؟
اس کے جواب میں اسکیلڈ کہتے ہیں: کنٹیکسٹ لرننگ۔
ایک حوالہ نقطہ کے طور پر، اسکائل نے بڑے ماڈل کے ترقی کے راستے کو موازنہ کے لیے استعمال کیا۔
اولی BERT بہت طاقتور تھی، لیکن ہر نئے کام کے لیے عام طور پر ڈیٹا کو دوبارہ تیار کرنا پڑتا تھا اور دوبارہ فائن ٹیون کرنا پڑتا تھا۔
جس نے حقیقی طور پر کھیل بدل دیا، وہ بعد میں GPT-3 کے بعد ظاہر ہونے والی سیاق و سباق سیکھنے کی صلاحیت تھی:
مڈل کے وزن کو تبدیل نہیں کرنا، صرف پرومپٹ میں کچھ مثالیں دیں، مڈل ایک نیا کام عارضی طور پر “سیکھ” سکتا ہے۔

اس کے مطابق، اسکلڈ کا خیال ہے کہ روبوٹ اب بھی BERT کے جیسے دور میں پھنسے ہوئے ہیں، اور وہ درحقیقت چاہتے ہیں کہ روبوٹ بھی ایک ہی طرح کا پیرادائم تبدیل کریں۔
یعنی، پری ٹریننگ کا اصلی فائدہ صرف اس بات کے لیے نہیں ہونا چاہیے کہ بعد کی ٹریننگ کے لیے کم ڈیٹا کی ضرورت ہو، بلکہ اس بات کے لیے ہونا چاہیے کہ روبوٹ کو آخرکار "حوالہ کے مطابق براہ راست سیکھنے" کی صلاحیت حاصل ہو۔
کنٹیکسٹ لرننگ
تو، S1 اس بار متن سے کیا سیکھا؟
اسکائل کا خیال ہے کہ روبوٹ کی سیکھنے کی صلاحیت کا اصلی امتحان صرف دو پہلوؤں میں ہے:
ایک یہ ہے کہ کیا وہ تربیت کے دوران کبھی نہ دیکھے گئے نئے مہارتوں کو سیکھ سکتا ہے؛ دوسرا یہ ہے کہ کیا وہ موجودہ مہارتوں کو دوبارہ منظم کرکے ایک لمبا اور بہت پیچیدہ نیا کام مکمل کر سکتا ہے۔
مثلاً، روبوٹ کو صرف ایک پینکیک پلٹنے کا ویڈیو دیکھ کر پینکیک بنانے کا طریقہ سیکھنا پڑتا ہے—
اگرچہ یہ مہارت پہلے کبھی اس کے تربیتی ڈیٹا میں نہیں آئی تھی۔
اسی دوران، جبکہ گن-1.5 نے پچھلے ہفتے سیکنڈ کے ویڈیوز دکھائے تھے، اس بار S1 نے سیکھنے کے ماحول کو لاکھوں منٹ تک بڑھا دیا ہے۔
پودوں کو برتن بدلنے جیسے کاموں میں، ہر کام کو لگاتار دہائیوں کے عملی مراحل پورے کرنے کی ضرورت ہوتی ہے۔ ان لمبے مراحل والے کاموں کے نمونوں میں، روبوٹ صرف نقل کرنے کے ساتھ محدود نہیں رہنا چاہیے، بلکہ اسے یہ جاننا ہوگا:
میں اب تک کیا کر چکا ہوں، اگلا قدم کیا ہے، مہارتوں کو کیسے جوڑیں، اور اگر درمیان میں کچھ بگڑ جائے تو کیا کریں۔
یعنی روبوٹ کو ویڈیو ڈیمو میں کام اور اقدامات کے مقصد کو سمجھنا ہوگا، صرف روایتی نقل کرنے کے بجائے صورتحال کے مطابق جواب دینا ہوگا۔
اس کے علاوہ، پودوں کو برتن بدلنے کے کام میں، ڈیمو شروع کرنے سے لے کر روبوٹ کے خود کار طور پر کام شروع کرنے تک صرف 11 منٹ لگے، جس سے روایتی بعد کی تربیت کو صرف کارکردگی کے لحاظ سے پیچھے چھوڑ دیا گیا۔
آخر میں، پورے عمل کے دوران، S1 نے فائن ٹیوننگ نہیں کی اور نہ ہی پوسٹ ٹریننگ کی، مدل وزن مکمل طور پر غیر تبدیل رہے، ایک ہی سیٹ کے وزن کا استعمال کرتے ہوئے بلاگ میں دکھائے گئے تمام کاموں کو مکمل کیا گیا۔
بنیادی طور پر، بڑے ماڈلز نے برت سے مخصوص سیناریوز کے لیے فائن ٹیوننگ کی ضرورت کو گٹ پی-3 کے صرف مثالوں کو دیکھ کر OOD ٹاسکس مکمل کرنے تک کی کھچڑی پار کر لی ہے۔
صرف ایک فرق یہ ہے کہ اب پرومپٹ کے طور پر زبان کے بجائے نیچے کے کام کے لیے بہتر طریقے سے مطابقت رکھنے والے ایکشن ویڈیوز استعمال کیے جا رہے ہیں۔

تجربہ: کیا ICL حقیقت میں زیادہ سکیل کر سکتا ہے؟
تجربی حصے میں، اسکیلڈ نے (ٹریننگ ڈیٹا) پر دیکھے گئے اور نہ دیکھے گئے کاموں پر ICL ویڈیو پرامپٹ اور روایتی زبانی پرامپٹ VLA کا موازنہ کیا۔

ٹیسٹ نتائج ظاہر کرتے ہیں کہ جب تربیتی ڈیٹا صرف 1000 گھنٹے ہو، تو زبانی پرامپٹ بہتر کام کرتا ہے، جبکہ ڈیٹا کے سائز میں اضافے کے ساتھ ICL سرکشی شروع کر دیتا ہے۔
100,000 گھنٹوں تک تربیت کے بعد، ICL 96%، زبانی پرامپٹ 89%۔
اصلی اہم OOD کاموں پر: ICL 66%، زبانی پرامپٹ صرف 9%، جس سے 7 گنا سے زیادہ فرق آ گیا۔
S1 کی جامعیت کی تصدیق کے لیے، Skild نے مختلف تجرباتی شرائط میں بھی ٹیسٹ کیا۔

نتائج سے ظاہر ہوتا ہے کہ زبان کے پرامپٹ VLA کی کارکردگی میں کمی، ICL کے تین گنا تک ہو سکتی ہے۔
یعنی ICL نے مخصوص مناظر میں اقدامات کی دہرائی نہیں سیکھی، بلکہ موجودہ ماحول کے مطابق دوبارہ منصوبہ بندی کرنے کا طریقہ سیکھا ہے۔
آخر میں، ون شاٹ لرننگ کے حوالے سے۔
S1 نئے کام پر پوسٹ ٹریننگ کے بغیر صرف ایک ویڈیو ڈیمو دیکھ کر 66% کامیابی حاصل کرتا ہے۔

اس کے مقابلے میں، روایتی VLA کو اسی سطح تک پہنچنے کے لیے تقریباً 380 بار ڈیمو کے بعد ٹریننگ کی ضرورت ہوتی ہے۔
بالکل، 2000 بار ڈیمو کے بعد، روایتی پوسٹ-ٹریننگ کا آخری نتیجہ 86% ہوگا۔
تو نتیجہ شاید “اب روبوٹس کو ٹریننگ کی ضرورت نہیں” نہیں بلکہ یہ ہے:
پہلے ایک نئی مہارت سیکھنے کے لیے سوویں بار تدریس کی ضرورت ہوتی تھی، اب صرف ایک بار دیکھ کر آپ فوراً 60 سے 70 فیصد تک کام کر سکتے ہیں۔
یہ اسکائلڈ کا کہنا ہے کہ ICL سکیلنگ قانون ہے:
زیادہ ڈیٹا کے ساتھ، مدل صرف زیادہ مہارت حاصل نہیں کرتا، بلکہ "ڈیمو سے مہارت سیکھنا" بھی بہتر ہوتا جاتا ہے۔
Skild AI کون ہے؟
اسکیلڈ کو 2023 میں قائم کیا گیا، جس کے پیچھے دو CMU روبوٹکس کے پرانے واقفین: ڈیپک پاتھک اور ابھینوو گپتا ہیں۔

دونوں کارنیگی میلون یونیورسٹی کے روبوٹکس انسٹیٹیوٹ کے پروفیسر ہیں، ڈیپاک کا مرکزی تحقیقی شعبہ روبوٹک سیکھنا، تقویتی سیکھنا اور کمپیوٹر ویژن ہے، جبکہ ابھیناو کمپیوٹر ویژن اور خود نگرانی سیکھنے کے شعبے میں ماہر ہیں۔
2022 میں ہی دونوں نے WHIRL پر کام کیا تھا، جس میں روبوٹس انسانی ویڈیوز دیکھ کر one-shot imitation کرتے تھے، جس سے واضح ہوتا ہے کہ S1 کا یہ راستہ اچانک پتھر کے درمیان سے نکلا نہیں تھا۔

شمالی امریکا کے جسمانی دائرے کی ایک ستارہ کمپنی کے طور پر، 2024 میں Skild نے اپنے پوشیدہ موڈ سے باہر نکلتے ہی 3 ارب ڈالر کا A سیریز فنڈنگ اور 15 ارب ڈالر کی منظوری حاصل کی؛
اس سال جنوری تک، 14 ارب امریکی ڈالر کی سی فنڈنگ مکمل ہو گئی، جس سے اس کی قیمت 140 ارب امریکی ڈالر سے زیادہ ہو گئی، جس میں سافٹ بینک نے قیادت کی اور نوویدیا، بیسوس جیسے افراد نے بھی اپنا سرمایہ جاری رکھا۔ دو سال سے زیادہ کے دوران، اس کی قیمت تقریباً دس گناہ ہو گئی۔
افقی تقابل کے لحاظ سے، اسکائلڈ کی شمالی امریکی ایمبڈڈ کمیونٹی میں حیثیت بھی کافی خاص ہے۔
PI کے مقابلے میں زیادہ تر "روبوٹ GPT" کی طرح ہے، جنرلسٹ حالیہ طور پر ون شاٹ لرنر، اور Genesis AI، سنڈے کی حالیہ مکمل اسٹیک مومنٹ پر زور دے رہا ہے، جبکہ سکلڈ ہمیشہ ایک جملہ پر زور دیتا رہا ہے: کوئی بھی روبوٹ، کوئی بھی کام، ایک دماغ۔
یہ کراس ایمبودیمنٹ پر زیادہ زور دیتا ہے، اور یہ چاہتا ہے کہ ایک ہی Skild Brain میکنیکل آرم، چار پاؤں والے، انسانی شکل جیسے مختلف جسموں پر چلے۔
سادہ الفاظ میں، یہ روبوٹ کے دور کا اینڈرائیڈ بننا چاہتے ہیں: ایک اسمارٹ لیئر جو مختلف جسموں میں ڈالی جائے۔
اس سے اس کا فیصلہ ہوتا ہے کہ اسکلڈ کی ڈیٹا حکمت عملی: سب کچھ۔
اسکیلڈ روبوٹ ڈیٹا کو ہارڈ ویئر پراکسیمٹی، ڈائورسٹی اور اسکیلیبیلٹی کے تین ابعاد کے طور پر دیکھتا ہے:
حقیقی ڈیوائس کنٹرول ہارڈویئر کے سب سے قریب ہے، لیکن مہنگا ہے؛ فرسٹ پرسپیکٹیو انسانی ویڈیوز کو سکیل کرنا آسان ہے، لیکن روبوٹ کے جسم سے بہت دور ہے؛ محاکہ سستا ہے اور تیزی سے تیار کیا جا سکتا ہے، لیکن اس میں sim-to-real فرق ہے۔

تو وہ روبوٹ ٹیلیاپ، UMI، ایگوسنٹرک ویڈیو، اور سیمولیشن کے لیے بنیادی طور پر سب کا استعمال کرنے کا طریقہ اپنا رہے ہیں۔
اور S1 کا ICL، اصل میں اس راستے کا قدرتی امتداد ہے:

2025ء کا ستمبر LocoFormer → 2026ء کا فروری پہلا In-Domain ICL → مئی میں پہلی بار فلپ کیا گیا → اگست میں S1 جاری، جس نے فوری طور پر سیکھنے کے لیے مختصر ترین 10 منٹ کے OOD لمبے کام تک سیاق و سباق کو بڑھا دیا۔
تو اب سچ مچ توجہ دینے والی بات یہ ہو سکتی ہے کہ روبوٹ اب مزید مہارتیں سیکھنے کے قابل نہیں رہ گئے، بلکہ:
ایک روبوٹ کو ایک نیا مہارت سیکھنے کی لاگت کو کیا حقیقت میں “سینکڑوں بار سکھانا” سے “آپ ایک بار کرتے ہیں، اور یہ ایک بار دیکھتا ہے” میں تبدیل کیا جا سکتا ہے؟
اگر یہ سکیلنگ قانون مزید لاگو رہا، تو روبوٹس کا GPT مومنٹ واقعی صرف ایک اور مارکیٹنگ گیم نہیں ہو سکتا۔
حوالہ جات: [1]https://www.skild.ai/blogs/s1
یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: henry
