ہواوی نوح کی کیفہ لیب نے متعدد اسٹریٹجی روبوٹ کو آرڈینیٹ کرنے کے لیے روبوہارنس سسٹم لانچ کیا ہے

iconMetaEra
بانٹیں
AI summary iconخلاصہ
ہواوی نوح کی کوسٹ کے لیب نے روبوہارنیس سسٹم کا اعلان کیا، جو لمبے عرصے تک کے کاموں کے لیے VLA، WAM، RL اور TAMP جیسے متعدد حکمت عملیوں کو موزوں کرنے کے لیے ڈیزائن کیا گیا ہے۔ یہ سسٹم سمجھ، یادداشت اور ترقی کو ملا کر بنایا گیا ہے، جس میں ایک میموری برج ماڈیول ہے جو حکمت عملیوں کے درمیان منتقلی کو بہتر بناتا ہے۔ تجربات نے 86% کامیابی کے شرح ظاہر کی۔ جبکہ TA برائے کرپٹو کا رجحان بڑھ رہا ہے، اس طرح کے ابتدائی اقدامات کرپٹو حکمت عملیوں میں قدرتی سرمایہ کاری پر اثر ڈال سکتے ہیں۔
ہواوی نوآ کیبین لیب نے RoboHarness سسٹم جاری کیا، جو Coding Agent کے ذریعے VLA، WAM، RL، TAMP جیسے مختلف اسٹریٹجیز کو کوآرڈینیٹ کرتا ہے اور لمبے سلسلہ وار کاموں کو زیرو شاٹ پر مکمل کرتا ہے۔ یہ سسٹم تین قسم کے مہارتیں شامل ہے: سمجھنا، یاد رکھنا، اور ترقی کرنا۔ Memory Bridge ماڈیول پالیسی تبدیلی کے دوران اسٹیٹ ڈسٹری بیشن میچنگ کے مسئلے کو حل کرتا ہے، جس میں تجرباتی کامیابی کا تناسب 86% ہے۔ یہ کام جسمانی ذکاوت کے لیے اکیلے ماڈل سے نظاماتی ترتیب کی طرف ترقی کی نمائندگی کرتا ہے۔

مضمون کا مصنف، ذریعہ: Leifengwang

ایک ایسا کام تصور کریں: دروازہ کھولیں، اندر چھپے ہوئے بلاکس تلاش کریں، اور انہیں ایک پل کے طور پر تعمیر کریں۔

انسان کے لیے یہ ایک بہت آسان بات ہے، کچھ حرکات آسانی سے جُڑ جاتی ہیں، اور اسے اسکول کے بچے بھی آسانی سے کر سکتے ہیں۔

لیکن روبوٹ کے لیے، یہ کام مختلف مکمل طور پر الگ الگ صلاحیتوں کو شامل کرتا ہے: بلاک تلاش کرنا، جس میں بصری سمجھ اور زبانی ہدایات کی پابندی درکار ہوتی ہے؛ دروازہ کھولنا، جس میں ماحول کے ساتھ پیچیدہ تعامل درکار ہوتا ہے؛ اور بلاکوں کو اکٹھا کرنا، جس میں جیومیٹرک منصوبہ بندی، درست چال چلن اور ماحول کے تبدیل ہونے کا اندازہ لگانا درکار ہوتا ہے۔

مزید مشکل یہ ہے کہ یہ صلاحیتیں متعدد مختلف "سکولوں" کے ماڈلز سے تعلق رکھتی ہیں — VLA (ویژن-لینگویج-ایکشن ماڈل)، WAM (ورلڈ-ایکشن ماڈل)، RL پالیسیز (رینفورسمنٹ لرننگ)، اور TAMP (ٹاسک اینڈ موشن پلاننگ)۔ ان کی اپنی اپنی طاقتیں ہیں، لیکن وہ آپس میں الگ الگ ہیں، ان کے ٹریننگ طریقے، ان پٹ فارمیٹس، اور اسٹیٹ اسپیس بھی مختلف ہیں۔

آج کے روبوٹکس کے شعبے میں صلاحیتیں کم نہیں، لیکن تعاون کی کمی ہے۔

ہواوی نوآ کیبین لیب نے حال ہی میں ایک تحقیقی مقالہ جاری کیا ہے جس میں روبو ہارنیس نامی ایک سسٹم پیش کیا گیا ہے جو مختلف حکمت عملیوں کے درمیان تعاون کے مسئلے کو حل کرتا ہے۔ اس کام کے حوالے سے، مقالے کے مصنفین نے ہم (لیفینگ وین) کے ساتھ بات چیت کی۔

ایجینٹ مخصوص دنیا کی طرف بڑھ رہا ہے: زبانی ذہانت سے روبوٹ کے "دماغ کے کمانڈر" تک

کاغذ: https://arxiv.org/abs/2607.18060

پروجیکٹ کی ویب سائٹ: https://www.robo-harness.com/

01 ونیورسل ماڈل کے خیال اور حقیقت کے درمیان فرق

اس گرمی کے موسم میں، ہارنس کے ارد گرد کئی تحقیقی کام آئے، جن سے ایک سمجھ سامنے آئی کہ بڑے ماڈلز کے ذریعے سب کچھ حل کرنا ابھی ممکن نہیں، روبوٹس کو ایک اجرائی تنظیمی نظام کی ضرورت ہے۔

چنگہوا یونیورسٹی کے پروفیسر یو چیان کی ٹیم نے جولائی میں Harness VLA جاری کیا، جس نے ڈیجیٹل انٹیلی جنس میں وسیع پیمانے پر استعمال ہونے والے Harness Layer کو جسمانی انٹیلی جنس میں شامل کیا، جس سے ایک فریزڈ VLA اپنے سب سے زیادہ مہارت والے مواصلاتی کنٹرول پر توجہ مرکوز کر سکے، جبکہ ایک Harness لیئر سیکھتا ہے کہ کب، کس طرح اسے فعال کیا جائے، اور VLA کے ناکام ہونے کے بعد اسے کیسے ری سیٹ اور دوبارہ کوشش کی جائے۔ LIBERO-Pro اضطراب ٹیسٹ میں، اس سسٹم نے کامیابی کی شرح 50% سے بڑھا کر 82.4% کر دی۔

فکر کے لحاظ سے، Harness VLA اس بات کو حل کرتا ہے کہ ایک ماڈل کیسے باہر کی تبدیلیوں کے تحت مستقل طور پر کام کرے۔ اس کا مسئلہ ایک ایکل راستے کی مستقلیت ہے۔

ہواوی نوی فان زھو لیب کا روبو ہارنیس، ایک اور سطح کے مسائل کا سامنا کر رہا ہے: جب کوئی کام کسی بھی ماڈل کی صلاحیت کے حد سے باہر چلا جائے، تو کیا کیا جائے؟

دونوں کو ہارنیس کہا جاتا ہے، اور دونوں کو تنظیمی سطح پر کوڈنگ ایجینٹ استعمال ہوتا ہے، لیکن وہ مختلف ابعاد کے چیلنجز کو حل کرتے ہیں۔ پہلا ایک ماہر کو زیادہ مستحکم بناتا ہے، جبکہ دوسرا مختلف مہارت رکھنے والے ماہرین کو مل کر کام کرنے کی سہولت فراہم کرتا ہے۔ جیسے جیسے روبوٹ کے امور کی پیچیدگی بڑھتی جا رہی ہے، اس دوسرے مسئلے کو نظرانداز کرنا ناممکن ہوتا جا رہا ہے۔

اس سوال کی جڑ، مختلف ماڈلز کی صلاحیتوں کی حدود سے شروع ہوتی ہے۔

VLA ماڈل کی ترجیح ایک کھلی زبانی ہدایات کو سمجھنا اور نئے ماحول میں جنرلائز کرنا ہے، لیکن اس کا ایک ساتھ ایکشن جنریٹ کرنا لمبے وقت کے کاموں میں مسلسل رہنے میں مشکل ہوتا ہے؛ ری انفورسمنٹ لرننگ کی حکمت عملی خاص تربیتی مناظر میں مستحکم سرکلر سلوک حاصل کر سکتی ہے، لیکن یہ مستحکمی تربیت کے ڈیٹا کے تقسیم پر منحصر ہے، اور ماحول میں چھوٹا سا تبدیلی ہو تو یہ ناکام ہو سکتی ہے؛ TAMP علامتی استدلال اور جیومیٹرک پابندیوں میں ماہر ہے، لیکن اسے پہلے سے ایکشن پرimitives کو تعریف کرنے کی ضرورت ہوتی ہے، اور کھلے مناظر اور ابہامی مقاصد کے سامنے پلانر جلد ہی پریشان ہو جاتا ہے؛ WAM مستقبل کی حالت کا پیش گوئی کر کے لمبے وقت کے فیصلوں میں مدد کر سکتا ہے، لیکن پیش گوئی کے دوران میں غلطیاں جمع ہونے کا خطرہ ہوتا ہے۔

پیچیدہ حقیقی کاموں کو одноٹیک سمجھ، جیومیٹرک منصوبہ بندی، بند لوپ کنٹرول، لمبے وقت کی استدلال اور ماحولیاتی تبدیلیوں کا اندازہ لگانا درکار ہوتا ہے، جن کے تربیتی مقاصد مختلف ہوتے ہیں اور کبھی کبھی آپس میں متصادم بھی ہوتے ہیں۔ ان صلاحیتوں میں الگ الگ کامیابی حاصل کرنے سے لے کر ایک واحد ماڈل کے ذریعے کھلے ماحول میں طویل عرصے تک تمام صلاحیتوں کو مستقل طور پر برقرار رکھنے تک، اب تک اصل میں عبور نہیں کیا گیا ایک وسیع خلائی فاصلہ موجود ہے۔

روبوہارنیس کا بنیادی خیال یہ ہے کہ اس خلأ کو بھرنے کا انتظار کرنے کے بجائے، موجودہ اور مختلف طرح کے ماڈلز کو حقیقی طور پر مل کر کام کرنے دیا جائے۔ مصنف کا خیال ہے کہ جب تک ایک ماڈل دیگر تمام ماڈلز کو مکمل طور پر دبانے اور مطلق حکمرانی کا مظاہرہ نہیں کرتا، تب تک ایسی ترتیب کا نظام بہت مفید ہے۔

یہ کام کسی بھی طرح سے خالی سے نہیں آیا۔ مصنف (LeiFeng.com) کے مطابق، RoboHarness کا ابتدائی رūp گزشتہ سال عالمی روبوٹک چیلنج BEHAVIOR Challenge میں شرکت کے تجربے سے پیدا ہوا۔ اس وقت، چیلنج کا کام لمبا اور مشکل تھا، اور ٹیم نے پایا کہ یا تو VLA کو اندرا سے اندرا تربیت دینا یا بھی اس طرح کے ماڈل جیسے بیہیوئر کلوننگ، کام کی مشکل کو پورا نہیں کر سکتے تھے۔ اس ناکامی نے ٹیم کو اصل مسئلے کو سمجھنے میں مدد کی۔

02 سکیولنگ براین کیسے فیصلہ کرتا ہے کہ کون کھیلے

روبوہارنیس کا مرکزی خیال یہ ہے کہ VLA، WAM، RL اسٹریٹجیز، TAMP جیسے الگ الگ ترقی یافتہ کنٹرول سسٹمز کو ایک یکجا شیڈولنگ کے قابل اجینٹک اسکلز میں محفوظ کیا جائے، جس کی بالا فہمی Coding Agent ذمہ دار ہو۔

اس ڈیزائن کا ایک اہم افتراض یہ ہے کہ کوئی بھی بنیادی حکمت عملی تبدیل یا دوبارہ تربیت نہیں کی جائے گی۔ تمام حکمت عملیاں اپنے اصل ایمپلیمنٹیشن کو برقرار رکھتی ہیں، مدل سٹرکچر، ایکشن سپیس یا تربیتی ڈیٹا کو شیئر نہیں کرتیں۔ RoboHarness صرف ان کے اوپر ایک تنظیمی صلاحیت شامل کرتا ہے۔

سٹریجی کا صحیح انتخاب آسان نہیں ہے۔

ایک کوڈنگ ایجینٹ کے لیے، صرف اصل تصویر کے انپٹ کے ساتھ، یہ فیصلہ کرنا کہ یہ کام کس کو سونپنا چاہیے، بہت مشکل ہے۔ کیونکہ اس فیصلے کے پیچھے بہت سے ایسے مقداری سوالات چھپے ہوئے ہیں جن کا جواب لینگویج ماڈل کی سیمانٹک سمجھ سے نہیں دیا جا سکتا۔ یہ ایک گلاس کو پلیٹ پر رکھنے کو سمجھ سکتا ہے، لیکن RGB تصویر سے موجودہ منظر کی کسی اسٹریٹجی کے ٹریننگ ڈسٹریبیوشن کے ساتھ مماثلت کا حساب نہیں لگا سکتا، اور نہ ہی اس وقت سینسر ڈیٹا کی قابلیت کا جائزہ لے سکتا ہے۔

اس مسئلے کو حل کرنے کے لیے، سسٹم نے تین قسم کی مددگار مہارتیں ڈیزائن کیں جو Coding Agent کے لیے فیصلہ لینے کے لیے ضروری معلومات کو الگ کرتی ہیں۔

ایجینٹ مخصوص دنیا کی طرف بڑھ رہا ہے: زبانی ذہانت سے روبوٹ کے "دماغ کے کمانڈر" تک

سکلز کو سمجھنا، اصل ان پٹ کو قابلِ قیاس سگنلز میں تبدیل کرنے کی ذمہ داری ہے، جیسے: تصویری ایم بیڈنگ اور مختلف اسٹریٹجیز کے ٹریننگ ڈیٹا کی شبہت، وقتی ونڈو کے اندر جسم کی پوزیشن کی استحکام، اور موجودہ روشنی اور تصویر کی معیار کیا مطلوبہ سطح پر ہے وغیرہ۔ یہ اشارے اسٹریٹجی راؤٹنگ کے حقیقی بنیاد ہیں۔ مصنف کا خیال ہے کہ اس ماڈول کا اصل مقصد، ہر اسٹریٹجی کو مختلف پہلوؤں سے یہ جانچنا ہے کہ وہ موجودہ کام کے لیے درست ہے یا نہیں۔

میموری سکلز، تاریخی اجرائی تجربات کو ریٹریو کرتا ہے تاکہ اسٹریٹجی کے انتخاب کے لیے حوالہ فراہم کیا جا سکے، اور Memory Bridge کے ذریعے اسٹریٹجیز کے درمیان اسٹیٹ ڈسٹریبیوشن کے عدم مطابقت کو حل کرتا ہے—یہ سسٹم کا سب سے اہم ڈیزائن ہے، جس کا تفصیلی جائزہ مندرجہ ذیل میں دیا جائے گا۔

ایولوشن اسکلز، آن لائن فیڈ بیک کا استعمال کرتے ہوئے حکمت عملی کے میٹا ڈیٹا اور آرگنائزیشن لاجک کو مستقل طور پر اپ ڈیٹ کرتا ہے، تاکہ سسٹم ہر نئی صورتحال کے لیے صفر سے فیصلہ نہ کرے بلکہ ہر اجراء سے سیکھے۔

تین قسم کے مہارتوں کی معلومات کا ایک دوسرے کے ساتھ تعامل ہوتا ہے اور یہ کوڈنگ ایجینٹ کے فیصلوں میں مدد کرتا ہے۔ عملی طور پر، اس نظام کے دو اہم کردار ہیں: ایک تو ٹاسک کو چھوٹے چھوٹے ذیلی ٹاسکس میں تقسیم کرنا، جو مختلف حکمت عملیوں کے لیے مناسب ہوں؛ اور دوسرا، جب موجودہ حکمت عملی اپنی صلاحیتوں کے حد تک پہنچ جائے، تو نظام فوراً زیادہ مناسب حکمت عملی پر منتقل ہو جاتا ہے، جس سے مختلف حکمت عملیوں کی صلاحیتوں میں مکملیت پیدا ہوتی ہے۔

ایک سیٹ کے مختصر تجربات نے دونوں لیئرز کے اپنے اپنے حصوں کو واضح کیا: صرف زبانی ماڈل کا استعمال کرکے pi0.5 کو ٹاسک ڈیکومپوز کرکے واپس بھیجنا، کامیابی کی شرح کو واضح طور پر بڑھا دیا؛ اس کے بعد متعدد غیر ہم جنس اسٹریٹجیز کو جوڑنے سے کامیابی کی شرح مزید بڑھ گئی۔ صحیح طریقے سے ڈیکومپوز کرنا پہلا مرحلہ ہے، اور درست طریقے سے تقسیم کرنا دوسرا مرحلہ ہے، دونوں ایک دوسرے کے بغیر نا ممکن ہیں۔

لیکن ایک تیسرا سوال بھی ہے، جو سب سے مشکل ہے، اور صرف اسٹریٹجی کا انتخاب کرکے اس کا حل نہیں نکالا جا سکتا۔

03 ریلے دوڑ کی فتح کا فیصلہ تبدیلی کے لمحے میں ہوتا ہے

دو الگ الگ تربیت یافتہ اسٹریٹجیز، عام طور پر اپنی اپنی ڈیٹا کی دنیا میں رہتی ہیں۔ ان کے ان پٹ فارمیٹ مختلف ہیں اور روبوٹ کی حالت کے تجرباتی تقسیم بھی مختلف ہیں۔ TAMP کے عمل کے ختم ہونے کے بعد جہاں روکا جاتا ہے، وہ جگہ اکثر ایسی حالت کے اندر پڑتی ہے جہاں VLA نے کبھی کام نہیں کیا اور جسے مستقل طور پر شروع نہیں کیا جا سکتا۔

یہ الگ الگ اسٹریٹجی آرکیٹیکچر کا منفرد مسئلہ ہے۔

اس لیے، دو اسٹریٹجیز کے مسلسل منتقل ہونے کے لیے ذمہ دار Memory Bridge کو مصنف نے RoboHarness کا سب سے اہم ماڈیول قرار دیا۔ وہ تسلیم کرتا ہے کہ اگر مستقبل میں کوئی عام ماڈل تمام اسٹیٹ اسپیس کو مکمل طور پر کور کر سکے، تو Memory Bridge شاید ضروری نہ ہو؛ لیکن موجودہ حالت میں، کوئی بھی ماڈل منتقلی کے لمحے میں آسانی سے اپنی صلاحیتوں کے دائرے سے باہر چلا جاتا ہے۔

ایجینٹ مخصوص دنیا کی طرف بڑھ رہا ہے: زبانی ذہانت سے روبوٹ کے "دماغ کے کمانڈر" تک

میموری برج کا کام تین مراحل پر مشتمل ہے۔

دریافت: اگلے ذیلی کام اور موجودہ مشاہدے کے مطابق، ٹیکسٹ اور ویژول شبہت کے ذریعے متعدد ماڈل یادداشت سے مقصدی حکمت عملی کی پہلے کامیابی سے انجام دی گئی Top-K مشابہ ٹریجکٹریز دریافت کریں، روبوٹ کی حالت جیسے آخری ایکٹویٹر کی پوزیشن اور جوائنٹ کے زاویے استخراج کریں۔

ماڈلنگ: ہر حالت کے ٹریکٹر میں نسبتی پیش رفت کے مطابق سپروائزڈ سگنل دیا جاتا ہے، اور آن لائن ریگریشن کے ذریعے مقصدی حکمت عملی کے "عام طور پر قبول کیا جانے والا" حالت کا دائرہ عملی طور پر فٹ کیا جاتا ہے۔

بریج: امکانی حالت کا نمونہ لیں اور اس کا جائزہ لیں، جس میں مقصدی حکمت عملی کے آرام دہ علاقے میں داخل ہونے کی اعتماد اور حرکت کی لاگت دونوں کو مدنظر رکھا جائے، سب سے مناسب بریج ہدف منتخب کریں اور انتقالی راستہ تخلیق کریں؛ جب روبوٹ اس حالت تک پہنچ جائے تو کنٹرول اگلی حکمت عملی کو منتقل کر دیا جائے۔

یہ مکانزم مکمل طور پر تاریخی انجام کے ڈیٹا پر آن لائن سیکھنے پر منحصر ہے، کسی بھی اسٹریٹجی کے لیے پلگ اینڈ پلے ہے، بنیادی عمل میں تبدیلی کی ضرورت نہیں اور کوئی مشترکہ تربیت بھی ضروری نہیں۔

ابلاٹیشن تجربات میں، میموری برج کو ختم کرنے کے بعد، ٹاسک پیش رفت میں کافی کمی نہیں آئی، جس سے پتہ چلتا ہے کہ اسٹریٹجی کا انتخاب اب بھی بنیادی طور پر درست ہے، لیکن مکمل کامیابی کی شرح 86.0% سے گھٹ کر 60.4% ہو گئی۔ بہت سارے ٹاسک آخری مرحلے تک پہنچ گئے، لیکن اسٹیٹس کے ناہماهنگ ہونے کی وجہ سے ناکام ہو گئے، جس سے میموری برج کی اہمیت کی تصدیق ہوتی ہے۔

04 دو ٹیکنیکل سلسلہ جات، ایک خاموشی سے ہونے والی ادغام

اس مقالے سے نظر کو دور کرتے ہوئے، ہم ایک بڑی جسمانی ٹیکنالوجی کی تصویر بیان کرنا چاہتے ہیں۔

روبوہارنیس کے مصنف نے نوٹ کیا کہ گزشتہ تین سالوں میں VLA کے تیزی سے ترقی کے پیش نظر، روایتی TAMP اور ہائیرارکیل پلاننگ کی کھلے ماحول میں جامع صلاحیتیں ایکڑو اینڈ اینڈ VLA کے مقابلے میں کافی کم تھیں، جس کی وجہ سے انہیں برادری کی توجہ سے ہٹا دیا گیا۔ تاہم، اس سال ایجنٹک سسٹمز اور کوڈنگ ایجنٹس کی تیز رفتار پیش رفت کے ساتھ، ہائیرارکیل اسٹرکچر نے نئی زندگی حاصل کی ہے: اعلیٰ سطح کا ایجنٹ قابل ترکیب مہارت کے ذریعے ٹاسک ڈیکامپوزیشن، ٹولز کا استعمال اور ڈائنامک پلاننگ کر سکتا ہے، جس سے روایتی ہائیرارکیل طریقہ کار کی جامع صلاحیت اور لچکداری میں نمایاں اضافہ ہوتا ہے۔ اس طرح، اکادمک برادری دوبارہ توجہ دے رہی ہے اور مضبوط جامع استدلال کو غیر متجانس نچلے سطح کے اسٹریٹجیز کے ساتھ جوڑنے کا طریقہ تلاش کر رہی ہے۔

اس مضمون کے مصنفین کینیڈا کے مشرقی کئی یونیورسٹیوں اور تحقیقی اداروں سے تعلق رکھتے ہیں۔ مصنف نے نوٹ کیا ہے کہ شمالی امریکہ میں روبوٹکس کی تحقیق میں طویل عرصے سے دو واضح اکادمیک روایات موجود ہیں: امریکہ کے مغربی ساحل، جس میں Stanford، Berkeley وغیرہ شامل ہیں، learning اور scaling پر زیادہ زور دیتے ہیں، جس میں end-to-end learning، ڈیٹا کا حجم اور ماڈل کی جنرلائزیشن پر توجہ دی جاتی ہے؛ جبکہ امریکہ کے شمال مشرقی علاقوں اور کینیڈا، جس میں MIT، ٹورونٹو یونیورسٹی، MILA وغیرہ شامل ہیں، طویل عرصے سے ہیرارکل آرکٹیکچر، سمبولک ریزننگ، منطقی منصوبہ بندی اور سٹرکچرڈ فیصلہ سازی پر زیادہ زور دیتے رہے ہیں۔

روبوہارنیس کے مصنفین، آخری سلسلے کے امتداد پر موجود ہیں۔

جسمانی ذہانت کے صنعتی شعبے میں ٹیکنالوجی کے راستوں کی تقسیم نے واضح نشانات چھوڑے ہیں۔ پچھلے کچھ سالوں میں تیزی سے ترقی کرنے والے ٹیمز نے فاؤنڈیشن ماڈل اسکیلنگ سے لے کر ایجنٹک ہائیرارکی تک کا ٹیکنالوجیکل سپیکٹرم تشکیل دیا ہے: ایک قسم جو جامع جسمانی فاؤنڈیشن ماڈلز، VLA اور ورلڈ ماڈلز پر زور دیتی ہے، جہاں ایک یکسانہ ماڈل، ڈیٹا کے سائز اور ماڈل کی صلاحیتوں کو بڑھا کر عام کرنے کی حدود کو وسعت دی جاتی ہے؛ دوسری قسم جو قابل دوبارہ استعمال کیے جانے والے آپریشنل مہارتوں اور ہائیرارکل آرکٹیکچر پر زور دیتی ہے، جہاں مسائل کو منصوبہ بندی، مہارتوں کو ملا کر اور بنیادی کنٹرول کو مسلسل مطابقت دے کر پیچیدہ کاموں کو مکمل کیا جاتا ہے۔ چین میں زہ یوان جیسے ٹیمز پہلے قسم کے قریب ہیں، جبکہ سو دو ٹیکنالوجیز، ماجک اٹم وغیرہ دوسری قسم کو زیادہ واضح طور پر ظاہر کرتے ہیں؛ overseas، Physical Intelligence کا pi سیریز طویل عرصے تک اسکیلنگ راستے کا نمائندہ رہا ہے، جبکہ Gemini Robotics نے "اعلیٰ استدلال اور منصوبہ بندی + بنیادی مہارت نفاذ" کے ہائیرارکل روایت کو جاری رکھا ہے۔

د цیل میں، اس ٹیکنالوجی کی شاخوں کا تقسیم ایک ساکت مخالفت نہیں بلکہ ترقی کے ساتھ مکمل کرنے والی شکل اختیار کر رہا ہے۔ پچھلے کچھ ماہوں میں، دونوں ٹیکنالوجی کے راستے میں واضح امتزاج نظر آنے لگا ہے۔ مثال کے طور پر، Physical Intelligence نے pi0.7 میں قابو اور مہارت کے مجموعے کو زیادہ مرکزی مقام دیا ہے؛ جبکہ NVIDIA جیسی ٹیمیں بھی تدریجی طور پر robot agentic systems کو متعارف کرائی ہیں جن میں بنیادی ماڈل کی سمجھ اور استدلال کی صلاحیتیں VLA کے ساتھ جوڑی گئی ہیں۔ مجموعی طور پر، foundation model scaling اور agentic hierarchy اب ایک دوسرے سے نسبتاً الگ ٹیکنالوجی کے راستوں سے گزرتے ہوئے، ایک ہی روبوٹ سسٹم میں مکمل کرنے والی صلاحیتیں بن رہے ہیں۔

05 منظم کرکے زیادہ عام ذکاوت کی طرف بڑھیں

روبوہارنیس کے خود میں واضح حدود ہیں: یہ صرف موجودہ اسٹریٹجیز کو شیڈول کر سکتا ہے، تمام اسٹریٹجیز جو نہیں کر سکتیں وہ کچھ بھی نہیں کر سکتا۔ میموری برج کی قابلیت کا انحصار کافی تاریخی اجراء کے ڈیٹا پر ہے، جدید شامل اسٹریٹجیز کے ابتدائی مراحل میں ان کی صلاحیت کا جائزہ لینے میں بڑی عدم یقینیت ہوتی ہے۔

مصنف کا مرکزی دعویٰ یہ نہیں کہ یکسانہ بڑے ماڈل کی ضرورت کو مسترد کیا جائے۔

لکھاری نے زور دیا کہ لمبے وقت کے کاموں کی ترتیب صرف موجودہ صلاحیتوں کا مجموعہ نہیں ہے، بلکہ یہ خود بخود ایسے ڈیٹا کو بھی پیدا کرتی ہے جو اکیلے ماڈل کے لیے حاصل کرنا مشکل ہوتا ہے — یہ ڈیٹا مختلف حکمت عملیوں کے درمیان تبدیلی، جوڑنے، ناکامی سے بحالی اور تعاون کے عمل کو درج کرتا ہے، جو بالکل اگلی نسل کے جامع روبوٹ ماڈلز کی تربیت کا اہم ذریعہ بن سکتا ہے۔ اس خیال کے مطابق، RoboHarness ٹیم مخلوط حکمت عملیوں کی ترتیب اور انجام دہی کے دوران پیدا ہونے والے ڈیٹا کو دوبارہ بنیادی حکمت عملیوں کی تربیت میں استعمال کرنے کا تجربہ کر رہی ہے، جس سے غیر متجانس ترتیب کا انجام دہی کا تجربہ ماڈل کی بنیادی صلاحیتوں کو مزید بہتر بننے میں مدد دے رہا ہے۔

سب سے طاقتور ماڈل کی تلاش سے لے کر مناسب صلاحیتوں کی ترتیب تک، جسمانی ذہانت کی مقابلہ، نظام کے ڈیزائن تک خاموشی سے بڑھ رہا ہے۔ غیر متجانس اسٹریٹجی آرکیٹیکچر اور ایک یکجا بڑا ماڈل، دو مختلف پہاڑی سلسلوں پر چلنے جیسے ہیں، جو دونوں ایک ہی دور کی طرف اشارہ کرتے ہیں: روبوٹس کو زیادہ عام اور زیادہ قابل اعتماد ذہانت فراہم کرنا۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔