2026 کی پہلی نصف سالیہ میں، چین کے AI شعبے میں عالمی ماڈل کے شعبے میں فنڈنگ کا کل مجموعہ تقریباً 90 ارب یوان تھا، جس کی رفتار پانچ گناں سے زیادہ تھی۔مضمون کے مصنف، ذریعہ: Leifengwang

2026 کے پہلے نصف سال میں، چین کے AI دنیا کے پیسے اور لوگ ایک ہی سمت کی طرف بہہ رہے ہیں: ورلڈ مڈل۔
صرف پہلے ست ماہ میں، گھریلو دنیا کے ماڈل کے شعبے میں کل فنڈنگ کا مجموعہ تقریباً 30 ارب یوان تھا، اگر "جسمانی ذہانت + دنیا کا ماڈل" کے فیوژن شعبے کو بھی شامل کر لیا جائے تو یہ رقم 900 ارب سے زائد ہو جاتی ہے۔
گزشتہ سال کے اسی دور کے مقابلے میں فنڈنگ کی رفتار پانچ گنازیادہ ہوگئی۔
ارب ڈالر کا مال، لاکھوں ماہرین، لہروں کی طرح بہہ رہے ہیں۔
ایک ایسا سوال جس سے گزرنا ناگزیر ہے: اتنے زیادہ لوگ اندر آ رہے ہیں، تو ان میں سے کتنے لوگوں نے حقیقت میں سمجھ لیا ہے کہ یہ چیز کیا ہے؟
کاروباری لوگ راستہ تلاش کر رہے ہیں، سرمایہ کار لوگوں کو تلاش کر رہے ہیں، ہیڈ ہنٹرز اداروں کی جانچ کر رہے ہیں، اور بڑی کمپنیوں کے حکمت عملی ڈیپارٹمنٹس یہ تلاش کر رہے ہیں کہ کون زندہ بچے گا۔
عجیب بات یہ ہے کہ سب لوگ ایک ہی سوال پوچھ رہے ہیں: کیا کوئی ایسا ہے جو دنیا کے ماڈل کے بارے میں واضح کر سکے؟
ہاں۔
ہم آج IDE انسٹیٹیوٹ کے چیئر سائنسدان اور شی کی فیچر کے بانی چانگ لی کا گہرا انٹرویو کر رہے ہیں، اور اس بات کو واضح کرنے کے لیے بات کرتے ہیں۔
وہ IEEE Fellow ہیں، جن کے Google Scholar پر 77,000 سے زیادہ حوالہ جات ہیں۔ ان کا DINO سیریز COCO پر 5 ماہ تک ٹاپ پر رہا، اور Grounding DINO اور اس کے بعد کا DINO-X نے گوگل اور میٹا کو پیچھے چھوڑ دیا، جسے لی فیفی ٹیم، نیوڈیا، اور گلیکسی جنرل سمیت کئی عالمی ٹاپ اداروں نے “معیاری” حوالہ کے طور پر استعمال کیا۔
2025 میں، اس نے اپنی ٹیم کے ساتھ IDEA سے اسپن آف کرکے شی چی ویلیو کی بنیاد رکھی، اور انجل راؤنڈ میں ایک ماہ میں تقریباً ایک ارب یوان کا فنڈز حاصل ہوا۔
اس کے پیچھے دو AI بڑے ہستیاں کھڑی ہیں: اکادمیک ماہر جنگ بو (چینی مصنوعی ذہانت کے بنیادی رکن میں سے ایک) اور صنعتی ماہر شن یانگ یانگ ( سابق مائیکروسافٹ عالمی ایگزیکٹو وائس پریزیڈنٹ اور سابق مائیکروسافٹ ایشین ریسرچ انسٹیٹیوٹ کے ڈائریکٹر)۔
لیکن یہ سب اسے تلاش کرنے کاہمارا بنیادی سبب نہیں ہیں۔
ہم اسے اس لیے تلاش کرتے ہیں کہ 2026 میں جب سب لوگ "دنیا کا ماڈل کیا ہے" پر بحث کر رہے ہیں، زانگ لی صرف ایک نایاب شخص ہیں جنہوں نے واضح، قابل عمل، اور کسی بھی مقبول رائے سے مساوی نہیں ہونے والا جواب دیا ہے۔
مایکروسافٹ ریسرچ کے سربراہ ریسرچر سے لے کر IDEA ریسرچ کے شیئر سائنسٹ اور پھر کاروباری شریک تک — اس کا پیشہ ورانہ راستہ کئی بار تبدیل ہوا، لیکن اس کا تحقیقی موضوع کبھی نہیں بدلा: “AI کو اشیاء کو سمجھنا سکھانا”。
دنیا کا ماڈل، جو صرف بیس سالوں سے ایک مسئلہ ہے، فزیکل دنیا میں اہم جواب ہے۔
اگر آپ دنیا کے ماڈل ڈیویلپمنٹ کے شعبے کو دیکھ رہے ہیں، اور سمجھنا چاہتے ہیں کہ کیا یہ حقیقت میں ببل ہے، کون جیتے گا، اور کس قسم کی ٹیم کے ساتھ ساتھ جانے کی قیمت ہے — اس شخص کی بات سننا آپ کے لیے قابلِ قدر ہے۔ کیونکہ، It's totally worth your time۔
یہ مکالمہ کا اصل ریکارڈ ہے، جسے AI ٹیک ریویوز نے اصل معنی کو بروئے کار رکھتے ہوئے ترمیم کی ہے۔
ڈاکٹر چانگ لی، IEEE فیلو، ویشی کے فانڈر اور سی ای او، موجودہ IDEA انسٹی ٹیوٹ کے کمپیوٹر ویژن اور روبوٹکس ریسرچ سینٹر (CVR) کے چیئر سائنسدان، ہانگ کانگ سائنس اینڈ ٹیکنالوجی یونیورسٹی (گوانگزو) کے ایک جوائنٹ پروفیسر، سابق مائیکروسافٹ ایشیا ریسرچ انسٹی ٹیوٹ اور مائیکروسافٹ ہیڈکوارٹرز ریسرچ کے چیف ریسرچر، جنہوں نے کمپیوٹر ویژن سمیت متعدد شعبوں میں 200 سے زائد تحقیقی مقالات شائع کئے ہیں، جن کے Google Scholar پر 77,000 سے زائد حوالہ جات ہیں، H-Index 107 ہے، اور ان کے پاس 60 سے زائد امریکی منظور شدہ پیٹنٹس ہیں۔ بڑے پیمانے پر تصویر شناخت اور ملٹی میڈیا معلومات کے تلاش میں ان کے عظیم الشان اہداف کے باعث وہ IEEE فیلو منتخب ہوئے۔
جسٹیک انٹیلی جنس کا سب سے بڑا رکاوٹ جسم نہیں، بلکہ دماغ ہے
AI ٹیک ریویو: گزشتہ سال سے جسمانی ذہانت کا افراط ہوا ہے، اور ہر روبوٹ کمپنیاں حرکت کے کنٹرول میں ہر دفعہ زیادہ حیرت انگیز ہو رہی ہیں، یو شو کے روبوٹ ماریتھن ٹریک پر دوڑ رہے ہیں، اور زھی یوان کے روبوٹ گھسٹے جا سکتے ہیں۔ لیکن ہم نے دیکھا ہے کہ عملی застосування میں ابھی ایک چھوٹی سی کمی باقی ہے۔ آپ کے خیال میں، جسمانی ذہانت کو حقیقت میں لانے کے لیے ابھی کون سے ضروری چیلنجز کو دور کرنا ہوگا؟
چانگ لی: روبوٹ کو حل کرنے کے لیے دو اہم باتیں ہیں: کامیابی کی شرح اور عام کرنے کی صلاحیت۔ کامیابی کی شرح کا مطلب ہے کہ کوئی کام کتنی قابل اعتماد طریقے سے مکمل ہو رہا ہے؛ عام کرنے کی صلاحیت کا مطلب ہے کہ ایک ہی کام کو ماحول یا جسم بدلنے پر بھی قابل اعتماد طریقے سے مکمل کیا جا سکے۔
چار خاص چیلنجز ہیں:
سب سے پہلا، ایک منفرد سیناریو میں عام کرنے کی صلاحیت کم ہے۔ اب بہت سے ٹیمیں ایک منفرد سیناریو میں کامیابی کی شرح 70 فیصد یا 80 فیصد تک لے جانے میں کامیاب ہو رہی ہیں، جو بڑی کامیابی لگتی ہے۔ لیکن اصل استعمال میں 80 فیصد کا کیا مطلب ہے؟ اس کا مطلب ہے کہ ہر پانچ آپریشنز میں سے ایک ناکام ہوتا ہے، جس کے لیے اب بھی بہت زیادہ انسانی وسائل کی ضرورت ہوتی ہے، اور یہ مکمل طور پر الگ طور پر ڈپلوی نہیں کیا جا سکتا۔
دوسرے، افقی وسعت کے سیناریوز کی عامیانہ صلاحیت کم ہے۔ پہلے ایک نقطہ کی صلاحیت کو اس کی حد تک پہنچانا چاہیے، اور پھر افقی طور پر سیناریوز کے застосування کی وسعت کو بڑھانا چاہیے تاکہ یہ زیادہ پیچیدہ ماحول میں زیادہ اور زیادہ پیچیدہ کام کر سکے۔ یہ روبوٹس کو "لیبارٹری ڈیمو" سے "حقیقی застосування" تک جانے والی بڑی رکاوٹ ہے۔
تیسری بات، "دماغ" کی گہری صلاحیتوں کا فقدان۔ موجودہ گہری سیکھنے کا زیادہ تر توجہ智能 کے "عمل" پر ہے، نہ کہ اس کے "طریقہ کار" (ذہانت کے پیچھے کام کرنے والے اصولوں) پر۔ جسمانی دماغ کو فزیکل دنیا کے لیے حقیقی علیت و معلولی استدلال (صرف احصائی تعلق نہیں، بلکہ "کیونکہ A اس لیے B" کے منطقی سلسلے کو سمجھنا) ضروری ہے، عام مفروضات کو سمجھنا اور خود کو موزوں بنانا، اور ہم اس شعبے میں صرف شروعات کر چکے ہیں۔
چوتھا، یہ ابھی تک "ٹرمنل" لیول کے اطلاقات تک نہیں پہنچا۔ اب تک زیادہ تر روبوٹس بڑے باہری کمپوٹیشنل طاقت پر منحصر ہیں، اور انہیں "آدمی کے ذمہ دار ہونے کی ضرورت نہ ہونا" جیسا بنیادی مسئلہ حل کرنا ہوگا تاکہ انہیں بڑے پیمانے پر استعمال میں لایا جا سکے اور "اطلاقات-ڈیٹا-ترقی" کا ایک صحت مند چکر قائم ہو سکے۔
AI ٹیک ریویو: صاف صاف کہوں تو، صنعت میں اس سوال پر رائے کا تقسیم ہے۔ ہارڈویئر والے ٹیم کا خیال ہے کہ چین کی سپلائی چین کا فائدہ واضح ہے، اس لیے پہلے اصل لاگت کو کم کیا جانا چاہیے؛ جبکہ الگورتھم والے ٹیم کا خیال ہے کہ دماغ ہی وہ جگہ ہے جہاں سب سے بڑی پابندی ہے۔ آپ کی رائے کیا ہے؟
چانگ لی: دماغ زیادہ مشکل ہے، لیکن زیادہ اہم ہے۔
ہارڈویئر کے حوالے سے، چین کی ہارڈویئر کی ترقی پر فخر کیا جا سکتا ہے۔ یو شو اور زھی یوئن جیسی کمپنیاں شبیہہ سازی کے ذریعہ تقویتی سیکھنے (مفتاحی الگورتھمز کو ورچوئل ماحول میں تربیت دے کر انہیں حقیقی روبوٹس پر منتقل کرنا) کے ذریعے حرکت کنٹرول کو بار بار بہتر بن رہی ہیں، موٹرز، ٹرانسمیشن مکینزم جیسے اہم اجزاء پر مستقل طور پر کام کر رہی ہیں، جس سے لاگت اور قابلیت میں بڑا بہتری آئی ہے، اور وہ ایک بہت مضبوط راستہ اپنا رہی ہیں۔ لیکن مارا تھون اور پرفارمنس میں ہارڈویئر کی جو صلاحیت دکھائی دیتی ہے، وہ صرف جانوروں کی بنیادی صلاحیتوں تک محدود ہے—جانوروں کے فطری رد عمل، کودنا، بچنا اور ماحول کے ساتھ تعامل کرنے کی صلاحیت ابھی تک حاصل نہیں ہوئی۔
AI ٹیکنالوجی کا جائزہ: آپ کہتے ہیں کہ "دماغ" زیادہ مشکل ہے، اس کی کیا وجہ ہے؟ کیا ڈیٹا کم ہے، یا ہم اس خودکاری کے بارے میں ابھی بھی بہت کم سمجھتے ہیں؟
چانگ لی: مشکل اس بات میں ہے کہ ہم پیچیدہ مکینزم کو حقیقت میں نہیں سمجھتے۔ انسانی دماغ دیگر جانوروں کے مقابلے میں سب سے زیادہ الگ اور سب سے زیادہ ذہین ہے۔ اب تک تمام گہری سیکھنے کی کامیابیاں صرف دماغ کے ذہنی عمل کے ظاہری پہلوؤں کو دیکھ کر، اور پھر الگورتھمز کے ذریعے انہیں حاصل کرنے کی کوشش سے حاصل ہوئی ہیں۔ AI اصل میں انسانی ذہانت کو نہیں سیکھ رہا، بلکہ انسانی رویے کو سیکھ رہا ہے۔ جیسا کہ استاد چانگ بوفا کہتے ہیں، بڑے زبان ماڈل انسان کی طرح بول سکتے ہیں، لیکن وہ زبان کو انسان کے طریقے سے بالکل مختلف طریقے سے سمجھتے ہیں۔
کیوں دنیا کے ماڈل کو بیس سال تک نظرانداز کیا گیا، اور آج اچانک وہ مقبول ہو گیا؟
AI ٹیکنالوجی کا جائزہ: جسمانی ای آئی کے بڑھتے ہوئے اظہار کے ساتھ، "دنیا کا ماڈل" کا تصور اچانک مقبول ہو گیا۔ لیکن صنعت کے لوگ جانتے ہیں کہ یہ ایک نیا لفظ نہیں ہے، 1990 کی دہائی میں ہی اس بارے میں ماہرین نے بات کی تھی۔ ہم دلچسپی سے سوچ رہے ہیں کہ اس تصور نے کیوں بیس سال تک خاموشی اختیار کی، اور آج اچانک اسے فورٹ کا مرکز بنایا گیا؟
چانگ لی: یہ ایک اچھا سوال ہے۔ عالمی ماڈل نئی تصور نہیں ہے۔ 1990 کی دہائی کے آغاز میں، محققین نے ایجنٹس (ماحول کو محسوس کرنے اور اپنے مقاصد تک پہنچنے کے لیے کارروائی کرنے والے AI سسٹم) کے درمیان تعامل کے لیے ماحول کی مدلنگ کی کوشش کی، تاکہ تقویت سیکھنے کے الگورتھمز کو بہتر بنایا جا سکے، لیکن اس وقت گہری سیکھنے کا ابھی ترقی نہیں ہوئی تھا، اس لیے تصور کے بعد اس کی تصدیق مشکل تھی۔
یہ تصور تقریباً 2018-2019 کے دوران سچ مچ کر ثابت ہوا، جب "World Models" کے نام سے ایک پیپر شائع ہوا اور اسے گیمنگ کے ماحول میں استعمال کیا گیا، کیونکہ گیمنگ ری انفورسمنٹ لرننگ کے لیے بہترین ماحول ہے۔
کچھ سالوں کے بعد تقویتی سیکھنے کی ترقی کے ساتھ، AI نے ویڈیو گیمز میں انسانی کھلاڑیوں کو شکست دے دی۔ اس وقت، تحقیق کاروں نے سوچنا شروع کر دیا کہ کیا AI ایجینٹس کو گیم کے ماحول کے ساتھ مستقل تعامل کے ذریعے خود بخود ایک عالمی ماڈل "سیکھنے" کی اجازت دی جا سکتی ہے، جس میں ماحول کے ترقی کے عمل کو شامل کیا جا سکے؟ یہ خیال 2018 سے 2020 تک مکمل طور پر تصدیق کیا گیا۔
AI ٹیکنالوجی کا جائزہ: تو اس کا آج کے جسمانی ذہن سے کیا تعلق ہے؟ ہم نے سنا کہ لگتا ہے کہ جسمانیت ہی وہ تحریک ہے جس نے دنیا کے ماڈل کو حقیقت میں لایا؟
چانگ لی: اس ربط کو زبانی ماڈل سے شروع کیا جانا چاہیے۔ صنعت نے پہلے VLA (Vision-Language-Action، یعنی بصری-زبانی-عمل ماڈل) بنایا، جس میں روبوٹ تصویر دیکھ کر اگلے اقدام کا تعین کرتا ہے، اور زبانی ماڈل کے نقل کرنے کے طریقہ کار کو استعمال کرتا ہے: زبانی ماڈل اگلے ٹوکن کا پیش گوئی کرتا ہے؛ جسمانی VLA میں روبوٹ موجودہ منظر دیکھ کر اگلا اقدام کیسے کرنا ہے اس کا تعین کرتا ہے۔
لیکن یہ طریقہ جلد ہی ایک حد تک پہنچ گیا۔ یہ حد صرف ڈیٹا تک محدود نہیں ہے، میں سمجھتا ہوں کہ ڈیٹا صرف ایک پہلو ہے، دوسرا پہلو یہ ہے کہ تقویتی سیکھنے کا استعمال ابھی کافی نہیں ہے۔ میرے پاس ایک تشبیہ ہے: نقل کرکے سیکھنا زبانی ماڈل کو بولنا سکھاتا ہے، جبکہ تقویتی سیکھنا زبانی ماڈل کو درست بولنا سکھاتا ہے۔
روبوٹ کی ذکاوت اور حرکات کی کامیابی کی شرح کو بھی تقویت سیکھنے کی ضرورت ہے۔
لیکن ایجنٹس میں تقویتی سیکھنے کا استعمال دو مہلک رکاوٹوں کا سامنا کرتا ہے: ایک تو ڈیٹا جمع کرنے کی صلاحیت بہت کم ہے، جو زبانی ماڈلز کے مقابلے میں بہت کم ہے، روبوٹ کو حقیقی ماحول میں ہر ایک حرکت کو عملی طور پر انجام دینا پڑتا ہے اور فزیکل ردعمل کا انتظار کرنا پڑتا ہے؛ دوسرا، ناکامی کا خرچ برداشت نہیں کیا جا سکتا، گھنٹی سیکھنے میں ناکام ہو جائیں تو برتن توڑ دیں، خود مختار گاڑیاں حادثوں سے بچنے کے لیے سیکھنے کے لیے کئی حقیقی حادثوں کا تجربہ کر سکتی ہیں۔ یہ زبانی ماڈلز کے ڈیجیٹل دنیا میں کم لاگت والے تجربات سے بالکل مختلف ہے۔
عالمی ماڈل فراہم کردہ ورچوئل ماحول، یہ مسائل کا حل ہے۔ اگر ایک ماڈل یہ پیش بینی کر سکے کہ "اگر میں نے یہ حرکت کی، تو ماحول کیا ہو جائے گا"، تو روبوٹ ورچوئل دنیا میں لاکھوں بار غلطیاں کرنے کے لیے "ذہنی طور پر تجربہ" کر سکتا ہے، جبکہ اصل میں ایک ہزار کٹورے توڑنے کی ضرورت نہیں ہوتی۔
(نوٹ: اس بات کے منطقی سلسلے کو آسانی سے سمجھیں۔ پہلا، روبوٹ کو کوئی کام سیکھنے کے لیے بہت ساری غلطیوں کی ضرورت ہوتی ہے۔ دوسرا، حقیقی دنیا میں غلطیاں کرنا بہت مہنگا اور خطرناک ہوتا ہے۔ تیسرا، عالمی ماڈل روبوٹ کے لیے ایک "وائرچل ٹریننگ فیلڈ" بناتا ہے، جہاں وہ اپنے دماغ میں مختلف اقدامات کے نتائج کا تجزیہ کرتا ہے۔ چوتھا، صرف بہترین حل کو حقیقی دنیا میں لاگو کیا جاتا ہے۔ اسی لیے عالمی ماڈل اس وقت پورے صنعت میں توجہ کا مرکز بن گیا ہے۔)
اگر عمل کو ان پٹ کے طور پر نہیں استعمال کیا جائے، تو اسے دنیا کا ماڈل نہیں کہا جا سکتا
AI ٹیکنالوجی کے جائزہ: اب صنعت میں "دنیا کے ماڈل" کی تعریف کافی گڑبڑ ہے۔ ویڈیو جنریشن کو دنیا کا ماڈل کہا جاتا ہے، 3D اسپیس مڈلنگ کو بھی دنیا کا ماڈل کہا جاتا ہے، اور LeCun کا JEPA (جائنٹ امبدنگ پریڈکٹو آرکیٹیکچر) بھی دنیا کا ماڈل کہلا رہا ہے۔ تو آپ کے خیال میں، ایک ماڈل کو ان چار الفاظ کے قابل بنانے کے لیے کم از کم کیا ہونا چاہیے؟
چانگ لی: میں سمجھتا ہوں کہ عالمی ماڈل میں ضرورت ہے کہ وہ ایکشن کے ساتھ منسلک ہو، یعنی ایکشن کنڈیشنڈ (ایکشن کو ان پٹ کے طور پر لیا جائے، ماڈل کو یہ جواب دینا چاہیے کہ "اگر کوئی ایکشن انجام دیا جائے، ماحول کیا ہو جائے گا؟")۔
ایجینٹ کی اقدامات کی وجہ سے وہ ماحول کے ساتھ تعامل کر سکتا ہے: ایجینٹ کی اقدامات ماحول میں تبدیلی لاتی ہیں، جس کے بعد نیا حالت پیدا ہوتا ہے اور اسے ایجینٹ کو واپس بھیجا جاتا ہے تاکہ اسے بتایا جا سکے کہ اس کا موجودہ اقدام مقصد کی طرف ایک قدم قریب لے گیا ہے یا نہیں۔ یہ ایک مکمل بند حلقة ہے، جہاں ماحول کی ہر حالت کا تبدیل ہونا پچھلے اقدام پر منحصر ہوتا ہے۔
لوگ عام طور پر کہتے ہیں کہ دنیا کا ماڈل زبانی ماڈل کے اگلے ٹوکن پیشگوئی کو اگلے حالت پیشگوئی میں تبدیل کر دیتا ہے، لیکن میرے خیال میں یہ تعریف بہت سخت نہیں ہے اور ایک اہم شرط کم ہے۔ صحیح تفصیل یہ ہونی چاہئے: ایکشن کے تحت اگلی حالت کی پیشگوئی۔ صرف اس صورت میں جب اقدام کا شرط شامل ہو، حالت کی پیشگوئی کا مطلب ہوتا ہے، اور یہی حقیقی طور پر تقویت سیکھنے کی ضرورت کے مطابق دنیا کا ماڈل ہوتا ہے۔
AI ٹیک ریویو: سچ بولوں تو، بہت سے لوگ، جن میں کچھ سرمایہ کار بھی شامل ہیں، BP میں سورا جیسے ویڈیو جنریشن ماڈلز کو بھی دنیا کا ماڈل کہتے ہیں۔ لیکن آپ کے بالکل ابھی دیے گئے معیار کے مطابق، ان میں واضح طور پر حرکت کا ابعاد کم ہے۔ ہم چاہتے ہیں کہ آپ اس مسئلے کو کیسے تحلیل کرتے ہیں؟
چانگ لی: ہم جو دنیا کا ماڈل یہاں بحث کر رہے ہیں، وہ تقویت سیکھنے کے شعبے سے ماخوذ ہے، جس کا مقصد ایجینٹ کو ماحول کے ساتھ زیادہ موثر طریقے سے تعامل کرنے میں مدد فراہم کرنا ہے۔ حالانکہ دنیا کے ماڈل کے بہت سارے заастعوارات ہیں، لیکن جسمانی ذہانت اب تک سب سے واضح اور سب سے قیمتی заاستعوار ہے۔
اس معنی میں، Sora جیسے صرف ویڈیو جنریٹنگ ماڈلز کو دنیا کا ماڈل نہیں کہا جا سکتا۔ بنیادی وجہ یہ ہے کہ یہ “عمل” کا ماڈل نہیں بناتے، یہ بنیادی طور پر ایک متناسب ویڈیو سلسلہ جنریٹ کرتے ہیں، پکسلز کے کیسے تبدیل ہونے کا پیشن گوئی کرتے ہیں، لیکن روبوٹ اور ماحول کے درمیان تفاعل کے عمل کو بالکل نہیں ماڈل کرتے۔ کیا یہ روبوٹس کی مدد میں غیر مباشرة طور پر مدد کر سکتے ہیں؟ ہاں، وہ دنیا کے تبدیل ہونے کے قوانین سیکھ سکتے ہیں، لیکن روبوٹس کو ماحول کے ساتھ بہتر طریقے سے تفاعل کرنے میں مدد کرنا مشکل ہے۔
AI ٹیک ریویو: حالیہ وقت میں بہت مقبول ہونے والا ورلڈ ایکشن ماڈل کیا ہے؟ ہم نے سنا ہے کہ یہ بھی ایکشن کے بارے میں بات کر رہا ہے، کیا یہ ایک اور عالمی ماڈل ہے؟
چانگ لی: WAM بھی تقویت سیکھنے کے معنی میں عالمی ماڈل نہیں ہے۔ یہ مستقبل کے مناظر کے پیکسل لیول کی نگرانی کا استعمال کرتا ہے تاکہ اقدامات کی پیشگوئی میں بہتری لائی جا سکے، اور کچھ کاموں میں اس نے VLA سے بہتر کارکردگی دکھائی ہے۔ تاہم، اس کا ماڈلنگ عمل اثر کے بعد علت کا ہے، یعنی وہ پہلے مستقبل کے مناظر کو جنریٹ کرتا ہے اور پھر اقدامات کو واپس سے متعین کرتا ہے، جس کی وجہ سے یہ تقویت سیکھنے کے لیے استعمال نہیں کیا جا سکتا، اس لیے یہ ہماری بحث میں آنے والے عالمی ماڈل کی تعریف کے مطابق نہیں ہے۔
پکسل پیکس بمقابلہ ایم بیک سپیس پیکس: دونوں طرف اصل میں ایک ہی کام کر رہی ہیں
AI ٹیکنالوجی کے جائزہ: راستوں کے تناظر پر بات کرتے ہوئے، یہ ابھی عالمی ماڈل کے شعبے میں سب سے زیادہ گرم موضوع ہے۔ لیکن اس کی طرف سے اسکریپٹ سائیڈ کی نمائندگی کی جاتی ہے، جبکہ سورا پکسل سائیڈ کی نمائندگی کرتا ہے۔ دونوں راستے ایک دوسرے کے خلاف لگتے ہیں، آپ کیا سوچتے ہیں؟
زہنگ لی: سب سے پہلے، ہمیں یہ دیکھنا چاہیے کہ دونوں راستوں میں مشترکہ خصوصیات ہیں۔
درحقیقت، ابھی لوگ عام طور پر محسوس کر رہے ہیں کہ ان کے درمیان بہت زیادہ تضاد ہے، شاید اس لیے کہ لیکن بہت واضح طور پر اپنے موقف کو مضبوطی سے سنبھال رہے ہیں، کبھی کبھی ایک ماہر اپنے موقف کو باہر یاد رکھانے کے لیے اسے بہت واضح طور پر بیان کرتا ہے۔
لیکن پکسل راستہ بھی اسکریٹ سپیس کی مدد سے کام کرتا ہے۔ اسٹیبل ڈفیوژن، سورا دونوں پہلے تصویر یا ویڈیو کو کم ابعادی رپریزینٹیشن سپیس میں کمپریس کرتے ہیں اور پھر اس پر کام کرتے ہیں۔ اس لیے، رپریزینٹیشن سپیس حقیقی طور پر زیادہ بنیادی مسئلہ ہے۔ دونوں راستوں کا اصل فرق یہ نہیں کہ کیا اسکریٹ سپیس استعمال کرنا چاہیے یا نہیں، بلکہ اسکریٹ سپیس میں داخل ہونے کے بعد کیا برقرار رکھنا چاہیے اور کیا چھوڑنا چاہیے۔
فرق یہ ہے کہ ا隐空间 راستہ روشنی، سایے، اور بُنیادی طور پر فزیکل قوانین سے متاثر نہ ہونے والے پکسل کے تفصیلات کو خارج کرنے کا خواہاں ہے، جس سے ماڈل کو حالت کے تبدیلی کے پیچھے کے زیادہ بنیادی قوانین سیکھنے میں مدد ملتی ہے، لیکن اس کا خطرہ یہ ہے کہ اگر ایک ہزار مختلف تصاویر ایک جیسے رپریزینٹیشن میں مپ ہو جائیں، تو رپریزینٹیشن کا انحطاط ہو جائے گا، جس کا مطلب ہے کہ ماڈل مختلف حالتोں کو الگ کرنے کی صلاحیت کھو دے گا۔ پکسل راستہ ہر چھوٹی تفصیل کو واضح رکھنے کا تقاضا کرتا ہے، جو بنیادی طور پر انسانی آنکھوں کو خوش کرنے کی کوشش ہے، کیونکہ انسان ویژول تفصیلات کے لیے بہت حساس ہوتا ہے۔
AI ٹیکنالوجی کا جائزہ: اب تک کی بات چیت کے بعد ہمارا ایک خیال ہے۔ کیا انسانی دماغ کا استدلال بھی ایک隐空间 میں ہوتا ہے؟ جب آپ آنکھیں بند کرکے کسی حرکت کے نتائج کا تخیل کرتے ہیں، تو کون اپنے دماغ میں ہر پکسل کو الگ الگ رینڈر کرے گا؟
زہنگ لی: ہاں۔ اگر انسانی دماغ میں ایک عالمی ماڈل موجود ہے، تو انسان جب تصور کرتا ہے کہ اس کی حرکت ماحول کو کیسے تبدیل کرے گی، تو وہ اسے پوشیدہ جگہ میں چلاتا ہے، اور دماغ میں پوری تصویر کو پکسل بہ پکسل نہیں گزرتا۔ اس لیے، عالمی ماڈل کے جائزہ کے لیے انسانی آنکھوں کے ذریعہ تصویر کی معیار کا جائزہ لینا کافی نہیں ہے۔ اگر پکسل راستہ عالمی ماڈل بنانا چاہتا ہے، تو اس کا حقیقی مقصد پکسلز کو زیادہ حقیقی بنانا نہیں بلکہ تخلیق کردہ ویڈیو سلسلہ کو فزکس کے لحاظ سے منطقی بنانا ہونا چاہیے۔
(نوٹ: یہ مکالمہ AI دنیا کے ماڈل کے دو راستوں کے درمیان تنازع کے بارے میں ہے۔ سورا کی نمائندگی کرنے والے پکسل فریق صرف واقعی تصویر کو ہی ہدف بناتے ہیں، جس کی وجہ سے اکثر گلاس ہوا میں تیر رہا ہو، اشیاء کا ایک دوسرے میں گھس جانا، یا موم بتی کا بجھنا نہیں پڑنا جیسے فزکس کے اصولوں کے خلاف خرابیاں پیدا ہوتی ہیں؛ جبکہ لیکن اور چانگ لی کا تجویز کردہ اسکریٹ اسپیس فریق پہلے تصویر کو قوانین میں تبدیل کرتا ہے اور پھر اس کا استنباط کرتا ہے، جس سے فزکس کے سبب و نتیجہ کو بہتر سمجھا جاتا ہے۔ چانگ لی کا اہم نوآوری اسکریٹ اسپیس میں "اشیاء کی ساخت" شامل کرنا ہے، جس سے AI پہلے گلاس، میز، اور انسان جیسے الگ الگ اشیاء کو پہچانتا ہے، اور پھر ان کے درمیان ت tươngات کے قوانین سیکھتا ہے، جس سے سورا جیسی وژول خرابیوں سے بچا جاتا ہے اور صرف انتزاعی اسکریٹ اسپیس کے مقابلے میں روبوٹس کو حقیقی دنیا میں رکاوٹوں سے بچنا، اشیاء کو پکڑنا، اور حرکت کا منصوبہ بنانا زیادہ مناسب ہوتا ہے۔)
AI ٹیکنالوجی کا جائزہ: آپ لیکن کے ساتھ ایک ہی ا隐空间 راستہ اپنا رہے ہیں۔ لیکن ہمیں سننا ہے کہ آپ کا انداز اس سے ایک اہم فرق رکھتا ہے، آپ "اشیاء کی ساخت کو شامل کرنے" پر زور دیتے ہیں۔ بنیادی فرق کیا ہے؟
چانگ لی: ہمارا راستہ لی کن کے ساتھ ایک ہی بنیادی اصول پر مبنی ہے: انسانی دماغ فعل-شرطی طور پر ضد واقعاتی استدلال ("اگر میں یہ کروں تو کیا ہوگا؟") کرتا ہے، جس میں خلاصہ نمائش میں استدلال ہوتا ہے، پکسلز میں دوبارہ نہیں۔
لیکن نے پچھلے کچھ سالوں میں I-JEPA، V-JEPA، اور LeJEPA کے ذریعے اس اصول کی تصدیق کی ہے: پیش بینی کو تصوراتی فضا میں ہونا چاہیے۔ لیکن جسمانی سمت کی فزیکل فضا کی پیچیدگی بہت زیادہ ہے، اور ہم سمجھتے ہیں کہ اس طریقہ کو بڑے پیمانے پر حقیقی ماحول میں لاگو کرنے کے لیے، ہمیں پوشیدہ فضا میں ضروری ساخت درج کرنے کی ضرورت ہے۔
یہ نقطہ نظر ہماری تصدیق شدہ صلاحیتوں سے ماخوذ ہے۔ ہماری مرکزی ٹیم کے ذریعہ ترقی دیا گیا DINO-X، کھلے دنیا میں "物体 دیکھنا" کا مسئلہ حل کر چکا ہے۔ اس لیے، اب ہم اشیاء کو عالمی ماڈل کے پیش بینی اور منصوبہ بندی کے بنیادی اکائی بناتے ہیں۔ واضح طور پر، فزکل قوانین اشیاء پر لاگو ہوتے ہیں، اور اگر ہم اسکریپٹ سپیس رپریزینٹیشن کو اشیاء کو سمجھنے کے لیے استعمال کریں، تو فزکل قوانین کو سیکھنا زیادہ موثر ہو جائے گا۔
AI ٹیکنالوجی جائزہ: ایک لمحہ رکیں، ہم ایک سوال پوچھنا چاہتے ہیں۔ لیکن کے AMI Labs نے کئی ارب امریکی ڈالر کی سرمایہ کاری حاصل کی ہے اور یہی سمت پر کام کر رہے ہیں۔ آپ کا “物体 کی ساخت کو شامل کرنا” کا بہتری، اس کے بڑے فریم ورک پر آگے بڑھنے کیلئے کیوں بہتر ہوگا؟
زہنگ لی: کیونکہ ہم نے پہلے DINO-X پر کام کیا تھا، جو ایک کھلا ہوا اشیاء کی تشخیص کا جامع ماڈل ہے، جس نے "اشیاء کو سمجھنا" کا کام عالمی سطح پر سب سے بہتر کیا ہے۔ ہماری بصری ماڈل کے عمل کی سمجھ، اور بصری ماڈل کیوں فزیکل طور پر منطقی نتائج دیتا ہے، وہ سب اصل میں جامع اشیاء کی سمجھ کے راستے کے ساتھ بہت زیادہ مطابقت رکھتے ہیں۔
سادہ الفاظ میں، لیکن کا راستہ بنیادی فریم ورک ہے، اور ہم اس فریم ورک پر اشیاء کی ساخت شامل کرتے ہیں اور اسے حقیقی ماحول میں بند حلقوں میں لاتے ہیں۔ یہ “بند حلقوں” کی صلاحیت، ہماری پچھلے کچھ سالوں کی کامیابی ہے۔
DINO سیریز کیوں گوگل اور میٹا کو دبانے میں کامیاب ہو رہا ہے؟
AI ٹیکنالوجی کے جائزے: آپ کی ٹیم نے ویژل لارج مڈل مرحلے میں بہت اہم کام کیا ہے۔ گراؤنڈنگ DINO اور بعد میں جاری کیا گیا DINO-X نے گوگل اور میٹا کو دبا دیا، جسے لی فیفی ٹیم، نوڈیا، اور گلیکسی جنرل جیسے عالمی سطح کے اداروں نے معیاری طور پر حوالہ دیا ہے۔ ہم نے اس بات پر اندر بحث کی ہے اور سب کو لگتا ہے کہ یہ کچھ "غیر معمولی" ہے: عام طور پر چینی ٹیمیں بیرونی ٹیموں کے پیچھے بھاگتی ہیں، لیکن آپ نے کیسے اس طرح کام کیا کہ بیرونی ٹیمیں آپ کے پیچھے بھاگنے لگیں؟
زہنگ لی: دو ابعاد خاص طور پر نمایاں ہیں۔
پیشگوئی کے لحاظ سے، ہم ویژول ڈومین میں پہلا ٹیم ہیں جس نے ٹرانسفارمر (ایک خود توجہ مبنی گہری سیکھنے کی ساخت، جو بڑی زبان ماڈلز کی بنیاد ہے) کو SOTA (حالت کا بہترین، شعبے کا بہترین) تک پہنچایا ہے۔ گراؤنڈنگ DINO نے زبان ماڈل کے پیشگوئی کو متعارف کرایا اور پہلی بار اوبجیکٹ ڈیٹیکشن کو اوپن ڈومین تک وسعت دی، جس سے ماڈل صرف تربیت یافتہ اوبجیکٹ کیٹیگریز کو پہچانے تک محدود نہیں رہا، بلکہ کبھی نہ دیکھے گئے کسی بھی اوبجیکٹ کو ڈیٹیکٹ کر سکتا ہے۔ اب تک، یہ اوپن سورس ماڈلز میں سب سے زیادہ حوالہ دیا جانے والا اور ڈاؤن لوڈ کیا جانے والا ماڈل ہے، جو ایک پیشگوئی کے لحاظ سے انقلابی کامیابی کہلائی جا سکتی ہے۔
گراؤنڈنگ DINO کے بعد، ہم نے ڈیٹا اور انجینئرنگ کی حکمت عملی پر بند ماڈل کی طرف موڑ لیا اور تصدیق شدہ خیالات کو سکیلنگ کی طرف آگے بڑھایا۔ اس کے ساتھ، میں نے اپنے کام کے معیار کو بہت بلند رکھا۔ حالانکہ اس وقت ٹیم نوجوان تھی اور اتنی طاقتور کام نہیں کیا تھا، لیکن میں نے دروازہ سختی سے بند رکھا اور یہ زور دیا کہ صرف بڑے ورژن کے برابر کا ترقی پذیر نتیجہ ہی جاری کیا جائے۔ اس لیے ہم نے گراؤنڈنگ DINO 1.5 کو جاری کرنے میں تقریباً ایک سال لگایا، اور پھر DINO-X کو جاری کرنے میں ستھرے ماہ لگائے۔ حقیقت یہ ثابت ہوئی کہ اس ایک سال سے زائد کی محنت سے بنائے گئے ورژن کو صنعت نے بہت زیادہ تسلیم کیا۔
AI ٹیکنالوجی جائزہ: آپ نے جو ویژول بڑے ماڈل بنائے ہیں، وہ آج کے ورلڈ ماڈلز سے کیا تعلق رکھتے ہیں؟
چانگ لی: ہمارا کام ایک ہی سلسلہ میں ہے۔ پہلے جسمانی احساس کے لیے، مرکزی مقصد روبوٹس کو احساس کی بنیاد فراہم کرنا تھا، اور بعد میں کئی ٹیمیں اپنے جسمانی ماحول کی سمجھ کے لیے ہمارا Grounding DINO استعمال کرتی ہیں۔
ٹیکنیکل طور پر، ورلڈ ماڈلز زبان کے مقابلے میں ویژوئل نیٹو ہیں، اور تقریباً تمام ورلڈ ماڈلز کا کام GPT جیسی صرف زبانی اسکیم پر مبنی نہیں ہے۔
ٹیم کے تجربے کے حوالے سے، ہم نے ویژول ماڈل کے مکانیات کو سمجھا ہے جو اصل میں عام اشیاء کی سمجھ کے لیے استعمال ہونے والی ٹیکنالوجی کے راستے کے ساتھ بہت زیادہ مطابقت رکھتا ہے۔ یہی وجہ ہے کہ ہم دنیا کے ماڈل کو لگاتار ترقی دینے کے لیے مطمئن ہیں۔
یہ ٹیم IDEA سے ایمبریو ہوئی 20 سے زائد افراد پر مشتمل ہے، جو بہت مستحکم ہے۔ جب ہم بند ماڈل بن رہے تھے، تو ہم نے باہر سے الگورتھم اور انجینئرنگ میں مضبوط لوگوں کو بھی شامل کیا۔ یہ 20 سے زائد افراد آج کل ویشی کے مستقبل کے “بیج” ہیں۔

DINO سیریز ماڈل سے ورلڈ ماڈل تک کا ترقیاتی راستہ
AI کو حقیقی طور پر اشیاء کو "دیکھنے" کے لیے کیسے بنائیں؟
AI ٹیکنالوجی کا جائزہ: آپ کہتے ہیں کہ موجودہ امبدنگ اسکیمز "objects کو حقیقت میں سمجھتی نہیں"، وہ نہیں جانتیں کہ منظر میں کون سے الگ الگ اشیاء ہیں اور اشیاء کے درمیان کیا تعلق ہے۔ ہم دلچسپی سے جاننا چاہتے ہیں کہ اس کا جائزہ کیسے لیا جاتا ہے؟ کیسے معلوم ہوگا کہ ماڈل حقیقت میں "objects کو سمجھ رہا ہے" یا صرف "سمجھنے کا نام نہیں لے رہا"؟
چانگ لی: سمجھنا خود بخود تصدیق نہیں کیا جا سکتا۔ لینگویج ماڈلز کیسے زبان کو سمجھتے ہیں، اب تک کوئی بھی واضح طور پر نہیں بتا سکا، صرف ان کے رویے کے ظاہری پہلوؤں کے ذریعے ہی فیصلہ کیا جا سکتا ہے۔ اگر وہ مسلسل الفاظ کا اخراج کرتے ہیں اور آپ کو لگتا ہے کہ وہ انسانوں کی باتوں سے کوئی فرق نہیں رکھتے، تو آپ کہتے ہیں کہ وہ سمجھ رہے ہیں۔
عالمی ماڈلز بھی اسی قسم کی پریشانی کا شکار ہیں۔ ماڈل کو حقیقت میں فزکل قوانین کی سمجھ ہے یا نہیں، اور کیا وہ اشیاء کی ساخت کو حقیقت میں پکڑ پایا ہے، اسے براہ راست واضح کرنا مشکل ہے۔ ہم درمیانی مراحل کی ویژولائزیشن کے ذریعے تجزیہ کریں گے، اگر نتائج انسانی ادراک کے مطابق ہوں، تو یہ ظاہر کرتا ہے کہ شاید وہ اشیاء کی ساخت کو پکڑ پایا ہے۔
AI ٹیکنالوجی جائزہ: کیا کوئی خاص ٹیسٹنگ طریقہ ہے؟ کیا ہم ایک تجربہ کر سکتے ہیں؟
زہنگ لی: ہاں۔ فرضی ٹیسٹ ایک اچھا طریقہ ہے جس میں ماڈل کو مختلف اقدامات کرنے کی کوشش کرنی ہوتی ہے تاکہ دیکھا جا سکے کہ کیا وہ فزیکلی منطقی نتائج دے سکتا ہے۔ اگر مسیر میں تھوڑا سا انحراف ہو جائے تو بھی ماڈل صحیح نتائج دے دے، تو یہ ظاہر کرتا ہے کہ اس نے قوانین سیکھ لیے ہیں؛ اگر وہ صحیح نتائج نہ دے سکے، تو یہ ظاہر کرتا ہے کہ اس نے صرف احصائی تعلق ہی سیکھا ہے۔
یہ بہت زیادہ بصیرت مانگتا ہے۔ جیسے پروفیسر رچرڈ سٹن نے کہا، انسان جب تحقیق کرتے ہیں تو ہمیشہ مدل کی مدد کرنے کا جذبہ محسوس کرتے ہیں اور اپنے تجربات کو اس میں ڈالنا چاہتے ہیں۔ زبانی مدلز کے محققین نے کبھی جملوں کی ساخت کو تجزیہ کرنا، الفاظ اور عبارتوں کو اس میں ڈالنا چاہا، لیکن آخرکار "اگلے ٹوکن کا پیشنگوئی" کا سادہ طریقہ ہی فتح پایا۔
میں خود اس مختصر پیرادائم کی ترقی کی طاقت پر بہت زیادہ ایمان رکھتا ہوں۔ زیادہ انسانی ڈیزائن، مختصر مدت میں موثر ہوتا ہے، لیکن لمبی مدت میں ترقی کو روک دیتا ہے۔
AI ٹیکنالوجی کے جائزہ: فزیکل دنیا میں کچھ ایسے پیچیدہ اشیاء بھی ہیں جیسے بھاگتی ریت، پانی کا بہاؤ، دھواں اور کپڑے، جن کی واضح سرحدیں نہیں ہوتیں۔ ہم یہ خوف رکھتے ہیں کہ کیا آپ کا "اشیاء پر مبنی" فریم ورک اس "اشیاء" کے تصور کے باعث پابند نہ ہو جائے؟
زہنگ لی: ہم خود بھی اس سوال پر غور کر رہے ہیں۔ ٹیکنیکل طور پر، سب سے آسان طریقہ ماسک ہے، جس میں اشیاء کے علاقوں کے پکسلز کو الگ کیا جاتا ہے۔ پچھلے کچھ سالوں میں ویژول شعبے میں اشیاء کی سیمانٹک سمجھ اور ماسک پیشگوئی بہت ترقی کر چکی ہے، اور ایسے غیر جامد اشیاء جیسے ریت اور پانی کو بھی سنبھالا جا سکتا ہے۔
اس لیے، ماسک سے شروع کرنا ایک عملی شروعات ہے۔ اور ہمارا عام اشیاء کی شناخت پر积累، باہر کسی بھی ٹیم سے زیادہ گہرا ہے۔
ایگوٹوائن: انسان کے ہاتھ کو روبوٹ کے ہاتھ سیکھنے کے لیے استعمال کریں
AI ٹیکنالوجی ریویو: آپ کے ٹیکنیکل فریم ورک میں ایک بہت اہم تصور "اکشن الائنمنٹ" ہے، جو انسان کے ہاتھ، دو انگلیوں والے گریپر، اور متعدد انگلیوں والے چالاک ہاتھ جیسے مختلف کنفگریشنز کے ایکشنز کو ایک ہی ا隐 سپیس میں مپ کرتا ہے۔ ہم اسے اس طرح سمجھتے ہیں، جیسے روبوٹس کو مختلف "زبانوں" کے ایکشنز کو سمجھنے کے لیے ترجمہ کرنا، کیا یہ صحیح ہے؟
زہنگ لی: عالمی ماڈل کے ان پٹ کے دو اہم عناصر ہیں: تصویر (حالت) اور ایکشن، اس لیے ایکشن کو سمجھنا بہت اہم ہے۔
ایکشن الائنمنٹ متعدد اوبجیکٹس کا بنیادی تقاضا ہے۔ ہاتھ اور میکنیکل آرم کا الائنمنٹ زیادہ مشکل ہے: میکنیکل آرم کے جوائنٹس کی پوزیشن فزیکل اسپیس میں XYZ کوآرڈینیٹس کے طور پر درست طور پر جانی جا سکتی ہے، لیکن ہاتھ کے ڈیٹا عام طور پر 2D ویڈیو ہوتے ہیں، لوگ ایک پکانے کا ویڈیو ریکارڈ کرتے ہیں جس میں صرف دو بعدی تصویر ہوتی ہے، تین بعدی کوآرڈینیٹس نہیں۔ براہ راست ملاپ کارکردگی کم ہوتی ہے۔
ہمارا طریقہ 3D کلیدی نکات نکالنا ہے، جس سے انسانی ہاتھ کے 2D ویڈیو کو 3D فضا میں آپریشن کی ترتیب میں تبدیل کیا جاتا ہے، اور اسے میکنیکل آرم کے ڈیٹا کے ساتھ ایک ہی فزیکل فضا میں مطابق کیا جاتا ہے۔ یہی صنعت کے مطابق Ego ڈیٹا (پہلے شخص کے نقطہ نظر سے جمع کیا گیا انسانی آپریشن ڈیٹا) کی جمع آوری اور پروسیسنگ ہے۔
ہم نے پہلے EgoTwin جاری کیا تھا، جو اس قسم کے ڈیٹا کلیکشن کے مسائل کو حل کرتا تھا، اور اب ہم بائیڈو کلاؤڈ کے ڈیٹا کلیکشن ٹیم کے ساتھ تعاون کر رہے ہیں۔
AI ٹیکنالوجی کا جائزہ: EgoTwin "ہاتھ کیسے حرکت کرتے ہیں" کے ڈیٹا کے مسئلے کو حل کرتا ہے۔ لیکن ہم یہ پوچھنا چاہیں گے کہ انسانی ویڈیوز میں ایک اعلیٰ سطح کی معلومات بھی پوشیدہ ہوتی ہے، "ہاتھ اس لیے حرکت کرتے ہیں کہ..." کا مقصد، اس حصے کا کیا ہوگا؟
زہنگ لی: اعلیٰ سطح کے اقدامات کے مقاصد کو سمجھنے کے لیے، ہم اسے عالمی ماڈل یا VLA ماڈل پر چھوڑ دیں گے۔ لیکن اس کا شرط یہ ہے کہ ڈیٹا کی خود کی معیار کافی اچھا ہو۔ ڈیٹا کا خام مادہ بہت اہم ہے۔ صنعت میں ڈیٹا جمع کرنے پر بہت زیادہ انسانی طاقت اور لاگت خرچ کی گئی ہے، لیکن بہت سے معاملات میں ڈیٹا کا استعمال کارآمد نہیں ہوتا۔ ہمارے Grounding DINO اور DINO-X کے کاموں میں حاصل کردہ مرکزی تجربہ یہ ہے کہ الگورتھم سمجھنے والے لوگوں کو ڈیٹا پر گہرا کام کرنے کے لیے متحرک کیا جائے، ورنہ جمع کردہ ڈیٹا تربیت کے دوران استعمال نہیں ہو سکتا۔ الگورتھم اور ڈیٹا دونوں لائنیں متوازی طور پر ترقی کرنا ضروری ہے۔
چانگ بو اور شن یانگیانگ: دو ماہرین، ایک ہی بنیاد
AI ٹیکنالوجی کے جائزہ: ہم نے نوٹ کیا ہے کہ آپ کے پیچھے دو ایسے افراد کھڑے ہیں جنہوں نے آپ پر گہرا اثر ڈالا ہے، پروفیسر چانگ بو (چینی صنعتِ ذہانت کے بنیادی رکن میں سے ایک) اور پروفیسر شین یانگیانگ (سابق مائیکروسافٹ عالمی ایگزیکٹو وائس پریزیڈنٹ اور سابق مائیکروسافٹ ایشین ریسرچ انسٹیٹیوٹ کے ڈائریکٹر)۔ ایک تعلیمی رخ رکھتا ہے، دوسرا صنعتی رخ، ہم جاننا چاہتے ہیں کہ ان دونوں نے آپ کو کیا دیا؟
چانگ لی: پروفیسر چانگ بو ہمیشہ میرے استاد اور مثال رہے ہیں۔ میں نے پروفیسر چانگ کو اپنے بیکالوریس کے دوران جب میں نے تشنگہوا کے ڈپارٹمنٹ میں داخلہ لیا تو پہلی بار جاننا شروع کیا، وہ لیبارٹری کے ڈائریکٹر تھے۔ اس وقت میں AGV (آٹو میٹک گائیڈڈ وہیکل) پر کام کر رہا تھا اور اپنے زیادہ تر فری ٹائم لیبارٹری میں ہارڈویئر ٹیسٹنگ اور تجربات کرنے میں گزارتے تھے، اس دوران میں بار بار پروفیسر چانگ کو لیبارٹری میں ڈاکٹریٹ طلبہ کو روبوٹکس سے متعلق کام پر ہدایت کرتے دیکھتا تھا۔ بعد میں، میں بہت خوش قسمت تھا کہ میں بھی پروفیسر چانگ کا ڈاکٹریٹ طالب علم بن گیا، اور سب سے زیادہ یاد رکھنے والی بات یہ تھی کہ وہ نئی ٹیکنالوجیز کے لیے بہت حساس تھے اور ان کے اندر مضبوط تجسس تھا۔ جب بھی میں ان سے اپنے تجربات کے نتائج پر بحث کرنے جاتا، وہ خوشی سے ایک طرف بیٹھ جاتے اور کہتے، "اسے تھوڑا تبدیل کر دو، دیکھتے ہیں کہ کیا ہوتا ہے۔" وہ اس طرح اپنی سمجھ کو بھی گہرا کرتے تھے۔ آپ دیکھ سکتے ہیں کہ ایک ماہر کا الگورتھم اور مسئلے کو سمجھنا بالکل تجسس سے چل رہا ہوتا ہے۔
دوسرا نقطہ جو اب تک مفید رہا، اس کا زور "چیزوں کو گہرائی سے سمجھنا" پر تھا، اگر آپ چیز کو پوری طرح نہ سمجھیں تو آپ کو دھوکہ دیا جائے گا، اور صرف اس وقت آپ کو بنیادی اصول کیا ہے، یہ معلوم ہوگا جب آپ اسے پوری طرح سمجھ لیں۔ بعد میں یہی جملہ میرا طلباء کو سکھانے کا اصول بن گیا: گہرائی سے سمجھیں، بہترین کوشش کریں۔
سینٹر شن یانگ نے میرے اُپر بہت بڑا اثر ڈالا۔ میں نے مائیکروسافٹ میں کام کرتے ہوئے، وہ ہمیشہ میرا سب سے بڑا بوس تھا، جس نے میری پوری کیریئر کی راہ کو متاثر کیا: چین سے امریکہ جانا اس نے میرے لیے منظم کیا، اور امریکہ سے شنزن واپس آنا بھی اس نے میرے لیے حوصلہ افزائی کی۔ اس کے علاوہ، وہ صنعتی رجحانات کے بارے میں بہت ہوشیار تھے، اور ٹیم بنانے سے لے کر فنڈنگ تک، مجھے کئی عملی مشورے اور تجربات کا اشتراک کیا۔
AI ٹیکنالوجی کے جائزہ: سننا ہے کہ استاد چانگ بو نے 90 سال کی عمر میں بھی آپ کی ٹیم سے ملاقات کی؟ ہمیں سن کر بہت احساس ہوا۔
چانگ لی: ہاں۔ گزشتہ نومبر، تسوہوا یونیورسٹی کی گریجویٹ سکول نے اسے شنزن میں لیکچر دینے کے لیے دعوت دی، اس نے صبح لیکچر ختم کیا اور بعد ظہیر کا وقت ہماری ٹیم کے لیے محفوظ رکھا۔ پورے بعد ظہیر تک ہم نے بات چیت کی اور شام کو ایک ساتھ رات کا کھانا کھایا۔ اس کا منظر بہت وسیع ہے، اور ہمارے جنرل وژن سمجھ اور روبوٹکس کے رخ کے لیے اس نے بہت سارے مشورے دیے۔ حالانکہ وہ بڑھ چکے ہیں، لیکن ان کا خیال بہت واضح ہے، ان کی منطقی صلاحیت اور مسائل کو سمجھنے کی گہرائی، جوانوں سے کم نہیں ہے۔
ہر لہر تصور سے زیادہ ہوتی ہے، لیکن لہر خود آپ کے پاس آئے گی
AI ٹیکنالوجی کے جائزہ: پچھلے کچھ سالوں میں، گہری سیکھنے سے لے کر بڑے ماڈلز اور جسمانی اور دنیا کے ماڈلز تک، آپ نے ہر لہر میں گہری شرکت کی ہے۔ ہم جاننا چاہتے ہیں کہ کیا کوئی لمحہ ایسا تھا جب آپ نے محسوس کیا کہ "یہی وہ چیز ہے جو میں کرنا چاہتا ہوں"؟
زہنگ لی: آبجیکٹ ڈیٹیکشن کا کام، آپ کے بیان کیے گئے حالت کے بہت قریب ہے۔ یہ کام مجھے بہت فخر کی بات لگتا ہے کیونکہ میں نے دیکھا ہے کہ پورے شعبے میں ایک انقلابی ترقی ہوئی ہے۔
اگلی دنیا کی ماڈل، ایک ایسا راستہ بھی ہے جس کے بارے میں میں بہت متاثر ہوں اور جس میں میں مکمل طور پر ملوں گا۔ پچھلے کچھ دہائیوں کے تقویت سیکھنے اور دنیا کے ماڈلز کے متبادل ترقی کا عمل، اور زبانی ماڈلز کی کامیابی کا طریقہ کار، دونوں کو اپنایا جا سکتا ہے۔ مجھے لگتا ہے کہ یہ راستہ پورے AI صنعت پر بڑا اثر ڈالے گا۔
AI ٹیکنالوجی جائزہ: تحقیق کاروں کے اعلیٰ لمحات اکثر بیان کیے جاتے ہیں، لیکن کم زوروں کے بارے میں کم بات ہوتی ہے۔ کیا آپ نے ٹیکنالوجی کے کم زوروں کا تجربہ کیا ہے؟
چانگ لی: جی ہاں۔ 2018 کے قریب، میں نے کمزور سپروائیزڈ ڈیٹا کا استعمال کرکے اشیاء کی تشخیص کرنے کی کوشش کی، صرف تصویر کے طبقہ لیبلز کے ذریعے اشیاء کے بارے میں باکس لیبلنگ سے بچتے ہوئے۔ یہ طریقہ بہت دلچسپ لگتا تھا، میں نے کافی لمبا وقت گزارا، لیکن میں نے اسے کبھی مکمل طور پر حل نہیں کیا۔
بعد میں، IDEA پر Grounding DINO پر کام کیا گیا، جس میں زبان کی سمجھ اور تشخیص کی صلاحیتیں ملا کر مسئلہ کو دوسرے زاویے سے حل کیا گیا۔ یہ کامیابی ایک طرف تو DINO ڈیٹیکشن ماڈل پر ہمارے ایجادی تبدیلیوں کی وجہ سے ممکن ہوئی، جو ہمیں مضبوط بنیاد فراہم کرتی ہیں، اور دوسری طرف زبردست طور پر زبانی ماڈلز کے ترقی سے مستفید ہوئی۔ Grounding DINO کی کامیابی 2022 کے آخر اور 2023 کے شروع میں ہوئی، جو بالکل ChatGPT کے ظہور کے وقت تھا۔ ایک بات ہے جسے "جب ڈیٹا کافی بڑا ہو جائے تو ذكاء خود بخود ظاہر ہو جاتا ہے" کہا جاتا ہے، جب ڈیٹا کافی بڑا ہو تو الگورتھم بھی کافی سادہ ہو سکتا ہے۔
میں سمجھتا ہوں کہ ناکامیاں عام بات ہیں، اہم بات یہ ہے کہ آپ کے اندر ایک ایسا جذبہ ہو جو مشکل مسائل کے ساتھ لڑے، اگر ایک طریقہ کام نہ کرے تو دوسرے زاویے سے دیکھیں، کھانا پینا، سونا، سب کچھ اسی کے گرد گھومے۔ حقیقی طور پر اچھے مسائل کئی سالوں تک آپ کے ذہن میں رہتے ہیں، اور پھر کسی ایک لمحے میں، شاید بے خودی سے ایک معیاری تبدیلی کا اظہار ہو جائے۔
AI ٹیکنالوجی کے جائزے: اب بہت سے نوجوان دنیا کے ماڈلز کے ساتھ کاروبار شروع کر رہے ہیں، جیسے نیگیٹو میٹرکس کے چین بائیویوان اور جی جیامنگ، اور بائی زے ٹیکنالوجی کے بائی ینقی، جو ابھی تک گریجویٹ طلبہ ہیں۔ ہمیں یہ بات بہت دلچسپ لگ رہی ہے، آپ اس "پسینے والی لہر" کے بارے میں کیا سوچتے ہیں؟
زہنگ لی: یہ ظاہر کرتا ہے کہ تحقیق میں داخل ہونے کی رکاوٹیں واقعی کم ہو گئی ہیں۔ گہری سیکھنے کے ابھار سے پہلے، نئے افراد کو بنیادیں ڈالنے میں کئی سال لگ جاتے تھے۔ اب اوپن سورس ٹیکنالوجیز نے ٹیکنالوجی کو سادہ کر دیا ہے، جس سے صرف ٹرانسفارمر کو سمجھنے سے اس شعبے میں داخل ہو سکتے ہیں۔ نوجوانوں کا فائدہ یہ ہے کہ ان کے پاس کوئی بوجھ نہیں ہوتا، اور وہ پہلے اصولوں سے شروع کرکے نئے طریقہ کار کو آسانی سے قبول کر لیتے ہیں۔ لیکن حقیقی طور پر مشکل مسائل کے لیے، تجربہ کار محققین کو بصیرت، سمجھ اور رجحان کو کنٹرول کرنے کی صلاحیت درکار ہوتی ہے۔
سماجی ہٹس ہمیشہ بدل رہے ہوتے ہیں، لیکن صرف ہٹس کے پیچھے بھاگنے کی کوشش کرنے سے آپ ان تک نہیں پہنچ سکتے۔ اصل بات یہ ہے: جس طرف بھی رجحان بدلے، ہر ٹیم کو ہمیشہ سب سے زیادہ صلاحیت رکھنے والے لوگوں کی ضرورت ہوتی ہے۔ آپ صرف سیکھنے کی خواہش اور مضبوط بنیاد رکھیں، تو سب سے آگے کے رجحانات خود آپ کی طرف آئیں گے۔
ایک وحی
اس انٹرویو میں جو ہمیں سب سے زیادہ متاثر کر گیا، وہ زہنگ لی کی چمکتی ہوئی ٹیکنالوجی کی کامیابیاں نہیں تھیں، اور نہ ہی ان کے ذریعہ تربیت پانے والے نوجوان طالب علم—انٹرن شیل ہوانگ زھینگ، لی شو لونگ، اور مائیکروسافٹ کے پہلے جنریشن چہرے کی تشخیص الگورتھم پروجیکٹ میں شامل ٹیم کے ارکان زہ لونگ، شیاو رونگ، اور یان شوچینگ۔
ہمیں اس کی بار بار تکرار کی گئی ایک لفظ سب سے زیادہ متاثر کرتا ہے: "سمجھنا".
یہ لفظ، چانگ لی نے تیس سال تک لکھا ہے۔
1990 کی دہائی کے آغاز میں، چنگہوا کے کیمپس میں، آرٹیفیشل انٹیلی جنس ایک ایسا موضوع تھا جس کی کوئی پرواہ نہیں تھی، اور چانگ لی ایک کمپیوٹر سائنس کے طالب علم تھے جو گرڈ روم میں AGV گاڑیوں کے ساتھ کھیل رہے تھے۔ اس وقت لیبارٹری کے ہدایت کار ڈاکٹریٹ کے طلبہ کو روبوٹکس سے متعلق کام پر مبنی ہدایت دے رہے تھے، جس نے انہیں گہرا اثر چھوڑا، اور بعد میں وہ بھی ان کے شاگرد بن گئے۔
لیب کے ڈائریکٹر کا نام چانگ بو ہے، جو چینی صنعتِ مصنوعی ذہانت کے بنیادی رکن ہیں۔ جب بھی چانگ لی انہیں تجرباتی نتائج دیکھنے کے لیے بلاتے، وہ ہمیشہ جوش کے ساتھ چانگ لی کے پاس بیٹھ جاتے اور اسکرین کو کچھ دیر تک دیکھتے، اپنی انگلی بڑھاتے ہوئے کہتے: "اسے تھوڑا تبدیل کر دو، دیکھتے ہیں کہ کیا ہوتا ہے۔" یہ ہوم ورک چیک کرنا نہیں تھا، بلکہ وہ حقیقت میں جاننا چاہتے تھے کہ جب تم پیرامیٹرز تبدیل کر دو، تو کیا ہوتا ہے۔
چانگ بو نے چانگ لی کو جو سکھایا، وہ بعد میں تین الفاظ میں مختص ہو گیا: "گہرائی سے سمجھنا"
جس نے سمجھا نہیں، وہ جھوٹا ثابت ہو جائے گا، جس نے سمجھ لیا، وہ بنیادی اصول کیسے کام کرتے ہیں، یہ جان جائے گا۔
چین کی نسل کے سائنسدانوں کی روایت یہی چھوٹی چھوٹی باتوں سے منتقل ہوتی ہے۔
2018ء میں، جانگ لی نے مائیکروسافٹ میں کمزور سوپروائیزڈ آبجیکٹ ڈیٹیکشن پر کام کیا، لیکن وہ کام نہیں ہوا، اس نے موضوع نہیں بدلنا۔
اگر اس بار کام نہیں چلا، تو ایک نئے زاویے سے دیکھیں، کھانا، سونا، اور اس کے گرد لگاتار گھومتے رہیں۔
یہ استعارہ نہیں، بلکہ اس کا روزمرہ ہے۔
بعد میں، IDEA پر Grounding DINO پر کام کرتے ہوئے، اس نے مسئلہ کو ایک دوسرے منظر سے حل کر دیا۔ طرزِ عمل کا بڑا موڑ 2022 کے آخر میں ChatGPT کے ظہور کے ساتھ آیا — زبانی ماڈلز کی صلاحیتیں بڑھ گئیں، اور ڈیٹا کافی بڑا ہو گیا۔
چانگ لی نے ایک تفصیل استعمال کی: "خودبخود ظاہر ہونا"۔
AGV گاڑی کے پیرامیٹرز کو تبدیل کرنے سے لے کر عالمی ماڈل کو سمجھنے تک، تیس سال کا فاصلہ تھا۔ اس تیس سال کے دوران، وہ بڑے پیمانے پر تصویری تلاش سے لے کر جامع بصری سمجھ تک، ہر مسئلے کو گہرائی سے سمجھنے اور بہترین نتائج حاصل کرنے کے لیے لگا رہا، جب تک کہ وہ دوبارہ "روبوٹس کے لیے عالمی ماڈل بنانا" کی طرف واپس نہ آ گیا۔ جیسے جابز نے کہا تھا، "ڈاٹس کو جوڑو" — جو بھی چیز آپ نے اچھی طرح سے کی ہے، وہ ضائع نہیں ہوتی۔
2025 کے آخر میں، 90 سالہ چانگ بو شنزن پر تدریس کے لیے اڑے۔ صبح کلاس ختم ہونے کے بعد، وہ شی چی ویلی کے دفتر میں چلے گئے۔ کچھ نوجوان اس کے گرد جمع ہو گئے، اور وہ پورا بعد کا وقت بات کرتے رہے، شام کو ایک ساتھ کھانا کھایا، اور اپنی تعلیم کے دوران کی باتیں، اور اس سمت کے بارے میں اپنے جائزے بانٹے۔ اس کا خیال واضح، منطق مضبوط تھا، اور نوجوانوں سے کم نہیں تھا۔ چانگ لی نے بھی اپنے استاد کو اپنے کر رہے کام کے بارے میں بتایا۔

سینیٹر چانگ بو نے مستقبل کو دیکھتے ہوئے، زہنگ لی نے اپنے استاد کو اپنی تحقیق کی ترقی کے بارے میں بتایا
تین دہائیاں پہلے، چنگہوا کے کیمپس میں، استاد نے طالب علم کے ساتھ بیٹھ کر کہا: اسے تھوڑا تبدیل کر دیں، دیکھیں کیسا ہوتا ہے۔
تین دہائیوں کے بعد، شنزن کا دفتر، ایک طالب علم اپنے 90 سالہ استاد کو اپنے بنائے ہوئے عالمی ماڈل کے بارے میں بتا رہا ہے۔
یہ کتنی جذباتی منظر کی دوبارہ تخلیق ہے۔
لوگ بوڑھے ہوتے ہیں، لہریں پیچھے ہٹتی ہیں، ٹرینڈز ٹھنڈے پڑ جاتے ہیں، لیکن چینی سائنسدانوں کا عزم کہ وہ دنیا کے ہر مشکل مسئلے کو گہرائی سے سمجھیں، کبھی نہیں بدلा۔ Leifeng.com
