২০২৬ এর প্রথম অর্ধেকে, চীনের এআই ক্ষেত্রে বিশ্ব মডেল সেগমেন্টে ফান্ডিংয়ের মোট পরিমাণ প্রায় ৯০০ বিলিয়ন যুয়ান, যা ৫ গুণের বেশি বৃদ্ধি পেয়েছে।লেখক এবং উৎস: লেইফেঙ্গওয়েন

২০২৬ এর প্রথম অর্ধেকে, চীনের এআই সম্প্রদায়ের টাকা এবং মানুষ একই দিকে প্রবাহিত হচ্ছে: বিশ্ব মডেল।
কেবল প্রথম ছয় মাসে, দেশীয় বিশ্ব মডেল সেগমেন্টে ঘোষিত ফান্ডিং মোট প্রায় 300 বিলিয়ন যুয়ান, যদি "এমবডিড ইন্টেলিজেন্স + ওয়ার্ল্ড মডেল" ফিউজন সেগমেন্টটিও অন্তর্ভুক্ত করা হয়, তবে এই সংখ্যা 900 বিলিয়নেরও বেশি হয়ে যায়।
গত বছরের একই সময়ের তুলনায় ফান্ডিং বৃদ্ধি 5 গুণের বেশি।
শত বিলিয়ন ডলারের অর্থ এবং প্রচুর প্রতিভাবান মানুষ ঢলে পড়ছে।
একটি অপরিহার্য প্রশ্ন হলো: এত মানুষ ভিতরে ঢুকেছে, কিন্তু এই জিনিসটি ঠিকমতো বুঝেছে কতজন?
পেশাদাররা দিক খুঁজছে, বিনিয়োগকারীরা মানুষ খুঁজছে, হেডহান্টাররা সংগঠন বুঝছে, বড় কোম্পানির কৌশল বিভাগ কে বেঁচে থাকবে তা অধ্যয়ন করছে।
একটি অদ্ভুত বিষয় হলো, সবাই একই প্রশ্ন করছে: কেউ কি বিশ্ব মডেল বিষয়টি পরিষ্কারভাবে ব্যাখ্যা করতে পারে?
হ্যাঁ।
আজ আমরা IDEA ইনস্টিটিউটের চেয়ার সায়েন্টিস্ট এবং শি কি ফিউচারের প্রতিষ্ঠাতা জাং লেইকে গভীরভাবে সাক্ষাত্কার করছি, এই বিষয়টি পরিষ্কারভাবে আলোচনা করতে।
তিনি IEEE Fellow এবং Google Scholar-এ 77,000 এর বেশি উদ্ধৃতি রয়েছে। তাঁর DINO সিরিজ COCO-তে 5 মাস ধরে শীর্ষে ছিল, এবং Grounding DINO এবং পরবর্তী DINO-X গুগল এবং Meta-কে পিছনে ফেলেছে, যা লি ফেইফেই টিম, NVIDIA, Galaxy General সহ বিশ্বের অনেক শীর্ষস্থানীয় প্রতিষ্ঠান দ্বারা "স্ট্যান্ডার্ড" উদ্ধৃতি হিসাবে ব্যবহৃত হয়।
২০২৫ সালে তিনি তার দলকে নিয়ে IDEA থেকে বিশি ভবিষ্যত প্রতিষ্ঠা করেন, যেখানে এঞ্জেল রাউন্ডে মাত্র এক মাসের মধ্যে কোটি কোটি টাকা জমা হয়।
পিছনে দাঁড়িয়েছেন দুজন এআই মহান ব্যক্তিত্ব: শিক্ষামূলক গুরু প্রফেসর চাং বো (চীনা কৃত্রিম বুদ্ধিমত্তার প্রতিষ্ঠাতা একজন), এবং শিল্প গুরু প্রফেসর শেন হিয়াংয়াং (পূর্ব মাইক্রোসফট গ্লোবাল এক্সিকিউটিভ ভাইস প্রেসিডেন্ট, পূর্ব মাইক্রোসফট এশিয়ান রিসার্চ ইনস্টিটিউটের পরিচালক)।
কিন্তু এগুলো আমাদের তাকে খোঁজার প্রধান কারণ নয়।
আমরা তাকে খুঁজছি কারণ ২০২৬ সালে, যখন সবাই “বিশ্ব মডেল কী” নিয়ে বিতর্ক করছে, তখন জাং লেই হলেন অল্প কয়েকজনের মধ্যে একজন, যিনি স্পষ্ট, কার্যকরী এবং কোনো প্রচলিত মতের সাথে সমঝোতা না করে উত্তর দিয়েছিলেন।
মাইক্রোসফ্ট রিসার্চের প্রধান গবেষক থেকে IDEA রিসার্চের চেয়ার সায়েন্টিস্ট, এবং তারপর উদ্যোক্তা—তার ক্যারিয়ার বারবার পথ পরিবর্তন করেছে, কিন্তু গবেষণার বিষয়টি কখনও পরিবর্তিত হয়নি: “AI-কে বস্তুগুলি বুঝতে শেখানো।”
বিশ্ব মডেল হল একটি প্রশ্ন, যার উত্তর পদার্থবিজ্ঞানের বিশ্বে বিশেষভাবে গুরুত্বপূর্ণ, যা বহু বছর ধরে আলোচিত হয়ে আসছে।
যদি তুমি বিশ্ব মডেল প্রতিযোগিতার দিকে তাকাচ্ছ, এবং বুঝতে চাও এটা কি সত্যিই বুলবুলি, কে রুট প্রতিযোগিতায় জিতবে, এবং কোন ধরনের টিমের সাথে যোগ দেওয়া সবচেয়ে মূল্যবান—এই ব্যক্তির কথাবার্তা শেষ পর্যন্ত পড়া তোমার জন্য সম্পূর্ণভাবে মূল্যবান।
এটি সংলাপের বাস্তব ট্রান্সক্রিপ্ট, যা AI টেক রিভিউ দ্বারা মূল অর্থ পরিবর্তন না করে সংক্ষিপ্ত করা হয়েছে।
ড. চাং লেই, IEEE ফেলো, ভিশি ফিউচারের প্রতিষ্ঠাতা ও সিইও, বর্তমানে IDEA ইনস্টিটিউটের কম্পিউটার ভিশন এবং রোবোটিক্স রিসার্চ সেন্টার (CVR)-এর চেয়ারড সায়েন্টিস্ট, হংকং বিজ্ঞান ও প্রযুক্তি বিশ্ববিদ্যালয় (গুয়াংজু)-এর অতিথি অধ্যাপক, পূর্বে মাইক্রোসফট এশিয়া রিসার্চ ইনস্টিটিউট এবং মাইক্রোসফট হেডকোয়ার্টারস রিসার্চের চিফ রিসার্চার, কম্পিউটার ভিশনের মতো ক্ষেত্রে ২০০টিরও বেশি পেপার প্রকাশ করেছেন, Google Scholar-এ ৭৭,০০০টিরও বেশি উদ্ধৃতি এবং H-Index ১০৭, ৬০টিরও বেশি মার্কিন পেটেন্ট ধারণ করেন। বড় স্কেলের ইমেজ রিকগনিশন এবং মাল্টিমিডিয়া ইনফরমেশন রিট্রিভালের জন্য অসাধারণ অবদানের জন্য তিনি IEEE Fellow হিসেবে নির্বাচিত হন।
শরীরের চেয়ে বুদ্ধি হল শরীরসংযুক্ত বুদ্ধির সবচেয়ে বড় বাধা
এআই টেক রিভিউ: গত বছর থেকে এমবডিড ইন্টেলিজেন্সের বিস্ফোরণ ঘটেছে, সব রোবোট কোম্পানি মোশন কন্ট্রোলে দুর্দান্ত অগ্রগতি করেছে, ইউশুর রোবোট ম্যারাথন ট্র্যাকে দৌড়াচ্ছে, জিহুয়ানের রোবোট পিছনের দিকে ঘুরতে পারে। কিন্তু আমরা লক্ষ্য করেছি, বাস্তবায়নের প্রয়োগগুলিতে এখনও একটি শেষ শ্বাসের অভাব রয়েছে। আপনার মতে, এমবডিড ইন্টেলিজেন্সকে বাস্তবের দিকে নিয়ে যাওয়ার জন্য আরও কী কী চ্যালেঞ্জ অতিক্রম করতে হবে?
জাং লেই: রোবটের মূল সমস্যা দুটি: সফলতার হার এবং সাধারণীকরণের ক্ষমতা। সফলতার হার বলতে একটি কাজ যথেষ্ট বিশ্বস্তভাবে সম্পন্ন হয় কিনা; সাধারণীকরণের ক্ষমতা বলতে একই কাজকে পরিবেশ বা শরীর পরিবর্তন করলেও বিশ্বস্তভাবে সম্পন্ন করা।
চারটি বিশেষ চ্যালেঞ্জ রয়েছে:
প্রথমত, একক স্কেনারিওর জন্য সাধারণীকরণের অভাব। বর্তমানে অনেক দল একক স্কেনারিওতে 70% বা এমনকি 80% সফলতার হার অর্জন করতে পারে, যা অনেক বড় অগ্রগতির মতো শোনায়। কিন্তু বাস্তব প্রয়োগে 80% মানে কী? এর মানে প্রতি পাঁচটি অপারেশনের মধ্যে একটি ব্যর্থ হয়, যা এখনও ব্যাপক মানব সম্পদের প্রয়োজনীয়তা রাখে এবং সম্পূর্ণরূপে স্বাধীনভাবে ডিপ্লয় করা সম্ভব নয়।
দ্বিতীয়ত, অনুভূত পরিসরের সাধারণীকরণ যথেষ্ট নয়। প্রথমে একক বিন্দুর ক্ষমতা সর্বোচ্চ সীমায় পৌঁছাতে হবে, তারপর পরিসরের প্রয়োগের প্রসার ঘটাতে হবে, যাতে এটি আরও জটিল পরিবেশে আরও বেশি এবং আরও জটিল কাজ করতে পারে। এটিই রোবটকে “ল্যাব ডেমো” থেকে “বাস্তব প্রয়োগ”-এ নিয়ে যাওয়ার বড়তম বাধা।
তৃতীয়ত, “মস্তিষ্ক”-এর গভীর ক্ষমতার অভাব। বর্তমানে গভীর শিক্ষা বেশি বুদ্ধিমত্তার “আচরণ” শিখছে, যেখানে “কার্যপ্রণালী” (বুদ্ধিমত্তার পিছনের কার্যপ্রণালী) নয়। শরীরসংযুক্ত মস্তিষ্কের জন্য ভৌত বিশ্বের প্রকৃত কারণ-প্রভাব যুক্তি (শুধু পরিসংখ্যানগত সম্পর্ক নয়, বরং “A-এর কারণে B” এর যুক্তিগত শৃঙ্খল বুঝতে হবে), সাধারণ জ্ঞান এবং সামঞ্জস্যপূর্ণ ক্ষমতা প্রয়োজন, এবং এই দিকে আমরা এখনও শুধু শুরু করেছি।
চতুর্থ, এখনও "এন্ড-টার্মিনাল" লেভেলের অ্যাপ্লিকেশনে পৌঁছানো হয়নি। বর্তমানে বেশিরভাগ রোবট বিশাল বাহ্যিক কম্পিউটিং পাওয়ারের উপর নির্ভরশীল, এবং "মানুষের দ্বারা সমর্থনের প্রয়োজন ছাড়াই" এই মৌলিক সমস্যা সমাধান করতে হবে, যাতে বিপুল সংখ্যক স্কেনারিওতে এটি ব্যাপকভাবে প্রসারিত হয় এবং "অ্যাপ্লিকেশন-ডেটা-আপডেট" একটি সুসংগঠিত চক্র গড়ে উঠে।
এআই টেক রিভিউ: স্পষ্টভাবে বলতে গেলে, শিল্পে এই প্রশ্ন নিয়ে মতপার্থক্য রয়েছে। হার্ডওয়্যার দলগুলি মনে করে চীনা সরবরাহ শৃঙ্খলের সুবিধা পরিষ্কারভাবে উল্লেখযোগ্য, তাই প্রথমে মূল খরচ কমানো উচিত; অন্যদিকে, অ্যালগরিদম দলগুলি মনে করে মস্তিষ্কই প্রকৃতপক্ষে বাধা। আপনি কীভাবে দেখেন?
জাং লেই: মস্তিষ্কটি আরও কঠিন, এবং আরও গুরুত্বপূর্ণ।
হার্ডওয়্যার প্রযুক্তির ক্ষেত্রে, চীনের হার্ডওয়্যার প্রগতি নিয়ে গর্বিত হওয়া যায়। ইউশু এবং জিয়ায়ুয়ান এই কোম্পানিগুলি সিমুলেশন-ভিত্তিক রিইনফোর্সমেন্ট লার্নিং (ভার্চুয়াল পরিবেশে কন্ট্রোল অ্যালগরিদম প্রশিক্ষণ দেওয়া এবং তা বাস্তব রোবটে স্থানান্তরিত করা) এর মাধ্যমে মোশন কন্ট্রোলকে পুনরায় উন্নত করছে, মোটর, ট্রান্সমিশন মেকানিজমসহ প্রধান উপাদানগুলির উপর নিরন্তর কাজ করছে, যার ফলে খরচ এবং বিশ্বস্ততা উভয়ই উল্লেখযোগ্যভাবে উন্নত হয়েছে। এটি একটি অত্যন্ত দৃঢ় পথ। তবে, ম্যারাথন এবং পারফরম্যান্সের মধ্যে এই হার্ডওয়্যারগুলির দেখানো ক্ষমতা শুধুমাত্র প্রাণীদের মৌলিক ক্ষমতা অর্জনের মতো—প্রাণীদের সহজাত প্রতিক্রিয়া, লাফানো, এড়িয়ে যাওয়া, এবং পরিবেশের সাথে tương tác-এর ক্ষমতা, এখনও অর্জিত হয়নি।
এআই টেক রিভিউ: আপনি বলেছেন “মস্তিষ্ক” বেশি কঠিন, কেন? কি ডেটা অপর্যাপ্ত, নাকি আমাদের বুদ্ধিমত্তার প্রতি বোঝার অত্যন্ত কম?
জাং লেই: কারণের পিছনের কার্যপ্রণালী আমরা প্রকৃতপক্ষে বুঝতে পারিনি। মানুষের মস্তিষ্ক অন্যান্য প্রাণীর তুলনায় সবচেয়ে বেশি পার্থক্য এবং সবচেয়ে উচ্চতর বুদ্ধিমত্তা রাখে। এখন সমস্ত গভীর শিক্ষার অগ্রগতি হল মস্তিষ্কের বুদ্ধিমত্তার প্রকাশকে পৃষ্ঠতলে দেখে, তারপর অ্যালগরিদম ব্যবহার করে তা বাস্তবায়ন। AI প্রকৃতপক্ষে মানুষের বুদ্ধিমত্তা শিখছে না, বরং মানুষের আচরণ শিখছে। যেমন জাং বা শিক্ষক প্রায়শই বলেন, বড় ভাষা মডেলগুলি মানুষের মতো কথা বলতে পারে, কিন্তু এগুলি ভাষা বুঝে থাকে মানুষের চেয়ে সম্পূর্ণভাবে ভিন্নভাবে।
কেন বিশ্ব মডেল বিশেষভাবে বিশ্রাম নিয়েছিল দুই দশক ধরে, আজ হঠাৎ জনপ্রিয় হয়ে উঠল?
এআই টেক রিভিউ: বডি-বেসড বিস্ফোরণের সাথে সাথে "ওয়ার্ল্ড মডেল" ধারণাটি হঠাৎ জনপ্রিয় হয়ে উঠেছে। কিন্তু বৃত্তিগত ব্যক্তিদের জানা আছে যে এটি একটি নতুন শব্দ নয়, ৯০-এর দশকেই এই ধারণাটি প্রস্তাব করা হয়েছিল। আমরা খুবই কৌতূহলী, এই ধারণাটি কেন বিশ্রাম নিয়েছিল দুই দশক, এবং আজকে হঠাৎ করেই এটি কেন একটি প্রবণতা হয়ে উঠল?
জাং লেই: এই প্রশ্নটি খুব ভালো। বিশ্ব মডেল একটি নতুন ধারণা নয়। ৯০-এর দশকের শুরুতেই গবেষকরা বুদ্ধিমত্তা (পরিবেশ অনুভব করে এবং লক্ষ্য অর্জনের জন্য কার্যকলাপ সম্পাদন করতে পারে এমন এআই সিস্টেম) এর মধ্যে পরিবেশ মডেলিংয়ের চেষ্টা করেছিলেন, যাতে শক্তিশালী শিক্ষা অ্যালগরিদমগুলি উন্নত হয়, কিন্তু সেই সময়ে ডিপ লার্নিং এখনও উঠে আসেনি, তাই ধারণাটি প্রস্তাবের পরে এটি পরীক্ষা করা কঠিন ছিল।
এই ধারণাটি প্রকৃতপক্ষে ২০১৮-২০১৯ এর দিকে প্রকাশিত “World Models” শীর্ষক পেপারগুলির মাধ্যমে যাচাই করা হয়েছিল এবং গেমিং পরিস্থিতিতে প্রয়োগ করা হয়েছিল, কারণ গেমিং হল শক্তিশালী শেখার জন্য সেরা পরিবেশ।
কিছু বছর পরে শক্তিশালী শেখার উন্নতির ফলে, এআই এখন গেমে মানুষের খেলোয়াড়দের হারাতে পারে। এই সময়ে গবেষকদের মনে প্রশ্ন জাগে: কি করে এআই এজেন্টগুলিকে গেম পরিবেশের সাথে নিয়মিত মিথস্ক্রিয়া করার মাধ্যমে স্বয়ংক্রিয়ভাবে "একটি বিশ্ব মডেল" তৈরি করতে দেওয়া যায়, যাতে পরিবেশের বিকাশের প্রক্রিয়াটি মডেলের ভিতরে সংযুক্ত থাকে? 2018 থেকে 2020 এর মধ্যে এই ধারণাটি সম্পূর্ণভাবে প্রমাণিত হয়।
এআই টেক রিভিউ: এটা আজকের এমবডিড ইন্টেলিজেন্সের সাথে কীভাবে সম্পর্কিত? আমরা শুনেছি, মনে হচ্ছে বাস্তব বিশ্ব মডেলকে জনপ্রিয় করার প্রধান কারণ হলো এমবডিডনেস?
জাং লেই: এই সম্পর্কটি ভাষা মডেল থেকে শুরু করতে হবে। শিল্পটি প্রথমে VLA (ভিজুয়াল-ল্যাঙ্গুয়েজ-অ্যাকশন, অর্থাৎ দৃশ্য-ভাষা-ক্রিয়া মডেল) তৈরি করেছিল, যেখানে রোবট চিত্রটি দেখে পরবর্তী ক্রিয়াটি পূর্বানুমান করে; এটি ভাষা মডেলের অনুকরণ শিক্ষার পদ্ধতির অনুসরণ করে: ভাষা মডেলটি Next Token Prediction করে; শরীরসংলগ্ন VLA-এর ক্ষেত্রে, রোবটটি বর্তমান দৃশ্যটি দেখে পরবর্তী ক্রিয়াটি কীভাবে করা উচিত তা পূর্বানুমান করে।
কিন্তু এই পদ্ধতি দ্রুত একটি বাধার সম্মুখীন হয়। বাধাটি শুধু ডেটার মধ্যে নয়, আমি মনে করি ডেটা শুধু একটি দিক, অন্য দিকটি হল পুনর্বলন শেখার প্রয়োগ এখনও যথেষ্ট নয়। আমার একটি উপমা আছে: অনুকরণ শেখা ভাষাগত মডেলকে কথা বলতে শেখায়, পুনর্বলন শেখা ভাষাগত মডেলকে সঠিকভাবে কথা বলতে শেখায়।
রোবটের বুদ্ধিমত্তা এবং কার্যক্রমের সফলতার হারও রিইনফোর্সমেন্ট লার্নিংয়ের প্রয়োজন।
কিন্তু শরীরে শিখনে শক্তিশালী শিক্ষার ব্যবহার দুটি মারাত্মক বাধা দেখায়: প্রথমত, ডেটা সংগ্রহের দক্ষতা অত্যন্ত কম, ভাষা মডেলের তুলনায় অনেক কম; রোবটকে প্রতিটি ক্রিয়াকলাপ বাস্তব পরিবেশে সম্পন্ন করতে হয় এবং ভৌত প্রতিক্রিয়ার জন্য অপেক্ষা করতে হয়; দ্বিতীয়ত, ব্যর্থতার খরচ অসহনীয়, পাত্র ধোয়া শেখা যায়নি মানেই পাত্রগুলি ভাঙা, অটোমেটেড ড্রাইভিংয়ের জন্য দুর্ঘটনা এড়ানোর শিক্ষা নেওয়ার জন্য অসংখ্য বাস্তব দুর্ঘটনা ঘটতে পারে। এটি ডিজিটাল বিশ্বে ভাষা মডেলের নিম্ন-খরচের পরীক্ষা-ভুলের সঙ্গে সম্পূর্ণভাবে ভিন্ন।
ওয়ার্ল্ড মডেল দ্বারা প্রদানকৃত ভার্চুয়াল পরিবেশই এই সমস্যাগুলির সমাধানের পথ। যদি একটি মডেল পূর্বানুমান করতে পারে যে “যদি আমি এই ক্রিয়াটি করি, তবে পরিবেশটি কীভাবে পরিবর্তিত হবে”, তবে রোবটটি বাস্তবে হাজার হাজার পাত্র ভাঙার প্রয়োজন ছাড়াই ভার্চুয়াল বিশ্বে অসংখ্যবার চেষ্টা-ভুল করতে পারে।
(লেখকের নোট: এই বক্তব্যের যুক্তিটি সহজভাবে বুঝুন। প্রথমত, রোবটকে একটি কাজ শেখাতে অসংখ্য পরীক্ষা-ভুল প্রয়োজন। দ্বিতীয়ত, বাস্তব জগতে পরীক্ষা-ভুল করা খুবই ব্যয়বহুল এবং বিপজ্জনক। তৃতীয়ত, ওয়ার্ল্ড মডেল হলো রোবটের জন্য একটি “ভার্চুয়াল ট্রেনিং ফিল্ড” তৈরি করা, যেখানে এটি মাথার ভিতরে বিভিন্ন ক্রিয়ার ফলাফলগুলির পূর্বানুমান করে। চতুর্থত, শুধুমাত্র সেরা সমাধানটিকেই বাস্তব জগতে বাস্তবায়ন করা হয়। এইজন্যই এই সময়ে ওয়ার্ল্ড মডেলটি সমগ্র শিল্পের জন্য হঠাৎই একটি গুরুত্বপূর্ণ লক্ষ্যে পরিণত হয়েছে।)
ক্রিয়াকে ইনপুট শর্ত হিসাবে না নিলে এটিকে ওয়ার্ল্ড মডেল বলা যায় না
এআই টেক রিভিউ: এখন শিল্পে "ওয়ার্ল্ড মডেল" শব্দটির সংজ্ঞা খুবই বিভ্রান্তিকর। ভিডিও জেনারেশনকে ওয়ার্ল্ড মডেল বলা হয়, 3ডি স্পেস মডেলিংকেও ওয়ার্ল্ড মডেল বলা হয়, এবং লেকুনের JEPA (জয়েন্ট এমবেডিং প্রেডিকশন আর্কিটেকচার) কেও ওয়ার্ল্ড মডেল বলা হয়। তাহলে আপনি কি মনে করেন, একটি মডেলকে এই চারটি শব্দের যোগ্য হতে হলে, অন্তত কী কী শর্ত পূরণ করতে হবে?
জাং লেই: আমি মনে করি বিশ্ব মডেলের অবশ্যই ক্রিয়া-নির্ভর হতে হবে, অর্থাৎ ক্রিয়া-সংশ্লিষ্ট (ক্রিয়াকে ইনপুট হিসাবে নিয়ে, মডেলটিকে উত্তর দিতে হবে “যদি কোনো ক্রিয়া সম্পাদন করা হয়, পরিবেশটি কীভাবে পরিবর্তিত হবে”)।
এজেন্ট পরিবেশের সাথে মিথস্ক্রিয়া করতে পারে কারণ এজেন্টের ক্রিয়া: এজেন্টের ক্রিয়া পরিবেশের পরিবর্তন ঘটায়, পরিবেশের পরিবর্তনের পর একটি নতুন অবস্থা তৈরি হয় এবং এটি এজেন্টকে ফিরিয়ে দেয়, যা তাকে জানায় যে এটি লক্ষ্যের দিকে একধাপ এগিয়েছে। এটি একটি সম্পূর্ণ বন্ধ চক্র, পরিবেশের অবস্থার প্রতিটি স্থানান্তরই আগের পদক্ষেপে সম্পাদিত নির্দিষ্ট ক্রিয়ার উপর নির্ভরশীল।
অনেকে বলেন যে বিশ্ব মডেল হল ভাষা মডেলের পরবর্তী টোকেন প্রেডিকশনকে পরবর্তী স্টেট প্রেডিকশনে রূপান্তরিত করা, কিন্তু আমি মনে করি এই সংজ্ঞাটি যথেষ্ট কঠোর নয়, এটি একটি গুরুত্বপূর্ণ শর্ত বাদ দিয়েছে। সঠিক বিবৃতিটি হল: অ্যাকশন-কন্ডিশনড পরবর্তী স্টেট প্রেডিকশন। কেবলমাত্র ক্রিয়ার এই পূর্বশর্তটি যোগ করলেই স্টেট প্রেডিকশনের অর্থ হয়, এবং এটিই বাস্তবিকই শক্তিশালী শিক্ষার প্রয়োজনীয়তা পূরণকারী বিশ্ব মডেল।
এআই টেক রিভিউ: সত্যি বলতে কি, অনেকেই, কিছু বিনিয়োগকারীদের সহ, বিজনেস প্ল্যানে সোরা এর মতো ভিডিও জেনারেশন মডেলগুলিকেও ওয়ার্ল্ড মডেল বলে ডাকে। কিন্তু আপনি যা বললেন, তার মানদণ্ড অনুযায়ী, এগুলোতে স্পষ্টভাবেই অ্যাকশনের মাত্রা অনুপস্থিত। আমরা শুনতে চাই যে, আপনি এই সমস্যাটিকে কিভাবে বিশ্লেষণ করবেন?
জাং লেই: আমরা যে বিশ্ব মডেল নিয়ে আলোচনা করছি, তা প্রবলেশন লার্নিং-এর মডেল-বেসড পদ্ধতি থেকে উদ্ভূত, যা এজেন্টকে পরিবেশের সাথে আরও কার্যকরভাবে মিথস্ক্রিয়া করতে সাহায্য করে। যদিও বিশ্ব মডেলের অনেকগুলি প্রয়োগ রয়েছে, তবে বর্তমানে সবচেয়ে স্পষ্ট এবং সবচেয়ে মূল্যবান প্রয়োগ হল এমবডিড ইন্টেলিজেন্স।
এই অর্থে, প্রাথমিক Sora-এর মতো শুধুমাত্র ভিডিও জেনারেশন মডেলগুলিকে বিশ্ব মডেল বলা যায় না। মূল কারণ হলো এগুলি “ক্রিয়া” মডেলিং করে না; এগুলি মূলত একটি সমঝোতাপূর্ণ ভিডিও সিরিজ তৈরি করে, পিক্সেলগুলির পরিবর্তন পূর্বানুমান করে, কিন্তু রোবট এবং পরিবেশের মধ্যে ইন্টারঅ্যাকশনের ক্রিয়াগুলি সম্পূর্ণভাবে মডেলিং করে না। তাহলে এটি কি রোবটকে পরোক্ষভাবে সহায়তা করতে পারে? হ্যাঁ, এটি বিশ্বের পরিবর্তনের কিছু নিয়ম শিখতে পারে, কিন্তু রোবটকে পরিবেশের সাথে ভালোভাবে ইন্টারঅ্যাক্ট করতে সহায়তা করা কঠিন।
AI টেক রিভিউ: সাম্প্রতিক কালে জনপ্রিয় হয়ে উঠা ওয়ার্ল্ড অ্যাকশন মডেল (World Action Model) কেমন? আমরা শুনেছি এটি ও অ্যাকশন নিয়ে কথা বলছে, এটি কি আরেকটি ওয়ার্ল্ড মডেল?
জাং লেই: WAM হল শিক্ষার্থী অর্থে বিশ্ব মডেল নয়। এটি ভবিষ্যতের চিত্রের পিক্সেল-স্তরের সুপারভাইজড ডেটা ব্যবহার করে ক্রিয়া পূর্বানুমানকে উন্নত করে, যা কিছু কাজে VLA-এর চেয়ে ভালো পারফরম্যান্স দেখিয়েছে। তবে, এর মডেলিং পদ্ধতি হল ফলাফল থেকে কারণের দিকে—এটি প্রথমে ভবিষ্যতের চিত্র তৈরি করে, তারপর ক্রিয়াগুলির প্রতিবিপ্লব ঘটায়, যা শিক্ষার্থীতে ব্যবহারযোগ্য নয়, তাই এটি আমাদের এখানে আলোচনা করা বিশ্ব মডেলের সংজ্ঞার সাথে মেলে না।
পিক্সেল প্যারি বনাম ইম্বেডেড স্পেস প্যারি: দুই পক্ষই আসলে একই কাজ করছে
এআই টেক রিভিউ: রুট বিরোধ নিয়ে কথা বলতে গেলে, এটি এখন বিশ্ব মডেল ক্ষেত্রের সবচেয়ে জনপ্রিয় বিষয়। লেকুন হলেন ইম্প্লিসিট স্পেস পক্ষের নেতা, আর সোরা হলেন পিক্সেল পক্ষের প্রতিনিধি। দুটি রুট দেখতে অসামঞ্জস্যপূর্ণ, আপনি কীভাবে দেখেন?
জাং লেই: প্রথমে, আমাদের দেখতে হবে যে দুটি পথের মধ্যে সাদৃশ্য রয়েছে।
বাস্তবে এখন সবাই অনুভব করছে যে এগুলির মধ্যে প্রবল বিরোধিতা রয়েছে, যা হয়তো LeCun-এর অত্যন্ত স্পষ্ট ও দৃঢ় মতাদর্শের কারণে। কখনও কখনও একজন বিজ্ঞানী বাইরের লোকদের নিজের মতাদর্শটি মনে রাখার জন্য এটিকে খুব পরিষ্কারভাবে ব্যক্ত করেন।
কিন্তু পিক্সেল পথও আসলে লেটেন্ট স্পেসের উপর নির্ভর করে কাজ করে। Stable Diffusion, Sora উভয়ই প্রথমে ছবি বা ভিডিওকে লো-ডাইমেনশনাল রিপ্রেজেন্টেশন স্পেসে কম্প্রেস করে তারপর প্রসেস করে। তাই, রিপ্রেজেন্টেশন স্পেসই আসলে আরও মৌলিক সমস্যা। দুটি পথের আসল পার্থক্য লেটেন্ট স্পেস ব্যবহার করা উচিত কি না, এটার উপর নয়, বরং লেটেন্ট স্পেসে প্রবেশের পর কী বজায় রাখবেন, কী বাদ দেবেন, এটার উপর।
পার্থক্যটি হল: ইম্বেডেড স্পেস পদ্ধতিটি আলো-ছায়া, টেক্সচার এমন পিক্সেল ডিটেইলগুলি বাদ দিতে চায় যা পদার্থবিদ্যার নিয়ম দ্বারা নিয়ন্ত্রিত হয় না, যাতে মডেলটি অবস্থার পরিবর্তনের পেছনের গভীরতর নিয়মগুলি শিখতে পারে; কিন্তু এটি রিপ্রেজেনটেশন ক্র্যাশের ঝুঁকির সম্মুখীন হয়—যদি একহাজারটি ভিন্ন ইমেজ একইভাবে প্রতিনিধিত্ব করা হয়, তবে রিপ্রেজেনটেশনটি ক্র্যাশ করে, যার অর্থ মডেলটি ভিন্ন অবস্থাগুলি চিহ্নিত করার ক্ষমতা হারিয়ে ফেলে। পিক্সেল পদ্ধতিটি সূক্ষ্মতম বিস্তারিতকে অনুসরণ করে, যা本质上 মানুষের চোখকে সন্তুষ্ট করার চেষ্টা, কারণ মানুষ দৃশ্যমান বিস্তারিতগুলির প্রতি অত্যন্ত সংবেদনশীল।
এআই টেক রিভিউ: এখানে পৌঁছানোর পর আমাদের একটি অনুভূতি হলো। মানুষের মস্তিষ্কও কি অন্তর্নিহিত স্পেসে যুক্তি প্রয়োগ করে? আপনি চোখ বন্ধ করে কোনো কাজের ফলাফল কল্পনা করেন, কেউ কি মস্তিষ্কে পিক্সেল-বাই-পিক্সেল রেন্ডারিং করে?
জাং লেই: হ্যাঁ। যদি মানুষের মস্তিষ্কে একটি বিশ্ব মডেল থাকে, তবে মানুষ কীভাবে ক্রিয়াকলাপ পরিবেশকে পরিবর্তন করবে তা কল্পনা করার সময় এটি আসলে একটি ইম্প্লিসিট স্পেসে কাজ করে, এবং মস্তিষ্কের মধ্যে পুরো ছবিটি পিক্সেল-দ্বারা-পিক্সেল পাস করে না। তাই, চিত্রের গুণগত মানের জন্য মানুষের চোখের মূল্যায়নকে বিশ্ব মডেলের মূল্যায়নের মাপকাঠি হিসাবে ব্যবহার করা যথেষ্ট নয়। পিক্সেল-ভিত্তিক পথটি যদি একটি বিশ্ব মডেল তৈরি করে, তবে এটি যা অনুসরণ করা উচিত তা হলো পিক্সেলগুলির প্রতিটিরই বাস্তবসম্মততা নয়, বরং জেনারেট করা ভিডিও সিরিজটির ভৌতভাবে যৌক্তিকতা।
(লেখকের নোট: এই কথোপকথনটি AI বিশ্ব মডেলের দুটি পথের মধ্যে বিরোধ নিয়ে আলোচনা করে। Sora-এর মতো পিক্সেল-ভিত্তিক পদ্ধতি শুধুমাত্র দৃশ্যের বাস্তবসম্মততার দিকে মনোযোগ দেয়, যা প্রায়শই কাপটি ভাসছে, বস্তুগুলি পারস্পরিকভাবে ভেদ করছে, বা মোমবাতি নিভছে না—এই ধরনের পদার্থবিজ্ঞানের সাধারণ নিয়মের বিরুদ্ধে কাজ করে। অন্যদিকে, LeCun এবং Zhang Lei-এর প্রস্তাবিত লেটেন্ট স্পেস পদ্ধতি প্রথমে দৃশ্যকে নিয়মের মধ্যে সারাংশবদ্ধ করে, তারপর এটি প্রতিফলিত করে, যা পদার্থবিজ্ঞানগত কারণ-প্রভাবকে বেশি বুঝতে পারে। Zhang Lei-এর মূল উদ্ভাবনটি হলো, লেটেন্ট স্পেসে “বস্তুর কাঠামো” যোগ করা, যাতে AI-এর মধ্যে কাপ, টেবিল, মানুষ—এইসব স্বতন্ত্র বস্তুগুলির পার্থক্য তৈরি হয়, এবং তারপরই এগুলির মধ্যকার 상호작্রমের নিয়মগুলি শেখা।এটি Sora-এর মতো দৃশ্যগতভাবে অসঙ্গতির (visual glitches) সমস্যা এড়ায়,এবংশুধুমাত্রপরিপূর্ণভাবেঅমূর্তলেটেন্টস্পেসেরচেয়েঅধিকভাবেযথার্থবিশ্বেরমধ্যেরবটগুলিকেবাধা-এড়ানো,ধরা,এবংক্রিয়াপরিকল্পনারজন্যউপযুক্ত।)
এআই টেক রিভিউ: আপনি লেকুনের সাথে একই ইম্বেডেড স্পেস পথে চলেছেন। কিন্তু আমরা শুনেছি, আপনার পদ্ধতিতে তার সাথে একটি মৌলিক পার্থক্য আছে—আপনি “বস্তুর কাঠামো প্রবর্তন”-এর উপর জোর দেন। মূল পার্থক্যটি কী?
জাং লেই: আমাদের পথটি লেকুনের সাথে একই প্রাথমিক নীতি অনুসরণ করে: মানুষের মস্তিষ্ক বাস্তবিক পরিস্থিতির বিপরীতে যুক্তি প্রয়োগ করে (“যদি আমি এটি করি তবে কী হবে?” এর যুক্তি), যা অ্যাকশন-শর্তাধীন, এবং এটি বিমূর্ত প্রতিনিধিত্বের মধ্যে প্রতিফলিত হয়, পিক্সেলে পুনরাবৃত্তি নয়।
লেকুন গত কয়েক বছর ধরে I-JEPA, V-JEPA, LeJEPA ব্যবহার করে এই অক্ষরটি প্রমাণ করেছেন: পূর্বাভাস প্রতিনিধিত্ব স্থানে ঘটা উচিত। কিন্তু শরীরের দিক থেকে ভৌত স্থানের জটিলতা অত্যন্ত বেশি, এই পদ্ধতিটি বড় পরিসরের বাস্তব পরিবেশে প্রয়োগ করতে, আমরা মনে করি গোপন স্থানে প্রয়োজনীয় কাঠামো যোগ করা প্রয়োজন।
এই দৃষ্টিভঙ্গি আমাদের যাচাইকৃত ক্ষমতার উপর ভিত্তি করে। আমাদের মূল দল দ্বারা বিকশিত DINO-X এখন ওপেন-ওয়ার্ল্ডে “বস্তু দেখা” সমস্যাটি সমাধান করেছে। তাই এখন, আমরা বস্তুগুলিকে বিশ্ব মডেলের পূর্বানুমান এবং পরিকল্পনার মৌলিক একক হিসাবে ব্যবহার করছি। সহজভাবে বলা যায়, পদার্থবিদ্যার নিয়মগুলি বস্তুগুলির উপর কাজ করে, এবং গোপন স্থানের প্রতিনিধিত্বের মাধ্যমে বস্তুগুলির বোঝা, পদার্থবিদ্যার নিয়মগুলি শেখার জন্য আরও কার্যকরভাবে সহায়তা করে।
এআই টেক রিভিউ: অপেক্ষা করুন, আমরা একটি প্রশ্ন জিজ্ঞাসা করতে চাই। লেকুনের AMI Labs একাধিক বিলিয়ন ডলার ফান্ডিং নিয়েও এই দিকে কঠোরভাবে কাজ করছে। আপনাদের “বস্তুর কাঠামো প্রবর্তন” উন্নতির ভিত্তিতে, আপনারা কীভাবে মনে করেন যে আপনারা তাঁর বড় কাঠামোর উপরে আরও দূরে যাবেন?
জাং লেই: কারণ আমরা আগে DINO-X করেছিলাম, যা একটি খোলা বস্তু সংবেদনশীল সাধারণ মডেল, যা "বস্তু বুঝতে" বিশ্বের সেরা হয়েছে। আমাদের দৃশ্যমান মডেলের কার্যপ্রণালী সম্পর্কে বোঝা, কেন দৃশ্যমান মডেলগুলি ভৌত যৌক্তিকতা তৈরি করে, এগুলি মূলত সাধারণ বস্তু বুঝতে এই লাইনের সাথে খুব মিলে যায়।
সহজ কথায়, লেকুনের পথটি হল মৌলিক কাঠামো, আমরা এই কাঠামোর উপর বস্তুর কাঠামো যোগ করি এবং এটিকে বাস্তব পরিবেশে সিলড করি। এই “সিলড” ক্ষমতাটি আমরা গত কয়েক বছরে তৈরি করেছি।
DINO সিরিজ কেন গুগল এবং মেটা কে পরাজিত করছে?
এআই প্রযুক্তি পর্যালোচনা: আপনার দল ভিজুয়াল লার্জ মডেল পর্যায়ে অসাধারণ সাফল্য অর্জন করেছে। গ্রাউন্ডিং ডিনো এবং পরবর্তীতে চালু করা ডিনো-এক্স গুগল এবং মেটা কে পিছনে ফেলে স্ট্যানফোর্ডের লি ফেইফেই টিম, নভিডিয়া, গ্যালাক্সি জেনারেলসহ বিশ্বব্যাপী শীর্ষস্থানীয় প্রতিষ্ঠানগুলির মানক উল্লেখ হয়েছে। এই বিষয়টি আমাদের অভ্যন্তরীণভাবে আলোচনা করা হয়েছে, এবং সবাই এটিকে "অস্বাভাবিক" মনে করেছে: সাধারণত চীনা দলগুলি বিদেশীদের অনুসরণ করে, কিন্তু আপনারা কিভাবে বিদেশী দলগুলিকে আপনাদের অনুসরণ করতে বাধ্য করলেন?
জাং লেই: দুটি মাত্রা বেশি উল্লেখযোগ্য।
ভিজুয়াল ডোমেইনে, আমরা প্রথম দল যে ট্রান্সফরমার (একটি সেলফ-অ্যাটেনশন মেকানিজম ভিত্তিক ডিপ লার্নিং আর্কিটেকচার এবং বড় ভাষা মডেলের মূল ভিত্তি) ব্যবহার করে SOTA (State of the Art, ক্ষেত্রের সেরা পর্যায়) ডিটেকশন অর্জন করেছে। Grounding DINO ভাষা মডেলের প্যারাডাইমটি চালু করে প্রথমবারের মতো বস্তু শনাক্তকরণকে ওপেন-ডোমেইনে প্রসারিত করেছে; মডেলটি শুধুমাত্র "প্রশিক্ষণকৃত বস্তুর শ্রেণীগুলি" চিনতেই সীমাবদ্ধ ছিল না, বরং এটি আগে কখনও দেখা না হওয়া যেকোনো বস্তুকে শনাক্ত করতে পারে। এখনও, এটি ওপেন-সোর্স মডেলগুলির মধ্যে সবচেয়ে বেশি উদ্ধৃত এবং ডাউনলোডযুক্ত, যা একটি প্যারাডাইম-লেভেলের বিপ্লব বলা যায়।
গ্রাউন্ডিং ডিনো-এর পরে, আমরা ডেটা এবং ইঞ্জিনিয়ারিং কৌশলে বন্ধ সোর্স পথে যাই এবং যাচাইকৃত ধারণাগুলিকে স্কেলিংয়ের দিকে নিয়ে যাই। একইসাথে, আমি আমার কাজের মানের জন্য খুব উচ্চ মানদণ্ড রাখি। যদিও সেই সময় দলটি তরুণ ছিল এবং এতটাই শক্তিশালী কাজ করেনি, তবুও আমি দৃঢ়ভাবে সীমানা রেখেছিলাম এবং বলেছিলাম যে শুধুমাত্র বড় সংস্করণের মতো বিপ্লবী অগ্রগতি হলেই প্রকাশ করা হবে। ফলে, আমরা গ্রাউন্ডিং ডিনো 1.5 চালু করতে প্রায় এক বছর সময় নিয়েছিলাম, এবং DINO-X চালু করতে আরও ছয় মাস সময় নিয়েছিলাম। প্রমাণিত হয়েছে যে, এই এক-বছর-অধিক-সময়ের পরিশ্রমের ফলাফলগুলির শিল্পের স্বীকৃতি খুবই উচ্চ।
এআই টেক রিভিউ: আপনারা যে ভিজুয়াল বড় মডেলগুলি তৈরি করছেন, তারা আজকের ওয়ার্ল্ড মডেল তৈরির সাথে কীভাবে সম্পর্কিত?
জাং লেই: আমাদের কাজ একই রেখায় চলেছে। আগে বস্তু সনাক্তকরণের কাজ করা হয়েছিল, যার মূল লক্ষ্য ছিল রোবটকে পরিবেশ বুঝতে সহায়তা করা, এরপর অনেক দল আমাদের Grounding DINO ব্যবহার করে এমবডিড পরিবেশ বোঝার সমস্যা সমাধান করেছে।
টেকনিক্যাল লাইনে, ওয়ার্ল্ড মডেলগুলি ভিজুয়াল-ন্যাটিভ এবং প্রায় সমস্ত ওয়ার্ল্ড মডেল কাজ GPT-এর মতো শুধুমাত্র ভাষাগত আর্কিটেকচারের উপর ভিত্তি করে নয়।
টিমের অভিজ্ঞতার ক্ষেত্রে, আমাদের ভিজুয়াল মডেলের কার্যপ্রণালী বোঝার দিকে আমাদের বুঝতে পারা খুব বেশি সামঞ্জস্যপূর্ণ, যা আগের সাধারণ বস্তু বুঝতে পারা টেকনোলজির দিকের সাথে মিলে যায়। এটিই আমাদের বিশ্ব মডেলকে ধারাবাহিকভাবে আপডেট করার প্রতি আমাদের আত্মবিশ্বাসের কারণ।
এই দলটি IDEA থেকে জন্ম নেওয়া 20-এরও বেশি সদস্যের একটি খুব স্থিতিশীল দল। আমরা বন্ধ সোর্স মডেল তৈরি করার সময়ও বাইরের অ্যালগরিদম এবং ইঞ্জিনিয়ারিংয়ে দক্ষ ব্যক্তিদের আকর্ষণ করেছি। এই 20-এরও বেশি মানুষই আজকের শিভিকির “বীজ”।

DINO সিরিজ মডেল থেকে ওয়ার্ল্ড মডেলের উন্নয়ন পথ
কিভাবে এআই প্রকৃতপ্রস্তাবে বস্তুগুলি “দেখতে” পাবে?
এআই টেক রিভিউ: আপনি বলেছেন যে বর্তমান ইম্বেডেড স্পেস সমাধানগুলি "বাস্তবিকভাবে বস্তুগুলি বুঝতে পারে না", এগুলি জানে না যে দৃশ্যে কোনগুলি স্বতন্ত্র বস্তু, বস্তুগুলির মধ্যে কী সম্পর্ক। আমরা খুব কৌতূহলী, এটি কীভাবে নির্ধারণ করা হয়? কীভাবে জানা যায় যে মডেলটি সত্যিই "বুঝছে" বস্তুগুলি, নাকি শুধু "বুঝার ভান" করছে?
জাং লেই: বুঝতে পারা সরাসরি যাচাই করা কঠিন। ভাষা মডেলগুলি কীভাবে ভাষা বুঝে, এখনও কেউ পরিষ্কারভাবে ব্যাখ্যা করতে পারেনি; শুধুমাত্র আচরণের প্রতিফলনের মাধ্যমে বিচার করা যায়। যদি এটি অবিচ্ছিন্নভাবে টেক্সট উত্পাদন করে এবং আপনি মনে করেন যে এটি মানুষের কথা বলার মতো, তবে আপনি বলবেন যে এটি বুঝেছে।
ওয়ার্ল্ড মডেলগুলি একই ধরনের সমস্যার সম্মুখীন হয়। মডেলটি প্রকৃতপক্ষে পদার্থবিদ্যার নিয়মগুলি বুঝেছে কিনা এবং বস্তুর কাঠামোগুলি সত্যিই ধরে ফেলেছে কিনা, তা সরাসরি ব্যাখ্যা করা কঠিন। আমরা মধ্যবর্তী ধাপগুলির ভিজুয়ালাইজেশনের মাধ্যমে বিশ্লেষণ করব, যদি ফলাফলগুলি মানুষের স্বাভাবিক অনুভূতির সাথে সঙ্গতিপূর্ণ হয়, তবে এটি বস্তুর কাঠামোগুলি ধরে ফেলেছে বলে ধরে নেওয়া যায়।
এআই টেক রিভিউ: কোনো নির্দিষ্ট পরীক্ষার পদ্ধতি আছে? কি একটি পরীক্ষা করে দেখা যায়?
জাং লেই: হ্যাঁ। বিপরীত প্রকল্প পরীক্ষা হল একটি ভালো পদ্ধতি, যেখানে মডেলটিকে বিভিন্ন ক্রিয়াগুলি প্রয়োগ করতে দেওয়া হয় এবং দেখা হয় যে এটি ভৌতভাবে যুক্তিসঙ্গত ফলাফল দিতে পারে কিনা। যদি ট্র্যাজেক্টরি একটু বিচ্যুত হয়েও সঠিকভাবে করা যায়, তাহলে এটি নিয়মগুলি শিখেছে; যদি করতে না পারে, তাহলে এটি সম্ভবত শুধুমাত্র পরিসংখ্যানগত সম্পর্কই শিখেছে।
এটি দক্ষতার পরীক্ষা। যেমন রিচার্ড সাটন প্রফেসর বলেছেন, গবেষকরা সবসময় মডেলকে সাহায্য করার ইচ্ছা করেন, তাদের নিজস্ব অভিজ্ঞতা ঢুকিয়ে দেওয়ার প্রবণতা থাকে। ভাষা মডেল গবেষকরা একসময় বাক্য গঠনের বিশ্লেষণ করে, শব্দ বিভাজন, শব্দগুচ্ছ সবকিছু মডেলকে খাওয়ানোর চেষ্টা করেছিলেন, কিন্তু শেষপর্যন্ত “পরবর্তী টোকেন পূর্বানুমান” এই সহজ পদ্ধতি দ্বারা পরাজিত হয়েছিল।
আমি নিজে এই সরল প্যারাডাইমের পুনরাবৃত্তির শক্তিতে খুব বিশ্বাস করি। অতিরিক্ত মানব ডিজাইন সংক্ষিপ্ত সময়ের জন্য কার্যকর, কিন্তু দীর্ঘমেয়াদে পুনরাবৃত্তির বাধা হয়ে দাঁড়ায়।
এআই টেক রিভিউ: ভৌত বিশ্বে কিছু খুব জটিল বস্তু আছে, যেমন রেতের স্রোত, জলের প্রবাহ, ধোঁয়া এবং কাপড়, যাদের স্পষ্ট সীমানা নেই। আমাদের চিন্তা হচ্ছে, আপনার “বস্তু-কেন্দ্রিক” কাঠামোটি কি “বস্তু” ধারণার দ্বারা বদ্ধ হয়ে যাবে?
জাং লেই: এই প্রশ্নটি আমরা নিজেদেরও চিন্তা করছি। প্রযুক্তিগতভাবে, সবচেয়ে সহজ প্রবেশার্ধ হল Mask, যা বস্তুর অঞ্চলের পিক্সেলগুলিকে বিভক্ত করে। গত কয়েক বছরে দৃশ্যক্ষেত্রে বস্তুর বৈশিষ্ট্য বোঝার এবং Mask পূর্বানুমানের ক্ষেত্রে এটি খুবই পরিপক্ক হয়েছে, যা রেতো, জলসমূহের মতো অ-কঠিন বস্তুগুলিও প্রক্রিয়াকরণ করতে পারে।
সুতরাং, মাস্ক দিয়ে শুরু করা একটি বাস্তবসম্মত শুরু। আর আমাদের সাধারণ বস্তু সংবেদনের উপর সঞ্চিত অভিজ্ঞতা, বাইরের যেকোনো দলের চেয়ে বেশি।
EgoTwin: মানুষের হাত দিয়ে রোবটের হাতকে শেখানো
এআই টেক রিভিউ: আপনার টেকনোলজি ফ্রেমওয়ার্কে একটি অত্যন্ত গুরুত্বপূর্ণ ধারণা আছে যার নাম "অ্যাকশন অ্যালাইনমেন্ট", যা মানুষের হাত, দুটি আঙুলের গ্রিপার, এবং বহু-আঙুলের দক্ষ হাতের মতো বিভিন্ন কনফিগারেশনের অ্যাকশনকে একই ইম্বেডেড স্পেসে ম্যাপ করে। আমরা এটিকে এভাবে বুঝি, এটি রোবটগুলিকে বিভিন্ন "ভাষা" এর অ্যাকশনগুলি বুঝতে সহায়তা করার মতো একটি অনুবাদের মতো, তাই না?
জাং লেই: বিশ্ব মডেলের প্রধান ইনপুট দুটি: দৃশ্য (অবস্থা) এবং ক্রিয়া, তাই ক্রিয়ার বোঝাপড়া খুবই গুরুত্বপূর্ণ।
অ্যাকশন অ্যালাইনমেন্ট হল একাধিক অবজেক্টের জন্য একটি মৌলিক প্রয়োজনীয়তা। মানুষের হাত এবং রোবটিক আর্মের অ্যালাইনমেন্ট আরও কঠিন: রোবটিক আর্মের জয়েন্টের অবস্থান ভৌত স্থানের XYZ স্থানাঙ্কে সঠিকভাবে জানা যায়, কিন্তু মানুষের হাতের ডেটা সাধারণত 2D ভিডিও, যেমন কেউ রান্না করার একটি ভিডিও তুললে, সেখানে শুধুমাত্র 2D ছবি থাকে, 3D স্থানাঙ্ক নেই। সরাসরি মিশ্রণ করলে দক্ষতা খুবই কম।
আমাদের পদ্ধতি হলো 3D কীপয়েন্ট বের করা, যার মাধ্যমে মানুষের হাতের 2D ভিডিওকে 3D স্পেসের অপারেশন সিকোয়েন্সে রূপান্তরিত করা এবং এটিকে মেকানিক্যাল আর্মের ডেটার সাথে একই ভৌত স্পেসে অ্যালাইন করা। এটিই বর্তমানে শিল্পে Ego ডেটা (প্রথম ব্যক্তির দৃষ্টিকোণ থেকে সংগৃহীত মানব অপারেশন ডেটা) সংগ্রহ এবং প্রক্রিয়াকরণ।
আমরা আগে যে EgoTwin প্রকাশ করেছিলাম, তা মূলত এই ধরনের ডেটা সংগ্রহের সমস্যা সমাধান করে, এবং এখন আমরা বাইডু ক্লাউডের ডেটা সংগ্রহ দলের সাথে কাজ করছি।
এআই টেক রিভিউ: ইগোটুইন "হাত কীভাবে ন动" ডেটা সমস্যার সমাধান করেছে। কিন্তু আমরা একটি প্রশ্ন করতে চাই, মানব ভিডিওতে আরও উচ্চতর স্তরের তথ্য লুকিয়ে আছে, "হাত এভাবে কেন ন动"-এর ইচ্ছা, এই অংশটি কীভাবে সমাধান করা হবে?
জাং লেই: উচ্চতর স্তরের কার্যকলাপের ইচ্ছা বুঝতে, আমরা এটিকে বিশ্ব মডেল বা ভিএলএ মডেলের উপর ছেড়ে দেব। কিন্তু এর পূর্বশর্ত হল ডেটার নিজস্ব গুণগত মান যথেষ্ট উচ্চ হওয়া। ডেটার কাঁচামাল খুবই গুরুত্বপূর্ণ। শিল্পে ডেটা সংগ্রহের জন্য অসংখ্য মানবিক প্রচেষ্টা এবং খরচ করা হয়েছে, কিন্তু অনেকক্ষেত্রে ডেটার ব্যবহারের দক্ষতা পরিপূর্ণ নয়। আমাদের Grounding DINO এবং DINO-X-এর কাজে অর্জিত মূল অভিজ্ঞতা হল, অ্যালগরিদমকে বোঝা এমন মানুষকে ডেটা তৈরির গভীরে যেতে হবে, অন্যথায় সংগৃহীত ডেটা ট্রেনিংয়ের সময় ব্যবহারযোগ্য হবে না। অ্যালগরিদম এবং ডেটা—উভয়টিরই সমান্তরালভাবে পুনরাবৃত্তি করা প্রয়োজন।
জাং বো এবং শেন জিয়াংয়াং: দুইজন গুরু, একই ভিত্তি
এআই প্রযুক্তি পর্যালোচনা: আমরা লক্ষ্য করেছি যে, আপনার পিছনে দাঁড়িয়ে আছেন দুজন ব্যক্তি যারা আপনার উপর গভীর প্রভাব ফেলেছেন—জাং বো অ্যাকাডেমিশিয়ান (চীনা কৃত্রিম বুদ্ধিমত্তার প্রতিষ্ঠাতা একজন) এবং শেন হিয়াংয়াং অ্যাকাডেমিশিয়ান (পূর্বতন মাইক্রোসফট গ্লোবাল এক্সিকিউটিভ ভাইস প্রেসিডেন্ট, পূর্বতন মাইক্রোসফট এশিয়া রিসার্চ ইনস্টিটিউটের পরিচালক)। একজন শুধুমাত্র শৈক্ষিক, অন্যজন শুধুমাত্র শিল্প-ভিত্তিক। আমরা খুবই জানতে চাই, তাঁরা প্রত্যেকে আপনাকে কী দিয়েছেন?
জাং লেই: প্রফেসর জাং বো সর্বদা আমার গুরু এবং অনুপ্রেরণার প্রতীক। আমি প্রথম প্রফেসর জাংকে চিনি যখন আমি ক্লারা বিশ্ববিদ্যালয়ের স্নাতক প্রথম বর্ষে প্রবেশ করি, তখন তিনি ল্যাবের প্রধান ছিলেন। সেই সময় আমি AGV (অটোমেটেড গাইডেড ভেহিকল) নিয়ে কাজ করছিলাম, এবং আমার অধিকাংশ অতিরিক্ত সময় ল্যাবে হার্ডওয়্যার টেস্টিং এবং পরীক্ষা-নিরীক্ষায় কাটিয়েছিলাম; তখনই আমি প্রফেসর জাংকে ল্যাবে ডক্টরেট ছাত্রদের রোবটিক্স-সংক্রান্ত কাজের দিকে নির্দেশনা দিতে দেখতাম। পরবর্তীতে, আমি খুবই ভাগ্যবান, প্রফেসর জাংয়ের ডক্টরেট ছাত্র হয়েছিলাম। সবচেয়ে বেশি মনে পড়ে, তিনি নতুন প্রযুক্তির প্রতি অত্যন্ত সংবেদনশীল এবং শক্তিশালী কৌতূহলী। প্রতিবার আমি তাঁকে পরীক্ষার ফলাফলগুলির আলোচনা করতে দেখালে, তিনি উৎসাহের সাথে পাশে বসেন, “এটা একটু পরিবর্তন করে, দেখো, কীভাবে হয়” —এইভাবেই। এইভাবেই, তিনি নিজেও নিজের বোঝারগুলিকেওগভীরভাবেই।আপনি ।একজনশিক্ষাবিদকেদেখতেপাবেনযা।অ্যালগরিদম,সমস্যা।বোঝার।পুরোপুরি।কৌতূহল।দ্বারা।পরিচালিত।
আজও যে কথাটি আমি মানি, তা হলো তিনি বলেছিলেন, “কিছু বুঝতে হলে সম্পূর্ণভাবে বুঝতে হবে”; যদি আপনি পুরোপুরি বুঝতে না পারেন, তাহলে আপনি প্রতারিত হবেন, এবং যখন আপনি পুরোপুরি বুঝতে পারবেন, তখনই আপনি মূল নীতিগুলি বুঝতে পারবেন। এই বাক্যটি পরবর্তীতে আমার শিক্ষার্থীদের প্রতি আমার নীতি হয়ে উঠেছে: সম্পূর্ণভাবে বুঝুন, সর্বোত্তমের দিকে যান।
শেন জিয়াংয়াং মহামহোপাধ্যায়ের আমার উপর অনেক বড় প্রভাব পড়েছে। আমি মাইক্রোসফটে থাকাকালীন, তিনি সর্বদা আমার প্রধান বস ছিলেন, এবং তিনি আমার সম্পূর্ণ ক্যারিয়ারের দিকনির্দেশনা করেছিলেন: চীন থেকে মার্কিন যুক্তরাষ্ট্রে আসা তিনিই আমাকে নিয়োগ দিয়েছিলেন, এবং মার্কিন যুক্তরাষ্ট্র থেকে শেনজেনে ফিরে আসা তিনিই আমাকে উৎসাহিত করেছিলেন। এছাড়াও, তিনি শিল্পের দিকনির্দেশনায় অত্যন্ত সূক্ষ্ম বিচারশক্তি রাখেন, টিম গঠন থেকে শুরু করে বিনিয়োগের বিষয়েও আমাকে অনেকগুলি বিশদ পরামর্শ এবং অভিজ্ঞতা শেয়ার করেছিলেন।
এআই প্রযুক্তি পর্যালোচনা: শুনেছি যে জাং বো স্যার ৯০ বছর বয়সেও আপনাদের দলের সাথে আলোচনা করতে এসেছিলেন? এটা শুনে আমাদেরও খুব অনুপ্রাণিত হতে হয়েছে।
জাং লেই: হ্যাঁ। গত নভেম্বরে, তসিংহু গ্র্যাজুয়েট স্কুল তাকে শেনজেনে বক্তৃতা দিতে আমন্ত্রণ জানায়। তিনি সকালে বক্তৃতা শেষ করেন, এবং বিকালে আমাদের দলের জন্য সময় রাখেন। আমরা একটা পুরো বিকাল আলাপ-আলোচনা করি, এবং রাতে একসাথে খাবার খাই। তার দৃষ্টিভঙ্গি খুবই ব্যাপক, এবং আমাদের জেনারিক ভিজুয়াল বোঝা এবং রোবটিক্সের দিকগুলোর জন্য তিনি অসংখ্য পরামর্শ দেন। যদিও তিনি বয়স্ক, তবুও তার চিন্তাভাবনা খুবই স্পষ্ট, যুক্তিসঙ্গততা এবং সমস্যার প্রতি বোঝার গভীরতা—এগুলোতে তিনি যুবকদের সমান।
প্রতিটি ঢেউ কল্পনাকে ছাড়িয়ে যায়, কিন্তু ঢেউগুলো নিজেরাই আপনার কাছে আসবে
এআই টেক রিভিউ: গত কয়েক বছরে, গভীর শিক্ষা থেকে বড় মডেল এবং শরীরবৃত্তিক এবং বিশ্ব মডেলের প্রতিটি ঢেউয়ে আপনি গভীরভাবে অংশগ্রহণ করেছেন। আমরা জানতে চাই, কোনো মুহূর্তে কি আপনি অনুভব করেছিলেন “এটাই আমার করা উচিত”?
জাং লেই: বস্তু শনাক্তকরণের কাজটি আপনি যে অবস্থার কথা বলেছেন, তার সাথে খুব কাছাকাছি। এই কাজটি আমাকে অত্যন্ত গর্বিত করেছে, কারণ আমি দেখতে পাচ্ছি যে এই ক্ষেত্রে একটি বিপ্লবী অগ্রগতি ঘটেছে।
পরবর্তী বিশ্ব মডেলটি হল এমন একটি দিক যার প্রতি আমি অত্যন্ত উত্তেজিত এবং সম্পূর্ণভাবে নিবেদিত হতে চাই। গত কয়েক দশকের শক্তিশালী শিক্ষা এবং বিশ্ব মডেলের পর্যায়ক্রমিক বিকাশ এবং ভাষা মডেলের সফল প্যারাডাইম থেকে আমরা অনেক কিছুই শিখতে পারি। আমি মনে করি, এই দিকটি সমগ্র AI শিল্পের উপর বড় প্রভাব ফেলবে।
এআই টেক রিভিউ: গবেষকদের উজ্জ্বল মুহূর্তগুলি প্রায়শই উল্লেখ করা হয়, কিন্তু নিম্নমুখী সময়গুলি প্রায় কখনই বলা হয় না। আপনি কি কোনো প্রযুক্তিগত নিম্নমুখী সময় অতিক্রম করেছেন?
জাং লেই: হ্যাঁ। 2018 এর আগে-পরে, আমি দুর্বল সুপারভাইজড ডেটা ব্যবহার করে বস্তু শনাক্তকরণের চেষ্টা করেছিলাম, যেখানে শুধুমাত্র ছবির শ্রেণী লেবেল ব্যবহার করে বস্তুগুলির বক্স লেবেলিংয়ের প্রয়োজনীয়তা এড়ানো যায়। এই পদ্ধতিটি খুবই আকর্ষণীয় মনে হয়েছিল, আমি এর জন্য প্রচুর সময় ব্যয় করেছিলাম, কিন্তু এটি সম্পূর্ণরূপে সমাধান করতে পারিনি।
পরে IDEA-এ Grounding DINO-এর জন্য কাজ করেছি, যেখানে ভাষা বুঝতে পারা এবং শনাক্তকরণের ক্ষমতা একত্রিত করে সমস্যাটিকে অন্যদিক থেকে সমাধান করা হয়েছে। এই বিপ্লবটি একদিকে DINO ডিটেকশন মডেলে আমাদের করা উদ্ভাবনের ফলাফল, যা আমাদের দৃঢ় ভিত্তি প্রদান করেছে, এবং অন্যদিকে ভাষা মডেলের উন্নতির কারণে। Grounding DINO-এর বিপ্লবটি 2022-এর শেষে এবং 2023-এর শুরুতে ঘটেছিল, যা ChatGPT-এর প্রকাশের সময়ের সাথে মিলে যায়। “যখন ডেটা যথেষ্ট বড় হয়, তখন বুদ্ধিমত্তা স্বাভাবিকভাবেই প্রকট হয়ে ওঠে” — এই ধারণাটি আছে, ডেটা যথেষ্ট বড় হলে, অ্যালগরিদমটি যথেষ্ট সহজও হতে পারে।
বাধা পেয়ে হতাশ হওয়া স্বাভাবিক, কিন্তু মূল বিষয় হলো খুব কঠিন সমস্যার সাথে লড়াইয়ের দৃঢ় ইচ্ছাশক্তি রাখা। একবার সমাধান না হলে, অন্য কোণ থেকে দেখুন, খাওয়া-দাওয়া, ঘুমের মধ্যেও এটির কথা ভাবুন, এর চারপাশে ঘুরে বেড়ান। সত্যিকারের ভালো সমস্যা বছরের পর বছর মনে থাকে, এবং কোনো এক মুহূর্তে, হয়তো স্বাভাবিকভাবেই একটি মৌলিক বিপ্লবের সূচনা হয়।
এআই টেক রিভিউ: বর্তমানে অনেক যুবকও বিশ্ব মডেল স্টার্টআপ করছেন, যেমন নেগেটিভ ম্যাট্রিক্সের চেন বোয়ান এবং জি জিয়ামিং, বাইজে টেকনোলজির বাই ইনকি। তারা এখনও স্নাতক ছাত্র। আমরা এটিকে খুবই আকর্ষণীয় মনে করি, আপনি এই “পরবর্তী ঢেউ”-এর বিষয়ে কী মনে করেন?
জাং লেই: এটি নির্দেশ করে যে গবেষণায় প্রবেশের বাধা প্রকৃতপক্ষে কমে গেছে। ডিপ লার্নিং-এর উত্থানের আগে, নতুন প্রবেশকারীদের কয়েক বছর ধরে মৌলিক দক্ষতা অর্জন করতে হত। এখন ওপেন-সোর্স প্রযুক্তি প্রযুক্তিকে সরল করেছে, Transformer বুঝতে পারলেই এই ক্ষেত্রে প্রবেশ করা যায়। যুবকদের সুবিধা হলো তাদের কাছে কোনো বোঝা নেই, প্রথম নীতি থেকে শুরু করে তারা সহজেই নতুন প্যারাডাইমগুলি গ্রহণ করতে পারে। কিন্তু সত্যিকারের কঠিন সমস্যাগুলির জন্যও দক্ষতা, বুঝিবার ক্ষমতা এবং দিশা নিয়ন্ত্রণের ক্ষমতা সম্পন্ন অভিজ্ঞ গবেষকদের প্রয়োজন।
সামাজিক ট্রেন্ড সবসময় পরিবর্তন হয়, কিন্তু শুধু ট্রেন্ডের পিছনে দৌড়ানোর জন্য দৌড়ালে আপনি তা ধরতে পারবেন না। মূল বিষয়টি হল: যেকোনো দিকে যাক, প্রতিটি দলের সবসময় সবচেয়ে দক্ষ মানুষদের প্রয়োজন। আপনি যদি শিখতে থাকেন এবং আপনার মৌলিক দক্ষতা শক্তিশালী রাখেন, তাহলে সবচেয়ে অগ্রগামী দিকগুলি নিজেই আপনার দিকে আসবে।
একটি প্রতীক
এই সাক্ষাত্কারের সবচেয়ে বেশি আমাদের মন ছুঁয়েছিল তাঁর উজ্জ্বল প্রযুক্তিগত সাফল্য নয়, এমনকি তিনি প্রশিক্ষণ দিয়েছিলেন এমন পরবর্তী প্রতিভাগুলিও নয়—ইন্টার্ন হুয়াং জেং, লি শুয়েলং, এবং মাইক্রোসফটের প্রথম প্রজন্মের চেহারা শনাক্তকরণ অ্যালগরিদম প্রকল্পের দলের সদস্য জু লং, শিয়াও রোং, ইয়ান শুইচেং।
আমাদের সবচেয়ে বেশি প্রভাবিত করেছে তার বারবার উল্লেখ করা একটি শব্দ: “পুরোপুরি বুঝতে”。
এই শব্দটি চাং লেই ৩০ বছর ধরে লিখে রেখেছেন।
1990-এর দশকের শুরুতে তসিংহুয়া ক্যাম্পাসে, কৃত্রিম বুদ্ধিমত্তা একটি এমন অজ্ঞাত বিষয় ছিল যা কারও মনোযোগ আকর্ষণ করত না, জাং লেই ছিলেন কম্পিউটার বিজ্ঞান বিভাগের একজন স্নাতক ছাত্র যিনি গবেষণাগারে AGV গাড়ির সাথে কাজ করছিলেন। সেই সময় পরীক্ষাগারের প্রধান ডক্টরেট ছাত্রদের রোবটিক্স-সংশ্লিষ্ট কাজের দিকে পরিচালিত করছিলেন, যা তাঁর মনে গভীর প্রভাব ফেলেছিল, পরবর্তীতে তিনি তাঁর শিষ্য হন।
ল্যাবের প্রধানের নাম জাং বা, চীনা কৃত্রিম বুদ্ধিমত্তার প্রতিষ্ঠাতা। যখন জাং লেই তাঁকে পরীক্ষার ফলাফল দেখতে আমন্ত্রণ জানান, তখন তিনি সবসময় উৎসাহের সাথে জাং লেইয়ের পাশে বসেন, স্ক্রিনের দিকে কিছুক্ষণ তাকিয়ে, আঙুল বাড়িয়ে বলেন: “এটা একটু পরিবর্তন করে দেখো, কী হয়।” এটা হোমওয়ার্ক চেক করা নয়, বরং তিনি সত্যিই জানতে চান, প্যারামিটারগুলো পরিবর্তন করলে কী ঘটবে।
জাং বো জাং লেইকে যা শেখান, তা পরে তিনটি শব্দে সংক্ষিপ্ত হয়: "গভীরভাবে বুঝুন"।
যদি আপনি বুঝতে না পারেন, তাহলে আপনি প্রতারিত হবেন, কিন্তু যদি আপনি ভালোভাবে বুঝতে পারেন, তাহলেই আপনি বুঝতে পারবেন যে মূল নীতিগুলি কী।
চীনের এক প্রজন্মের বিজ্ঞানীদের আধ্যাত্মিকতা এই ক্ষুদ্র ক্ষুদ্র বিষয়গুলির মধ্যে প্রেরণা পায়।
2018 সালে, জাং লেই মাইক্রোসফটে দুর্বল সুপারভাইজড অবজেক্ট ডিটেকশনে কাজ করছিলেন, কিন্তু তিনি এটি সফলভাবে করতে পারেননি, তিনি বিষয়টি পরিবর্তন করেননি।
যদি এই চেষ্টায় সফল না হয়, তাহলে একটি ভিন্ন দৃষ্টিকোণ থেকে দেখুন, খাওয়া-দাওয়া আর ঘুমের সময়ও এটি নিয়ে চিন্তা করুন, এর চারপাশে অবিরাম ঘুরুন।
এটি একটি রূপক নয়, এটি তার দৈনিক জীবন।
পরে IDEA-তে Grounding DINO-এ কাজ করার সময়, তিনি সমস্যাটিকে অন্য দিক থেকে সমাধান করেন। বিপ্লবের মুহূর্তটি ছিল ২০২২ সালের শেষের দিকে ChatGPT-এর আবির্ভাব—ভাষা মডেলের ক্ষমতা বেড়েছিল, ডেটা যথেষ্ট বড় ছিল।
জাং লেই একটি বর্ণনা ব্যবহার করেছিলেন: "স্বাভাবিকভাবেই উদ্ভূত হওয়া"।
AGV রোবটের প্যারামিটার পরিবর্তন থেকে বিশ্ব মডেল বুঝতে তিনি ত্রিশ বছর অতিক্রম করেছেন। এই ত্রিশ বছরে তিনি বড় পরিসরের ছবি অনুসন্ধান থেকে সাধারণ দৃশ্য বোঝার দিকে যান, প্রতিটি সমস্যার জন্য পুরোপুরি বুঝতে এবং সেরাটি করতে চেয়েছেন, যতক্ষণ না আবার “রোবটের জন্য বিশ্ব মডেল তৈরি” এই দিকে ফিরে আসেন। ঠিক জবসের মতোই “connect the dots” — প্রতিটি ভালোভাবে করা কাজই ব্যর্থ হয়নি।
২০২৫ সালের শেষের দিকে, ৯০ বছর বয়সী জাং বা শেনজেনে পাঠ দেন। সকালে পাঠ শেষ করে, বিকালে তিনি শিহুই ভিজুয়াল ফিউচারের অফিসে ঢুকে পড়েন। সাত আটজন যুবক তাঁকে ঘিরে বসে, তিনি পুরো বিকাল ধরে বলেন, রাতে একসাথে খাবার খেয়ে তিনি নিজের পড়াশোনার কথা বলেন, এই দিকটি নিয়ে তাঁর মূল্যায়ন ব্যাখ্যা করেন। তাঁর চিন্তাভাবনা স্পষ্ট, যুক্তি প্রবল, যুবকদের চেয়ে কম নয়। জাং লেইও তাঁর শিক্ষককে নিজের করছেন এমন কাজগুলির কথা বলেন।

বিশিষ্ট বিজ্ঞানী জাং বো ভিজুয়াল ফিউচারে, জাং লেই তাঁর শিক্ষককে গবেষণার প্রগতি সম্পর্কে বর্ণনা করছেন
তিন দশক আগে, তসিংহুয়া ক্যাম্পাসে, শিক্ষক ছাত্রের পাশে বসে বললেন: এটি একটু পরিবর্তন করুন, দেখুন কেমন হয়।
তিন দশক পরে, শেনজেন অফিসে, একজন শিক্ষার্থী তার ৯০ বছরের শিক্ষককে তার যে বিশ্ব মডেল নিয়ে কাজ করছে তার কথা বলছে।
এটি কতটা অনুভূতিপূর্ণ দৃশ্যের পুনর্নির্মাণ।
মানুষ বুড়ো হয়, জল প্রবাহিত হয়, ট্রেন্ড শীতল হয়ে যায়, কিন্তু চীনা বিজ্ঞানীদের বিশ্বের প্রতিটি জটিল সমস্যাকে “পুরোপুরি বুঝতে” চাওয়ার অটল ইচ্ছা কখনও পরিবর্তিত হয়নি। Leifeng.com
