হুয়াওয়ে IJCAI 2026-এ চারটি পেপার গ্রহণ করেছে, যা AI-এর প্রযুক্তিগত প্রবণতাকে “স্কেল ডেনসিটি” থেকে “ডিজাইন ডেনসিটি”-এ সরিয়ে আনে।লেখক এবং উৎস: লেইফেঙ্গওয়েন

এআই বাস্তব পরিস্থিতিতে প্রবেশ করছে, সিস্টেম্যাটিক ইঞ্জিনিয়ারিং ক্ষমতা হল বাধা, এবং একইসাথে বিচ্ছিন্নতার সুযোগ।
IJCAI-ECAI 2026 এর আয়োজন করা হবে 2026 সালের 15 থেকে 21 আগস্ট জার্মানির ব্রেমেনে। এআই ক্ষেত্রের একটি সমগ্র শীর্ষস্থানীয় সম্মেলন হিসাবে, IJCAI সবসময় বড় কোম্পানিগুলির গত বছরের অগ্রণী গবেষণার ফলাফল পরীক্ষা করার একটি মূল পরীক্ষার ক্ষেত্র হয়ে আসছে: কে কোন দিকে প্রকৃত অগ্রগতি অর্জন করেছে, কোন প্রযুক্তিগত পথগুলির উপর সমঝোতা হচ্ছে—এই প্রশ্নের সবচেয়ে সরাসরি উত্তর হলো পেপার।
কনফারেন্সের সময়, এআই টেক রিভিউ এই শীর্ষ কনফারেন্সে প্রকাশিত পেপারগুলি সিস্টেমেটিকভাবে স্ক্যান করছে এবং প্রযুক্তিগত প্রবণতা এবং শিল্পের দিকনির্দেশ শনাক্ত করছে।
একটি স্পষ্ট প্রবণতা হল: এআই কম্পিউটিং শক্তির খরচ অপরিবর্তিত রয়েছে, এবং প্যারামিটার স্কেল বৃদ্ধির ফলে প্রাপ্ত প্রান্তিক লাভ এখন প্রান্তিক খরচের সাথে পাল্লা দিতে পারছে না। এই অর্থনৈতিক বাস্তবতা প্রযুক্তিগত উদ্ভাবনের যুক্তিকে পুনরায় গঠন করছে—“কি করে আরও বড় করা যায়” থেকে “কি করে আরও কম খরচে ব্যবহার করা যায়”-এর দিকে।
IJCAI 2026-এ হুয়াওয়ের চারটি পেপার এই পরিবর্তনের জন্য প্রযুক্তিগত পথ প্রদান করে: ডেটা স্কারসিটির বাধা পার করতে আরও পরিষ্কার আর্কিটেকচার ডিজাইন এবং ট্রেনিং স্ট্র্যাটেজি ব্যবহার করে, একক কম্পিউটেশনাল পাওয়ারের জন্য বেশি বুদ্ধিমত্তা উৎপাদন অর্জন করা।
এই প্রযুক্তিগত পরিবর্তনটি এআই-এর বাস্তবায়নের গভীর পরিবর্তনকেও প্রতিধ্বনিত করে: যখন প্রযুক্তি ল্যাব থেকে বেরিয়ে আসে, তখন প্রতিযোগিতা কোনও একটি ক্ষমতার একক বিন্দু ভাঙন নয়, বরং সঠিকতা, সাধারণীকরণ, ডেটা এবং কম্পিউটিং পাওয়ারের মধ্যে সিস্টেমগত সমন্বয়—প্রতিটি ধাপই বাধা হতে পারে, আবার প্রতিটি ধাপই ভেদক হতে পারে।
এই চারটি পেপার ঠিক এই চারটি দিক থেকে হুয়াওয়ের সিস্টেম্যাটিক ইঞ্জিনিয়ারিং ক্ষমতা এবং প্রযুক্তিগত বাছাইকে প্রদর্শন করে।
01 স্কেল ব্রেকিং: আর্কিটেকচার এবং ট্রেনিং, হাইয়ারার্কিক্যাল ViT-এর ক্ষমতার সীমানা পুনর্লিখন
ভিজুয়াল বেস মডেলের স্কেলিং প্রতিযোগিতায় একটি অদৃশ্য "ছাদ" সর্বদা বিদ্যমান ছিল। সাধারণ ViT-এর স্কেলিং অবিরাম এগিয়ে চলেছে, 6B থেকে 22B-এর মধ্যে সীমানা নিয়মিত আপগ্রেড করছে। কিন্তু হাইয়ারার্কিক্যাল ViT সবসময় 2B প্যারামিটারের নিচেই আটকে পড়েছে। বড় করার ইচ্ছা নেই না, বরং বড় করা যায় না। হাইয়ারার্কিক্যাল মডেলগুলির ডেটা এবং ট্রেনিং স্ট্র্যাটেজির প্রয়োজনীয়তা সাধারণ ViT-এর তুলনায় অনেক বেশি, এবং সাধারণ ViT-এর স্কেলিং পদ্ধতি সরাসরি প্রয়োগ করা যায় না। এটি একটি গঠনগত বিরোধের দিকে নিয়ে যায়—হাইয়ারার্কিক্যাল ViT-এর প্রকৃতি হলো মাল্টি-স্কেল প্রতিনিধিত্ব এবং ঘনত্বপূর্ণ পূর্বানুমানের (অবজেক্ট ডিটেকশন, সেগমেন্টেশন, ভিডিও বোঝা) জন্য অত্যন্ত উপযুক্ত, কিন্তু স্কেলিংয়ের অভাবে এর ক্ষমতার সীমা বন্ধ হয়ে গেছে।
হুয়াওয়ে টিমের এই পেপারটি, "Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters", স্কেল সীমাকে 2B থেকে সরাসরি 30B-এ নিয়ে গেছে।

কিভাবে এটি সম্ভব হল? উত্তরটি হল মডেল স্ট্রাকচার এবং ট্রেনিং স্ট্র্যাটেজি উভয়কেই পুনর্নকশা করা, যার মধ্যে একটি অপরিহার্য।
কাঠামোগত মূল ডিজাইন হল কার্যকরী হাইয়ারার্কিক্যাল ViT আর্কিটেকচার। এটি বহু-স্কেল বৈশিষ্ট্য বের করার ক্ষমতা বজায় রাখার সাথে সাথে গণনামূলক দক্ষতাকেও বিবেচনা করে।
এই আর্কিটেকচারের ভিত্তিতে, দলটি 200M থেকে 5B প্যারামিটার পর্যন্ত ঘন মডেল প্রশিক্ষণ করেছে এবং সমগ্র প্যারামিটার সংখ্যা 30B-এ নিয়ে আসার জন্য স্পার্স এক্সপার্ট মিক্সচার (SMoE) ভেরিয়েন্ট চালু করেছে—যা এখনপর্যন্ত হায়ারার্কিক্যাল ViT ক্ষেত্রে প্রকাশিত সবচেয়ে বড় প্যারামিটার স্কেল।
প্রশিক্ষণের জন্য, দল একটি দুই-পর্যায়ের প্রক্রিয়া ডিজাইন করেছে:
প্রথম পর্যায়ে, ImageNet-21K-এর উপর MAE স্ব-নিরীক্ষিত প্রি-ট্রেনিং করে মডেলকে দৃশ্যমান প্রতিনিধিত্বের মৌলিক নিয়মগুলি শেখানো হয়;
দ্বিতীয় পর্যায়ে, 27 মিলিয়ন ছবির ডেটাসেটে বিভিন্ন উন্নত সাধারণ ফাউন্ডেশন মডেল থেকে জ্ঞান ডিসিল করে ক্ষমতার বিপ্লব ঘটানো হয়।
পরীক্ষার ফলাফল সবচেয়ে শক্তিশালী প্রমাণ দেয়। ImageNet-1K লিনিয়ার মূল্যায়নে, মোট 30B প্যারামিটারযুক্ত MoE মডেল (EHV-5B-MoE) শুধুমাত্র 6.7B প্যারামিটার সক্রিয় করে 89.0% সঠিকতার সাথে EVA-CLIP-18B-এর মতো বড় মডেলকে ছাড়িয়ে যায়। এর চেয়েও গুরুত্বপূর্ণ বিষয় হলো, এর পারফরম্যান্সের উন্নতি শুধুমাত্র ইমেজ ক্লাসিফিকেশনেই সীমাবদ্ধ নয়—ভিডিও বিশ্লেষণ এবং ঘন প্রেডিকশন টাস্কেও এটি অসাধারণভাবে কাজ করে। এটি নির্দেশ করে যে EHV শুধুমাত্র ক্লাসিফিকেশন বৈশিষ্ট্যই শিখেনি, বরং প্রকৃতপক্ষে উচ্চ-গুণগত, সাধারণীকরণযোগ্য ভিজুয়াল রিপ্রেজেন্টেশন।
হুয়াওয়ে দল এই কাজের মাধ্যমে প্রমাণ করেছেন যে স্তরবদ্ধ ViT শুধু বড় করা যায় না, বরং উপস্থাপনার পক্ষে কম এক্টিভেশন প্যারামিটার ব্যবহার করেও বেশি সঠিকতা অর্জন করতে পারে। আর্কিটেকচার ডিজাইন মডেলের ক্ষমতার সীমানা নির্ধারণ করে, আর ট্রেনিং স্ট্র্যাটেজি এই সীমানা কতটা প্রকাশ পায় তা নির্ধারণ করে।
02 প্রিফিল্টার ইনপুট: লার্নিং ফ্রেম সিলেক্টরের প্যারাডাইম ইনোভেশন
মডেলের ভিত্তির ছাদ উঠে গেছে, কিন্তু ক্যালকুলেশন খরচ শুধু মডেলের উপরই সীমাবদ্ধ নয়; মডেলকে দেওয়া ডেটা একইভাবে বিপুল পরিমাণে কম্পিউটেশনাল সম্পদ খরচ করে। ভিডিও-বড় ভাষা মডেল (Video-LLMs) ভিডিও প্রসেস করার সময়, ক্যালকুলেশন খরচ প্রধানত ফ্রেম এনকোডিং-এর উপর ব্যয়িত হয়। খরচ নিয়ন্ত্রণের জন্য, বর্তমান মডেলগুলি প্রায়শই সমান ব্যবধানে ফ্রেম নমুনা নেয়—সমান ব্যবধানে ফ্রেম বাছাই।
তবে, ভিডিওতে প্রাসঙ্গিক ঘটনাগুলি কখনই সমানভাবে বণ্টিত হয় না। একটি গুরুত্বপূর্ণ ক্রিয়া মাত্র এক বা দুই সেকেন্ড স্থায়ী হতে পারে, এবং যদি এটি দুটি নমুনা বিন্দুর মধ্যে পড়ে যায়, তবে এটি সম্পূর্ণরূপে উপেক্ষিত হয়। অন্যদিকে, দীর্ঘস্থায়ী স্থির দৃশ্যগুলি বারবার এনকোড করা হয়, যা মূল্যবান কম্পিউটেশনাল সম্পদের অপচয় করে।
অন্য একটি পদ্ধতি হলো প্রশ্ন-ভিত্তিক পদ্ধতি— নির্দিষ্ট প্রশ্নের ভিত্তিতে সংশ্লিষ্ট ফ্রেমগুলি অনুসন্ধান করা। এটি ভিডিও প্রশ্নোত্তরের পরিস্থিতিতে কার্যকর, কিন্তু বিস্তারিত ভিডিও বর্ণনা একটি “কোয়েরি-হীন” কাজ, এবং এখানে এই পদ্ধতি কাজ করে না।
সমান নমুনা খুব কাঁচা, আর কোয়েরি-ড্রিভেন পদ্ধতি ব্যবহার করা যায় না। কীভাবে সমাধান করবেন? হুয়াওয়ে AI ডেটা টিম দ্বারা প্রস্তাবিত শিক্ষযোগ্য ফ্রেম সিলেক্টর LFS (Learnable Frame Selector) এই সমস্যার সমাধানের চেষ্টা করছে।
পেপারের ঠিকানা: https://arxiv.org/pdf/2601.14594v1
তাদের মূল ধারণাটি খুব সরল: ম্যানুয়ালি ফ্রেম বাছাইয়ের পরিবর্তে, মডেলটিকে নিজেই শেখানো হবে যে “কী দেখতে হবে”।

এটি একটি "শেষ থেকে শুরু" ট্রেনিং প্যারাডাইম, যেখানে LFS আর "কোন ফ্রেমগুলি কোনো মধ্যবর্তী স্কোরে বেশি স্কোর পায়" শেখে না, এটি শেখে "কোন ফ্রেমগুলি বড় মডেলকে ভালো বর্ণনা লিখতে সাহায্য করে"। এটি কীভাবে করা হয়? তিনটি মূল ডিজাইন:
প্রথমে, প্রতিটি ফ্রেমের জন্য একটি "ঘটনার গুরুত্ব" স্কোর দেওয়ার জন্য একটি স্কোরিং নেটওয়ার্ক ট্রেন করুন।

দ্বিতীয়ত, সম্পূর্ণ ভিডিওর সার্বিক ক্রমানুসারে ফ্রেম নির্বাচন নয়, বরং বিভাগে বিভাগে ফ্রেম নির্বাচন করুন। ফ্রেম নির্বাচনের সময় শুধুমাত্র “সর্বোচ্চ স্কোরের প্রথম Kটি” নির্বাচন নয়, বরং সম্পূর্ণ ভিডিওকে একাধিক সময় ব্যবধানে বিভক্ত করুন এবং প্রতিটি সময় ব্যবধানে সবচেয়ে গুরুত্বপূর্ণ ফ্রেমগুলি আলাদাভাবে বাছাই করুন। এটি কীভাবে মূল ঘটনাগুলি ধরে রাখে এবং ফ্রেমগুলিকে সময়ের অক্ষে সমানভাবে বণ্টন করে।
তৃতীয়, এবং সবচেয়ে গুরুত্বপূর্ণ ধাপ—প্রশিক্ষণ পদ্ধতি। LFS ফ্রেমগুলি বাছাই করার পর, এগুলিকে ফ্রিজ করা Video-LLM-এর কাছে দেওয়া হয় যাতে বর্ণনা তৈরি করে, তারপর জেনারেট করা বর্ণনাগুলিকে মানুষের দ্বারা লেবেলযুক্ত মানক বর্ণনার সাথে তুলনা করা হয়, ক্ষতি গণনা করা হয়, এবং তারপর ফ্রেম সিলেক্টরের প্যারামিটারগুলি আপডেট করার জন্য ব্যাকওয়ার্ড প্রপাগেশন প্রয়োগ করা হয়। পুরো প্রক্রিয়াটিতে, বড় ভাষা মডেলটি নিজেই একটিও পরিবর্তন করেনি, LFS একটি প্লাগ-অ্যান্ড-প্লে এক্সট্রা মডিউলের মতো।
এছাড়াও, গবেষণা দলটি একটি সমস্যা আবিষ্কার করেছে: বর্তমান বিস্তারিত ভিডিও বর্ণনা বেঞ্চমার্ক এবং মানুষের প্রকৃত চেতনার মধ্যে প্রচুর পার্থক্য রয়েছে। তাই তারা একটি নতুন বেঞ্চমার্ক ICH-CC তৈরি করেছে, যেখানে সমস্ত ভিডিও চীনা অদৃশ্য সাংস্কৃতিক উত্তরাধিকারের রান্নার প্রকৃত বাণিজ্যিক পরিস্থিতি (যেমন রেস্তোঁরার রান্নাঘর, রান্না শেখানো ইত্যাদি) থেকে আসে, এবং সমস্ত বর্ণনা এবং প্রশ্ন-উত্তর মানুষের দ্বারা সাবধানে লেখা হয়েছে, যা প্রকৃত প্রয়োগের পরিস্থিতির সাথে বেশি মিলে যায়।

পরীক্ষার ফলাফল কেমন?

LFS বিভিন্ন মডেল এবং বিভিন্ন বেঞ্চমার্কে সাধারণ এবং স্থিতিশীল উন্নতি আনে। সমস্ত মডেলের LFS-সমৃদ্ধ সংস্করণগুলি সমস্ত পরীক্ষিত বেঞ্চমার্কে বেসলাইন মডেলগুলির চেয়ে উচ্চতর, যা নির্দেশ করে যে LFS শুধুমাত্র একটি একক বেঞ্চমার্কে ভালো ফলাফল অর্জন করে না, বরং এটি কিছুটা সাধারণীকরণ ক্ষমতা রাখে।
এটি পেপারের মূল প্রস্তাবনার উত্তর দেয়: সমানভাবে নমুনা করা ফ্রেমগুলিতে মডেলকে “কঠোরভাবে গণনা” করার পরিবর্তে, ইনপুটে একবার বুদ্ধিমানের সাথে নির্বাচন করুন—সঠিক ফ্রেমগুলি বাছাই করলে, ডাউনস্ট্রিম টাস্কের পারফরম্যান্সও উন্নত হয়।

03 কাজ অ্যাডাপ্টেশন: মডিউলার হস্তক্ষেপের প্রতিনিধিত্ব পুরো মডেল ফাইন-টিউনিংকে প্রতিস্থাপন করে
ক্রস-টাস্ক জেনারালিজেশন ক্ষমতা বড় ল্যাঙ্গুয়েজ মডেলের জন্য একটি "বলতে গুরুত্বপূর্ণ, কিন্তু করতে কঠিন" সমস্যা। বর্তমানে প্রচলিত সমাধানগুলি হল পার-টোকেন ডাইনামিক রাউটিং—প্রতিটি টোকেন প্রক্রিয়াকরণের সময় একাধিক LoRA অ্যাডাপ্টারের মধ্যে বেছে নেয়, কোন পথে যাবে তা নির্ধারণ করে। এই মেকানিজমটি প্রকৃতপক্ষে কার্যকর, কিন্তু এর মূল্যও বেশি: গণনা পরিমাণ এবং VRAM ব্যবহার উভয়ই অত্যধিক, ফলে মডেলটি ধীরে এবং VRAM-এর অনেক বেশি ব্যবহার করে।
একটি বিকল্প পদ্ধতি—প্রতীকী সূক্ষ্ম সামঞ্জস্য (ReFT)—যা মডেলের প্যারামিটারগুলি পরিবর্তন করে না, বরং শুধুমাত্র প্রিফিক্স এবং পোস্টফিক্স টোকেনের প্রতীকী উপস্থাপনা সম্পাদনা করে একক কাজের জন্য অ্যাডাপ্টেশন অর্জন করে, যা LoRA-এর তুলনায় অনেক বেশি দক্ষ। তবে এর দুটি সীমাবদ্ধতা রয়েছে: প্রথমত, টোকেনগুলির নিজস্ব অর্থের অস্পষ্টতা রয়েছে, তাই শুধুমাত্র শুরু এবং শেষটি পরিবর্তন করলে যথেষ্ট সঠিক হয় না; দ্বিতীয়ত, এটি "স্ব-নির্দেশিত" কোনও কাঠামোর অভাব রয়েছে, যার ফলে মডেলটি অপরিচিত নতুন কাজগুলির সম্মুখীন হলে কোন স্তরটি, কোন প্রতীকী উপস্থাপনা পরিবর্তন করতে হবে, তা জানতে পারে না।
হুয়াওয়ে ক্লাউড দল বিভিন্ন বিশ্ববিদ্যালয়ের সাথে সহযোগিতা করে, রিপ্রেজেন্টেশন-অ্যাওয়ার মডুলারিটি (RaMod) ফ্রেমওয়ার্কটি প্রস্তাব করেছে, যা ReFT-এর ধারণাকে ক্রস-টাস্ক জেনারালাইজেশন স্কেনারিওতে সফলভাবে প্রসারিত করেছে।

মূল পদ্ধতিটিকে দুটি অংশে বিভক্ত করা যায়:
প্রথম অংশ হল ডুয়াল-মডিউল রিপ্রেজেন্টেশন এবং প্যারামিটার ফাইন-টিউনিং। ReFT শুধুমাত্র শুরু এবং শেষকে পরিবর্তন করতে পারে, কিন্তু RaMod অনেক বেশি সূক্ষ্ম—এটি মধ্যবর্তী স্তরের হিডেন রিপ্রেজেন্টেশন থেকে একটি স্ট্র্যাটেজি-ভিত্তিক সাবসেট বাছাই করে মডিউলার হস্তক্ষেপ করে। কোথায় পরিবর্তন করবেন, কীভাবে পরিবর্তন করবেন—সবকিছুই নির্বাচনমূলক এবং স্ট্র্যাটেজিক। এভাবে মডেলটিকে অপরিচিত টাস্কগুলি সমাধানের জন্য আরও সঠিকভাবে নির্দেশিত করা যায়।
দ্বিতীয় অংশ হল অ্যাসিঙ্ক্রোনাস স্কেডুলার। টাস্কের মধ্যে জেনারালাইজেশনের জন্য সবচেয়ে বড় চ্যালেঞ্জ হল মেমোরি ঘাটতি, যা RaMod একটি সক্রিয় স্কেডুলিং মেকানিজম ডিজাইন করে সমাধান করেছে: যে হস্তক্ষেপগুলির প্রয়োজন হয়, তার জন্যই মেমোরি আবদ্ধ করা হয়, এবং ব্যবহার শেষ হলে সক্রিয়ভাবে মুক্ত করা হয়। এইভাবে, স্টোরেজ ওভারহেডকে সর্বনিম্নে নিয়ে আসা হয়েছে।
প্রভাব তাৎক্ষণিক। পরীক্ষাগুলি দেখিয়েছে যে RaMod শুধুমাত্র কার্যের মধ্যে সাধারণীকরণের ক্ষমতা বেশি, ব্যয়ও উল্লেখযোগ্যভাবে কমেছে: মূল LLMs-এর তুলনায়, এই পদ্ধতিটি অতিরিক্ত প্রিফিলিং সময় 83% কমিয়েছে, জেনারেশন ল্যাটেন্সি 100% কমিয়েছে এবং ভিজিউয়াল মেমোরি ব্যবহার 79% কমিয়েছে।
অর্থাৎ, RaMod কাজের অ্যাডাপ্টেশনকে “মডেল পরিবর্তন” থেকে “রিপ্রেজেন্টেশন টিউনিং”-এ রূপান্তরিত করে—মডেলের মূল অংশ অপরিবর্তিত রেখে শুধুমাত্র কীভাবে লেয়ারের হিডেন স্টেটে পয়েন্ট-টু-পয়েন্ট এডিটিং করা হয়। যদি এই ধারণা কার্যকর হয়, তবে বড় মডেলগুলির ডিপ্লয়মেন্টের অর্থনীতি পুনর্লিখিত হতে পারে: একটি বেস মডেল এবং কয়েকটি হালকা হস্তক্ষেপ মডিউল দিয়ে, পৃথক পৃথক কাজের পরিস্থিতিতে সম্পূর্ণ কপি পৃথকভাবে ট্রেন বা লোড না করেই কম খরচে সেবা দেওয়া যাবে।
তবে “পুনর্লিখন” এর আগে, এই প্রতিনিধিত্ব সূক্ষ্ম সামঞ্জস্য পদ্ধতির কিছু কী সমস্যা এখনও উত্তর দেওয়ার প্রয়োজন, যেমন জটিল যুক্তিবিদ্যা ইত্যাদি উচ্চ কঠিন পরিস্থিতিতে, কি এটি গণনা খরচ বাঁচানোর সাথে সাথে সঠিকতা বজায় রাখতে পারে।
04 ডেটা ব্রেকথ্রু: ভাষাবিদরা তাদের দায়িত্ব পালন করছেন, ধাপে ধাপে প্রশিক্ষণ চলছে
প্রথম তিনটি পেপার সবই “মডেলটিকে কীভাবে আরও দক্ষতার সাথে ব্যবহার করা যায়” তা নিয়ে কাজ করেছে। কিন্তু অনেক টাস্কের জন্য একটি আরও মৌলিক বাস্তব চ্যালেঞ্জ রয়েছে: যদি ট্রেনিং ডেটাই যথেষ্ট না হয়?
কোড-সুইচিং (Code-Switching, CS) ভয়েস ট্রান্সলেশন টাস্কটি বিভিন্ন ভাষার মিশ্রিত ভয়েসকে লক্ষ্য ভাষায় অনুবাদ করে। এই টাস্কটি শুধু অর্থগত মডেলিংয়ের জন্যই জটিল নয়, বরং CS ডেটার অভাবও একটি বড় সমস্যা।
পূর্বের গবেষণাগুলি মূলত দুটি পথে চলেছিল: একটি হল মডেলকে নিজে থেকে বৈশিষ্ট্যের অর্থ বুঝতে দেওয়া, যার ফলাফল নিয়ন্ত্রণযোগ্য নয়; অন্যটি হল ম্যানুয়ালি অ্যানোটেশন করার জন্য বড় পরিমাণে খরচ করা, যা খুবই ব্যয়বহুল এবং স্কেল করা কঠিন।
হুয়াওয়ে অনুবাদ সেবা কেন্দ্র দল, জিয়ামেন বিশ্ববিদ্যালয় এবং ম্যাকাও বিশ্ববিদ্যালয়ের সাথে সহযোগিতায় এই গবেষণাপত্রটি একটি নতুন ধারণা প্রস্তাব করে: মডেলকে নিজেরাই বিভিন্ন ভাষার অর্থগত প্রতিনিধিত্ব খুঁজে বের করতে দেওয়ার পরিবর্তে, এগুলিকে সক্রিয়ভাবে সামঞ্জস্য করা হোক—প্রতিটি ভাষার জন্য আলাদা একটি “বিশেষজ্ঞ দল” তৈরি করুন, যাতে প্রতিটি দল নিজেদের ভাষার অর্থগত মডেলিংয়ের দায়িত্ব বহন করে, এবং শেষে সবগুলোকে একত্রিতভাবে সামঞ্জস্য করা হোক।

পেপারের ঠিকানা: https://arxiv.org/pdf/2511.10670
দুটি প্রধান ডিজাইন রয়েছে:
প্রথমটি হল MoE (মিক্সড এক্সপার্ট) ভয়েস প্রজেক্টর। পারম্পরিক প্রজেক্টরগুলি সমস্ত ভাষাকে সমানভাবে বিবেচনা করে, যার ফলে ফলাফল স্বাভাবিকভাবেই অপ্রতুল। MoE সংস্করণটি প্রতিটি ভাষার জন্য একটি বিশেষ “এক্সপার্ট” গ্রুপ বরাদ্দ করে, যেখানে প্রতিটি এক্সপার্ট গ্রুপ শুধুমাত্র একটি ভাষার ফাইন-গ্রেনুলার ভয়েস ফিচার মডেলিংয়ের জন্য দায়ী। রাউটিং মেকানিজমটি স্বয়ংক্রিয়ভাবে ভয়েস ফিচারগুলিকে সংশ্লিষ্ট ভাষার এক্সপার্ট গ্রুপের কাছে পাঠায়।

পথ সঠিক রাখার জন্য, পেপারটি দুটি সহায়ক ক্ষতি প্রবর্তন করে: ভাষা-নির্দিষ্ট ক্ষতি নিশ্চিত করে যে প্রতিটি এক্সপার্ট সংশ্লিষ্ট ভাষার বৈশিষ্ট্যগুলি আসলে শিখেছে, এবং গ্রুপ-অন্তর্গত লোড ব্যালেন্সিং ক্ষতি সমস্ত টোকেনের একই এক্সপার্টের উপর জমা হওয়া প্রতিরোধ করে।
দ্বিতীয়টি একটি বহু-পর্যায়ের প্রশিক্ষণ পদ্ধতি। ডেটা অপর্যাপ্ত হলে, কৌশল দিয়ে পূরণ করুন। সম্পূর্ণ প্রশিক্ষণ চারটি ধাপে বিভক্ত: প্রথমে, প্রতিটি ভাষার জন্য অটোমেটিক স্পিচ রিকগনিশন (ASR) ডেটা ব্যবহার করে প্রজেকশনারগুলি আলাদাভাবে পূর্ব-প্রশিক্ষিত করুন, যাতে স্বরূপ-পাঠ্য সমন্বয়ের ভিত্তি তৈরি হয়; তারপর, বিভিন্ন ভাষার প্রজেকশনারগুলিকে MoE স্ট্রাকচারে সংযুক্ত করুন এবং ভাষা-নির্দিষ্ট লস এবং লোড ব্যালেন্সিং লস ব্যবহার করে একসাথে অপ্টিমাইজ করুন; এরপর, ASR ডেটা থেকে ধীরে ধীরে একভাষিক স্পিচ অনুবাদ (ST) ডেটাতে স্থানান্তরিত হন, এবং ট্রানজিশনাল লস ব্যবহার করে সহজেই স্থানান্তরণ ঘটান; শেষে, ST ডেটা থেকে CS স্পিচ অনুবাদ ডেটাতে অ্যাডাপ্টেশন করুন।
এই প্রগতিশীল ডিজাইনের মূল বিষয় হলো—মডেলকে সরাসরি দুর্লভ CS ডেটা খাওয়ানোর পরিবর্তে, প্রথমে পর্যাপ্ত ASR এবং ST ডেটা ব্যবহার করে মৌলিক ক্ষমতা শক্তিশালী করা হয়, তারপর ধাপে ধাপে লক্ষ্য কাজের দিকে এগিয়ে যাওয়া হয়।

Whisper, SeamlessM4T, LLaST এর মতো অনেকগুলি শক্তিশালী বেসলাইন মডেলের সাথে পরীক্ষামূলক তুলনা করা হয়েছে। Fisher এবং NTUML2021-এর চারটি টেস্ট সেটে, এই পদ্ধতিটি SeamlessM4T-এর চেয়েও ভালো ফলাফল দেখিয়েছে, যার BLEU সর্বোচ্চ 39.52 এবং COMET সর্বোচ্চ 81.33 হয়েছে।
এই কাজটি স্পষ্ট সংকেত দেয়: ডেটা স্বল্পতা বিশিষ্ট বহুভাষিক পরিস্থিতিতে, সূক্ষ্ম আর্কিটেকচার ডিজাইন এবং পদক্ষেপবদ্ধ ট্রেনিং কৌশল শুধুমাত্র ডেটা জমা দেওয়ার চেয়ে বেশি কার্যকর হতে পারে।
এটি মনে রাখা প্রয়োজন যে, সীমিত ভাষার সংখ্যা এবং ডেটা গুণগত মান নিয়ন্ত্রিত পরিস্থিতিতে এটি একটি কার্যকরী "হাতিয়ার" হিসাবে কাজ করে, কিন্তু দশগুণ ভাষার জন্য সাধারণ বহুভাষিক অনুবাদ সিস্টেমের জন্য এটির স্কেলযোগ্যতা আরও পরীক্ষা করা প্রয়োজন।
05 শেষ কথাঃ ডিজাইন ঘনত্ব দিয়ে ক্যালকুলেশন খরচ পরিবর্তন করুন
30B হাইয়ারার্কিক্যাল ViT মডেলের স্কেলেল পুনর্গঠন করেছে, যার ফলে 67 বিলিয়ন এক্টিভেশন প্যারামিটার ImageNet-এ 180 বিলিয়নের প্রতিদ্বন্দ্বীকে ছাড়িয়ে গেছে;
LFS ইনপুটে একটি বিয়োগ করেছে, যা গণনার আগে অসংখ্য অর্থহীন ফ্রেম এনকোডিং ওভারহেডকে বাধা দিয়েছে;
RaMod সম্পূর্ণ ফাইন-টিউনিংকে রিপ্রেজেন্টেশন লেয়ারের ফিক্সড-পয়েন্ট এডিটিংয়ে সংকুচিত করেছে, যার ফলে ক্রস-টাস্ক অ্যাডাপ্টেশনের জন্য মেমোরি এবং ল্যাটেন্সি উভয়ই কমেছে;
মোই বিভাগীকরণ এবং প্রগতিশীল প্রশিক্ষণের মাধ্যমে ভাষা রূপান্তর অনুবাদ প্রমাণ করেছে যে, সবচেয়ে কম ডেটা সহ পথেও: আর্কিটেকচারের বুদ্ধিমত্তা কখনও কখনও ডেটার দারিদ্র্যকে পূরণ করতে পারে।
চারটি পেপার, চারটি দিক, সবগুলোই একই কেন্দ্রের দিকে ইঙ্গিত করছে: হুয়াওয়ে এখন “স্কেল ডেনসিটি”-এর পরিবর্তে “ডিজাইন ডেনসিটি” ব্যবহার করছে। এই চারটি পেপার যথাক্রমে বেসিক রিসার্চ, এআই ডেটা, ক্লাউড সার্ভিস এবং ট্রান্সলেশন সার্ভিস সেন্টার থেকে এসেছে, যা দেখায় যে দক্ষতাকে অগ্রাধিকার দেওয়া শুধুমাত্র কোনো একটি টিমের পছন্দ নয়—এই যুক্তি প্রতিটি পর্যায়ের টেকনোলজির বাছাইয়ের মধ্যে লিখে ফেলা হয়েছে।
যদি গত দুই বছরের এআই প্রতিযোগিতাকে “মাইনিং রেস” বলা যায়, তাহলে ২০২৬ সাল একটি মোড়ের দিকে ইঙ্গিত করছে: “প্রক্রিয়াকরণ প্রযুক্তি” রেসের যুগ শুরু হয়েছে। স্পার্স এক্টিভেশন, স্মার্ট ফিল্টারিং, মডিউলার অ্যাডাপ্টেশন, প্রগতিশীল ট্রেনিং—এই পথগুলি আরও বেশি চিপ এবং কম্পিউটিং পাওয়ারের উপর নির্ভর করে না, বরং সমস্যাটির প্রতি আরও গভীর বোঝাপড়ার উপর নির্ভর করে।
বড় কোম্পানি বা স্টার্টআপ উভয়ই ইতিমধ্যে প্যারামিটার অস্ত্রাগারের প্রতিযোগিতা পার হয়ে গেছে; AI-এর দ্বিতীয় অংশে, বাস্তব বাস্তবায়নের সমস্যাগুলির বোঝা এবং এই সমস্যাগুলির ব্যবস্থাগতভাবে সমাধানের ইঞ্জিনিয়ারিং ক্ষমতাই প্রকৃতপক্ষে সিদ্ধান্তকারী বিন্দু।
