হুয়াওয়ে এআই ডিজাইন দক্ষতা সম্পর্কে চারটি IJCAI 2026 পেপার প্রকাশ করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
হুয়াওয়ে IJCAI 2026-এ চারটি AI + ক্রিপ্টো সংবাদ-সম্পর্কিত পেপার প্রকাশ করেছে, যেখানে MetaEra ব্যবহার করে ডিজাইনের দক্ষতা নিয়ে গবেষণা করা হয়েছে। এই গবেষণায় আর্কিটেকচারাল নবায়ন, ডেটা নির্বাচন, মডুলার অ্যাডাপ্টেশন এবং ট্রেনিং স্ট্র্যাটেজি অন্তর্ভুক্ত রয়েছে। এই পদ্ধতিগুলি পারফরম্যান্সকে স্থিতিশীল রেখে গণনা খরচ কমানোর উদ্দেশ্যে নেওয়া হয়েছে। অন-চেইন সংবাদ এবং AI-এর উন্নতি বাস্তব জীবনের প্রয়োগগুলিকে আকার দিচ্ছে।
হুয়াওয়ে IJCAI 2026-এ চারটি পেপার গ্রহণ করেছে, যা AI-এর প্রযুক্তিগত প্রবণতাকে “স্কেল ডেনসিটি” থেকে “ডিজাইন ডেনসিটি”-এ সরিয়ে আনে।

লেখক এবং উৎস: লেইফেঙ্গওয়েন

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

এআই বাস্তব পরিস্থিতিতে প্রবেশ করছে, সিস্টেম্যাটিক ইঞ্জিনিয়ারিং ক্ষমতা হল বাধা, এবং একইসাথে বিচ্ছিন্নতার সুযোগ।

IJCAI-ECAI 2026 এর আয়োজন করা হবে 2026 সালের 15 থেকে 21 আগস্ট জার্মানির ব্রেমেনে। এআই ক্ষেত্রের একটি সমগ্র শীর্ষস্থানীয় সম্মেলন হিসাবে, IJCAI সবসময় বড় কোম্পানিগুলির গত বছরের অগ্রণী গবেষণার ফলাফল পরীক্ষা করার একটি মূল পরীক্ষার ক্ষেত্র হয়ে আসছে: কে কোন দিকে প্রকৃত অগ্রগতি অর্জন করেছে, কোন প্রযুক্তিগত পথগুলির উপর সমঝোতা হচ্ছে—এই প্রশ্নের সবচেয়ে সরাসরি উত্তর হলো পেপার।

কনফারেন্সের সময়, এআই টেক রিভিউ এই শীর্ষ কনফারেন্সে প্রকাশিত পেপারগুলি সিস্টেমেটিকভাবে স্ক্যান করছে এবং প্রযুক্তিগত প্রবণতা এবং শিল্পের দিকনির্দেশ শনাক্ত করছে।

একটি স্পষ্ট প্রবণতা হল: এআই কম্পিউটিং শক্তির খরচ অপরিবর্তিত রয়েছে, এবং প্যারামিটার স্কেল বৃদ্ধির ফলে প্রাপ্ত প্রান্তিক লাভ এখন প্রান্তিক খরচের সাথে পাল্লা দিতে পারছে না। এই অর্থনৈতিক বাস্তবতা প্রযুক্তিগত উদ্ভাবনের যুক্তিকে পুনরায় গঠন করছে—“কি করে আরও বড় করা যায়” থেকে “কি করে আরও কম খরচে ব্যবহার করা যায়”-এর দিকে।

IJCAI 2026-এ হুয়াওয়ের চারটি পেপার এই পরিবর্তনের জন্য প্রযুক্তিগত পথ প্রদান করে: ডেটা স্কারসিটির বাধা পার করতে আরও পরিষ্কার আর্কিটেকচার ডিজাইন এবং ট্রেনিং স্ট্র্যাটেজি ব্যবহার করে, একক কম্পিউটেশনাল পাওয়ারের জন্য বেশি বুদ্ধিমত্তা উৎপাদন অর্জন করা।

এই প্রযুক্তিগত পরিবর্তনটি এআই-এর বাস্তবায়নের গভীর পরিবর্তনকেও প্রতিধ্বনিত করে: যখন প্রযুক্তি ল্যাব থেকে বেরিয়ে আসে, তখন প্রতিযোগিতা কোনও একটি ক্ষমতার একক বিন্দু ভাঙন নয়, বরং সঠিকতা, সাধারণীকরণ, ডেটা এবং কম্পিউটিং পাওয়ারের মধ্যে সিস্টেমগত সমন্বয়—প্রতিটি ধাপই বাধা হতে পারে, আবার প্রতিটি ধাপই ভেদক হতে পারে।

এই চারটি পেপার ঠিক এই চারটি দিক থেকে হুয়াওয়ের সিস্টেম্যাটিক ইঞ্জিনিয়ারিং ক্ষমতা এবং প্রযুক্তিগত বাছাইকে প্রদর্শন করে।

01 স্কেল ব্রেকিং: আর্কিটেকচার এবং ট্রেনিং, হাইয়ারার্কিক্যাল ViT-এর ক্ষমতার সীমানা পুনর্লিখন

ভিজুয়াল বেস মডেলের স্কেলিং প্রতিযোগিতায় একটি অদৃশ্য "ছাদ" সর্বদা বিদ্যমান ছিল। সাধারণ ViT-এর স্কেলিং অবিরাম এগিয়ে চলেছে, 6B থেকে 22B-এর মধ্যে সীমানা নিয়মিত আপগ্রেড করছে। কিন্তু হাইয়ারার্কিক্যাল ViT সবসময় 2B প্যারামিটারের নিচেই আটকে পড়েছে। বড় করার ইচ্ছা নেই না, বরং বড় করা যায় না। হাইয়ারার্কিক্যাল মডেলগুলির ডেটা এবং ট্রেনিং স্ট্র্যাটেজির প্রয়োজনীয়তা সাধারণ ViT-এর তুলনায় অনেক বেশি, এবং সাধারণ ViT-এর স্কেলিং পদ্ধতি সরাসরি প্রয়োগ করা যায় না। এটি একটি গঠনগত বিরোধের দিকে নিয়ে যায়—হাইয়ারার্কিক্যাল ViT-এর প্রকৃতি হলো মাল্টি-স্কেল প্রতিনিধিত্ব এবং ঘনত্বপূর্ণ পূর্বানুমানের (অবজেক্ট ডিটেকশন, সেগমেন্টেশন, ভিডিও বোঝা) জন্য অত্যন্ত উপযুক্ত, কিন্তু স্কেলিংয়ের অভাবে এর ক্ষমতার সীমা বন্ধ হয়ে গেছে।

হুয়াওয়ে টিমের এই পেপারটি, "Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters", স্কেল সীমাকে 2B থেকে সরাসরি 30B-এ নিয়ে গেছে।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

কিভাবে এটি সম্ভব হল? উত্তরটি হল মডেল স্ট্রাকচার এবং ট্রেনিং স্ট্র্যাটেজি উভয়কেই পুনর্নকশা করা, যার মধ্যে একটি অপরিহার্য।

কাঠামোগত মূল ডিজাইন হল কার্যকরী হাইয়ারার্কিক্যাল ViT আর্কিটেকচার। এটি বহু-স্কেল বৈশিষ্ট্য বের করার ক্ষমতা বজায় রাখার সাথে সাথে গণনামূলক দক্ষতাকেও বিবেচনা করে।

এই আর্কিটেকচারের ভিত্তিতে, দলটি 200M থেকে 5B প্যারামিটার পর্যন্ত ঘন মডেল প্রশিক্ষণ করেছে এবং সমগ্র প্যারামিটার সংখ্যা 30B-এ নিয়ে আসার জন্য স্পার্স এক্সপার্ট মিক্সচার (SMoE) ভেরিয়েন্ট চালু করেছে—যা এখনপর্যন্ত হায়ারার্কিক্যাল ViT ক্ষেত্রে প্রকাশিত সবচেয়ে বড় প্যারামিটার স্কেল।

প্রশিক্ষণের জন্য, দল একটি দুই-পর্যায়ের প্রক্রিয়া ডিজাইন করেছে:

প্রথম পর্যায়ে, ImageNet-21K-এর উপর MAE স্ব-নিরীক্ষিত প্রি-ট্রেনিং করে মডেলকে দৃশ্যমান প্রতিনিধিত্বের মৌলিক নিয়মগুলি শেখানো হয়;

দ্বিতীয় পর্যায়ে, 27 মিলিয়ন ছবির ডেটাসেটে বিভিন্ন উন্নত সাধারণ ফাউন্ডেশন মডেল থেকে জ্ঞান ডিসিল করে ক্ষমতার বিপ্লব ঘটানো হয়।

পরীক্ষার ফলাফল সবচেয়ে শক্তিশালী প্রমাণ দেয়। ImageNet-1K লিনিয়ার মূল্যায়নে, মোট 30B প্যারামিটারযুক্ত MoE মডেল (EHV-5B-MoE) শুধুমাত্র 6.7B প্যারামিটার সক্রিয় করে 89.0% সঠিকতার সাথে EVA-CLIP-18B-এর মতো বড় মডেলকে ছাড়িয়ে যায়। এর চেয়েও গুরুত্বপূর্ণ বিষয় হলো, এর পারফরম্যান্সের উন্নতি শুধুমাত্র ইমেজ ক্লাসিফিকেশনেই সীমাবদ্ধ নয়—ভিডিও বিশ্লেষণ এবং ঘন প্রেডিকশন টাস্কেও এটি অসাধারণভাবে কাজ করে। এটি নির্দেশ করে যে EHV শুধুমাত্র ক্লাসিফিকেশন বৈশিষ্ট্যই শিখেনি, বরং প্রকৃতপক্ষে উচ্চ-গুণগত, সাধারণীকরণযোগ্য ভিজুয়াল রিপ্রেজেন্টেশন।

হুয়াওয়ে দল এই কাজের মাধ্যমে প্রমাণ করেছেন যে স্তরবদ্ধ ViT শুধু বড় করা যায় না, বরং উপস্থাপনার পক্ষে কম এক্টিভেশন প্যারামিটার ব্যবহার করেও বেশি সঠিকতা অর্জন করতে পারে। আর্কিটেকচার ডিজাইন মডেলের ক্ষমতার সীমানা নির্ধারণ করে, আর ট্রেনিং স্ট্র্যাটেজি এই সীমানা কতটা প্রকাশ পায় তা নির্ধারণ করে।

02 প্রিফিল্টার ইনপুট: লার্নিং ফ্রেম সিলেক্টরের প্যারাডাইম ইনোভেশন

মডেলের ভিত্তির ছাদ উঠে গেছে, কিন্তু ক্যালকুলেশন খরচ শুধু মডেলের উপরই সীমাবদ্ধ নয়; মডেলকে দেওয়া ডেটা একইভাবে বিপুল পরিমাণে কম্পিউটেশনাল সম্পদ খরচ করে। ভিডিও-বড় ভাষা মডেল (Video-LLMs) ভিডিও প্রসেস করার সময়, ক্যালকুলেশন খরচ প্রধানত ফ্রেম এনকোডিং-এর উপর ব্যয়িত হয়। খরচ নিয়ন্ত্রণের জন্য, বর্তমান মডেলগুলি প্রায়শই সমান ব্যবধানে ফ্রেম নমুনা নেয়—সমান ব্যবধানে ফ্রেম বাছাই।

তবে, ভিডিওতে প্রাসঙ্গিক ঘটনাগুলি কখনই সমানভাবে বণ্টিত হয় না। একটি গুরুত্বপূর্ণ ক্রিয়া মাত্র এক বা দুই সেকেন্ড স্থায়ী হতে পারে, এবং যদি এটি দুটি নমুনা বিন্দুর মধ্যে পড়ে যায়, তবে এটি সম্পূর্ণরূপে উপেক্ষিত হয়। অন্যদিকে, দীর্ঘস্থায়ী স্থির দৃশ্যগুলি বারবার এনকোড করা হয়, যা মূল্যবান কম্পিউটেশনাল সম্পদের অপচয় করে।

অন্য একটি পদ্ধতি হলো প্রশ্ন-ভিত্তিক পদ্ধতি— নির্দিষ্ট প্রশ্নের ভিত্তিতে সংশ্লিষ্ট ফ্রেমগুলি অনুসন্ধান করা। এটি ভিডিও প্রশ্নোত্তরের পরিস্থিতিতে কার্যকর, কিন্তু বিস্তারিত ভিডিও বর্ণনা একটি “কোয়েরি-হীন” কাজ, এবং এখানে এই পদ্ধতি কাজ করে না।

সমান নমুনা খুব কাঁচা, আর কোয়েরি-ড্রিভেন পদ্ধতি ব্যবহার করা যায় না। কীভাবে সমাধান করবেন? হুয়াওয়ে AI ডেটা টিম দ্বারা প্রস্তাবিত শিক্ষযোগ্য ফ্রেম সিলেক্টর LFS (Learnable Frame Selector) এই সমস্যার সমাধানের চেষ্টা করছে।

পেপারের ঠিকানা: https://arxiv.org/pdf/2601.14594v1

তাদের মূল ধারণাটি খুব সরল: ম্যানুয়ালি ফ্রেম বাছাইয়ের পরিবর্তে, মডেলটিকে নিজেই শেখানো হবে যে “কী দেখতে হবে”।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

এটি একটি "শেষ থেকে শুরু" ট্রেনিং প্যারাডাইম, যেখানে LFS আর "কোন ফ্রেমগুলি কোনো মধ্যবর্তী স্কোরে বেশি স্কোর পায়" শেখে না, এটি শেখে "কোন ফ্রেমগুলি বড় মডেলকে ভালো বর্ণনা লিখতে সাহায্য করে"। এটি কীভাবে করা হয়? তিনটি মূল ডিজাইন:

প্রথমে, প্রতিটি ফ্রেমের জন্য একটি "ঘটনার গুরুত্ব" স্কোর দেওয়ার জন্য একটি স্কোরিং নেটওয়ার্ক ট্রেন করুন।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

দ্বিতীয়ত, সম্পূর্ণ ভিডিওর সার্বিক ক্রমানুসারে ফ্রেম নির্বাচন নয়, বরং বিভাগে বিভাগে ফ্রেম নির্বাচন করুন। ফ্রেম নির্বাচনের সময় শুধুমাত্র “সর্বোচ্চ স্কোরের প্রথম Kটি” নির্বাচন নয়, বরং সম্পূর্ণ ভিডিওকে একাধিক সময় ব্যবধানে বিভক্ত করুন এবং প্রতিটি সময় ব্যবধানে সবচেয়ে গুরুত্বপূর্ণ ফ্রেমগুলি আলাদাভাবে বাছাই করুন। এটি কীভাবে মূল ঘটনাগুলি ধরে রাখে এবং ফ্রেমগুলিকে সময়ের অক্ষে সমানভাবে বণ্টন করে।

তৃতীয়, এবং সবচেয়ে গুরুত্বপূর্ণ ধাপ—প্রশিক্ষণ পদ্ধতি। LFS ফ্রেমগুলি বাছাই করার পর, এগুলিকে ফ্রিজ করা Video-LLM-এর কাছে দেওয়া হয় যাতে বর্ণনা তৈরি করে, তারপর জেনারেট করা বর্ণনাগুলিকে মানুষের দ্বারা লেবেলযুক্ত মানক বর্ণনার সাথে তুলনা করা হয়, ক্ষতি গণনা করা হয়, এবং তারপর ফ্রেম সিলেক্টরের প্যারামিটারগুলি আপডেট করার জন্য ব্যাকওয়ার্ড প্রপাগেশন প্রয়োগ করা হয়। পুরো প্রক্রিয়াটিতে, বড় ভাষা মডেলটি নিজেই একটিও পরিবর্তন করেনি, LFS একটি প্লাগ-অ্যান্ড-প্লে এক্সট্রা মডিউলের মতো।

এছাড়াও, গবেষণা দলটি একটি সমস্যা আবিষ্কার করেছে: বর্তমান বিস্তারিত ভিডিও বর্ণনা বেঞ্চমার্ক এবং মানুষের প্রকৃত চেতনার মধ্যে প্রচুর পার্থক্য রয়েছে। তাই তারা একটি নতুন বেঞ্চমার্ক ICH-CC তৈরি করেছে, যেখানে সমস্ত ভিডিও চীনা অদৃশ্য সাংস্কৃতিক উত্তরাধিকারের রান্নার প্রকৃত বাণিজ্যিক পরিস্থিতি (যেমন রেস্তোঁরার রান্নাঘর, রান্না শেখানো ইত্যাদি) থেকে আসে, এবং সমস্ত বর্ণনা এবং প্রশ্ন-উত্তর মানুষের দ্বারা সাবধানে লেখা হয়েছে, যা প্রকৃত প্রয়োগের পরিস্থিতির সাথে বেশি মিলে যায়।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

পরীক্ষার ফলাফল কেমন?

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

LFS বিভিন্ন মডেল এবং বিভিন্ন বেঞ্চমার্কে সাধারণ এবং স্থিতিশীল উন্নতি আনে। সমস্ত মডেলের LFS-সমৃদ্ধ সংস্করণগুলি সমস্ত পরীক্ষিত বেঞ্চমার্কে বেসলাইন মডেলগুলির চেয়ে উচ্চতর, যা নির্দেশ করে যে LFS শুধুমাত্র একটি একক বেঞ্চমার্কে ভালো ফলাফল অর্জন করে না, বরং এটি কিছুটা সাধারণীকরণ ক্ষমতা রাখে।

এটি পেপারের মূল প্রস্তাবনার উত্তর দেয়: সমানভাবে নমুনা করা ফ্রেমগুলিতে মডেলকে “কঠোরভাবে গণনা” করার পরিবর্তে, ইনপুটে একবার বুদ্ধিমানের সাথে নির্বাচন করুন—সঠিক ফ্রেমগুলি বাছাই করলে, ডাউনস্ট্রিম টাস্কের পারফরম্যান্সও উন্নত হয়।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

03 কাজ অ্যাডাপ্টেশন: মডিউলার হস্তক্ষেপের প্রতিনিধিত্ব পুরো মডেল ফাইন-টিউনিংকে প্রতিস্থাপন করে

ক্রস-টাস্ক জেনারালিজেশন ক্ষমতা বড় ল্যাঙ্গুয়েজ মডেলের জন্য একটি "বলতে গুরুত্বপূর্ণ, কিন্তু করতে কঠিন" সমস্যা। বর্তমানে প্রচলিত সমাধানগুলি হল পার-টোকেন ডাইনামিক রাউটিং—প্রতিটি টোকেন প্রক্রিয়াকরণের সময় একাধিক LoRA অ্যাডাপ্টারের মধ্যে বেছে নেয়, কোন পথে যাবে তা নির্ধারণ করে। এই মেকানিজমটি প্রকৃতপক্ষে কার্যকর, কিন্তু এর মূল্যও বেশি: গণনা পরিমাণ এবং VRAM ব্যবহার উভয়ই অত্যধিক, ফলে মডেলটি ধীরে এবং VRAM-এর অনেক বেশি ব্যবহার করে।

একটি বিকল্প পদ্ধতি—প্রতীকী সূক্ষ্ম সামঞ্জস্য (ReFT)—যা মডেলের প্যারামিটারগুলি পরিবর্তন করে না, বরং শুধুমাত্র প্রিফিক্স এবং পোস্টফিক্স টোকেনের প্রতীকী উপস্থাপনা সম্পাদনা করে একক কাজের জন্য অ্যাডাপ্টেশন অর্জন করে, যা LoRA-এর তুলনায় অনেক বেশি দক্ষ। তবে এর দুটি সীমাবদ্ধতা রয়েছে: প্রথমত, টোকেনগুলির নিজস্ব অর্থের অস্পষ্টতা রয়েছে, তাই শুধুমাত্র শুরু এবং শেষটি পরিবর্তন করলে যথেষ্ট সঠিক হয় না; দ্বিতীয়ত, এটি "স্ব-নির্দেশিত" কোনও কাঠামোর অভাব রয়েছে, যার ফলে মডেলটি অপরিচিত নতুন কাজগুলির সম্মুখীন হলে কোন স্তরটি, কোন প্রতীকী উপস্থাপনা পরিবর্তন করতে হবে, তা জানতে পারে না।

হুয়াওয়ে ক্লাউড দল বিভিন্ন বিশ্ববিদ্যালয়ের সাথে সহযোগিতা করে, রিপ্রেজেন্টেশন-অ্যাওয়ার মডুলারিটি (RaMod) ফ্রেমওয়ার্কটি প্রস্তাব করেছে, যা ReFT-এর ধারণাকে ক্রস-টাস্ক জেনারালাইজেশন স্কেনারিওতে সফলভাবে প্রসারিত করেছে।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

মূল পদ্ধতিটিকে দুটি অংশে বিভক্ত করা যায়:

প্রথম অংশ হল ডুয়াল-মডিউল রিপ্রেজেন্টেশন এবং প্যারামিটার ফাইন-টিউনিং। ReFT শুধুমাত্র শুরু এবং শেষকে পরিবর্তন করতে পারে, কিন্তু RaMod অনেক বেশি সূক্ষ্ম—এটি মধ্যবর্তী স্তরের হিডেন রিপ্রেজেন্টেশন থেকে একটি স্ট্র্যাটেজি-ভিত্তিক সাবসেট বাছাই করে মডিউলার হস্তক্ষেপ করে। কোথায় পরিবর্তন করবেন, কীভাবে পরিবর্তন করবেন—সবকিছুই নির্বাচনমূলক এবং স্ট্র্যাটেজিক। এভাবে মডেলটিকে অপরিচিত টাস্কগুলি সমাধানের জন্য আরও সঠিকভাবে নির্দেশিত করা যায়।

দ্বিতীয় অংশ হল অ্যাসিঙ্ক্রোনাস স্কেডুলার। টাস্কের মধ্যে জেনারালাইজেশনের জন্য সবচেয়ে বড় চ্যালেঞ্জ হল মেমোরি ঘাটতি, যা RaMod একটি সক্রিয় স্কেডুলিং মেকানিজম ডিজাইন করে সমাধান করেছে: যে হস্তক্ষেপগুলির প্রয়োজন হয়, তার জন্যই মেমোরি আবদ্ধ করা হয়, এবং ব্যবহার শেষ হলে সক্রিয়ভাবে মুক্ত করা হয়। এইভাবে, স্টোরেজ ওভারহেডকে সর্বনিম্নে নিয়ে আসা হয়েছে।

প্রভাব তাৎক্ষণিক। পরীক্ষাগুলি দেখিয়েছে যে RaMod শুধুমাত্র কার্যের মধ্যে সাধারণীকরণের ক্ষমতা বেশি, ব্যয়ও উল্লেখযোগ্যভাবে কমেছে: মূল LLMs-এর তুলনায়, এই পদ্ধতিটি অতিরিক্ত প্রিফিলিং সময় 83% কমিয়েছে, জেনারেশন ল্যাটেন্সি 100% কমিয়েছে এবং ভিজিউয়াল মেমোরি ব্যবহার 79% কমিয়েছে।

অর্থাৎ, RaMod কাজের অ্যাডাপ্টেশনকে “মডেল পরিবর্তন” থেকে “রিপ্রেজেন্টেশন টিউনিং”-এ রূপান্তরিত করে—মডেলের মূল অংশ অপরিবর্তিত রেখে শুধুমাত্র কীভাবে লেয়ারের হিডেন স্টেটে পয়েন্ট-টু-পয়েন্ট এডিটিং করা হয়। যদি এই ধারণা কার্যকর হয়, তবে বড় মডেলগুলির ডিপ্লয়মেন্টের অর্থনীতি পুনর্লিখিত হতে পারে: একটি বেস মডেল এবং কয়েকটি হালকা হস্তক্ষেপ মডিউল দিয়ে, পৃথক পৃথক কাজের পরিস্থিতিতে সম্পূর্ণ কপি পৃথকভাবে ট্রেন বা লোড না করেই কম খরচে সেবা দেওয়া যাবে।

তবে “পুনর্লিখন” এর আগে, এই প্রতিনিধিত্ব সূক্ষ্ম সামঞ্জস্য পদ্ধতির কিছু কী সমস্যা এখনও উত্তর দেওয়ার প্রয়োজন, যেমন জটিল যুক্তিবিদ্যা ইত্যাদি উচ্চ কঠিন পরিস্থিতিতে, কি এটি গণনা খরচ বাঁচানোর সাথে সাথে সঠিকতা বজায় রাখতে পারে।

04 ডেটা ব্রেকথ্রু: ভাষাবিদরা তাদের দায়িত্ব পালন করছেন, ধাপে ধাপে প্রশিক্ষণ চলছে

প্রথম তিনটি পেপার সবই “মডেলটিকে কীভাবে আরও দক্ষতার সাথে ব্যবহার করা যায়” তা নিয়ে কাজ করেছে। কিন্তু অনেক টাস্কের জন্য একটি আরও মৌলিক বাস্তব চ্যালেঞ্জ রয়েছে: যদি ট্রেনিং ডেটাই যথেষ্ট না হয়?

কোড-সুইচিং (Code-Switching, CS) ভয়েস ট্রান্সলেশন টাস্কটি বিভিন্ন ভাষার মিশ্রিত ভয়েসকে লক্ষ্য ভাষায় অনুবাদ করে। এই টাস্কটি শুধু অর্থগত মডেলিংয়ের জন্যই জটিল নয়, বরং CS ডেটার অভাবও একটি বড় সমস্যা।

পূর্বের গবেষণাগুলি মূলত দুটি পথে চলেছিল: একটি হল মডেলকে নিজে থেকে বৈশিষ্ট্যের অর্থ বুঝতে দেওয়া, যার ফলাফল নিয়ন্ত্রণযোগ্য নয়; অন্যটি হল ম্যানুয়ালি অ্যানোটেশন করার জন্য বড় পরিমাণে খরচ করা, যা খুবই ব্যয়বহুল এবং স্কেল করা কঠিন।

হুয়াওয়ে অনুবাদ সেবা কেন্দ্র দল, জিয়ামেন বিশ্ববিদ্যালয় এবং ম্যাকাও বিশ্ববিদ্যালয়ের সাথে সহযোগিতায় এই গবেষণাপত্রটি একটি নতুন ধারণা প্রস্তাব করে: মডেলকে নিজেরাই বিভিন্ন ভাষার অর্থগত প্রতিনিধিত্ব খুঁজে বের করতে দেওয়ার পরিবর্তে, এগুলিকে সক্রিয়ভাবে সামঞ্জস্য করা হোক—প্রতিটি ভাষার জন্য আলাদা একটি “বিশেষজ্ঞ দল” তৈরি করুন, যাতে প্রতিটি দল নিজেদের ভাষার অর্থগত মডেলিংয়ের দায়িত্ব বহন করে, এবং শেষে সবগুলোকে একত্রিতভাবে সামঞ্জস্য করা হোক।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

পেপারের ঠিকানা: https://arxiv.org/pdf/2511.10670

দুটি প্রধান ডিজাইন রয়েছে:

প্রথমটি হল MoE (মিক্সড এক্সপার্ট) ভয়েস প্রজেক্টর। পারম্পরিক প্রজেক্টরগুলি সমস্ত ভাষাকে সমানভাবে বিবেচনা করে, যার ফলে ফলাফল স্বাভাবিকভাবেই অপ্রতুল। MoE সংস্করণটি প্রতিটি ভাষার জন্য একটি বিশেষ “এক্সপার্ট” গ্রুপ বরাদ্দ করে, যেখানে প্রতিটি এক্সপার্ট গ্রুপ শুধুমাত্র একটি ভাষার ফাইন-গ্রেনুলার ভয়েস ফিচার মডেলিংয়ের জন্য দায়ী। রাউটিং মেকানিজমটি স্বয়ংক্রিয়ভাবে ভয়েস ফিচারগুলিকে সংশ্লিষ্ট ভাষার এক্সপার্ট গ্রুপের কাছে পাঠায়।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

পথ সঠিক রাখার জন্য, পেপারটি দুটি সহায়ক ক্ষতি প্রবর্তন করে: ভাষা-নির্দিষ্ট ক্ষতি নিশ্চিত করে যে প্রতিটি এক্সপার্ট সংশ্লিষ্ট ভাষার বৈশিষ্ট্যগুলি আসলে শিখেছে, এবং গ্রুপ-অন্তর্গত লোড ব্যালেন্সিং ক্ষতি সমস্ত টোকেনের একই এক্সপার্টের উপর জমা হওয়া প্রতিরোধ করে।

দ্বিতীয়টি একটি বহু-পর্যায়ের প্রশিক্ষণ পদ্ধতি। ডেটা অপর্যাপ্ত হলে, কৌশল দিয়ে পূরণ করুন। সম্পূর্ণ প্রশিক্ষণ চারটি ধাপে বিভক্ত: প্রথমে, প্রতিটি ভাষার জন্য অটোমেটিক স্পিচ রিকগনিশন (ASR) ডেটা ব্যবহার করে প্রজেকশনারগুলি আলাদাভাবে পূর্ব-প্রশিক্ষিত করুন, যাতে স্বরূপ-পাঠ্য সমন্বয়ের ভিত্তি তৈরি হয়; তারপর, বিভিন্ন ভাষার প্রজেকশনারগুলিকে MoE স্ট্রাকচারে সংযুক্ত করুন এবং ভাষা-নির্দিষ্ট লস এবং লোড ব্যালেন্সিং লস ব্যবহার করে একসাথে অপ্টিমাইজ করুন; এরপর, ASR ডেটা থেকে ধীরে ধীরে একভাষিক স্পিচ অনুবাদ (ST) ডেটাতে স্থানান্তরিত হন, এবং ট্রানজিশনাল লস ব্যবহার করে সহজেই স্থানান্তরণ ঘটান; শেষে, ST ডেটা থেকে CS স্পিচ অনুবাদ ডেটাতে অ্যাডাপ্টেশন করুন।

এই প্রগতিশীল ডিজাইনের মূল বিষয় হলো—মডেলকে সরাসরি দুর্লভ CS ডেটা খাওয়ানোর পরিবর্তে, প্রথমে পর্যাপ্ত ASR এবং ST ডেটা ব্যবহার করে মৌলিক ক্ষমতা শক্তিশালী করা হয়, তারপর ধাপে ধাপে লক্ষ্য কাজের দিকে এগিয়ে যাওয়া হয়।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: 'স্কেল ডেনসিটি' থেকে 'ডিজাইন ডেনসিটি'-এ স্থানান্তর

Whisper, SeamlessM4T, LLaST এর মতো অনেকগুলি শক্তিশালী বেসলাইন মডেলের সাথে পরীক্ষামূলক তুলনা করা হয়েছে। Fisher এবং NTUML2021-এর চারটি টেস্ট সেটে, এই পদ্ধতিটি SeamlessM4T-এর চেয়েও ভালো ফলাফল দেখিয়েছে, যার BLEU সর্বোচ্চ 39.52 এবং COMET সর্বোচ্চ 81.33 হয়েছে।

এই কাজটি স্পষ্ট সংকেত দেয়: ডেটা স্বল্পতা বিশিষ্ট বহুভাষিক পরিস্থিতিতে, সূক্ষ্ম আর্কিটেকচার ডিজাইন এবং পদক্ষেপবদ্ধ ট্রেনিং কৌশল শুধুমাত্র ডেটা জমা দেওয়ার চেয়ে বেশি কার্যকর হতে পারে।

এটি মনে রাখা প্রয়োজন যে, সীমিত ভাষার সংখ্যা এবং ডেটা গুণগত মান নিয়ন্ত্রিত পরিস্থিতিতে এটি একটি কার্যকরী "হাতিয়ার" হিসাবে কাজ করে, কিন্তু দশগুণ ভাষার জন্য সাধারণ বহুভাষিক অনুবাদ সিস্টেমের জন্য এটির স্কেলযোগ্যতা আরও পরীক্ষা করা প্রয়োজন।

05 শেষ কথাঃ ডিজাইন ঘনত্ব দিয়ে ক্যালকুলেশন খরচ পরিবর্তন করুন

30B হাইয়ারার্কিক্যাল ViT মডেলের স্কেলেল পুনর্গঠন করেছে, যার ফলে 67 বিলিয়ন এক্টিভেশন প্যারামিটার ImageNet-এ 180 বিলিয়নের প্রতিদ্বন্দ্বীকে ছাড়িয়ে গেছে;

LFS ইনপুটে একটি বিয়োগ করেছে, যা গণনার আগে অসংখ্য অর্থহীন ফ্রেম এনকোডিং ওভারহেডকে বাধা দিয়েছে;

RaMod সম্পূর্ণ ফাইন-টিউনিংকে রিপ্রেজেন্টেশন লেয়ারের ফিক্সড-পয়েন্ট এডিটিংয়ে সংকুচিত করেছে, যার ফলে ক্রস-টাস্ক অ্যাডাপ্টেশনের জন্য মেমোরি এবং ল্যাটেন্সি উভয়ই কমেছে;

মোই বিভাগীকরণ এবং প্রগতিশীল প্রশিক্ষণের মাধ্যমে ভাষা রূপান্তর অনুবাদ প্রমাণ করেছে যে, সবচেয়ে কম ডেটা সহ পথেও: আর্কিটেকচারের বুদ্ধিমত্তা কখনও কখনও ডেটার দারিদ্র্যকে পূরণ করতে পারে।

চারটি পেপার, চারটি দিক, সবগুলোই একই কেন্দ্রের দিকে ইঙ্গিত করছে: হুয়াওয়ে এখন “স্কেল ডেনসিটি”-এর পরিবর্তে “ডিজাইন ডেনসিটি” ব্যবহার করছে। এই চারটি পেপার যথাক্রমে বেসিক রিসার্চ, এআই ডেটা, ক্লাউড সার্ভিস এবং ট্রান্সলেশন সার্ভিস সেন্টার থেকে এসেছে, যা দেখায় যে দক্ষতাকে অগ্রাধিকার দেওয়া শুধুমাত্র কোনো একটি টিমের পছন্দ নয়—এই যুক্তি প্রতিটি পর্যায়ের টেকনোলজির বাছাইয়ের মধ্যে লিখে ফেলা হয়েছে।

যদি গত দুই বছরের এআই প্রতিযোগিতাকে “মাইনিং রেস” বলা যায়, তাহলে ২০২৬ সাল একটি মোড়ের দিকে ইঙ্গিত করছে: “প্রক্রিয়াকরণ প্রযুক্তি” রেসের যুগ শুরু হয়েছে। স্পার্স এক্টিভেশন, স্মার্ট ফিল্টারিং, মডিউলার অ্যাডাপ্টেশন, প্রগতিশীল ট্রেনিং—এই পথগুলি আরও বেশি চিপ এবং কম্পিউটিং পাওয়ারের উপর নির্ভর করে না, বরং সমস্যাটির প্রতি আরও গভীর বোঝাপড়ার উপর নির্ভর করে।

বড় কোম্পানি বা স্টার্টআপ উভয়ই ইতিমধ্যে প্যারামিটার অস্ত্রাগারের প্রতিযোগিতা পার হয়ে গেছে; AI-এর দ্বিতীয় অংশে, বাস্তব বাস্তবায়নের সমস্যাগুলির বোঝা এবং এই সমস্যাগুলির ব্যবস্থাগতভাবে সমাধানের ইঞ্জিনিয়ারিং ক্ষমতাই প্রকৃতপক্ষে সিদ্ধান্তকারী বিন্দু।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।