অ্যালিবাবা গ্রুপ IJCAI 2026-এ চারটি পেপার প্রকাশ করেছে, যেখানে ডায়নামিক পরিবেশে AI-এর সামঞ্জস্যতা সম্পর্কে ব্যাপকভাবে অনুসন্ধান করা হয়েছে।লেখক, উৎস: লেইফেঙ্গোয়েন

সবচেয়ে বুদ্ধিমান অ্যালগরিদমই শেষপর্যন্ত ডায়নামিক পরিবেশে পরীক্ষা করা হয়।
IJCAI-ECAI 2026 এর আয়োজন করা হবে 2026 সালের 15 থেকে 21 আগস্ট জার্মানির ব্রেমেনে। কনফারেন্সের সময়, AI টেক রিভিউ এই শীর্ষ কনফারেন্সে প্রকাশিত পেপারগুলি সিস্টেমেটিকভাবে স্ক্যান করছে, যাতে প্রযুক্তিগত প্রবণতা এবং শিল্পের দিকনির্দেশ শনাক্ত করা যায়।
হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: "স্কেল ডেনসিটি" থেকে "ডিজাইন ডেনসিটি"-এ স্থানান্তরতে, আমরা বড় কোম্পানিগুলির প্যারামিটার প্রতিযোগিতায় সংযম এবং কম্পিউটেশনাল দক্ষতার প্রতি আকর্ষণ লক্ষ্য করেছি।
এবং অ্যালিবাবা গ্রুপ দ্বারা নির্বাচিত চারটি পেপার একই গুরুত্বপূর্ণ কিন্তু সম্পূর্ণ ভিন্ন পথের প্রযুক্তিগত প্রবণতার দিকে ইঙ্গিত করে: ডায়নামিক পরিবেশের সাথে খাপ খাওয়ানোর জন্য পদ্ধতিগত অনুসন্ধান।
ল্যাবে অ্যালগরিদম মডেলের সঠিকতা নিয়মিত রেকর্ড ভাঙছে, কিন্তু বাস্তব জগতে বাস্তবায়নের সাথে সাথে পারফরম্যান্স হ্রাস পাওয়া প্রায় স্বাভাবিক। কারণটি খুব সহজ: বাস্তব জগত কখনও স্থির থাকে না।
অ্যালিবাবা গ্রুপের ব্যবসায়িক পরিস্থিতিতে এই “অস্থিরতা” চরম সীমায় পৌঁছেছে: 10 বিলিয়নের বেশি ব্যবহারকারী, 8,000টিরও বেশি সেবা, পেমেন্টের শীর্ষ ও রাতের নিম্নতম মাত্রার মধ্যে কয়েকটি ক্ষমতার পার্থক্য হতে পারে, রিস্ক কন্ট্রোল মডেলগুলিকে ঘন্টার মধ্যেই ব্ল্যাকহ্যাট কৌশলের আপডেটের প্রতিক্রিয়া দিতে হবে, এবং গ্লোবাল ডিপ্লয়মেন্টকে বিভিন্ন দেশের অসামঞ্জস্যপূর্ণ আর্থিক অবকাঠামোর সাথে খাপ খাইয়ে নিতে হবে।
এই পরিবেশে, "একবার প্রশিক্ষণ, চিরস্থায়ী ডিপ্লয়" স্থির মডেলগুলি "চাকার নিশান খোঁজা" সমস্যায় আটকে যাবে।
এই কারণেই, প্রকৃত বুদ্ধিমত্তা হলো অ্যালগরিদম কি পরিবেশের পরিবর্তন বুঝতে পারে, নিজের কৌশল সক্রিয়ভাবে সামঞ্জস্য করে এবং গতিশীলতার মধ্যে সর্বোত্তম সমাধান খুঁজে পায়। আন্ট গ্রুপের এই চারটি গবেষণা পত্র একইভাবে এই মূল প্রশ্নের উত্তর দেয়: AI-কে “স্থির সমাধানকারী” থেকে “গতিশীল স্ব-অভিযোজনকারী”-এ কিভাবে উন্নীত করা যায়?
01 MSRGC-Net: সময় ধারাবাহিক ক্লাস্টারিংকে ডেটা ঘনত্ব বণ্টনের সাথে "সামঞ্জস্যপূর্ণ" করুন
টাইম সিরিজ ক্লাস্টারিং হল বিপুল পরিমাণ আচরণের সিরিজকে স্বয়ংক্রিয়ভাবে শ্রেণীবদ্ধ করা, যা আচরণের প্যাটার্ন বুঝতে এবং অস্বাভাবিক সংকেত পর্যবেক্ষণের একটি মৌলিক টুল।
কিন্তু বর্তমান পদ্ধতিগুলির প্রতিটিরই অস্বস্তিকর দিক রয়েছে:
- সাদৃশ্য পদ্ধতি (যেমন k-Shape): স্থানীয় প্যাটার্ন ধরতে পারে, কিন্তু সমস্ত নমুনার মধ্যে দুটি করে দূরত্ব গণনা করতে হয়, ডেটা বেশি হলে এটি ধীর হয়ে যায়;
- ডিপ লার্নিং পদ্ধতি (যেমন অটোএনকোডার): প্রতিনিধিত্ব ক্ষমতা শক্তিশালী, কিন্তু প্রশিক্ষণ ব্যয়বহুল, প্যারামিটার টিউনিং জটিল এবং কম্পিউটেশনাল সম্পদ ব্যয় বেশি;
- প্রাচীন বৈশিষ্ট্য বের করা: মানুষের দ্বারা ডিজাইন করা বৈশিষ্ট্যের উপর নির্ভরশীল, যার ফলে গুরুত্বপূর্ণ সময়ভিত্তিক গতিশীলতার তথ্য হারিয়ে যেতে পারে।
বড় সমস্যাটি হল: বাস্তবের সময়ক্রম ডেটা ঘনত্ব অত্যন্ত অসমভাবে বিন্যস্ত — ডিজিটাল সিঙ্গলসের ট্রানজেকশন ডেটা বৃষ্টির মতো ঘন, কিন্তু রাতের ডেটা ফোঁটা ফোঁটা করে বিরল, কিন্তু প্রচলিত পদ্ধতিগুলি আপনাকে আগে থেকেই বলতে হয় কয়টি শ্রেণিতে ভাগ করবেন, যা নিজেই বাস্তবতার সাথে অসামঞ্জস্যপূর্ণ।
মার্টিন গ্রুপ এবং চোংকিং ইউনিভার্সিটি অফ পোস্ট এন্ড টেলিকমিউনিকেশন দ্বারা প্রস্তাবিত MSRGC-Net, একটি "ট্রেনিং-ফ্রি" কম্বিনেশন ব্যবহার করে প্রেসিশন এবং কম্পিউটেশনাল দক্ষতার মধ্যে দ্বন্দ্ব এড়িয়ে চলেছে।

পেপারের ঠিকানা: https://arxiv.org/pdf/2606.12077v1
▎এর মূল যুক্তি তিনটি ধাপে বিভক্ত করা যায়:

প্রথম ধাপ, বহু-স্কেল রিজার্ভয়ার এনকোডিং (বৈশিষ্ট্য বের করা)। মূল সময় ধারাথেকে স্থানীয় উত্থান-পতন এবং দীর্ঘমেয়াদী প্রবণতা একসাথে বের করতে, কোনো প্রশিক্ষণ ছাড়াই একাধিক ইকো স্টেট নেটওয়ার্ক (ESN) ব্যবহার করা হয়, যা শুধুমাত্র স্পেকট্রাল রেডিয়াস সমন্বয় করে কাজ করে। সমস্ত নমুনা একত্রিত করে, ভিউ ফিচার ম্যাট্রিক্স তৈরি করা হয়, যা পরবর্তী ধাপের জন্য ইনপুট হিসেবে ব্যবহৃত হয়।
দ্বিতীয় ধাপ, “গ্রেনুলার বল” অ্যানকরিং গ্রাফ তৈরি (স্ট্রাকচারাল মডেলিং), যা সবচেয়ে চালাক অংশ। অ্যালগরিদম এখন একক ডেটা পয়েন্টের দিকে নজর দেয় না, বরং ডেটার স্থানীয় ঘনত্বের ভিত্তিতে “গ্রেনুলার বল” (Granular Ball) স্বয়ংক্রিয়ভাবে বিভক্ত করে: ঘনত্ব যেখানে বেশি, সেখানে ছোট এবং বেশি গ্রেনুলার গঠিত হয়, আর ঘনত্ব যেখানে কম, সেখানে বড় এবং কম গ্রেনুলার গঠিত হয়। ডেটা আকার N-এর পরিবর্তে M (গ্রেনুলার সংখ্যা, M < N) এ কমিয়ে ফেলা হয়, একইসঙ্গে শব্দের হস্তক্ষেপও কমিয়ে দেওয়া হয়।
তৃতীয় ধাপ, কনসেনসাস-ভিত্তিক মাল্টিস্কেল গ্রাফ অপ্টিমাইজেশন। স্কেলের মধ্যে অ্যানকর গ্রাফগুলি কনসেনসাস স্ট্র্যাটেজির মাধ্যমে ফিউজ করা হয়, যার ফলে মডেলটি মাইক্রো লোকাল প্যাটার্নগুলি ধরতে পারে এবং ম্যাক্রো গ্লোবাল ট্রেন্ডগুলি বুঝতে পারে, যার ফলে ম্যানুয়ালি ক্লাস্টার সংখ্যা নির্দিষ্ট করার প্রয়োজন ছাড়াই একটি দৃঢ় ক্লাস্টারিং ফলাফল তৈরি হয়।
এই কৌশলটির ফলাফল কেমন?

5টি বহু-পরিবর্তনশীল বেঞ্চমার্ক ডেটাসেট এবং 15টি মূল্যায়ন মেট্রিক (NMI, ARI, RI প্রতিটি 5টি) এর উপর, MSRGC-Net 12টি শীর্ষ এবং 2টি দ্বিতীয় স্থান অর্জন করেছে—80% শীর্ষ হার।
এর সবচেয়ে গুরুত্বপূর্ণ বিষয় হল এটি O(n²) জোড়া গণনা এড়িয়ে প্রায় রৈখিক জটিলতা অর্জন করে। সহজ কথায়: এটি দ্রুত এবং সঠিক, এবং আপনাকে কয়টি শ্রেণিতে ভাগ করতে হবে তা অনুমান করার দরকার হয় না।
অ্যালিবাবার প্রকৃত ব্যবসায়িক পরিস্থিতিতে, এর অর্থ হল সিস্টেম ট্রাফিক ঘনত্বের ভিত্তিতে ক্লাস্টারিং গ্রেনুলারিটি স্বয়ংক্রিয়ভাবে সামঞ্জস্য করতে পারে—শীর্ষ সময়ে অসাধারণ আচরণ ধরতে সূক্ষ্ম গোষ্ঠীকরণ, নিম্ন সময়ে কমপ্রসেসিং শক্তি সঞ্চয়ের জন্য কোষ্ঠক সারাংশ, সবসময় ডেটার সাথে চলে।
02 অফলাইন থেকে অনলাইন রিইনফোর্সমেন্ট লার্নিংয়ের জন্য অ্যাডাপ্টিভ ডেটা মিক্সিং স্ট্র্যাটেজি
অফলাইন ডেটাতে প্রশিক্ষিত মডেল যখন অনলাইনে চালু হয়, তখন এটি সহজেই "মনে হারায়" — এটি শক্তিশালী শিক্ষার একটি পরিচিত সমস্যা, "ডিস্ট্রিবিউশন শিফট": অফলাইন ডেটা এবং অনলাইন ইন্টারঅ্যাকশন ডেটার মধ্যে বিভাজনের পার্থক্যের কারণে অনলাইনের প্রাথমিক পর্যায়ে কৌশলটি দ্রুত অফলাইনে শেখা জ্ঞান ভুলে যায়।
বর্তমান সমাধান দুটি মাত্র: একটি হলো ৫০% অফলাইন এবং ৫০% অনলাইনের মিশ্রণ নির্দিষ্ট করা, অন্যটি হলো হিউরিস্টিক নিয়ম ব্যবহার করে “নিকটস্থ পদ্ধতি”-এর নমুনা প্রাধান্য দেওয়া।
কিন্তু সমস্যা হলো, বিভিন্ন পর্যায়ে কৌশলের প্রয়োজনীয়তা সম্পূর্ণ ভিন্ন—প্রাথমিক পর্যায়ে মৌলিক ভিত্তি স্থিতিশীল রাখতে বেশি অফলাইন ডেটার প্রয়োজন হয়, পরবর্তী পর্যায়ে নতুন সম্ভাবনা অন্বেষণের জন্য বেশি অনলাইন ডেটার প্রয়োজন হয়। স্থির কৌশল হলো নৌকায় তলানির চিহ্ন করে রাখা।
অ্যালিবাবা গ্রুপ এবং শাংহাই জিয়াওটং বিশ্ববিদ্যালয় একসাথে ROAD প্রস্তাব করেছে, যাতে ডেটা মিশ্রণের অনুপাতকে একটি "পূর্বনির্ধারিত প্যারামিটার" থেকে "ডায়নামিক সিদ্ধান্ত চলক" হিসেবে পরিণত করা হয়েছে।

পেপারের ঠিকানা: https://arxiv.org/pdf/2605.14497
এর মূল ধারণাটি খুব আকর্ষণীয়: ডেটা নির্বাচন মূলত একটি দ্বিতলীয় অপ্টিমাইজেশন সমস্যা।

- অন্তর্গত (Inner-Level): বেলম্যান ত্রুটি ন্যূনতমকরণের মাধ্যমে মানক Q-শিক্ষা আপডেট;
- বাহ্যিক (অ্যাউটার-লেভেল): অনলাইন স্ট্র্যাটেজির প্রত্যাশিত রিটার্নকে সর্বোচ্চকরণের লক্ষ্যে ডেটা মিক্সিং স্ট্র্যাটেজিকে মেটা-ডিসিশন ভেরিয়েবল হিসাবে বিবেচনা করুন।
দুটি স্তরকে মাল্টি-আর্মড ব্যান্ডিট (MAB) অ্যালগরিদম ব্যবহার করে আনুমানিকভাবে সমাধান করা হয়, যাতে মিশ্র কৌশলটি প্রশিক্ষণের সময় বাস্তবসময়ে সামঞ্জস্য করতে পারে: যখন মডেলটি অফলাইন পর্যায়ে শেখা জ্ঞানকে “ভুলে যাওয়া” শুরু করে, তখন অটোমেটিকভাবে অফলাইন ডেটা স্যাম্পলিং অনুপাত বাড়ানো হয় যাতে মূল ভিত্তি স্থিতিশীল থাকে; যখন মডেলটি সতর্কতাপূর্ণ হয়ে পড়ে এবং অনুসন্ধানের অভাব দেখা দেয়, তখন অনলাইন ডেটার অনুপাত বাড়ানো হয়, যাতে এটি ভুল করার জন্য উৎসাহিত হয়।
পরীক্ষাগুলি খুব ভালভাবে পরিচালিত হয়েছে। দলটি অফলাইন থেকে অনলাইন শক্তিশালী শেখার তিনটি ক্লাসিক বেঞ্চমার্কে যাচাই করেছে: AntMaze (রোবট একটি ল্যাবিরিন্থে লক্ষ্যের দিকে যায়), MuJoCo (জীববিজ্ঞানের অনুকরণকারী রোবটের গতিবিধি নিয়ন্ত্রণ) এবং FrankaKitchen (একটি মেকানিক্যাল আর্ম একটি রান্নাঘরে জটিল কাজগুলি সম্পন্ন করে)। এই কাজগুলির কঠিনতা ভিন্ন, অবস্থা স্পেসগুলি বিভিন্ন, যা অ্যালগরিদমের সাধারণীকরণের ক্ষমতা পরীক্ষা করতে সক্ষম।

ROAD এর অ্যালগরিদমের সার্বজনীনতা যাচাইয়ের জন্য, গবেষণা দল ROAD কে IQL, PEX, CQL, Cal-QL সহ বিভিন্ন প্রধান অফলাইন অ্যালগরিদমের সাথে “যুক্ত” করেছে। ফলাফল দেখায়: যেকোনো অধস্থ অ্যালগরিদম ব্যবহার করুক না কেন, ROAD স্থিরভাবে পারফরম্যান্সের উন্নতি আনে।

PEX+ROAD উদাহরণে, এই পদ্ধতিটি D4RL বেঞ্চমার্কের 24টি নিরবচ্ছিন্ন নিয়ন্ত্রণ কাজে 71.12 সামগ্রিক গড় স্কোর অর্জন করেছে, যেখানে 24টি কাজের মধ্যে 18টিতে প্রথম স্থান অধিকার করেছে, যা স্থির অনুপাত, হ্রাসপ্রাপ্ত অনুপাত, হিউরিস্টিক ব্যালেন্সড রিপ্লে সহ সমস্ত বেসলাইনকে উল্লেখযোগ্যভাবে ছাড়িয়েছে।
অর্থাৎ, ROAD মডেলকে “সাবধানে উত্তরাধিকারসূত্রে প্রাপ্ত” এবং “আক্রমণাত্মকভাবে অন্বেষণ” এর মধ্যে সর্বোত্তম ভারসাম্য খুঁজে পায়—যা শুরুতেই ব্যর্থ হওয়ার প্রবণতা এড়ায় এবং বাস্তবসময়ের ডেটা দ্বারা আনা উন্নতির সুযোগকেও হারায় না। এই পদ্ধতি অ্যালিবাবা গ্রুপের রিস্ক কন্ট্রোল মডেল লঞ্চ এবং রিকমেন্ডেশন সিস্টেমের বাস্তবসময়ের অপটিমাইজেশনের মতো পরিস্থিতিতে স্পষ্টভাবে মূল্যবান।
03 DSEBO: উচ্চমাত্রিক বেয়েসিয়ান অপ্টিমাইজেশনকে "সামঞ্জস্যপূর্ণ" সাবস্পেস অনুসন্ধানের জন্য সজ্জিত করুন
বেয়েসিয়ান অপ্টিমাইজেশন হল ব্ল্যাক-বক্স ফাংশন অপ্টিমাইজেশনের একটি ক্লাসিক পদ্ধতি, কিন্তু উচ্চ-মাত্রিক সমস্যার সাথে এটি সমস্যায় পড়ে। একটি সাধারণ সমাধান হল র্যান্ডম এমবেডিং—অপ্টিমাইজেশনকে একটি নিম্ন-মাত্রিক উপ-স্থানে প্রক্ষেপ করা, কিন্তু একটি নতুন সমস্যা দেখা দেয়: কার্যকরী মাত্রা কতটা?
প্রাচীন পদ্ধতিগুলি বা তো বিশেষজ্ঞদের অভিজ্ঞতার উপর নির্ভর করে স্থির উপ-স্থান মাত্রা নির্ধারণ করে, অথবা পরীক্ষা-ভুল পদ্ধতিতে বারবার অনুমান করে, যা অনেক সম্পদ খরচ করে এবং স্থির উপ-স্থান মাত্রা বিভিন্ন কাজের সাথে খাপ খাইয়ে নেওয়া কঠিন। আরও সমস্যার বিষয় হলো, কার্যকরী মাত্রা নিজেই অপটিমাইজেশনের প্রক্রিয়ায় পরিবর্তিত হতে পারে: প্রাথমিক অনুসন্ধানের সময় কম মাত্রা যথেষ্ট, কিন্তু পরবর্তীতে সূক্ষ্ম সমায়োজনের জন্য উচ্চতর মাত্রার বিস্তারিত প্রয়োজন হতে পারে।
অ্যালিবাবা গ্রুপ এবং ইস্ট চাইনা নরমাল ইউনিভার্সিটি, ন্যানজিং ইউনিভার্সিটির সমন্বয়ে প্রস্তাবিত DSEBO-এ সাবস্পেস ডাইমেনশনকে অপ্টিমাইজেশন প্রক্রিয়ার একটি “ডায়নামিক ভেরিয়েবল” হিসেবে ব্যবহার করা হয়, যা অনুসন্ধানের প্রগতির সাথে সাথে স্বয়ংক্রিয়ভাবে পরিবর্তিত হয়।

পেপারের ঠিকানা: https://arxiv.org/pdf/2605.23473
DSEBO-এর মূল কাঠামো হল "নিম্ন থেকে উচ্চে, ধাপে ধাপে উন্নতি":

- নিম্ন-মাত্রিক উপ-স্থান থেকে শুরু করে, অপ্টিমাইজার নিম্ন-মাত্রিক স্থানে প্রার্থী সমাধান তৈরি করে, যা র্যান্ডম এমবেডিং ম্যাপিং দ্বারা মূল স্থানে প্রেরিত হয় এবং লক্ষ্য ফাংশনের প্রায় আকৃতি দ্রুত বুঝতে পারে, তারপর ফলাফলের ফিডব্যাক গাউসিয়ান প্রক্রিয়াকে পুনরাবৃত্তি আপডেটের জন্য পরিচালিত করে;
- অবধারিত সংকুচনের পর স্বয়ংক্রিয়ভাবে মাত্রা বিস্তার ট্রিগার হয়, যেখানে শেয়ারড এমবেডিং ম্যাট্রিক্সের মাধ্যমে লো-ডাইমেনশনাল সলিউশনকে "উত্তরাধিকারসূত্রে" হাই-ডাইমেনশনালে নেওয়া হয়;
- নতুন সাবস্পেস ইনিশিয়ালাইজেশন এবং অপ্টিমাইজেশন চালিয়ে যাওয়া হচ্ছে, শেয়ার্ড এমবেডিং ম্যাট্রিক্স দ্বারা নিশ্চিত করে যে সমস্ত সাবস্পেস পরস্পরের সাথে নেস্টেড হয়, যা “লো-ডাইমেনশনাল এক্সপ্লোরেশন → কনভারজেন্স ট্রিগার → ডাইমেনশন এক্সপানশন → অপ্টিমাইজেশন চালিয়ে যাওয়া” সাইকেল গঠন করে, যতক্ষণ না মূল্যায়ন বাজেট লিমিটে পৌঁছায়।
আকার প্রসারণ পর্যায়ে, প্রসারণের মাত্রা স্থির নয়—অ্যালগরিদমটি বর্তমান সর্বোত্তম মানের পরিবর্তন বক্ররেখার উপর ভিত্তি করে স্বয়ংসমন্বিতভাবে সামঞ্জস্য করে: বক্ররেখা সমতল হলে ধীরে প্রসারিত হয়, অপ্রয়োজনীয় খরচ এড়ানোর জন্য; বক্ররেখা তীব্র হলে দ্রুত প্রসারিত হয়, উচ্চ-মাত্রিক লাভ দ্রুত ধরে রাখার জন্য।
পরীক্ষার ফলাফল হল: সিনথেটিক ফাংশন (Levy, Griewank, Sphere, D=1000) এবং তিনটি বাস্তব টাস্ক (MSLR, Lasso-Hard, LIMO) এর উপর DSEBO কে REMBO, SIRBO, BAxUS, TuRBO সহ দশটিরও বেশি প্রধান পদ্ধতির সাথে তুলনা করা হয়েছে, যেখানে প্রায় সমস্ত টাস্কে এটি সর্বোত্তম সমাধান অর্জন করেছে—সঠিকতা এবং অভিসরণ গতি উভয়ই শীর্ষে।

এই “নিম্নমাত্রিক পথ খোঁজা, উচ্চমাত্রিক সূক্ষ্ম সমায়োজন” পদ্ধতিটি অ্যালিবাবার দৈনিক গবেষণা ও উন্নয়নেও খুব কার্যকর—ক্রেডিট মডেলের অতি-পরামিতি অপ্টিমাইজেশন, ঝুঁকি নিয়ন্ত্রণ কৌশলের সীমানা অপ্টিমাইজেশন, এবং বিপণন কর্মসূচির বহু-চলক পরীক্ষার ডিজাইনের জন্য এখন বিশেষজ্ঞদের মাথায় ভাবা মাত্রার অনুমানের প্রয়োজন নেই; অ্যালগরিদমটি নিজেই “চলাকালীন দেখছে” এবং স্বয়ংক্রিয়, উচ্চ দক্ষতার কার্যকারিতা অর্জন করেছে।
04 VGA-BenchV2: ভিডিও মূল্যায়ন বেঞ্চমার্ককে AIGC ইকোসিস্টেমের উন্নয়নের জন্য "অ্যাডাপ্টিভ" করুন
যদি প্রথম তিনটি পেপার অ্যালগরিদম স্তরের অ্যাডাপ্টিভিটি নিয়ে আলোচনা করে, তবে VGA-BenchV2 দেখায় যে মূল্যায়ন অবকাঠামো কীভাবে AIGC প্রযুক্তির ইকোসিস্টেমের পুনরাবৃত্তির সাথে "অ্যাডাপ্ট" হয়। এটিই চারটি পেপারের মধ্যে একমাত্র মাল্টিমোডাল কনটেন্ট বুঝতে কেন্দ্রীভূত কাজ, যা অ্যানটস গ্রুপের ডিজিটাল জীবন, কনটেন্ট ইকোসিস্টেম ইত্যাদি অ-বিত্তীয় ক্ষেত্রের কৌশলগত সঞ্চয়কে প্রতিফলিত করে।
AIGC এর কারণে ভিডিও উত্পাদন বিস্ফোরিত হয়েছে, কিন্তু একটি মৌলিক সমস্যা দাঁড়িয়েছে: আমরা এই জেনারেট করা ভিডিওগুলির গুণমান কীভাবে পদ্ধতিগতভাবে মূল্যায়ন করব?
ফভিডি (সামগ্রিক গুণগত মান এবং সময়ক্রমিক সামঞ্জস্যতা মূল্যায়ন), সিলিপ স্কোর (জেনারেট করা ইমেজ এবং টেক্সট বর্ণনার অর্থগত সামঞ্জস্যতা মূল্যায়ন), এগুলি মূলত দেখে যে ছবিটি কতটা ক্লিয়ার, মুভমেন্টগুলি কতটা কন্টিনিউয়াস, এবং টেক্সটটি কতটা মেলে। কিন্তু কম্পোজিশনের সৌন্দর্য, লাইটিংয়ের সূক্ষ্মতা, রঙের সামঞ্জস্যতা—এই “সৌন্দর্য”-সংক্রান্ত পারসেপচুয়াল কোয়ালিটির জন্য এগুলি প্রায় অক্ষম।
পূর্বে CVPR 2026-এ, অ্যালিবাবা বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনে

পেপার লিঙ্ক: https://arxiv.org/pdf/2604.10127
কিন্তু ভিডিও জেনারেশন মডেলগুলির উন্নয়ন খুব দ্রুত হচ্ছে, মাসের মধ্যে আপডেটের গতি ধ্রুবক বেঞ্চমার্ককে দ্রুত “অপর্যাপ্ত” করে তুলছে। IJCAI 2026 পেপারে, দলটি VGA-BenchV2 চালু করেছে।

ওপেন সোর্স ঠিকানা:
https://huggingface.co/datasets/BestVictoryLab/VGA-Bench
▎মূল উন্নয়ন তিনটি:
প্রথমত, মানব লেবেলিংয়ের পরিমাণ বৃদ্ধি পেয়েছে। VGA-BenchV2-এ 36,000টি টাস্ক-লেভেল মানব লেবেল যোগ করা হয়েছে, যার মধ্যে 16,200টি সৌন্দর্য্য গুণমান লেবেল, 13,200টি সৌন্দর্য্য ট্যাগ লেবেল এবং 6,600টি জেনারেশন গুণমান লেবেল রয়েছে, যা VGA-Bench-এর তুলনায় যথাক্রমে 13.46 গুণ, 11.15 গুণ এবং 1.55 গুণ বৃদ্ধি। আরও পর্যাপ্ত “মানব পছন্দ” ডেটা, মূল্যায়নকারীকে মানব সৌন্দর্য্য বিচারের সাথে আরও ভালভাবে সামঞ্জস্যপূর্ণ করে।
দ্বিতীয়ত, মূল্যায়নকারী আর্কিটেকচার আপগ্রেড করা হয়েছে। দলটি একটি মিশ্র আর্কিটেকচার ডিজাইন করেছে: VAQA-Net নিরবচ্ছিন্ন সৌন্দর্য স্কোরিংয়ের জন্য দায়ী, এবং VTag-Net এবং VGQA-Net Qwen বড় ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলের উপর ভিত্তি করে ট্যাগ শনাক্তকরণ এবং মান মূল্যায়ন করে। বড় মডেলের প্রবেশের ফলে, মূল্যায়নকারীটি জটিল ভিজুয়াল সেমান্টিক্সকে বুঝতে একটি নতুন মাত্রা অর্জন করেছে। পরীক্ষার ফলাফলগুলি দেখায় যে, এটি বিভিন্ন জেনারেটিভ মডেলের উপর মানব বিচারের সাথে অত্যন্ত সামঞ্জস্যপূর্ণ।
তৃতীয়ত, "মূল্যায়ন" থেকে "অপ্টিমাইজেশন" পর্যন্ত একটি বন্ধ চক্র তৈরি করা। এটি VGA-BenchV2-এর সবচেয়ে বিপ্লবী ডিজাইন: এটি শেখা সৌন্দর্য মূল্যায়নকারীকে পুরস্কার সংকেত হিসাবে ব্যবহার করে প্রত্যক্ষভাবে শক্তিশালী শিক্ষা ভিত্তিক জেনারেটিভ মডেলের ফাইন-টিউনিংয়ের জন্য। এর অর্থ হলো, মূল্যায়ন বেঞ্চমার্ক আর শুধু "বিচারক" নয়—এটি প্রদান করা স্কোরগুলি প্রত্যক্ষভাবে অপ্টিমাইজেশন সংকেতে রূপান্তরিত হয়, যা জেনারেটিভ মডেলকে সৌন্দর্যগত মানের উপর ধারাবাহিকভাবে পুনরায় বিকাশের জন্য পথনির্দেশ করে।
VGA-Bench থেকে VGA-BenchV2-এ, মূল্যায়ন ব্যবস্থা এখন স্থির মাপকাঠি নয়, বরং জেনারেটিভ ইকোসিস্টেমের সাথে “একসাথে বিকশিত” হওয়া একটি জীবন্ত সিস্টেম। অ্যালিবাবা গ্রুপের কন্টেন্ট বুঝতে, নিরাপত্তা পরীক্ষা, রিকমেন্ডেশন অপ্টিমাইজেশনের মতো সিনেরিওগুলির জন্য, ভিডিও কোয়ালিটি মূল্যায়নের ক্ষমতা AIGC ইকোসিস্টেমের উন্নতির সাথে হালনাগাদ হওয়ার পাশাপাশি উপরের মডেলগুলিকেও অপ্টিমাইজ করতে পারে: “স্কোরিং” থেকে “অপ্টিমাইজেশন”-এ, একটি বন্দর তৈরি হয়েছে।
শেষ কথাঃ যত বুদ্ধিমান অ্যালগরিদমই হোক না কেন, এটিকে অবশ্যই ডাইনামিক পরিবেশে পরীক্ষা করতে হবে।
চারটি পেপার যথাক্রমে অনুপলব্ধ শিক্ষা, শক্তিশালী শিক্ষা, ব্ল্যাকবক্স অপ্টিমাইজেশন এবং মাল্টিমোডাল মূল্যায়নের চারটি দিক থেকে প্রবেশ করে, যা একই প্রযুক্তিগত পথের দিকে নিয়ে যায়—স্থির থেকে গতিশীলের পরিবর্তন।
পরীক্ষামূলক ডেটা এই পথের কার্যকারিতা প্রমাণ করে: MSRGC-Net 15টি মেট্রিকের মধ্যে 12টিতে প্রথম এবং 2টিতে দ্বিতীয় স্থান অধিকার করে; ROAD বহু-প্রকার অফলাইন থেকে অনলাইন রিইনফোর্সমেন্ট লার্নিং টাস্কে বর্তমান স্ট্র্যাটেজির চেয়ে ভালো পারফর্ম করে; DSEBO হাজার-মাত্রিক অপটিমাইজেশন সমস্যায় পরিমাপযোগ্য উন্নতি অর্জন করে; VGA-BenchV2 বহু জেনারেটিভ মডেলের উপর মূল্যায়ন ফলাফলগুলি মানুষের বিচারের সাথে উচ্চ মাত্রায় সঙ্গতিপূর্ণ।
এই প্রযুক্তিগত পথটি অনুসরণ করে অ্যালিবাবার সমগ্র কৌশল দেখলে একটি স্পষ্ট “দ্বৈত-চালনা” কাঠামো দেখা যায়: একদিকে ফিন্টেকের মূল স্কেনারিওতে সময়ক্রম মডেলিং, রিইনফোর্সমেন্ট লার্নিং এবং অপ্টিমাইজেশন অ্যালগরিদমের উপর গভীরভাবে কাজ করা হচ্ছে; অন্যদিকে ডিজিটাল জীবন এবং কনটেন্ট ইকোসিস্টেমে মাল্টিমডাল বুঝতে এবং মূল্যায়নের ভিত্তি প্রস্তুত করা হচ্ছে।
শেষ পর্যন্ত, এলগরিদম যতই বুদ্ধিমান হোক না কেন, এটিকে অবশ্যই গতিশীল পরিবেশে পরীক্ষা করতে হবে। এই চারটি গবেষণাপত্রের প্রকৃত মূল্য হয়তো এটিই: তারা সবই বাস্তব ব্যবসায়িক মাটিতে বেড়েছে—অ্যালিবাবা-এর ব্যবসায়িক পরিস্থিতি গবেষণাপত্রের “পটভূমি” নয়, বরং সমস্যার উৎস, ডেটার উৎপাদনক্ষেত্র এবং ফলাফলের পরীক্ষার মাঠ।
এবং এটিই হয়তো শিল্পক্ষেত্রে এআই গবেষণা করার সবচেয়ে অনন্য বিষয়—তারা শুধু “পেপার তৈরি” করছে না, বরং বাস্তব বিশ্বের সমস্যার জন্য “গতিশীল পরিবর্তনের প্রতি টিকে থাকার” সমাধান খুঁজছে।
