অ্যান্ট গ্রুপ ডায়নামিক পরিবেশে এআই অ্যাডাপ্টেবিলিটি সম্পর্কে চারটি IJCAI 2026 পেপার প্রকাশ করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
অ্যান্ট গ্রুপ IJCAI 2026-এ চারটি এআই + ক্রিপ্টো পেপার প্রকাশ করেছে, যা ডায়নামিক পরিবেশে এআইয়ের অ্যাডাপ্টিভিটির উপর ফোকাস করে। গবেষণাটি ডায়নামিক টাইম সিরিজ ক্লাস্টারিং, রিইনফোর্সমেন্ট লার্নিং ডেটা মিক্সিং, হাই-ডাইমেনশনাল বেয়েসিয়ান অপটিমাইজেশন এবং ভিডিও কোয়ালিটি অসেসমেন্টকে কভার করে। এই গবেষণাগুলি ডিস্ট্রিবিউশন শিফট, কম্পিউটেশনাল দক্ষতা এবং বিকাশশীল AIGC বাস্তুতন্ত্রকে সমাধানের লক্ষ্যে রেখেছে। মেটাEra-এর মতো অন-চেইন নিউজ প্ল্যাটফর্মগুলি এই কাজের প্রযুক্তিগত গভীরতা এবং বাস্তব-জীবনের প্রাসঙ্গিকতা উল্লেখ করেছে।
অ্যালিবাবা গ্রুপ IJCAI 2026-এ চারটি পেপার প্রকাশ করেছে, যেখানে ডায়নামিক পরিবেশে AI-এর সামঞ্জস্যতা সম্পর্কে ব্যাপকভাবে অনুসন্ধান করা হয়েছে।

লেখক, উৎস: লেইফেঙ্গোয়েন

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

সবচেয়ে বুদ্ধিমান অ্যালগরিদমই শেষপর্যন্ত ডায়নামিক পরিবেশে পরীক্ষা করা হয়।

IJCAI-ECAI 2026 এর আয়োজন করা হবে 2026 সালের 15 থেকে 21 আগস্ট জার্মানির ব্রেমেনে। কনফারেন্সের সময়, AI টেক রিভিউ এই শীর্ষ কনফারেন্সে প্রকাশিত পেপারগুলি সিস্টেমেটিকভাবে স্ক্যান করছে, যাতে প্রযুক্তিগত প্রবণতা এবং শিল্পের দিকনির্দেশ শনাক্ত করা যায়।

হুয়াওয়ে IJCAI 2026 পেপার রিভিউ: "স্কেল ডেনসিটি" থেকে "ডিজাইন ডেনসিটি"-এ স্থানান্তরতে, আমরা বড় কোম্পানিগুলির প্যারামিটার প্রতিযোগিতায় সংযম এবং কম্পিউটেশনাল দক্ষতার প্রতি আকর্ষণ লক্ষ্য করেছি।

এবং অ্যালিবাবা গ্রুপ দ্বারা নির্বাচিত চারটি পেপার একই গুরুত্বপূর্ণ কিন্তু সম্পূর্ণ ভিন্ন পথের প্রযুক্তিগত প্রবণতার দিকে ইঙ্গিত করে: ডায়নামিক পরিবেশের সাথে খাপ খাওয়ানোর জন্য পদ্ধতিগত অনুসন্ধান।

ল্যাবে অ্যালগরিদম মডেলের সঠিকতা নিয়মিত রেকর্ড ভাঙছে, কিন্তু বাস্তব জগতে বাস্তবায়নের সাথে সাথে পারফরম্যান্স হ্রাস পাওয়া প্রায় স্বাভাবিক। কারণটি খুব সহজ: বাস্তব জগত কখনও স্থির থাকে না।

অ্যালিবাবা গ্রুপের ব্যবসায়িক পরিস্থিতিতে এই “অস্থিরতা” চরম সীমায় পৌঁছেছে: 10 বিলিয়নের বেশি ব্যবহারকারী, 8,000টিরও বেশি সেবা, পেমেন্টের শীর্ষ ও রাতের নিম্নতম মাত্রার মধ্যে কয়েকটি ক্ষমতার পার্থক্য হতে পারে, রিস্ক কন্ট্রোল মডেলগুলিকে ঘন্টার মধ্যেই ব্ল্যাকহ্যাট কৌশলের আপডেটের প্রতিক্রিয়া দিতে হবে, এবং গ্লোবাল ডিপ্লয়মেন্টকে বিভিন্ন দেশের অসামঞ্জস্যপূর্ণ আর্থিক অবকাঠামোর সাথে খাপ খাইয়ে নিতে হবে।

এই পরিবেশে, "একবার প্রশিক্ষণ, চিরস্থায়ী ডিপ্লয়" স্থির মডেলগুলি "চাকার নিশান খোঁজা" সমস্যায় আটকে যাবে।

এই কারণেই, প্রকৃত বুদ্ধিমত্তা হলো অ্যালগরিদম কি পরিবেশের পরিবর্তন বুঝতে পারে, নিজের কৌশল সক্রিয়ভাবে সামঞ্জস্য করে এবং গতিশীলতার মধ্যে সর্বোত্তম সমাধান খুঁজে পায়। আন্ট গ্রুপের এই চারটি গবেষণা পত্র একইভাবে এই মূল প্রশ্নের উত্তর দেয়: AI-কে “স্থির সমাধানকারী” থেকে “গতিশীল স্ব-অভিযোজনকারী”-এ কিভাবে উন্নীত করা যায়?

01 MSRGC-Net: সময় ধারাবাহিক ক্লাস্টারিংকে ডেটা ঘনত্ব বণ্টনের সাথে "সামঞ্জস্যপূর্ণ" করুন

টাইম সিরিজ ক্লাস্টারিং হল বিপুল পরিমাণ আচরণের সিরিজকে স্বয়ংক্রিয়ভাবে শ্রেণীবদ্ধ করা, যা আচরণের প্যাটার্ন বুঝতে এবং অস্বাভাবিক সংকেত পর্যবেক্ষণের একটি মৌলিক টুল।

কিন্তু বর্তমান পদ্ধতিগুলির প্রতিটিরই অস্বস্তিকর দিক রয়েছে:

  • সাদৃশ্য পদ্ধতি (যেমন k-Shape): স্থানীয় প্যাটার্ন ধরতে পারে, কিন্তু সমস্ত নমুনার মধ্যে দুটি করে দূরত্ব গণনা করতে হয়, ডেটা বেশি হলে এটি ধীর হয়ে যায়;
  • ডিপ লার্নিং পদ্ধতি (যেমন অটোএনকোডার): প্রতিনিধিত্ব ক্ষমতা শক্তিশালী, কিন্তু প্রশিক্ষণ ব্যয়বহুল, প্যারামিটার টিউনিং জটিল এবং কম্পিউটেশনাল সম্পদ ব্যয় বেশি;
  • প্রাচীন বৈশিষ্ট্য বের করা: মানুষের দ্বারা ডিজাইন করা বৈশিষ্ট্যের উপর নির্ভরশীল, যার ফলে গুরুত্বপূর্ণ সময়ভিত্তিক গতিশীলতার তথ্য হারিয়ে যেতে পারে।

বড় সমস্যাটি হল: বাস্তবের সময়ক্রম ডেটা ঘনত্ব অত্যন্ত অসমভাবে বিন্যস্ত — ডিজিটাল সিঙ্গলসের ট্রানজেকশন ডেটা বৃষ্টির মতো ঘন, কিন্তু রাতের ডেটা ফোঁটা ফোঁটা করে বিরল, কিন্তু প্রচলিত পদ্ধতিগুলি আপনাকে আগে থেকেই বলতে হয় কয়টি শ্রেণিতে ভাগ করবেন, যা নিজেই বাস্তবতার সাথে অসামঞ্জস্যপূর্ণ।

মার্টিন গ্রুপ এবং চোংকিং ইউনিভার্সিটি অফ পোস্ট এন্ড টেলিকমিউনিকেশন দ্বারা প্রস্তাবিত MSRGC-Net, একটি "ট্রেনিং-ফ্রি" কম্বিনেশন ব্যবহার করে প্রেসিশন এবং কম্পিউটেশনাল দক্ষতার মধ্যে দ্বন্দ্ব এড়িয়ে চলেছে।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

পেপারের ঠিকানা: https://arxiv.org/pdf/2606.12077v1

▎এর মূল যুক্তি তিনটি ধাপে বিভক্ত করা যায়:

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

প্রথম ধাপ, বহু-স্কেল রিজার্ভয়ার এনকোডিং (বৈশিষ্ট্য বের করা)। মূল সময় ধারাথেকে স্থানীয় উত্থান-পতন এবং দীর্ঘমেয়াদী প্রবণতা একসাথে বের করতে, কোনো প্রশিক্ষণ ছাড়াই একাধিক ইকো স্টেট নেটওয়ার্ক (ESN) ব্যবহার করা হয়, যা শুধুমাত্র স্পেকট্রাল রেডিয়াস সমন্বয় করে কাজ করে। সমস্ত নমুনা একত্রিত করে, ভিউ ফিচার ম্যাট্রিক্স তৈরি করা হয়, যা পরবর্তী ধাপের জন্য ইনপুট হিসেবে ব্যবহৃত হয়।

দ্বিতীয় ধাপ, “গ্রেনুলার বল” অ্যানকরিং গ্রাফ তৈরি (স্ট্রাকচারাল মডেলিং), যা সবচেয়ে চালাক অংশ। অ্যালগরিদম এখন একক ডেটা পয়েন্টের দিকে নজর দেয় না, বরং ডেটার স্থানীয় ঘনত্বের ভিত্তিতে “গ্রেনুলার বল” (Granular Ball) স্বয়ংক্রিয়ভাবে বিভক্ত করে: ঘনত্ব যেখানে বেশি, সেখানে ছোট এবং বেশি গ্রেনুলার গঠিত হয়, আর ঘনত্ব যেখানে কম, সেখানে বড় এবং কম গ্রেনুলার গঠিত হয়। ডেটা আকার N-এর পরিবর্তে M (গ্রেনুলার সংখ্যা, M < N) এ কমিয়ে ফেলা হয়, একইসঙ্গে শব্দের হস্তক্ষেপও কমিয়ে দেওয়া হয়।

তৃতীয় ধাপ, কনসেনসাস-ভিত্তিক মাল্টিস্কেল গ্রাফ অপ্টিমাইজেশন। স্কেলের মধ্যে অ্যানকর গ্রাফগুলি কনসেনসাস স্ট্র্যাটেজির মাধ্যমে ফিউজ করা হয়, যার ফলে মডেলটি মাইক্রো লোকাল প্যাটার্নগুলি ধরতে পারে এবং ম্যাক্রো গ্লোবাল ট্রেন্ডগুলি বুঝতে পারে, যার ফলে ম্যানুয়ালি ক্লাস্টার সংখ্যা নির্দিষ্ট করার প্রয়োজন ছাড়াই একটি দৃঢ় ক্লাস্টারিং ফলাফল তৈরি হয়।

এই কৌশলটির ফলাফল কেমন?

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

5টি বহু-পরিবর্তনশীল বেঞ্চমার্ক ডেটাসেট এবং 15টি মূল্যায়ন মেট্রিক (NMI, ARI, RI প্রতিটি 5টি) এর উপর, MSRGC-Net 12টি শীর্ষ এবং 2টি দ্বিতীয় স্থান অর্জন করেছে—80% শীর্ষ হার।

এর সবচেয়ে গুরুত্বপূর্ণ বিষয় হল এটি O(n²) জোড়া গণনা এড়িয়ে প্রায় রৈখিক জটিলতা অর্জন করে। সহজ কথায়: এটি দ্রুত এবং সঠিক, এবং আপনাকে কয়টি শ্রেণিতে ভাগ করতে হবে তা অনুমান করার দরকার হয় না।

অ্যালিবাবার প্রকৃত ব্যবসায়িক পরিস্থিতিতে, এর অর্থ হল সিস্টেম ট্রাফিক ঘনত্বের ভিত্তিতে ক্লাস্টারিং গ্রেনুলারিটি স্বয়ংক্রিয়ভাবে সামঞ্জস্য করতে পারে—শীর্ষ সময়ে অসাধারণ আচরণ ধরতে সূক্ষ্ম গোষ্ঠীকরণ, নিম্ন সময়ে কমপ্রসেসিং শক্তি সঞ্চয়ের জন্য কোষ্ঠক সারাংশ, সবসময় ডেটার সাথে চলে।

02 অফলাইন থেকে অনলাইন রিইনফোর্সমেন্ট লার্নিংয়ের জন্য অ্যাডাপ্টিভ ডেটা মিক্সিং স্ট্র্যাটেজি

অফলাইন ডেটাতে প্রশিক্ষিত মডেল যখন অনলাইনে চালু হয়, তখন এটি সহজেই "মনে হারায়" — এটি শক্তিশালী শিক্ষার একটি পরিচিত সমস্যা, "ডিস্ট্রিবিউশন শিফট": অফলাইন ডেটা এবং অনলাইন ইন্টারঅ্যাকশন ডেটার মধ্যে বিভাজনের পার্থক্যের কারণে অনলাইনের প্রাথমিক পর্যায়ে কৌশলটি দ্রুত অফলাইনে শেখা জ্ঞান ভুলে যায়।

বর্তমান সমাধান দুটি মাত্র: একটি হলো ৫০% অফলাইন এবং ৫০% অনলাইনের মিশ্রণ নির্দিষ্ট করা, অন্যটি হলো হিউরিস্টিক নিয়ম ব্যবহার করে “নিকটস্থ পদ্ধতি”-এর নমুনা প্রাধান্য দেওয়া।

কিন্তু সমস্যা হলো, বিভিন্ন পর্যায়ে কৌশলের প্রয়োজনীয়তা সম্পূর্ণ ভিন্ন—প্রাথমিক পর্যায়ে মৌলিক ভিত্তি স্থিতিশীল রাখতে বেশি অফলাইন ডেটার প্রয়োজন হয়, পরবর্তী পর্যায়ে নতুন সম্ভাবনা অন্বেষণের জন্য বেশি অনলাইন ডেটার প্রয়োজন হয়। স্থির কৌশল হলো নৌকায় তলানির চিহ্ন করে রাখা।

অ্যালিবাবা গ্রুপ এবং শাংহাই জিয়াওটং বিশ্ববিদ্যালয় একসাথে ROAD প্রস্তাব করেছে, যাতে ডেটা মিশ্রণের অনুপাতকে একটি "পূর্বনির্ধারিত প্যারামিটার" থেকে "ডায়নামিক সিদ্ধান্ত চলক" হিসেবে পরিণত করা হয়েছে।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

পেপারের ঠিকানা: https://arxiv.org/pdf/2605.14497

এর মূল ধারণাটি খুব আকর্ষণীয়: ডেটা নির্বাচন মূলত একটি দ্বিতলীয় অপ্টিমাইজেশন সমস্যা।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

  • অন্তর্গত (Inner-Level): বেলম্যান ত্রুটি ন্যূনতমকরণের মাধ্যমে মানক Q-শিক্ষা আপডেট;
  • বাহ্যিক (অ্যাউটার-লেভেল): অনলাইন স্ট্র্যাটেজির প্রত্যাশিত রিটার্নকে সর্বোচ্চকরণের লক্ষ্যে ডেটা মিক্সিং স্ট্র্যাটেজিকে মেটা-ডিসিশন ভেরিয়েবল হিসাবে বিবেচনা করুন।

দুটি স্তরকে মাল্টি-আর্মড ব্যান্ডিট (MAB) অ্যালগরিদম ব্যবহার করে আনুমানিকভাবে সমাধান করা হয়, যাতে মিশ্র কৌশলটি প্রশিক্ষণের সময় বাস্তবসময়ে সামঞ্জস্য করতে পারে: যখন মডেলটি অফলাইন পর্যায়ে শেখা জ্ঞানকে “ভুলে যাওয়া” শুরু করে, তখন অটোমেটিকভাবে অফলাইন ডেটা স্যাম্পলিং অনুপাত বাড়ানো হয় যাতে মূল ভিত্তি স্থিতিশীল থাকে; যখন মডেলটি সতর্কতাপূর্ণ হয়ে পড়ে এবং অনুসন্ধানের অভাব দেখা দেয়, তখন অনলাইন ডেটার অনুপাত বাড়ানো হয়, যাতে এটি ভুল করার জন্য উৎসাহিত হয়।

পরীক্ষাগুলি খুব ভালভাবে পরিচালিত হয়েছে। দলটি অফলাইন থেকে অনলাইন শক্তিশালী শেখার তিনটি ক্লাসিক বেঞ্চমার্কে যাচাই করেছে: AntMaze (রোবট একটি ল্যাবিরিন্থে লক্ষ্যের দিকে যায়), MuJoCo (জীববিজ্ঞানের অনুকরণকারী রোবটের গতিবিধি নিয়ন্ত্রণ) এবং FrankaKitchen (একটি মেকানিক্যাল আর্ম একটি রান্নাঘরে জটিল কাজগুলি সম্পন্ন করে)। এই কাজগুলির কঠিনতা ভিন্ন, অবস্থা স্পেসগুলি বিভিন্ন, যা অ্যালগরিদমের সাধারণীকরণের ক্ষমতা পরীক্ষা করতে সক্ষম।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

ROAD এর অ্যালগরিদমের সার্বজনীনতা যাচাইয়ের জন্য, গবেষণা দল ROAD কে IQL, PEX, CQL, Cal-QL সহ বিভিন্ন প্রধান অফলাইন অ্যালগরিদমের সাথে “যুক্ত” করেছে। ফলাফল দেখায়: যেকোনো অধস্থ অ্যালগরিদম ব্যবহার করুক না কেন, ROAD স্থিরভাবে পারফরম্যান্সের উন্নতি আনে।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

PEX+ROAD উদাহরণে, এই পদ্ধতিটি D4RL বেঞ্চমার্কের 24টি নিরবচ্ছিন্ন নিয়ন্ত্রণ কাজে 71.12 সামগ্রিক গড় স্কোর অর্জন করেছে, যেখানে 24টি কাজের মধ্যে 18টিতে প্রথম স্থান অধিকার করেছে, যা স্থির অনুপাত, হ্রাসপ্রাপ্ত অনুপাত, হিউরিস্টিক ব্যালেন্সড রিপ্লে সহ সমস্ত বেসলাইনকে উল্লেখযোগ্যভাবে ছাড়িয়েছে।

অর্থাৎ, ROAD মডেলকে “সাবধানে উত্তরাধিকারসূত্রে প্রাপ্ত” এবং “আক্রমণাত্মকভাবে অন্বেষণ” এর মধ্যে সর্বোত্তম ভারসাম্য খুঁজে পায়—যা শুরুতেই ব্যর্থ হওয়ার প্রবণতা এড়ায় এবং বাস্তবসময়ের ডেটা দ্বারা আনা উন্নতির সুযোগকেও হারায় না। এই পদ্ধতি অ্যালিবাবা গ্রুপের রিস্ক কন্ট্রোল মডেল লঞ্চ এবং রিকমেন্ডেশন সিস্টেমের বাস্তবসময়ের অপটিমাইজেশনের মতো পরিস্থিতিতে স্পষ্টভাবে মূল্যবান।

03 DSEBO: উচ্চমাত্রিক বেয়েসিয়ান অপ্টিমাইজেশনকে "সামঞ্জস্যপূর্ণ" সাবস্পেস অনুসন্ধানের জন্য সজ্জিত করুন

বেয়েসিয়ান অপ্টিমাইজেশন হল ব্ল্যাক-বক্স ফাংশন অপ্টিমাইজেশনের একটি ক্লাসিক পদ্ধতি, কিন্তু উচ্চ-মাত্রিক সমস্যার সাথে এটি সমস্যায় পড়ে। একটি সাধারণ সমাধান হল র‍্যান্ডম এমবেডিং—অপ্টিমাইজেশনকে একটি নিম্ন-মাত্রিক উপ-স্থানে প্রক্ষেপ করা, কিন্তু একটি নতুন সমস্যা দেখা দেয়: কার্যকরী মাত্রা কতটা?

প্রাচীন পদ্ধতিগুলি বা তো বিশেষজ্ঞদের অভিজ্ঞতার উপর নির্ভর করে স্থির উপ-স্থান মাত্রা নির্ধারণ করে, অথবা পরীক্ষা-ভুল পদ্ধতিতে বারবার অনুমান করে, যা অনেক সম্পদ খরচ করে এবং স্থির উপ-স্থান মাত্রা বিভিন্ন কাজের সাথে খাপ খাইয়ে নেওয়া কঠিন। আরও সমস্যার বিষয় হলো, কার্যকরী মাত্রা নিজেই অপটিমাইজেশনের প্রক্রিয়ায় পরিবর্তিত হতে পারে: প্রাথমিক অনুসন্ধানের সময় কম মাত্রা যথেষ্ট, কিন্তু পরবর্তীতে সূক্ষ্ম সমায়োজনের জন্য উচ্চতর মাত্রার বিস্তারিত প্রয়োজন হতে পারে।

অ্যালিবাবা গ্রুপ এবং ইস্ট চাইনা নরমাল ইউনিভার্সিটি, ন্যানজিং ইউনিভার্সিটির সমন্বয়ে প্রস্তাবিত DSEBO-এ সাবস্পেস ডাইমেনশনকে অপ্টিমাইজেশন প্রক্রিয়ার একটি “ডায়নামিক ভেরিয়েবল” হিসেবে ব্যবহার করা হয়, যা অনুসন্ধানের প্রগতির সাথে সাথে স্বয়ংক্রিয়ভাবে পরিবর্তিত হয়।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

পেপারের ঠিকানা: https://arxiv.org/pdf/2605.23473

DSEBO-এর মূল কাঠামো হল "নিম্ন থেকে উচ্চে, ধাপে ধাপে উন্নতি":

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

  • নিম্ন-মাত্রিক উপ-স্থান থেকে শুরু করে, অপ্টিমাইজার নিম্ন-মাত্রিক স্থানে প্রার্থী সমাধান তৈরি করে, যা র‍্যান্ডম এমবেডিং ম্যাপিং দ্বারা মূল স্থানে প্রেরিত হয় এবং লক্ষ্য ফাংশনের প্রায় আকৃতি দ্রুত বুঝতে পারে, তারপর ফলাফলের ফিডব্যাক গাউসিয়ান প্রক্রিয়াকে পুনরাবৃত্তি আপডেটের জন্য পরিচালিত করে;
  • অবধারিত সংকুচনের পর স্বয়ংক্রিয়ভাবে মাত্রা বিস্তার ট্রিগার হয়, যেখানে শেয়ারড এমবেডিং ম্যাট্রিক্সের মাধ্যমে লো-ডাইমেনশনাল সলিউশনকে "উত্তরাধিকারসূত্রে" হাই-ডাইমেনশনালে নেওয়া হয়;
  • নতুন সাবস্পেস ইনিশিয়ালাইজেশন এবং অপ্টিমাইজেশন চালিয়ে যাওয়া হচ্ছে, শেয়ার্ড এমবেডিং ম্যাট্রিক্স দ্বারা নিশ্চিত করে যে সমস্ত সাবস্পেস পরস্পরের সাথে নেস্টেড হয়, যা “লো-ডাইমেনশনাল এক্সপ্লোরেশন → কনভারজেন্স ট্রিগার → ডাইমেনশন এক্সপানশন → অপ্টিমাইজেশন চালিয়ে যাওয়া” সাইকেল গঠন করে, যতক্ষণ না মূল্যায়ন বাজেট লিমিটে পৌঁছায়।

আকার প্রসারণ পর্যায়ে, প্রসারণের মাত্রা স্থির নয়—অ্যালগরিদমটি বর্তমান সর্বোত্তম মানের পরিবর্তন বক্ররেখার উপর ভিত্তি করে স্বয়ংসমন্বিতভাবে সামঞ্জস্য করে: বক্ররেখা সমতল হলে ধীরে প্রসারিত হয়, অপ্রয়োজনীয় খরচ এড়ানোর জন্য; বক্ররেখা তীব্র হলে দ্রুত প্রসারিত হয়, উচ্চ-মাত্রিক লাভ দ্রুত ধরে রাখার জন্য।

পরীক্ষার ফলাফল হল: সিনথেটিক ফাংশন (Levy, Griewank, Sphere, D=1000) এবং তিনটি বাস্তব টাস্ক (MSLR, Lasso-Hard, LIMO) এর উপর DSEBO কে REMBO, SIRBO, BAxUS, TuRBO সহ দশটিরও বেশি প্রধান পদ্ধতির সাথে তুলনা করা হয়েছে, যেখানে প্রায় সমস্ত টাস্কে এটি সর্বোত্তম সমাধান অর্জন করেছে—সঠিকতা এবং অভিসরণ গতি উভয়ই শীর্ষে।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

এই “নিম্নমাত্রিক পথ খোঁজা, উচ্চমাত্রিক সূক্ষ্ম সমায়োজন” পদ্ধতিটি অ্যালিবাবার দৈনিক গবেষণা ও উন্নয়নেও খুব কার্যকর—ক্রেডিট মডেলের অতি-পরামিতি অপ্টিমাইজেশন, ঝুঁকি নিয়ন্ত্রণ কৌশলের সীমানা অপ্টিমাইজেশন, এবং বিপণন কর্মসূচির বহু-চলক পরীক্ষার ডিজাইনের জন্য এখন বিশেষজ্ঞদের মাথায় ভাবা মাত্রার অনুমানের প্রয়োজন নেই; অ্যালগরিদমটি নিজেই “চলাকালীন দেখছে” এবং স্বয়ংক্রিয়, উচ্চ দক্ষতার কার্যকারিতা অর্জন করেছে।

04 VGA-BenchV2: ভিডিও মূল্যায়ন বেঞ্চমার্ককে AIGC ইকোসিস্টেমের উন্নয়নের জন্য "অ্যাডাপ্টিভ" করুন

যদি প্রথম তিনটি পেপার অ্যালগরিদম স্তরের অ্যাডাপ্টিভিটি নিয়ে আলোচনা করে, তবে VGA-BenchV2 দেখায় যে মূল্যায়ন অবকাঠামো কীভাবে AIGC প্রযুক্তির ইকোসিস্টেমের পুনরাবৃত্তির সাথে "অ্যাডাপ্ট" হয়। এটিই চারটি পেপারের মধ্যে একমাত্র মাল্টিমোডাল কনটেন্ট বুঝতে কেন্দ্রীভূত কাজ, যা অ্যানটস গ্রুপের ডিজিটাল জীবন, কনটেন্ট ইকোসিস্টেম ইত্যাদি অ-বিত্তীয় ক্ষেত্রের কৌশলগত সঞ্চয়কে প্রতিফলিত করে।

AIGC এর কারণে ভিডিও উত্পাদন বিস্ফোরিত হয়েছে, কিন্তু একটি মৌলিক সমস্যা দাঁড়িয়েছে: আমরা এই জেনারেট করা ভিডিওগুলির গুণমান কীভাবে পদ্ধতিগতভাবে মূল্যায়ন করব?

ফভিডি (সামগ্রিক গুণগত মান এবং সময়ক্রমিক সামঞ্জস্যতা মূল্যায়ন), সিলিপ স্কোর (জেনারেট করা ইমেজ এবং টেক্সট বর্ণনার অর্থগত সামঞ্জস্যতা মূল্যায়ন), এগুলি মূলত দেখে যে ছবিটি কতটা ক্লিয়ার, মুভমেন্টগুলি কতটা কন্টিনিউয়াস, এবং টেক্সটটি কতটা মেলে। কিন্তু কম্পোজিশনের সৌন্দর্য, লাইটিংয়ের সূক্ষ্মতা, রঙের সামঞ্জস্যতা—এই “সৌন্দর্য”-সংক্রান্ত পারসেপচুয়াল কোয়ালিটির জন্য এগুলি প্রায় অক্ষম।

পূর্বে CVPR 2026-এ, অ্যালিবাবা বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনেস গ্রুপ বিজনে

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

পেপার লিঙ্ক: https://arxiv.org/pdf/2604.10127

কিন্তু ভিডিও জেনারেশন মডেলগুলির উন্নয়ন খুব দ্রুত হচ্ছে, মাসের মধ্যে আপডেটের গতি ধ্রুবক বেঞ্চমার্ককে দ্রুত “অপর্যাপ্ত” করে তুলছে। IJCAI 2026 পেপারে, দলটি VGA-BenchV2 চালু করেছে।

অ্যালিবাবা গ্রুপের আইজিসিএআই ২০২৬ পেপার সমীক্ষা: এআইকে "পরিস্থিতি অনুযায়ী প্রতিক্রিয়া জানানো" শেখানো

ওপেন সোর্স ঠিকানা:

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

▎মূল উন্নয়ন তিনটি:

প্রথমত, মানব লেবেলিংয়ের পরিমাণ বৃদ্ধি পেয়েছে। VGA-BenchV2-এ 36,000টি টাস্ক-লেভেল মানব লেবেল যোগ করা হয়েছে, যার মধ্যে 16,200টি সৌন্দর্য্য গুণমান লেবেল, 13,200টি সৌন্দর্য্য ট্যাগ লেবেল এবং 6,600টি জেনারেশন গুণমান লেবেল রয়েছে, যা VGA-Bench-এর তুলনায় যথাক্রমে 13.46 গুণ, 11.15 গুণ এবং 1.55 গুণ বৃদ্ধি। আরও পর্যাপ্ত “মানব পছন্দ” ডেটা, মূল্যায়নকারীকে মানব সৌন্দর্য্য বিচারের সাথে আরও ভালভাবে সামঞ্জস্যপূর্ণ করে।

দ্বিতীয়ত, মূল্যায়নকারী আর্কিটেকচার আপগ্রেড করা হয়েছে। দলটি একটি মিশ্র আর্কিটেকচার ডিজাইন করেছে: VAQA-Net নিরবচ্ছিন্ন সৌন্দর্য স্কোরিংয়ের জন্য দায়ী, এবং VTag-Net এবং VGQA-Net Qwen বড় ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলের উপর ভিত্তি করে ট্যাগ শনাক্তকরণ এবং মান মূল্যায়ন করে। বড় মডেলের প্রবেশের ফলে, মূল্যায়নকারীটি জটিল ভিজুয়াল সেমান্টিক্সকে বুঝতে একটি নতুন মাত্রা অর্জন করেছে। পরীক্ষার ফলাফলগুলি দেখায় যে, এটি বিভিন্ন জেনারেটিভ মডেলের উপর মানব বিচারের সাথে অত্যন্ত সামঞ্জস্যপূর্ণ।

তৃতীয়ত, "মূল্যায়ন" থেকে "অপ্টিমাইজেশন" পর্যন্ত একটি বন্ধ চক্র তৈরি করা। এটি VGA-BenchV2-এর সবচেয়ে বিপ্লবী ডিজাইন: এটি শেখা সৌন্দর্য মূল্যায়নকারীকে পুরস্কার সংকেত হিসাবে ব্যবহার করে প্রত্যক্ষভাবে শক্তিশালী শিক্ষা ভিত্তিক জেনারেটিভ মডেলের ফাইন-টিউনিংয়ের জন্য। এর অর্থ হলো, মূল্যায়ন বেঞ্চমার্ক আর শুধু "বিচারক" নয়—এটি প্রদান করা স্কোরগুলি প্রত্যক্ষভাবে অপ্টিমাইজেশন সংকেতে রূপান্তরিত হয়, যা জেনারেটিভ মডেলকে সৌন্দর্যগত মানের উপর ধারাবাহিকভাবে পুনরায় বিকাশের জন্য পথনির্দেশ করে।

VGA-Bench থেকে VGA-BenchV2-এ, মূল্যায়ন ব্যবস্থা এখন স্থির মাপকাঠি নয়, বরং জেনারেটিভ ইকোসিস্টেমের সাথে “একসাথে বিকশিত” হওয়া একটি জীবন্ত সিস্টেম। অ্যালিবাবা গ্রুপের কন্টেন্ট বুঝতে, নিরাপত্তা পরীক্ষা, রিকমেন্ডেশন অপ্টিমাইজেশনের মতো সিনেরিওগুলির জন্য, ভিডিও কোয়ালিটি মূল্যায়নের ক্ষমতা AIGC ইকোসিস্টেমের উন্নতির সাথে হালনাগাদ হওয়ার পাশাপাশি উপরের মডেলগুলিকেও অপ্টিমাইজ করতে পারে: “স্কোরিং” থেকে “অপ্টিমাইজেশন”-এ, একটি বন্দর তৈরি হয়েছে।

শেষ কথাঃ যত বুদ্ধিমান অ্যালগরিদমই হোক না কেন, এটিকে অবশ্যই ডাইনামিক পরিবেশে পরীক্ষা করতে হবে।

চারটি পেপার যথাক্রমে অনুপলব্ধ শিক্ষা, শক্তিশালী শিক্ষা, ব্ল্যাকবক্স অপ্টিমাইজেশন এবং মাল্টিমোডাল মূল্যায়নের চারটি দিক থেকে প্রবেশ করে, যা একই প্রযুক্তিগত পথের দিকে নিয়ে যায়—স্থির থেকে গতিশীলের পরিবর্তন।

পরীক্ষামূলক ডেটা এই পথের কার্যকারিতা প্রমাণ করে: MSRGC-Net 15টি মেট্রিকের মধ্যে 12টিতে প্রথম এবং 2টিতে দ্বিতীয় স্থান অধিকার করে; ROAD বহু-প্রকার অফলাইন থেকে অনলাইন রিইনফোর্সমেন্ট লার্নিং টাস্কে বর্তমান স্ট্র্যাটেজির চেয়ে ভালো পারফর্ম করে; DSEBO হাজার-মাত্রিক অপটিমাইজেশন সমস্যায় পরিমাপযোগ্য উন্নতি অর্জন করে; VGA-BenchV2 বহু জেনারেটিভ মডেলের উপর মূল্যায়ন ফলাফলগুলি মানুষের বিচারের সাথে উচ্চ মাত্রায় সঙ্গতিপূর্ণ।

এই প্রযুক্তিগত পথটি অনুসরণ করে অ্যালিবাবার সমগ্র কৌশল দেখলে একটি স্পষ্ট “দ্বৈত-চালনা” কাঠামো দেখা যায়: একদিকে ফিন্টেকের মূল স্কেনারিওতে সময়ক্রম মডেলিং, রিইনফোর্সমেন্ট লার্নিং এবং অপ্টিমাইজেশন অ্যালগরিদমের উপর গভীরভাবে কাজ করা হচ্ছে; অন্যদিকে ডিজিটাল জীবন এবং কনটেন্ট ইকোসিস্টেমে মাল্টিমডাল বুঝতে এবং মূল্যায়নের ভিত্তি প্রস্তুত করা হচ্ছে।

শেষ পর্যন্ত, এলগরিদম যতই বুদ্ধিমান হোক না কেন, এটিকে অবশ্যই গতিশীল পরিবেশে পরীক্ষা করতে হবে। এই চারটি গবেষণাপত্রের প্রকৃত মূল্য হয়তো এটিই: তারা সবই বাস্তব ব্যবসায়িক মাটিতে বেড়েছে—অ্যালিবাবা-এর ব্যবসায়িক পরিস্থিতি গবেষণাপত্রের “পটভূমি” নয়, বরং সমস্যার উৎস, ডেটার উৎপাদনক্ষেত্র এবং ফলাফলের পরীক্ষার মাঠ।

এবং এটিই হয়তো শিল্পক্ষেত্রে এআই গবেষণা করার সবচেয়ে অনন্য বিষয়—তারা শুধু “পেপার তৈরি” করছে না, বরং বাস্তব বিশ্বের সমস্যার জন্য “গতিশীল পরিবর্তনের প্রতি টিকে থাকার” সমাধান খুঁজছে।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।