اینٹ گروپ نے ڈائنانک ماحول میں AI کی لچک کے بارے میں IJCAI 2026 پر چار پیپرز شائع کیے

iconMetaEra
بانٹیں
AI summary iconخلاصہ
اینٹ گروپ نے IJCAI 2026 پر چار AI + کرپٹو نیوز پیپرز جاری کیے، جو متحرک ماحول میں AI کی لچک پر مرکوز ہیں۔ تحقیق میں متحرک وقت کی سیریز کلسٹرنگ، تقویت سیکھنے کے ڈیٹا مکسنگ، اعلیٰ ڈائیمنشنل بیزین آپٹیمائزیشن، اور ویڈیو کوالٹی ایسیسمنٹ شamil ہے۔ ان مطالعات کا مقصد توزیع کے تبدیل ہونے، کمپوٹیشنل کارآمدی، اور ترقی پذیر AIGC ایکو سسٹم کے مسائل حل کرنا ہے۔ آن چین نیوز پلیٹ فارمز جیسے MetaEra نے اس کام کی ٹیکنیکل ڈیپتھ اور عملی دنیا کے معاملات سے وابستگی پر روشنی ڈالی۔
اینٹی گروپ نے IJCAI 2026 میں چار تحقیقی مقالے شائع کیے، جن میں AI کی ڈائنانک ماحول میں خود کو ایڈجسٹ کرنے کی صلاحیت کا جامع طور پر جائزہ لیا گیا۔

مضمون کا مصنف، ذریعہ: Leifengwang

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

کوئی بھی انتہائی ذکی الگورتھم، بالآخر ایک متحرک ماحول میں ٹیسٹ ہونا ضروری ہے۔

IJCAI-ECAI 2026 کو 15 سے 21 اگست 2026 تک جرمنی کے بریمن میں منعقد ہوگا۔ کانفرنس کے دوران، AI ٹیکنالوجی ریویو اس کانفرنس میں شائع ہونے والے پیپرز کا نظام کے ذریعے جائزہ لے رہا ہے تاکہ ٹیکنالوجی کے رجحانات اور صنعت کے رجحانات کو تشخیص کیا جا سکے۔

میںہواوی IJCAI 2026 کے پیپرز کا جائزہ: "سائز ڈینسٹی" سے "ڈیزائن ڈینسٹی" کی طرف، ہم نے بڑی کمپنیوں کی پیرامیٹر مقابلے میں احتیاط اور کمپوٹیشنل کارکردگی کی طرف رجحان کا مشاہدہ کیا۔

جبکہ蚂蚁集团 کی منتخب چار تحریریں، ایک اسی طرح اہم لیکن مکمل طور پر مختلف ٹیکنالوجی کی راہ کی طرف اشارہ کرتی ہیں: متحرک ماحول کی جوابی صلاحیت کے نظام کی تلاش۔

لیب میں الگورتھم ماڈل کی درستگی لگاتار ریکارڈ توڑ رہی ہے، لیکن جب اسے حقیقی دنیا میں ڈپلوی کیا جاتا ہے، تو کارکردگی میں کمی آنا تقریباً عام بات بن جاتی ہے۔ وجہ بہت آسان ہے: حقیقی دنیا کبھی ساکن نہیں ہوتی۔

اینٹی گروپ کے بزنس سیناریوز میں یہ “غیر ثابت” حالت کو انتہا تک پہنچایا گیا ہے: ایک ارب سے زائد صارفین، 8000 سے زیادہ سروسز، ادائیگی کے طوفان اور رات کے دیر وقت کے کم سرگرمی کے درمیان کئی درجہ بندیوں کا فرق ہو سکتا ہے، جس کے لیے ریسک کنٹرول ماڈل کو گھنٹوں کے اندر بلاکس کی تبدیلیوں کا جواب دینا ہوگا، اور عالمی سطح پر ڈپلومنٹ کو مختلف ممالک کے درمیان فرق کرتے ہوئے مالی بنیادی ڈھانچوں کے ساتھ مطابقت رکھنا ہوگا۔

اس ماحول میں، "ایک بار تربیت، ہمیشہ کے لیے ڈپلوی" والے سٹیٹک ماڈل، "کشتی کے نشان کو تلاش کرنا" کی پریشانی میں مبتلا ہو جائیں گے۔

اسی لیے، اصل ذكاء اس بات پر منحصر ہے کہ الگورتھم ماحول کے تبدیل ہونے کا احساس کر سکے، اپنی حکمت عملی کو فعال طور پر تبدیل کر سکے، اور متحرک حالات میں بہترین حل تلاش کر سکے۔ اینٹ گروپ کی یہ چار تحریریں، ایک ہی سوال کا جواب دیتی ہیں: AI کو "سٹیٹک سولور" سے "ڈائنا مک ایڈاپٹر" میں کیسے تبدیل کیا جائے؟

01 MSRGC-Net: وقتی سلسلہ کلاسٹرنگ کو "خودکار" ڈیٹا ڈینسٹی کی توزیع دیں

ٹائم سیریز کلاسٹرنگ، بے شمار سلسلہ وار افعال کو خودکار طور پر درجہ بندی کرتی ہے، جو افعال کے نمونوں کو سمجھنے اور غیر معمولی سگنلز کی نگرانی کا بنیادی ٹول ہے۔

لیکن موجودہ طریقے کے پاس اپنا اپنا الجھنا ہے:

  • Similarity methods (e.g., k-Shape): Can capture local patterns, but require computing pairwise distances between all samples, making them slow with large datasets;
  • گہری سیکھنے کے طریقے (جیسے خود کوڈر):نمائندگی کی طاقتور صلاحیتیں، لیکن تربیت مہنگی، پیرامیٹر ٹیوننگ پریشان کن، اور کمپوٹیشنل طاقت کا زیادہ استعمال کرتے ہیں؛
  • سنتی طریقہ کار کے ذریعہ خصوصیات کا استخراج: دستی طور پر ڈیزائن کردہ خصوصیات پر انحصار، جس کی وجہ سے اہم وقتی تبدیلیوں کی معلومات ضائع ہو سکتی ہیں۔

بڑا مسئلہ یہ ہے کہ حقیقی وقت کے ڈیٹا کی ڈینسٹی غیر مساوی ہوتی ہے — دوسرے بائی بائی کے ٹریڈنگ ڈیٹا بارش کی طرح مکمل ہوتے ہیں، جبکہ رات کے اوقات میں ڈیٹا قطروں کی طرح کم ہوتا ہے، لیکن روایتی طریقے آپ کو پہلے سے بتانا چاہتے ہیں کہ اسے کتنے کلاسز میں تقسیم کیا جائے، جو خود حقیقت سے مطابقت نہیں رکھتا۔

اینٹی گروپ اور چونگکنگ یونیورسٹی آف پوسٹ اینڈ ٹیلیکامنیکیشنز کی طرف سے پیش کیا گیا MSRGC-Net، ایک "بے تربیت" کمبو کے ذریعے درستگی اور کمپوٹیشنل کارکردگی کے درمیان کے دشواری کو دور کرتا ہے۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

کاغذ کا لنک: https://arxiv.org/pdf/2606.12077v1

▎اس کا مرکزی منطق تین مراحل میں تقسیم کیا جا سکتا ہے:

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

مرحلہ اول: متعدد مقیاسی اسٹوریج ریزرو (خصوصیات کا استخراج)۔ متعدد تربیت کے بغیر ایککو سٹیٹ نیٹ ورکس (ESN) کا استعمال کرکے اسٹوریج ریزرو کے بنیادی اکائی کے طور پر، صرف سپیکٹرل ریڈیس کو ترتیب دے کر اصل وقتی سلسلوں سے مقامی اتار چڑھاؤ اور طویل مدتی رجحانات کو одноں سے استخراج کیا جاتا ہے، اور تمام نمونوں کو ملا کر ویو خصوصیات کا میٹرکس تشکیل دیا جاتا ہے، جو بعد کے مراحل کے لیے ان پٹ کے طور پر استعمال ہوتا ہے۔

دوسرا مرحلہ، "دانوں کی گیند" کا اینکل گراف بنانا (سٹرکچرل مڈلنگ)، جو سب سے ذکاوت والا حصہ ہے۔ الگورتھم صرف ایک منفرد ڈیٹا پوائنٹ پر توجہ نہیں دیتا، بلکہ ڈیٹا کی مقامی ڈینسٹی کے مطابق خودکار طور پر "دانوں کی گیند" (Granular Ball) تقسیم کرتا ہے: زیادہ ڈینسٹی والے علاقوں میں چھوٹی اور زیادہ دانے بن جاتے ہیں، جبکہ کم ڈینسٹی والے علاقوں میں بڑی اور کم دانے بن جاتے ہیں۔ ڈیٹا کا سائز N سے M (دانوں کی تعداد، M < N) تک کم ہو جاتا ہے، جبکہ نویز کی خرابی بھی کم ہو جاتی ہے۔

مرحلہ 3: اجماع کے بنیاد پر متعدد سطحی گراف آپٹیمائزیشن۔ اسکیلز کے درمیان اینکر گراف اجماع کی حکمت عملی کے ذریعہ ادغام کیا جاتا ہے، جس سے ماڈل مائیکرو لوکل پیٹرنز کو پکڑنے کے ساتھ ساتھ میکرو جنرل ٹرینڈز کو بھی سمجھ سکتا ہے، اور آخرکار انسانی طور پر مقرر کردہ کلسٹر نمبر کی ضرورت کے بغیر مضبوط کلسٹرنگ نتائج تیار کرتا ہے۔

یہ طریقہ کار کتنا اثر انگیز ہے؟

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

5 متغیرہ بنچ مارک ڈیٹا سیٹس اور 15 جائزہ اشاریوں (NMI، ARI، RI میں سے ہر ایک پر 5) پر، MSRGC-Net نے 12 میں سب سے بہترین اور 2 میں دوسرا مقام حاصل کیا — 80% سب سے بہترین شرح۔

مزید اہم بات یہ ہے کہ یہ O(n²) جوڑوں کے حساب کو چھوڑ دیتا ہے اور تقریباً لکیری پیچیدگی حاصل کرتا ہے۔ سادہ الفاظ میں: یہ تیز اور درست ہے، اور آپ کو یہ اندازہ لگانے کی ضرورت نہیں کہ آپ کتنے گروہوں میں تقسیم کرنا چاہتے ہیں۔

انٹی میں اصل کاروباری مناظر میں، اس کا مطلب ہے کہ سسٹم ٹریفک ڈینسٹی کے مطابق خوشه کی درجہ بندی کو خودکار طور پر ترتیب دے سکتا ہے — ذروں پر نازک گروپنگ کے ذریعے غیر معمولی صورتحال کو پکڑتا ہے، اور کم تر نقطوں پر کم حسابی طاقت کے ساتھ خاکہ بندی کرتا ہے، ہمیشہ ڈیٹا کے ساتھ چلتا ہے۔

02 آف لائن سے آن لائن ری انفورسمنٹ لرننگ کے لیے "ایڈاپٹو" ڈیٹا مکسچر اسٹریٹجی

ایک مشہور مسئلہ جسے "ڈسٹریبیوشن شفٹ" کہا جاتا ہے، جس کی وجہ سے تقویت سیکھنے کا مسئلہ "محلی ماحول کے مطابق نہ ہونا" ہوتا ہے: آفلائن ڈیٹا پر تربیت پانے والا ماڈل آن لائن ہوتے ہی "بھول جاتا" ہے۔ اس کی وجہ یہ ہے کہ آفلائن ڈیٹا اور آن لائن انٹرایکشن ڈیٹا کے درمیان تفرقہ ہوتا ہے، جس کی وجہ سے آن لائن شروعاتی اسٹریٹجی آفلائن سیکھی گئی معلومات کو جلدی بھول جاتی ہے۔

موجودہ حل صرف دو قسم کے ہیں: یا تو 50% آفلائن اور 50% آنلائن کا مixed نسبت مقرر کریں، یا پھر اسٹریٹجی کے قریب کے نمونوں کو ترجیح دینے کے لیے ایک ہیورسٹک قاعدہ استعمال کریں۔

لیکن مسئلہ یہ ہے کہ مختلف مراحل میں اسٹریٹجی کی ضروریات بالکل مختلف ہوتی ہیں—ابتدائی مراحل میں بنیادی بنیاد کو مستحکم رکھنے کے لیے زیادہ آف لائن ڈیٹا کی ضرورت ہوتی ہے، جبکہ بعد کے مراحل میں نئے امکانات کی تلاش کے لیے زیادہ آن لائن ڈیٹا کی ضرورت ہوتی ہے۔ ایک ثابت اسٹریٹجی، اس کا مطلب ہے کہ جہاز کے نشان پر تلاش کرنا۔

اینٹی گروپ نے شنگھائی جیائوٹونگ یونیورسٹی کے ساتھ مل کر ROAD پیش کیا، جس نے ڈیٹا مکسچر کے تناسب کو ایک “پیش گئی پیرامیٹر” سے “ڈائنامک فیصلہ متغیر” میں تبدیل کر دیا۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

کاغذ کا لنک: https://arxiv.org/pdf/2605.14497

اس کا بنیادی خیال دلچسپ ہے: ڈیٹا کا انتخاب بنیادی طور پر ایک دو سطحی بہترین مسئلہ ہے۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

  • اندر کی سطح (Inner-Level): بیلمن ایرر کو کم کرنے والا معیاری Q-سیکھنا؛
  • بیرونی سطح (Outer-Level): آن لائن اسٹریٹجی کے توقعی ریٹرن کو زیادہ سے زیادہ کرنے کے مقصد کے ساتھ ڈیٹا مکس اسٹریٹجی کو میٹا فیصلہ متغیر کے طور پر دیکھیں۔

دو سطحیں متعدد بازو والے بینڈٹ (MAB) الگورتھم کے ذریعہ تقریبی طور پر حل کی جاتی ہیں، جس سے مخلوط حکمت عملی تربیت کے دوران حقیقی وقت میں تبدیل ہو سکتی ہے: جب مدل شروع کر دے کہ آف لائن مرحلے میں سیکھی گئی معلومات کو بھول رہا ہے، تو آف لائن ڈیٹا کے نمونہ لینے کا تناسب خودکار طور پر بڑھا دیا جاتا ہے تاکہ بنیادی بنیاد مستحکم رہے؛ جب مدل محتاط ہو جائے اور تجربہ کم کرے، تو آن لائن ڈیٹا کا تناسب فوراً بڑھا دیا جاتا ہے تاکہ اسے غلطیوں کا امتحان دینے کی حوصلہ افزائی کی جائے۔

تجربہ بہت مضبوط طریقے سے کیا گیا۔ ٹیم نے آف لائن سے آن لائن تقویتی سیکھنے کے تین مشہور معیاری ٹیسٹ پر تصدیق کی: AntMaze (روبوٹ جو لیر میں مقصد تلاش کرتا ہے)، MuJoCo (بائیو میٹک روبوٹس کا حرکت کنٹرول) اور FrankaKitchen (کچن میں پیچیدہ کاموں کو مکمل کرنے والا مکینیکل ہاتھ)۔ ان کاموں کی مشقت مختلف ہے اور ان کے اسٹیٹ اسپیس بھی الگ الگ ہیں، جو الگورتھم کی جامع صلاحیت کا جائزہ لینے کے لیے مکمل طور پر موزوں ہیں۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

ROAD کے الگورتھم کی عمومی صلاحیت کی تصدیق کے لیے، تحقیقی ٹیم نے ROAD کو IQL، PEX، CQL، Cal-QL سمیت کئی ممتاز آف لائن الگورتھمز کے ساتھ جوڑا۔ نتائج نے ظاہر کیا کہ کسی بھی بنیادی الگورتھم کا استعمال کرتے ہوئے، ROAD مستقل طور پر کارکردگی میں اضافہ لاتا ہے۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

PEX+ROAD کے ساتھ، یہ طریقہ D4RL بینچ مارک پر 24 مسلسل کنٹرول ٹاسکس پر 71.12 کا کل اوسط اسکور حاصل کرتا ہے، جس میں 24 میں سے 18 ٹاسکس پر پہلا نمبر حاصل کیا گیا، جو ثابت نسبت، کم ہوتی نسبت، اور ہیورسٹک بالنس ریپلے جیسے تمام بنیادی طریقوں سے کافی بہتر ہے۔

یعنی، ROAD ماڈل کو “احتیاطی وراثت” اور “جسورانہ تلاش” کے درمیان بہترین توازن فراہم کرتا ہے — نہ تو یہ شروع ہی پر ناکام ہوتا ہے اور نہ ہی یہ حقیقی ڈیٹا کے فوائد کو ضائع کرتا ہے۔ اس طریقہ کار کا انتظامیہ کے ریسک کنٹرول ماڈلز کے لانچ اور تجویز نظام کے ریل ٹائم بہتر بنانے جیسے مناظر میں واضح اہمیت ہے۔

03 DSEBO: اعلیٰ بعدی بیزین تحسین کو "خودکار" سرچ سبسیس میں ڈالیں

بیزین تعمیم ایک کلاسیکل طریقہ ہے جو بلاک باکس فنکشن کو آپٹیمائز کرنے کے لیے استعمال ہوتا ہے، لیکن جب یہ اعلیٰ ڈائیمنشنل مسائل سے ٹکراتا ہے تو پریشان ہو جاتا ہے۔ ایک عام حل رینڈم امبیڈنگ ہے — جس میں آپٹیمائزیشن کو کم ڈائیمنشنل سبسیس میں پروجیکٹ کیا جاتا ہے، لیکن اس سے ایک نیا مسئلہ پیدا ہوتا ہے: موثر ڈائیمنشنز کتنی ہیں؟

روایتی طریقے یا تو ماہرین کی تجربات پر منحصر ہوتے ہیں جو ثابت ذیلی خلائی ابعاد فراہم کرتے ہیں، یا پھر تجربہ و غلطی کے ذریعے بار بار اندازہ لگایا جاتا ہے، جس سے بہت زیادہ وسائل کا استعمال ہوتا ہے اور ثابت ذیلی خلائی ابعاد مختلف کاموں کے لیے موزوں نہیں ہوتے۔ اس سے بھی زیادہ پریشان کن بات یہ ہے کہ موثر ابعاد خود بخود ترقی کے دوران تبدیل ہو سکتے ہیں: شروعاتی مرحلے میں تلاش کے لیے کم ابعاد کافی ہوتے ہیں، جبکہ بعد میں تفصیل کے لیے زیادہ ابعاد کی ضرورت پڑ سکتی ہے۔

اینٹی گروپ نے ایسوسی ایشن فار ایسٹ چین نارمل یونیورسٹی اور نینجنگ یونیورسٹی کے ساتھ مل کر DSEBO پیش کیا، جس میں ذیلی خلا کی ابعاد کو تلاش کے عمل کے دوران "ڈائنانمک متغیر" کے طور پر استعمال کیا جاتا ہے اور یہ تلاش کی پیشرفت کے ساتھ خودکار طور پر تبدیل ہوتے ہیں۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

کاغذ کا لنک: https://arxiv.org/pdf/2605.23473

DSEBO کا مرکزی مکینیزم "کم سے زیادہ، مرحلہ وار ترقی" ہے:

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

  • کم تعداد کے ذیریں فضا سے شروع کرتے ہوئے، آپٹیمائزر کم تعداد کی فضا میں امکانی حل تیار کرتا ہے، جو تصادفی ایم بیڈنگ کے ذریعے اصل فضا میں منتقل ہوتا ہے، اور تیزی سے مقصد فنکشن کا تقریبی نقشہ تیار کرتا ہے، پھر نتائج کی فیڈ بیک کے ذریعے گوسین پروسس کو دہرایا جاتا ہے؛
  • ایکٹھا ہونے کے بعد خودکار طور پر ڈیمنشن کا اضافہ ہوتا ہے، جس میں شیئرڈ ایمبیڈنگ میٹرکس کے ذریعے کم ڈیمنشنل حل کو "ورثہ" کیا جاتا ہے؛
  • نئے ذیلی خلائوں کی شروعات اور مسلسل بہتری، جس میں مشترکہ ایمبیڈنگ میٹرکس کے ذریعے ذیلی خلائوں کو ایک دوسرے میں ڈالا جاتا ہے، جس سے "کم ابعاد کی تلاش → امتیاز کا اطلاق → ابعاد کا وسعت دینا → مسلسل بہتری" کا حلقہ بن جاتا ہے، جب تک کہ جائزہ کے بجٹ کی حد نہ پہنچ جائے۔

اندازہ بڑھانے کے مرحلے میں، بڑھاؤ کا درجہ بھی مستقل نہیں ہوتا — الگورتھم موجودہ بہترین قیمت کے منحنی کے مطابق خودکار طور پر ایڈجسٹ کرتا ہے: اگر منحنی سستا ہو تو آہستہ بڑھائیں، غیر ضروری اخراجات سے بچیں؛ اگر منحنی تیز ہو تو جلدی بڑھائیں، اعلیٰ ابعاد کے فائدے کو جلد پکڑیں۔

تجربی نتائج یہ ہیں کہ: مرکب فنکشنز (Levy، Griewank، Sphere، D=1000) اور تین حقیقی کاموں (MSLR، Lasso-Hard، LIMO) پر، DSEBO نے REMBO، SIRBO، BAxUS، TuRBO سمیت دس سے زائد مقبول طریقوں کے ساتھ تفصیلی مقابلہ کیا اور تقریباً تمام کاموں پر بہترین حل حاصل کیا — درستگی اور ابھار کی رفتار دونوں میں اگلے۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

"کم ابعادی راستہ ڈھونڈنا، اعلیٰ ابعادی تفصیلی ضبط" کا یہ طریقہ ماریب کے روزمرہ ریسرچ اور ترقی میں بھی کارآمد ہے — قرضہ ماڈل کے سپر پیرامیٹرز کی بہترین ترتیب، ریسک کنٹرول اسٹریٹجیز کے تھریشولڈز کا تعین، اور مارکیٹنگ کیمپینز کے متعدد متغیر تجربات کا ڈیزائن، اب اس کے لیے ماہرین کو اندراج کرنے کی ضرورت نہیں رہی، الگورتھم خود "چلتے چلتے" دیکھتا ہے اور خودکار، اعلیٰ کارکردگی والے عمل کو ممکن بناتا ہے۔

04 VGA-BenchV2: ویڈیو ایوانٹ بینچ مارک کو "خودکار" بنائیں AIGC ایکوسسٹم کی ترقی کے ساتھ

اگر پہلی تین کتابوں میں الگورتھم کے لحاظ سے ایڈاپٹیوٹی پر بحث کی گئی ہے، تو VGA-BenchV2 یہ دکھاتا ہے کہ ایوان کیسے "ایڈاپٹ" ہوتا ہے AIGC ٹیکنالوجی کے ایکوسسٹم کی ترقی کے ساتھ۔ یہ چاروں کتابوں میں واحد کام ہے جو متعدد ماڈل کنٹینٹ کی سمجھ پر مرکوز ہے، جو اینٹ گروپ کے ڈیجیٹل زندگی، کنٹینٹ ایکوسسٹم جیسے غیر مالی شعبوں میں اسٹریٹجک اسٹاک کو ظاہر کرتا ہے۔

AIGC نے ویڈیو پیداوار میں بڑا اضافہ کیا ہے، لیکن ایک مرکزی مسئلہ رکاوٹ بن گیا ہے: ہم ان پیدا کردہ ویڈیوز کی معیار کو کس طرح نظام کے ساتھ جانچیں؟

فیڈی ویلیو ڈیٹا (FVD) (کلی کوالٹی اور ٹائم سیریز کوہرنس کا جائزہ لینا)، CLIP اسکور (جینریٹڈ تصویر اور ٹیکسٹ ڈسکرپشن کے درمیان سیمینٹک کنسسٹنسی کا جائزہ لینا)، بنیادی طور پر تصویر کی واضحیت، حرکت کی مسلسلیت، اور ٹیکسٹ کے مطابقت پر نظر رکھتے ہیں۔ جبکہ ترتیب کی دقت، روشنی اور سایہ کا احترام، رنگوں کا ہماہنگ ہونا — ان "خوبصورتی" سے متعلق تصوراتی معیارات پر ان کا کوئی اثر نہیں۔

پہلے CVPR 2026 پر، Ant Group نے بیجنگ فلم اکیڈمی اور جنرل آرٹیفیشل انٹیلیجنس انسٹیٹیوٹ (BIGAI) کے ساتھ مل کر VGA-Bench پیش کیا، جس نے ویڈیو ایسٹھیٹک ایوال کے لیے تین ڈیمنشن فریم ورک (ایسٹھیٹک کوالٹی، ایسٹھیٹک لیبلز، جنریٹڈ کوالٹی) کو پہلی بار متعارف کرایا، اور 1016 پرامپٹس، 12 جنریٹو ماڈلز، اور 60,000 سے زائد ویڈیوز کے بنیاد پر ایک ایوال بینچ مکمل کیا، جس سے AI نے پہلی بار پیشہ ورانہ نقطہ نظر سے ویڈیوز کا جائزہ لینا سیکھا۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

کاغذ کا لنک: https://arxiv.org/pdf/2604.10127

لیکن ویڈیو جنریشن ماڈلز بہت تیزی سے ترقی کر رہے ہیں، جس کی ماہانہ ترقی کی رفتار سے مخصوص بنچ مارک جلد ہی “کافی نہیں رہ جاتے”۔ IJCAI 2026 کے اس پیپر میں، ٹیم نے مزید VGA-BenchV2 متعارف کرایا۔

میٹس گروپ IJCAI 2026 کے پیپرز کا جائزہ: AI کو "موقّع کے مطابق اقدام کرنے" کی تعلیم دینا

اوپن سورس ایڈریس:

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

▎اہم ترقی کے تین پہلو ہیں:

سب سے پہلا، دستی نشان زدی کی مقدار میں اضافہ ہوا۔ VGA-BenchV2 میں 36,000 نئے ٹاسک لیول دستی نشان زدی شامل کی گئی ہیں، جن میں سے 16,200 خوبصورتی کی معیار کی نشان زدی، 13,200 خوبصورتی لیبل کی نشان زدی، اور 6,600 تخلیقی معیار کی نشان زدی شامل ہیں، جو VGA-Bench کے مقابلے میں ترتیب سے 13.46، 11.15، اور 1.55 گنا بڑھ گئی ہیں۔ زیادہ موزوں "انسانی ترجیحات" کے ڈیٹا کی بدولت، ایوان کا انسانی خوبصورتی کے جائزے سے زیادہ مطابقت رکھنا ممکن ہو گیا ہے۔

دوسرے، ایوان کی ساخت کا اپگریڈ۔ ٹیم نے مخلوط ساخت ڈیزائن کی: VAQA-Net لگاتار خوبصورتی اسکورنگ کے لیے ذمہ دار ہے، جبکہ VTag-Net اور VGQA-Net Qwen بڑے ویژول زبان ماڈل کے بنیاد پر لیبل شناخت اور معیار کا جائزہ لیتے ہیں۔ بڑے ماڈل کے شامل ہونے سے ایوان کو پیچیدہ ویژول سیمانٹکس کو سمجھنے میں نئی سطح حاصل ہوئی۔ تجرباتی نتائج ظاہر کرتے ہیں کہ یہ کئی جنریٹو ماڈلز پر انسانی ججمنٹ کے ساتھ انتہائی مطابقت رکھتا ہے۔

تیسری بات، "جمہوریہ" سے "بہتری" تک کا بند حلقوں کو جوڑنا۔ یہ VGA-BenchV2 کا سب سے زیادہ انقلابی ڈیزائن ہے: اس نے سیکھا گیا خوبصورتی جائزہ لینے والا کو انعام کے سگنل کے طور پر ب безرخ تقویت سیکھنے والے مدل کی میکرو ٹیوننگ کے لیے ب безرخ استعمال کیا ہے۔ اس کا مطلب یہ ہے کہ جائزہ لینے والا معیار صرف "کرکٹ کھلاڑی" نہیں رہا، بلکہ اس کے درجات کو ب безرخ بہتری کے سگنل میں تبدیل کیا جا سکتا ہے، جو خوبصورتی کی معیار پر مدل کو مستقل طور پر ترقی دینے میں مدد کرتا ہے۔

VGA-Bench سے VGA-BenchV2 تک، ایوانیشن سسٹم اب ایک ساکھی پیمانہ نہیں بلکہ تخلیقی ایکوسسٹم کے ساتھ "ساتھ ساتھ ترقی کرنے والا" زندہ نظام ہے۔蚂蚁集团 کے لیے ویڈیو کی معیار کی تشخیص کی صلاحیت نہ صرف AIGC ایکوسسٹم کی ترقی کے ساتھ گامزن رہتی ہے بلکہ اس کے اپسٹریم ماڈلز کو بہتر بنانے میں بھی مدد کرتی ہے: "سکور دینے" سے "بہتر بنانے" تک، یہ بند حلقة مکمل ہو جاتا ہے۔

اختتامیہ: کوئی بھی انتہائی ذکی الگورتھم، نہایت دینامک ماحول میں ٹیسٹ ہونے تک کامیاب نہیں ہو سکتا۔

چار تحقیقی مقالے ناپیمائی سیکھنے، تقویتی سیکھنے، سیاہ باکس بہتری اور بہ متغیر جائزے کے چار رخوں سے شروع ہوئے اور سب مل کر ایک ہی ٹیکنالوجی کے راستے کی طرف اشارہ کرتے ہیں — سٹیٹک سے ڈائنانک پر تبدیلی کا۔

تجربی ڈیٹا نے اس راستے کی موثریت کی تصدیق کی: MSRGC-Net نے 15 اشاریوں میں سے 12 پہلے اور 2 دوسرے مقام حاصل کیے؛ ROAD نے متعدد آفلائن سے آن لائن طاقتی سیکھنے کے کاموں میں موجودہ حکمت عملیوں کو پیچھے چھوڑ دیا؛ DSEBO نے ہزاروں ڈیمنشن کے بہترین بنانے کے مسائل میں قابلِ قیاس بہتری حاصل کی؛ VGA-BenchV2 نے متعدد جنریٹو ماڈلز پر انسانی ججمنٹ کے ساتھ انتہائی مطابقت رکھنے والے نتائج دیے۔

اس ٹیکنیکل راستے کو دیکھتے ہوئے، ماریب کی کلیہ ترتیب میں ایک واضح "دو چرخ ڈرائیو" ساخت نظر آتی ہے: ایک طرف، فنانشل کور سینریز میں ٹائم سیریز مڈلنگ، ری انفورسمنٹ لرننگ اور آپٹیمائزیشن الگورتھمز پر توجہ مرکوز کر رہا ہے؛ دوسری طرف، ڈیجیٹل لائف اور کنٹینٹ ایکوسسٹم میں ملٹی مودل فہم اور ایوانل انفراسٹرکچر کے لیے آگے بڑھ رہا ہے۔

آخر کار، الگورتھم کتنا ہی ذہین کیوں نہ ہو، اسے بالآخر ایک متحرک ماحول میں ٹیسٹ کرنا پڑتا ہے۔ ان چار تحقیقی مقالوں کی اصل قیمت شاید اس بات میں ہے کہ وہ سب حقیقی کاروباری ماحول میں پیدا ہوئی ہیں: علی بابا کے کاروباری مناظر تحقیقی مقالوں کے “پس منظر” نہیں، بلکہ مسائل کا ذریعہ، ڈیٹا کا ماخذ اور اثرات کا ٹیسٹنگ فیلڈ ہیں۔

اور شاید یہی صنعت کے AI تحقیق کا سب سے منفرد پہلو ہے — وہ صرف "پیپرز لکھنے" تک محدود نہیں، بلکہ حقیقی دنیا کے مسائل کے لیے "ڈائنامک تبدیلیوں کا مقابلہ کرنے والے" حل تلاش کر رہے ہیں۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔