ہواوی نے IJCAI 2026 میں چار تحقیقی مقالے شائع کیے، جس سے AI کی تکنیکی رجحان کو "سائز ڈینسٹی" سے "ڈیزائن ڈینسٹی" کی طرف منتقل ہونے کا ثبوت ملتا ہے۔مضمون کا مصنف، ذریعہ: Leifengwang

AI کا عملی منظر میں داخل ہونا، سسٹمیک انجینئرنگ کابیلیت، رکاوٹ ہے اور ایک کامیابی کا نقطہ بھی۔
IJCAI-ECAI 2026 کو 15 سے 21 اگست 2026 تک جرمنی کے بریمن میں منعقد ہوگا۔ AI کے شعبے کے ایک جامع اور سرٹیفائیڈ لیڈنگ کانفرنس کے طور پر، IJCAI ہمیشہ بڑی کمپنیوں کے گزشتہ سال کے سرٹیفائیڈ تحقیقی نتائج کا اہم ٹیسٹنگ فیلڈ رہا ہے: کون کس سمت میں حقیقی پیش رفت کر رہا ہے، کون سے ٹیکنالوجی کے راستے اب اتفاق رائے بن رہے ہیں — پیپرز سب سے براہ راست جواب ہیں۔
کانفرنس کے دوران، AI ٹیکنالوجی ریویو بھی اس کانفرنس میں شائع ہونے والے پیپرز کو سسٹمیٹک طور پر سکین کر رہا ہے تاکہ ٹیکنالوجی کے رجحانات اور صنعت کے رجحانات کو پکڑا جا سکے۔
ایک واضح رجحان یہ ہے: AI کی کمپوٹیشنل طاقت کی لاگت اب بھی بلند ہے، اور پیرامیٹر سائز میں اضافہ سے حاصل ہونے والی حدی فائدہ پہلے ہی حدی لاگت کے ساتھ نہیں چل پا رہا۔ یہ مالیاتی حقیقت تکنیکی نوآوری کے منطق کو دوبارہ شکل دے رہی ہے — "کیا ہم اسے اور بڑا بناسکتے ہیں؟" سے "کیا ہم اسے زیادہ سے زیادہ محفوظ طریقے سے استعمال کر سکتے ہیں؟" کی طرف۔
IJCAI 2026 میں شامل ہونے والی ہواوی کی چار تحقیقی تحریریں اس موڑ کے لیے ٹیکنیکل راستہ فراہم کرتی ہیں: کم ڈیٹا کی کمی کے بحران کو کم کرنے اور اکائی کیلکولیشن پر زیادہ ذہانت کا حصول حاصل کرنے کے لیے زیادہ مہارت سے ڈیزائن کردہ آرکیٹیکچر اور ٹریننگ حکمت عملی استعمال کرنا۔
اس تکنیکی موڑ نے AI کے عملی اطلاق کے گہرے تبدیلیوں کو بھی عکس کیا ہے: جب تکنیک لیب سے باہر نکلتی ہے، تو مقابلہ صرف ایک ہی صلاحیت کے منفرد کامیابی کا نہیں بلکہ درستگی، عام کرنے کی صلاحیت، ڈیٹا اور کمپوٹنگ پاور کے درمیان نظام کا انتظام ہوتا ہے—ہر ایک مرحلہ ممکنہ طور پر رکاوٹ بن سکتا ہے، اور ممکنہ طور پر کامیابی کا نقطہ بھی بن سکتا ہے۔
یہ چار تحقیقی مقالے، بالکل ان چار رخوں سے ہواوی کی سسٹمیک انجینئرنگ صلاحیت اور ٹیکنالوجی کے انتخاب کو ظاہر کرتے ہیں۔
01 سائز کا بارڈر توڑنا: آرکیٹیکچر اور ٹریننگ، ہیرارکیکل ViT کی صلاحیتوں کی حد کو دوبارہ تعریف کرنا
ویژوئل بیس مڈل کے سکیلنگ مقابلے میں ہمیشہ ایک ادھوری “چھت” موجود رہی ہے۔ عام ViT کا سکیلنگ لگاتار آگے بڑھ رہا ہے، 6B سے لے کر 22B تک اپنی حدود کو بار بار عبور کرتا رہا ہے۔ لیکن ہائیرارکل ViT ہمیشہ 2B پیرامیٹرز کے نیچے ہی پھنسا رہا ہے۔ یہ بڑا نہیں بننا چاہتے، بلکہ بڑا نہیں بن سکتے۔ ہائیرارکل ماڈلز کو عام ViT کے مقابلے میں بہت زیادہ ڈیٹا اور ٹریننگ اسٹریٹجی کی ضرورت ہوتی ہے، اور عام ViT کے سکیلنگ حل کو بس اس طرح لاگو کرنا کام نہیں کرتا۔ اس سے ایک ساختی تضاد پیدا ہوتا ہے — ہائیرارکل ViT فطرتاً متعدد سکیل ریپریزینٹیشن اور ڈینس پریڈکشن ایسگنمنٹس (آبجیکٹ ڈیٹیکشن، سیگمنٹیشن، ویڈیو سمجھ) کے لیے موزوں ہے، لیکن اس کا سکیل نہیں بڑھ پاتا، جس کی وجہ سے اس کی صلاحیتوں کی حد بند ہو جاتی ہے۔
ہواوی ٹیم کی یہ تحریر "Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters" سائز کی حد کو 2B سے براہ راست 30B تک پہنچا دیتی ہے۔

یہ کیسے ممکن ہوا؟ جواب یہ ہے کہ ماڈل کی ساخت اور تربیت کی حکمت عملی دونوں کو دوبارہ ڈیزائن کیا گیا، جن میں سے کوئی بھی ایک نہیں ہو سکتا۔
مرکزی ڈیزائن کا ہیروکل ViT آرکیٹیکچر ہے۔ یہ متعدد سیل سکیل خصوصیات کی نکالنے کی صلاحیت کو برقرار رکھتے ہوئے کمپوٹیشنل کارکردگی کو بھی مدنظر رکھتا ہے۔
اس ساخت کے مطابق، ٹیم نے 200M سے لے کر 5B پیرامیٹرز تک کے ڈینسی ماڈلز تربیت دیں اور کل پیرامیٹرز کو 30B تک پہنچانے کے لیے اسپارس ایکسپرٹ مکسچر (SMoE) ویریئنٹ شامل کیا — جو اب تک کے شائع شدہ ہائرارکل ViT شعبے میں سب سے بڑا پیرامیٹر سائز ہے۔
ٹریننگ کے لیے ٹیم نے ایک دو مراحل کا عمل ڈیزائن کیا:
مرحلہ اول، ImageNet-21K پر MAE کے ذریعہ خود supervised پری ٹریننگ کریں، تاکہ ماڈل ویژل ریپریزینٹیشن کے بنیادی اصول سیکھ سکے؛
دوسرا مرحلہ، 27 ملین تصاویر کے ڈیٹا سیٹ پر، کئی جدید ترین عام بنیادی ماڈلز سے علم کو ڈسٹل کرکے صلاحیتوں میں کھچاﺅ حاصل کیا جاتا ہے۔
تجربی نتائج نے سب سے مضبوط ثبوت فراہم کیا۔ ImageNet-1K لینیئر ایوال میں، کل 30B پیرامیٹرز والے MoE ماڈل (EHV-5B-MoE) نے صرف 6.7B پیرامیٹرز کو فعال کرتے ہوئے 89.0% درستگی کے ساتھ EVA-CLIP-18B جیسے بڑے پیرامیٹرز والے عام ViT ماڈلز کو پیچھے چھوڑ دیا۔ اہم بات یہ ہے کہ اس کی کارکردگی صرف تصویر طبقہ بندی تک محدود نہیں ہے — ویڈیو تجزیہ اور گھنٹے ہوئے پیڈکشن کاموں میں بھی اس نے عمدہ کارکردگی دکھائی۔ اس سے ثابت ہوتا ہے کہ EHV صرف طبقہ بندی خصوصیات ہی نہیں سیکھ رہا، بلکہ اصل میں اعلیٰ معیار، قابلِ تعمیل بصارتی نمائندگیاں سیکھ رہا ہے۔
ہواوی ٹیم نے اس کام کے ذریعے ثابت کیا کہ ہیرارکیل ViT نہ صرف بڑا ہو سکتا ہے، بلکہ انفریئر سائیڈ پر کم ایکٹیویشن پیرامیٹرز کے ساتھ زیادہ درستگی حاصل کر سکتا ہے۔ آرکیٹیکچر ڈیزائن ماڈل کی صلاحیت کی حد کا تعین کرتا ہے، جبکہ ٹریننگ اسٹریٹجی یہ تعین کرتی ہے کہ یہ حد کتنی حد تک آزاد ہو سکتی ہے۔
02 پیشتر فلٹر درج کریں: سیکھنے والے فریم سیلیکٹر کا طرزِ عمل
مڈل بیس کی حد بڑھ گئی ہے، لیکن کمپوٹنگ پاور کا استعمال صرف مڈل پر ہی نہیں ہوتا، بلکہ مڈل کو دی جانے والی ڈیٹا بھی کمپوٹنگ وسائل کو زبردست طور پر استعمال کرتی ہے۔ ویڈیو-بڑے زبانی مڈل (Video-LLMs) ویڈیو کو پروسیس کرتے وقت، کمپوٹنگ لاگت کا بڑا حصہ فریم اینکوڈنگ پر خرچ ہوتا ہے۔ لاگت کو کنٹرول کرنے کے لیے، موجودہ مڈل تقریباً یکساں نمونہ لینے کا استعمال کرتے ہیں—مساوی فاصلے پر فریمز نکالنا۔
تاہم، ویڈیو میں اہم واقعات کبھی بھی مساوی طور پر تقسیم نہیں ہوتے۔ ایک اہم حرکت صرف ایک یا دو سیکنڈ تک جاری رہ سکتی ہے، اور اگر وہ دو نمونہ نقطوں کے درمیان آ جائے تو پوری طرح نظر انداز کر دی جاتی ہے۔ اس کے برعکس، لمبے ساکن مناظر بار بار کوڈ کیے جاتے ہیں، جس سے قیمتی کمپوٹیشنل وسائل ضائع ہوتے ہیں۔
ایک دوسرے نقطہ نظر کے طور پر، کوئری ڈرائیون طریقہ ہے — جس میں مخصوص سوال کے مطابق متعلقہ فریمز کو تلاش کیا جاتا ہے۔ یہ ویڈیو سوال وجواب کے منظر نامے میں اچھی طرح کام کرتا ہے، لیکن تفصیلی ویڈیو تفصیل ایک “بے کوئری” ٹاسک ہے، جہاں یہ طریقہ کار کام نہیں کرتا۔
یکساں نمونہ لینا بہت خشن ہے، اور کوئری ڈرائیون طریقہ استعمال نہیں کیا جا سکتا۔ کیا کریں؟ ہواوی AI ڈیٹا ٹیم نے سیکھنے والا فریم سیلیکٹر LFS (Learnable Frame Selector) پیش کیا ہے جو اس مسئلے کو حل کرنے کی کوشش کرتا ہے۔
کاغذ کا لنک: https://arxiv.org/pdf/2601.14594v1
ان کا بنیادی خیال بہت سیدھا ہے: فریمز کا انتخاب انسانی قواعد کے بجائے ماڈل خود یہ سیکھے کہ "کیا دیکھنا ہے"۔

یہ ایک "نتیجہ سے شروع کرنا" کا تربیتی طریقہ ہے، LFS اب "کون سی فریمز کو کسی درمیانی اسکور پر زیادہ ترجیح دی جائے" کا تعلیم نہیں دیتا، بلکہ یہ سیکھتا ہے کہ "کون سی فریمز بڑے ماڈل کو بہتر تفصیل لکھنے میں مدد دیں گی"۔ اس کا عمل کیسے ہوتا ہے؟ تین اہم ڈیزائن:
سب سے پہلے، ایک اسکورنگ نیٹ ورک تربیت دیں جو ہر فریم کو ایک "واقعے کی اہمیت" اسکور دے۔

دوم، سراسری ترتیب کے بجائے ٹائم اسٹیپس کے لحاظ سے فریمز کا انتخاب۔ فریمز کے انتخاب میں صرف "سب سے زیادہ اسکور والے پہلے K فریمز" کا استعمال نہیں کیا جاتا، بلکہ پورا ویڈیو کئی عرصوں میں تقسیم کیا جاتا ہے اور ہر عرصے میں سب سے اہم فریمز الگ الگ منتخب کیے جاتے ہیں۔ اس طرح اہم واقعات کو حاصل کیا جاتا ہے اور فریمز کا وقتی محور پر مساوی تقسیم بھی یقینی بنایا جاتا ہے۔
تیسری، اور سب سے اہم قدم — تربیت کا طریقہ۔ LFS فریمز کا انتخاب کرنے کے بعد، انہیں فریز کردہ ویڈیو-LLM کو دیتا ہے تاکہ وہ تفصیلات تیار کرے، پھر یہ تفصیلات مصنوعی طور پر نشان لگائے گئے معیاری تفصیلات کے ساتھ موازنہ کی جاتی ہیں، نقص کا حساب لگایا جاتا ہے، اور پھر فریم سیلیکٹر کے پیرامیٹرز کو اپڈیٹ کرنے کے لیے بیک ورڈ پراپیگیشن استعمال کی جاتی ہے۔ پورے عمل میں بڑی زبان ماڈل خود مکمل طور پر غیر متحرک رہتا ہے، LFS ایک پلگ اینڈ پلے اضافی ماڈول کی طرح کام کرتا ہے۔
اس کے علاوہ، تحقیقی ٹیم نے ایک مسئلہ بھی دریافت کیا: موجودہ تفصیلی ویڈیو تفصیلات کے بینچ مارک اور انسانی حقیقی شناخت کے درمیان کافی فرق ہے۔ اس لیے انہوں نے ایک نیا بینچ مارک ICH-CC تیار کیا، جس میں ویڈیوز تمام چینی غیر مادی ثقافتی ورثہ پکوان کے حقیقی تجارتی مناظر (جیسے ریستوراں کے کچن، پکوان کی تعلیم وغیرہ) سے لی گئی ہیں، اور تمام تفصیلات اور سوالات انسانی طور پر دقت سے تحریر کیے گئے ہیں، جو حقیقی استعمال کے مناظر کے زیادہ قریب ہیں۔

تجربی نتائج کیسے ہیں؟

LFS نے مختلف ماڈلز اور مختلف بنچ مارکس پر عام اور مستقل بہتری لائی۔ تمام ماڈلز کے LFS بہتر شدہ ورژن، تمام ٹیسٹ بنچ مارکس پر بنیادی ماڈلز سے زیادہ ہیں، جس سے ثابت ہوتا ہے کہ LFS صرف ایک بنچ مارک پر اچھا کام نہیں کرتا بلکہ عام صلاحیت بھی رکھتا ہے۔
یہ مقالے کے مرکزی دعوے کا جواب بھی ہے: مدل کو یکساں نمونہ لی جانے والی فریمز پر "سختی سے کام لینے" کی بجائے، ان پر ایک ذکی فلٹر لگائیں — درست فریمز منتخب کرنے سے نیچے کے کام کی کارکردگی بھی بہتر ہوتی ہے۔

03 ٹاسک ایڈاپٹیشن: میکولر انٹروینشن کا استعمال مکمل ماڈل فائن ٹیوننگ کی جگہ لینے کے لیے
کراس ٹاسک جنرلائزیشن کی صلاحیت، جو بڑے زبان ماڈلز میں استعمال ہوتی ہے، ہمیشہ ایک "بیان کرنے میں اہم، لیکن عمل میں مشکل" مسئلہ رہی ہے۔ موجودہ مرکزی حل پر-ٹوکن ڈائنامک راؤٹنگ ہے — ہر ٹوکن کو معالجہ کے دوران کئی LoRA ایڈاپٹرز کے درمیان انتخاب کرنا پڑتا ہے کہ کون سا راستہ اختیار کیا جائے۔ یہ نظام واقعی موثر ہے، لیکن اس کا اخراج بھی زیادہ ہے: کمپوٹیشنل لوڈ اور ویڈیو میموری کا استعمال دونوں بلند سطح پر رہتے ہیں، جس سے ماڈل تیزی سے چلتا ہے اور زیادہ ویڈیو میموری استعمال کرتا ہے۔
ایک دوسرے نقطہ نظر — ریپریزینٹیشن فائن ٹیوننگ (ReFT) — مدل کے پیرامیٹرز کو تبدیل نہیں کرتا، بلکہ صرف پریفکس اور سافیکس ٹوکن کے ریپریزینٹیشنز کو ایڈٹ کرکے ایک منفرد ٹاسک کے لیے ایڈجسٹ کرتا ہے، جس کی کارکردگی LoRA سے کافی زیادہ ہے۔ لیکن اس کے دو کمزور پہلو ہیں: ایک تو ٹوکن کا خود مطلب مبہم ہوتا ہے، اور صرف شروع اور اختتام کو تبدیل کرنا درست نہیں ہوتا؛ دوسرا، اس میں "خود ہدایت" کا کوئی نظام نہیں ہے، جس سے مدل نئے ٹاسکس کا مقابلہ کرتے وقت نہیں جانتا کہ کون سی لیئر یا کون سا ریپریزینٹیشن تبدیل کرنا ہے۔
ہواوی کلاؤڈ ٹیم نے کئی یونیورسٹیوں کے ساتھ تعاون کیا اور ریپریزنٹیشن-اے ویئر مودیولرٹی (RaMod) فریم ورک پیش کیا، جس نے ReFT کے خیال کو کراس ٹاسک جنرلائزیشن کے منظر نامے میں کامیابی کے ساتھ وسعت دی۔

مرکزی طریقہ کار کو دو حصوں میں تقسیم کیا جا سکتا ہے:
پہلا حصہ دو ماڈیول ریپریزینٹیشن اور پیرامیٹر فائن ٹیوننگ ہے۔ ReFT صرف شروع اور اختتام کو ہی تبدیل کر سکتا ہے، جبکہ RaMod بہت زیادہ باریکی سے کام کرتا ہے — وہ درمیانی لیئرز کے پوشیدہ ریپریزینٹیشنز میں سے ایک انتخابی اسٹریٹجی کے ذریعے ایک ذیلی مجموعہ منتخب کرتا ہے تاکہ ماڈیولر انٹروینشن کیا جا سکے۔ کہاں تبدیل کرنا ہے اور کیسے تبدیل کرنا ہے، یہ سب انتخابی اور اسٹریٹجک طریقے سے طے کیا جاتا ہے۔ اس طرح ماڈل کو نئے کاموں کو حل کرنے کے لیے زیادہ درست طریقے سے ہدایت کی جا سکتی ہے۔
دوسرا حصہ ای سینکرونس سکیولر ہے۔ ٹاسکس کے درمیان جنرلائزیشن کا سب سے بڑا خدشہ ویڈیو میموری کی کمی ہے، جس کے لیے RaMod نے ایک فعال سکیولنگ مکینزم ڈیزائن کیا: جتنی ضرورت ہو اتنی ویڈیو میموری مختص کی جائے، اور استعمال ہونے کے بعد فوراً ریلیز کر دی جائے۔ اس طرح، اسٹوریج کا خرچہ کم سے کم ہو گیا۔
اس کا اثر فوری طور پر نظر آتا ہے۔ تجربات سے پتہ چلتا ہے کہ RaMod نہ صرف ٹاسکس کے درمیان بہتر جنرلائزیشن فراہم کرتا ہے بلکہ لاگت بھی کافی حد تک کم ہوتی ہے: اصل LLMs کے مقابلے میں، اس طریقہ کار نے اضافی پریفِل کا وقت 83% کم کر دیا، جنریشن لیٹنسی 100% کم کر دی، اور ویڈیو میموری استعمال 79% کم کر دیا۔
دوسرا لفظ میں، RaMod نے کام کو "ماڈل تبدیل کرنا" سے "نمائندگی کو ترتیب دینا" میں تبدیل کر دیا ہے — ماڈل کے بنیادی حصے کو متحرک نہیں کیا جاتا، بلکہ صرف اہم لیyers کے پوشیدہ حالت پر نقطہ وار ترمیم کی جاتی ہے۔ اگر یہ تصور کام کرتا ہے، تو بڑے ماڈلز کی تنصیب کی معیشت کو دوبارہ لکھا جا سکتا ہے: ایک بنیادی ماڈل جس کے ساتھ کچھ ہلکے مداخلتی ماڈولز ہوں، مختلف کاموں کے لیے کم لاگت پر خدمات فراہم کر سکتے ہیں، بغیر ہر سیناریو کے لیے الگ الگ تربیت یا مکمل نسخے لوڈ کئے جائیں۔
لیکن "دوبارہ لکھنے" سے پہلے، اس نمائندگی کے ریٹیوننگ کے طریقے کے کچھ اہم سوالات اب بھی جواب کا انتظار ہیں، جیسے کہ پیچیدہ استدلال جیسے مشکل سیناریوز میں، کیا حسابی لاگت میں بڑی بچت کے ساتھ ساتھ درستگی کو برقرار رکھا جا سکتا ہے۔
04 ڈیٹا کا ٹوٹنا: زبان کے ماہرین اپنے فرائض انجام دے رہے ہیں، تدریجی تربیت قدم بہ قدم
پہلی تین تحریریں "ماڈل کو زیادہ موثر طریقے سے کیسے استعمال کیا جائے" کا حل تلاش کر رہی ہیں۔ لیکن بہت سے کاموں کا ایک اور زیادہ بنیادی عملی چیلنج یہ ہے: اگر تربیتی ڈیٹا خود کافی نہیں ہے تو؟
کوڈ سوئچنگ (Code-Switching، CS) بولی ٹرانسلیشن کا کام، متعدد زبانوں کو ملا کر بولی گئی آواز کو مقصدی زبان میں ترجمہ کرتا ہے۔ اس کام میں صرف معنی کا ماڈلنگ پیچیدہ ہے، بلکہ CS ڈیٹا کی کمی بھی ایک بڑی پریشانی ہے۔
پہلے کے تحقیقی کامز میں دو راستے اپنائے جاتے تھے: یا تو ماڈل کو خود سیمانٹک ریپریزینٹیشن سمجھنے کے لیے چھوڑ دیا جاتا تھا، جس کا نتیجہ غیر قابل کنٹرول تھا؛ یا پھر انسانی اینوٹیشن پر بہت زیادہ خرچ کیا جاتا تھا، جس کی لاگت بہت زیادہ تھی اور اس کا سکیل بڑھانا مشکل تھا۔
ہواوی ترجمہ سروسز ٹیم، جو ایکمن یونیورسٹی اور مکاؤ یونیورسٹی کے ساتھ مل کر اس تحقیقی مقالہ پر کام کر رہی ہے، ایک نئی تصور پیش کرتی ہے: مدل کو مختلف زبانوں کے معنیاتی نمائندگی کو خود دریافت کرنے کے بجائے، انہیں فعال طور پر مطابق کر دیا جائے — ہر زبان کے لیے الگ ایک “ماہر ٹیم” بنائی جائے، جو اپنی زبان کے معنیاتی ماڈلنگ کے لیے ذمہ دار ہو، اور پھر آخر میں ان کا ایک ساتھ مطابقت کیا جائے۔

کاغذ کا پتہ: https://arxiv.org/pdf/2511.10670
دو اہم ڈیزائن ہیں:
پہلا MoE (Mixture of Experts) اسپیچ پروجیکٹر ہے۔ روایتی پروجیکٹرز تمام زبانوں کے ساتھ ایک جیسا سلوک کرتے ہیں، جس کا نتیجہ قابل قبول نہیں ہوتا۔ MoE ورژن میں، ہر زبان کے لیے ایک الگ “ماہر” گروہ مختص کیا جاتا ہے، جو صرف ایک زبان کے باریک سے اسپیچ خصوصیات کا ماڈلنگ کرتا ہے۔ راؤٹنگ میکنزم خودکار طور پر اسپیچ خصوصیات کو متعلقہ زبان کے ماہر گروہ تک پہنچاتا ہے۔

راستہ کو درست رکھنے کے لیے، تحقیقی مقالہ میں دو معاون نقصانات شامل کیے گئے: زبان خاص نقصان یقینی بناتا ہے کہ ہر ماہر اپنی مخصوص زبان کے خصوصیات سیکھ لے، اور گروہ کے اندر لوڈ بیلنس نقصان یہ روکتا ہے کہ تمام ٹوکن ایک ہی ماہر پر جمع نہ ہو جائیں۔
دوسرا ایک متعدد مراحل کی تربیت کا طریقہ کار ہے۔ اگر ڈیٹا کم ہو، تو اسے حکمت سے پُر کریں۔ پوری تربیت چار مراحل پر مشتمل ہے: پہلے، ہر زبان کے لیے آٹومیٹک سپیچ ریکگنیشن (ASR) ڈیٹا کا استعمال کرتے ہوئے پروجیکٹرز کو الگ الگ پری ٹرین کریں تاکہ آواز-ٹیکسٹ الائنمنٹ کا بنیادی ڈھانچہ تیار ہو جائے؛ پھر، تمام زبانوں کے پروجیکٹرز کو MoE سٹرکچر میں جوڑ دیں اور زبان خاص نقصان اور لوڈ بیلنسنگ نقصان کے ساتھ مشترکہ طور پر بہتر بنائیں؛ اس کے بعد، ASR ڈیٹا سے ایک لغت مخصوص آواز ترجمہ (ST) ڈیٹا پر منتقل ہو جائیں اور منتقلی نقصان کا استعمال کرتے ہوئے نرم منتقلی حاصل کریں؛ آخر میں، ST ڈیٹا سے CS آواز ترجمہ ڈیٹا پر ایڈجسٹ کریں۔
اس تدریجی ڈیزائن کی عمدگی یہ ہے کہ مدل کو براہ راست کمیاب CS ڈیٹا کھانے کے بجائے، پہلے ASR اور ST ڈیٹا کے ساتھ بنیادی صلاحیتیں مضبوط بنائی جاتی ہیں، اور پھر تدریجاً مقصدی کاموں کی طرف منتقل ہو جاتی ہیں۔

تجربی طور پر Whisper، SeamlessM4T، LLaST جیسے کئی مضبوط بنیادی ماڈلز کا موازنہ کیا گیا۔ فشر اور NTUML2021 کے چار ٹیسٹ سیٹس پر، یہ طریقہ SeamlessM4T جیسے دوسرے ماڈلز کو عبور کر گیا، جس کا BLEU اسکور 39.52 تک اور COMET اسکور 81.33 تک پہنچا۔
اس کام سے واضح سیگنل ملتا ہے: ڈیٹا کی کمی والے کراس لینگویج سیناریوز میں، باریک بینی والی آرکیٹیکچر ڈیزائن اور تدریجی تربیت کی حکمت عملی، صرف ڈیٹا جمع کرنے کے مقابلے میں زیادہ موثر ہو سکتی ہے۔
یہ نوٹ کیا جانا چاہئے کہ یہ تجاویز صرف محدود زبانوں اور قابل کنٹرول ڈیٹا کی جدید صورتحال میں ایک موثر "تیز ترین حل" ہے، لیکن دہائیوں زبانوں کو کور کرنے والے عام بہت زبانوں والے ترجمہ سسٹم میں اس کی قابلیتِ توسیع کو مزید ثابت کرنے کی ضرورت ہے۔
05 اختتام: ڈیزائن ڈینسٹی کے ساتھ کمپیوٹیشنل لاگت کو بدلیں
30B ہیرارکیکل ViT نے ماڈل کی ساخت کو دوبارہ ڈیزائن کیا، جس سے 67 ارب ایکٹیویٹیں پیرامیٹرز ImageNet پر 180 ارب کے مقابلے میں بہتر کارکردگی دکھائی۔
LFS نے ان پٹ پر ایک تفریق کی، جس سے بہت سارے بے معنی فریم کوڈنگ کا اخراج حساب سے پہلے روک دیا گیا؛
RaMod نے مکمل فائن ٹیوننگ کو ریپریزینٹیشن لیyer پر فکسڈ پوائنٹ ایڈیٹنگ میں دبایا، جس سے ٹاسک کراس ایڈجسٹمنٹ کے لیے میموری اور لیٹنسی دونوں کم ہو گئیں؛
کوڈ تبدیلی کی آواز کے ترجمے میں MoE کی تقسیم اور تدریجی تربیت کا استعمال کیا گیا، جس نے سب سے کم ڈیٹا والے شعبے میں ایک بات ثابت کی: اکثر ڈیٹا کی کمی کو ڈیزائن کی ذہانت سے پورا کیا جا سکتا ہے۔
چار تحقیقی مقالے، چار مختلف شعبے، سب ایک ہی مرکزی نقطہ کی طرف اشارہ کر رہے ہیں: ہواوی "سائز ڈینسٹی" کی جگہ "ڈیزائن ڈینسٹی" استعمال کر رہا ہے۔ یہ چار مقالے بنیادی تحقیق، AI ڈیٹا، کلاؤڈ سروسز اور ترجمہ سروس سینٹر سے آئے ہیں، جو یہ ظاہر کرتے ہیں کہ کارکردگی کو ترجیح دینا صرف کسی ایک ٹیم کی پسند نہیں، بلکہ یہ منطق تمام تقنیکی فیصلوں میں شامل ہو چکا ہے۔
اگر گزشتہ دو سال کے AI مقابلے کو "مین کا مقابلہ" کہا جائے تو 2026ء ایک موڑ کو ظاہر کر رہا ہے: "پروسیسنگ ٹیکنالوجی" کا مقابلہ شروع ہو چکا ہے۔ اسپارس ایکٹیویشن، اسمارٹ فلٹرنگ، ماڈیولر ایڈاپٹیشن، پروگریسیو ٹریننگ — یہ راستے مزید چپس اور کمپوٹیشنل پاور پر انحصار نہیں کرتے، بلکہ مسئلے کے بارے میں گہری سمجھ پر انحصار کرتے ہیں۔
بڑی کمپنیوں یا اسٹارٹ اپس کے لیے، پیرامیٹر آرمس ریس کا دور پہلے ہی ختم ہو چکا ہے؛ AI کے دوسرے مرحلے میں، حقیقی دنیا کے مسائل کو سمجھنا اور ان مسائل کو نظام کے طور پر حل کرنے کی انجینئرنگ صلاحیتیں ہی اصل فیصلہ کن نکتہ ہیں۔
