گوگل ڈیپ مائنڈ کا پیپر ظاہر کرتا ہے کہ ری سرکولیشن طریقہ ٹرانسفارمر کی کارکردگی میں اضافہ کرتا ہے

iconCryptoBriefing
بانٹیں
AI summary iconخلاصہ
گوگل ڈیپ مائنڈ نے ایک نیا پیپر جاری کیا جس میں ٹرانسفارمر ماڈلز کو بہتر بنانے کے لیے 'ری سرکولیشن' نامی طریقہ متعارف کرایا گیا ہے۔ یہ ٹیکنیک انفرنس کے دوران گہرے لیئرز کے ایکٹیویشنز کو پہلے لیئرز میں واپس بھیجتی ہے، جس سے ری ٹریننگ کے بغیر پرفارمنس بڑھ جاتی ہے۔ آن-چین خبروں کے مطابق، اس طریقہ نے GSM8K بینچ مارک پر پرپلکسٹی کو 23% اور استدلال کی درستگی کو 21% بڑھایا۔ تاہم، اس سے شروعاتی پروسیسنگ لاگت بڑھ جاتی ہے۔ کرپٹو خبروں کے ذرائع اس طریقہ کے بلاک چین اطلاقات میں AI کی کارکردگی میں اضافے کے امکانات پر زور دے رہے ہیں۔

گوگل ڈیپ مائنڈ نے ایک پیپر جاری کیا ہے جو زبانی ماڈلز کے متن کو پروسیس کرنے کے طریقے کو خاموشی سے تبدیل کر سکتا ہے۔ اس طریقہ کار کو "ری سرکولیشن" کہا جاتا ہے، جو ٹرانسفارمر کے گہرے لیئرز سے ایکٹی ویشنز لے کر انہیں انفرنس کے دوران اپنے سطحی لیئرز میں واپس ملا دیتا ہے۔ ٹیکساس یونیورسٹی آف آسٹن کے تحقیقی افراد کے ساتھ مل کر لکھا گیا یہ پیپر ظاہر کرتا ہے کہ یہ ہلکا پھلکا ریکرینٹ کنکشن مکمل فائن ٹننگ کے برابر، اور کچھ معاملات میں اس سے بھی بہتر پرفارمنس فراہم کرتا ہے۔ کوئی دوبارہ ٹریننگ کی ضرورت نہیں۔ کوئی بڑی آرکیٹیکچرل سرجیری کی ضرورت نہیں۔

ری سرکولیشن اصل میں کیا کرتا ہے

ری سرکولیشن ٹرانسفارمر پروسیسنگ کے ایک طرفہ بہاؤ کو توڑ دیتی ہے۔ مدل کے گہرے لیئرز میں حساب کیے گئے ایک حصہ ایکٹی ویشنز کو ٹوکن جنریشن کے دوران شالو لیئرز میں واپس بھیجا جاتا ہے۔ مدل کو اپنے اندرونی ریپریزینٹیشنز کو سمجھنے کا دوبارہ موقع ملتا ہے، جس سے وہ کاغذ کے مطابق اپنے "بیلیف اسٹیٹس" کو متعدد مراحل میں بہتر بنانے کا موقع پاتا ہے۔

موجودہ طریقہ جات جیسے چین آف تھوٹ پرومنٹنگ یا لوپڈ ٹرانسفارمر آرکیٹیکچر سے بنیادی فرق یہ ہے کہ ریسرکولیشن کو اضافی تفصیلی ٹوکنز یا اضافی آرکیٹیکچرل ڈیپتھ کی ضرورت نہیں ہوتی۔ یہ انفرنس کے طریقہ کار کو تبدیل کرنے کا ایک اضافہ ہے، نہ کہ مدل کی خود کو دوبارہ ڈیزائن کرنا۔

اعلان

ان اعداد کو نظرانداز کرنا مشکل ہے

ڈیپ مائنڈ ٹیم نے جیما3 ماڈل فیملی، جس میں 1B، 4B اور 12B پیرامیٹر ورائنٹس شamil ہیں، کے لیے ری سرکولیشن کا امتحان کیا۔ بنیادی ری سرکولیشن نے نو زبان کے ماڈلنگ ڈیٹا سیٹس پر تقریباً 8.5% کم پرپلیکسٹی پیدا کی، جبکہ جنریشن کے دوران کوئی اضافی لیٹنسی نہیں ہوئی۔

اداپٹو ری سرکولیشن کو مزید آگے بڑھایا گیا، جس سے انہیں نو ڈیٹاسیٹس پر پرپلیکسٹی میں 23% کا اوسط کمی حاصل ہوا۔ حوالہ کے طور پر، مکمل فائن ٹیوننگ صرف 21.6% کمی کر پائی۔ ترکیبی کاموں پر، GSM8K بینچ مارک میں اداپٹو ری سرکولیشن کے ساتھ درستگی میں 21% نسبی اضافہ ہوا۔

ایک توازن ہے۔ پری فل پروسیسنگ، وہ مرحلہ جہاں ماڈل ابتدائی پرامپٹ کو سمجھتا ہے، ری سرکولیشن کے تحت سیریل ہو جاتا ہے، جس سے پرامپٹ کو پروسیس کرنے کا ابتدائی اخراج بڑھ جاتا ہے۔

کیوں AI کمیونٹی توجہ دے رہی ہے

کاغذ، جسے arXiv:2608.17981 کے طور پر فہرست کیا گیا ہے، پہلے ہی مستقل طور پر دوبارہ تیار کر لیا گیا ہے۔ گٹھب کے ایمپلیمنٹیشنز نے جیما خاندان کے باہر، جس میں Llama 3.2 1B بھی شامل ہے، ماڈلز پر فائدے کی تصدیق کی ہے۔ بحثیں X اور چینی ٹیک میڈیا پلیٹ فارمز پر تحقیقی برادریوں کے درمیان پھیل چکی ہیں۔

ری سرکولیشن فعالیت کے سطح پر کام کرتی ہے، ٹوکن جنریشن کی سطح کے نیچے، جس سے یہ چین آف تھوٹ ریزننگ جیسے پرامپٹنگ ٹیکنیکس کے ساتھ مکمل کرتی ہے، نہ کہ ان کے مقابلے میں، جو آؤٹ پٹ ٹوکنز استعمال کرتے ہیں اور لیٹنسی شامل کرتے ہیں۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔