ڈیٹا میں بہتری AI پری-ٹریننگ کی کارکردگی میں ماڈل کی ترقیوں سے زیادہ اثر انداز ہوتی ہے

iconTechFlow
بانٹیں
AI summary iconخلاصہ
ٹیکفلو کی طرف سے حوالہ دیے گئے ایک حالیہ مطالعہ کے مطابق، AI پر-ٹریننگ کی کارکردگی میں ڈیٹا میں بہتری کا رفتار مدل کی ترقیوں سے زیادہ ہے۔ 2019 سے 2025 تک، ڈیٹا میں بہتری نے مدل اپ گریڈز کے مقابلے میں 3.24 گنا زیادہ کمپیوٹ کی کارکردگی میں اضافہ کیا۔ آن-چین ڈیٹا تجزیہ نے ظاہر کیا کہ OLMES بینچ مارک کی 88% متغیرت جمع ڈیٹا اور مدل کے اثرات سے آئی۔ یہ نتائج اس بات پر زور دیتے ہیں کہ جب مدلز بڑھتے جائیں تو ڈیٹا کی ترتیب کا کردار اہم ہوتا جا رہا ہے۔ انفلیشن ڈیٹا کے رجحانات بھی AI انفراسٹرکچر میں اضافہ ہونے والے اخراجات کو ظاہر کرتے ہیں۔

مصنف: Dwarkesh Patel

ترجمہ: شن چاؤ ٹیکفلو

شین چاؤ کا خلاصہ: پچھلے ست سالوں میں AI ماڈلز کی صلاحیت میں بہت بڑی ترقی ہوئی، لیکن یہ ترقی الگورتھمز یا ڈیٹا میں سے کس سے آئی؟ اس مضمون میں ایک چھوٹے سے کنٹرولled تجربے کے ذریعے ایک غیر متوقع نتیجہ پیش کیا گیا ہے: ڈیٹا میں بہتری کی وجہ سے کمپوٹیشنل کارکردگی میں ترقی ماڈل میں بہتری سے تین گنا زیادہ ہے۔ AI انفراسٹرکچر کے سرمایہ کاروں اور سرحدی لیبز کے مقابلے پر نظر رکھنے والوں کے لیے، یہ ایک نظرانداز کیا جانے والا ڈرائیور ظاہر کرتا ہے: ڈیٹا انجینئرنگ۔

گزشتہ کچھ سالوں میں AI کے شعبے میں جو تیزی سے ترقی دیکھی گئی، اس میں سے کتنی ترقی ڈیٹا میں بہتری کی وجہ سے ہوئی اور کتنی ماڈل میں بہتری کی وجہ سے؟ اس سوال کا جواب سرحدی لیبز کے مالی ماڈل اور مستقبل کی ترقی کی رفتار پر بڑا اثر ڈالتا ہے۔

ہم نے اس مسئلے پر نسبتاً چھوٹے پیمانے پر تحقیق کی ہے، جو 2019 سے 2025 تک کے پری ٹرینڈنگ پر مرکوز ہے۔ ان سالوں میں، ہر سال نئے اوپن سورس ماڈلز کا ایک مجموعہ جاری کیا گیا، جس نے اس سال کے شائع شدہ، جانے جانے والے الگورتھم میں اصلاحات (جیسے آرکیٹیکچر، آپٹیمائزر، انیشلائزیشن، لرننگ ریٹ اسکیڈولنگ، اور ہائپر پیرامیٹرز وغیرہ) کو خلاصہ کیا۔ اس کے علاوہ، ہر سال نئے اوپن ڈیٹا کارپس بھی ظاہر ہوئے (جس میں بڑے پیمانے پر اسکریپنگ اور نئے کریٹنگ، ایکسٹریکشن، اور فلٹرنگ ٹیکنیکس شامل ہیں)۔

ہم نے مختلف سالانہ سطحوں کے ماڈل اسکیم اور ڈیٹا کارپس کے مختلف کمبینیشنز کو مختلف تربیتی کمپوٹیشنل سائزز پر ٹرین کیا (اچھی سے 1e19 FLOPs تک)۔

واضح طور پر، ہم ان مختلف ماڈلز کا موازنہ ان کے مخصوص ڈیٹا سیٹ پر کراس اینٹروپی نقص کے ذریعے نہیں کر سکتے، کیونکہ ہم ان کے تربیتی ڈیٹا سیٹس کو تبدیل کر رہے ہیں۔ اس لیے، ہم ان ماڈلز کا جائزہ ان کی آخری صلاحیت کے بنیاد پر لیتے ہیں، جس کا معیار OLMES جائزہ ہے (جو 10 نسبتاً آسان بینچ مارکس، زیادہ تر بہت سے انتخابی سوالات جوابات کو مجموعی طور پر شامل کرتا ہے)۔ افسوسناک طور پر، پری ٹریننگ نقص کے بجائے آخری صلاحیت کا جائزہ لینے سے ہمارے نتائج میں کچھ نوائس شامل ہو جاتا ہے، جسے آپ نیچے دی گئی شکل میں دیکھ سکتے ہیں، تاہم ہم نے زیادہ صاف حدود حاصل کرنے کے لیے متعدد رینڈم سیدز کا استعمال کرنے کی کوشش کی ہے۔

ہم نے پایا کہ 2019 سے 2025 تک، 1e19 FLOPs کے کمپوٹیشنل بجٹ کے تحت، 3.24 گنا سے زیادہ کمپوٹیشنل ایفیشنسی میں اضافہ ڈیٹا میں بہتری کی وجہ سے ہوا، نہ کہ مدل میں بہتری کی وجہ سے (ڈیٹا: 12.0 گنا، مدل: 3.7 گنا)۔

یہ گرڈ دکھاتا ہے کہ 3.16e18 FLOPs کی کمپوٹیشنل پاور کے تحت، ہمارے ماڈل نے 2019 کے ڈیٹا اور آرکیٹیکچر بیس لائن کے مقابلے میں آخری ٹیسٹ کی صلاحیت میں کتنی بہتری حاصل کی ہے۔

ہم نے پایا کہ ڈیٹا میں بہتری اور ماڈل میں بہتری سے حاصل ہونے والے فوائد زیادہ تر آپس میں مستقل ہیں اور ایک دوسرے کے ساتھ کوئی تعامل نہیں رکھتے (یعنی کسی ماڈل میں بہتری کا فائدہ کسی خاص ٹریننگ ڈیٹا سیٹ پر منحصر نہیں ہوتا، اور اس کے برعکس بھی)۔ لینئر ماڈل کا استعمال کرتے ہوئے، OLMES اسکور کے 88% واریئنس کو ماڈل میں بہتری اور ڈیٹا میں بہتری کے جمعی اثرات سے وضاحت کیا جا سکتا ہے۔

بحث

پیش منظر کے طور پر، آئیے 2019 سے 2025 تک ڈیٹا اور ماڈل دونوں پہلوؤں میں کیا تبدیلیاں آئیں، اس کا مختصر جائزہ لیتے ہیں۔

ماڈل کی طرف سے، ہم GPT-2 سے OLMo-2 تک پہنچ چکے ہیں، جس میں آپٹیمائزر، پوزیشنل اینکوڈنگ، نارملائزیشن، ایکٹیویشن فنکشن، اور ابتدائی ترتیب جیسے اہم ایجادیں شامل ہیں۔

ڈیٹا کی طرف سے، ہم نے 2019 میں OpenWebText سے شروع کیا، جو صرف ریڈیٹ پر کافی لائکس والے لنک والے ویب صفحات پر مشتمل تھا، جسے ڈپلیکیٹس اور فلٹرنگ کے بعد صرف تقریباً 9 ارب ٹوکن (جو تقریباً GPT-2 کے ٹریننگ ڈیٹا کے برابر ہے) باقی رہ گئے۔ 2025 تک، UltraFineWeb جیسے اوپن سورس ڈیٹا کارپس نہ صرف بہت بڑے سائز کے ہیں (پورے انٹرنیٹ کو اسکین کر کے)، بلکہ ان میں بہت زیادہ پیچیدہ فلٹرنگ طریقے استعمال کیے جاتے ہیں (مثلاً ایک طبقہ بند کرنے والا ماڈل تربیت دیا جاتا ہے جو پیش گوئی کرتا ہے کہ کون سا ڈیٹا ماڈل کی کارکردگی میں اضافہ کرے گا)۔

ہمارے نتائج کا ایک سادہ تفسیر یہ ہے کہ 2019 سے 2024 تک (پری ٹرینڈ دور) AI کی زیادہ تر پیشرفت دراصل بہتر ڈیٹا انجینئرنگ (استخراج، انتخاب وغیرہ) کی تھی، اور اس دور میں تمام ماڈلز کا کام بہت کم اہم تھا۔

لیکن یہ مدل کے بہتر بننے کی قیمت کو دیکھنے کا غلط طریقہ ہو سکتا ہے۔ مدل کے بہتر بننے کا اہم ترین اہمیت یہ نہیں کہ وہ کم FLOPs کے ساتھ ایک جیسی کارکردگی حاصل کرتا ہے۔ بلکہ، یہ پہلے بڑے پیمانے پر کمپوٹیشنل طاقت کو دستیاب بناتا ہے۔ جب پیرامیٹرز، سیکونڈ لمبائی، رن ٹائم اور کلستر سائز بڑھتے ہیں، تو مختلف مسائل خراب ہونے لگتے ہیں (گریڈینٹ اسپلیشن یا غائب ہونا، میموری اور بینڈ وڈتھ ختم ہونا، ٹریننگ ناممکن طور پر سست ہو جانا)۔ مدل تحقیق کا ایک بڑا حصہ ان محدودیتوں کو دور کرنا یا انہیں مزید تاخیر دینا ہے۔ بہت سے اہم ترین ایجادات اسی قسم کی ہیں، جیسے MoE، اسپارس اٹینشن ویریئنٹس، استحکام متعلقہ ایجادات (نارملائزیشن کی جگہ، انٹشلائزیشن وغیرہ) اور FlashAttention جیسے سسٹم اور کرنل لیول آپٹیمائزیشنز۔

ہم یہاں جو ڈیٹا میں بہتری کا مطالعہ کر رہے ہیں، وہ بڑے ماڈلز کے لیے کم اہم ہو سکتی ہے۔ چھوٹے ماڈلز (جیسے ہم نے جو تربیت دی ہے) ڈیٹا کی معیار میں بہتری سے زیادہ فائدہ اٹھاتے ہیں، کیونکہ ان کی صلاحیت محدود ہوتی ہے، اس لیے آپ کو اس میں کیا ڈالنا ہے، اس کا بہت دھیان سے فیصلہ کرنا پڑتا ہے۔ جبکہ بڑے ماڈلز کے پاس بہت زیادہ زائد صلاحیت ہوتی ہے، شاید آپ صرف اتنا ہی ڈیٹا ڈالنا چاہیں کہ جتنا ممکن ہو، حتیٰ کہ اکثریت کچھ زبالہ ہو، تو بھی رینڈم گریڈینٹ ڈسکنٹ کا جادو سگنل کو نوائس سے الگ کر دے گا۔ اگر آپ تشدد کے ساتھ ڈیٹا فلٹر کرنا چاہتے ہیں، تو آپ کو دسوں ایپوچس کرنے پڑ سکتے ہیں، اور تجرباتی نتائج عام طور پر کم تر اوسط معیار لیکن زیادہ بڑے ڈیٹا سیٹ کا استعمال کرنے سے بدتر ہوتے ہیں۔ حقیقت میں، اگر آپ اس بات کو بھی مدنظر رکھیں کہ جدید ماڈلز Chinchilla کے بہترین معیار کے مقابلے میں تقریباً 100 گنا زیادہ تربیت دی جاتی ہیں تاکہ تقویت سیکھنے اور ڈپلوائمنٹ کے لیے استعمال ہونے والے انفرینس کمپوٹنگ طاقت کو کم سے کم کیا جا سکے، تو تشدد والی ڈیٹا کریننگ کا نقصان مزید بڑھ جاتا ہے۔

ایک تشبیہ ہو سکتی ہے کہ یہ جہاز اور کنٹینر جہاز کے درمیان فرق کی طرح ہے: کنٹینر جہاز ضروری نہیں کہ زیادہ تیز چلے، لیکن یہ ہزاروں ٹن مال (جو کہ سینکڑوں تریلین ٹوکن کے پری ٹرینڈ ڈیٹا کے برابر ہے) لے جا سکتی ہے، اور لہروں والی سمندر پر الٹ نہیں پڑتی (جو کہ لاکھوں GPU پر مستقل تربیت کے برابر ہے)۔

اب جب ہمارے پاس زیادہ بڑے اور زیادہ مضبوط کنٹینر جہاز ہیں، تو ہمیں یہ سوچنے کی ضرورت نہیں کہ کیا مال ڈالنا ہے، ہم وہ سب کچھ ڈال سکتے ہیں جو صرف ایک چھوٹا سا فائدہ بھی دے۔ جبکہ 2019 کے چھوٹے اور کمزور جہازوں کے لیے، آپ کو بہت احتیاط کرنی پڑتی تھی اور صرف سب سے قیمتی مال ہی لے جانا تھا۔

لیکن اگر پیش تربیت کی ترقی کا اصل مطلب صرف اس جہاز میں مزید مال ڈالنا ہے، تو کیا ہم تقریباً مال ختم کر چکے ہیں؟ یہ ڈیٹا وال کا مسئلہ ہے، اور یہ بھی کہ سنتھیٹک ڈیٹا کتنی حد تک ہمیں اس دیوار کے پار جانے میں مدد کر سکتا ہے۔ سنتھیٹک ڈیٹا واضح طور پر مختلف لیبز میں وسیع پیمانے پر استعمال ہو رہا ہے، لیکن ہم نے ابھی تک تحقیق نہیں کی ہے کہ کیا یہ ماڈل کی کارکردگی کو نقصان پہنچائے بغیر ڈیٹا کارپس کو مؤثر طریقے سے بڑھا سکتا ہے۔ اگر اس قسم کے فوائد محدود ہیں، تو پیش تربیت کی ترقی کا مرکزی محرک رک جائے گا، کیونکہ ہم مزید انٹرنیٹ مواد نہیں بنائیں گے، اور ایک مخصوص ڈیٹا سیٹ کو کتنی حد تک منظم کیا جا سکتا ہے، اس کا بھی ایک محدود حد ہے۔ اس بات کا ذکر ضروری ہے کہ ہمارے پاس ابھی تک کوئی مثبت وجہ نہیں ہے کہ اس طرح ہوگا۔ لیکن چونکہ پیش تربیت کی ترقی کو آگے بڑھانے میں ڈیٹا کا اتنا اہم کردار ہے، لگتا ہے کہ یہ ایک اہم سوال ہے جس پر مزید تحقیق کی ضرورت ہے۔

رائین گرین بلاٹ نے اشارہ کیا کہ بہت سے تاریخی پری ٹرینڈڈ ڈیٹا کارپس میں بہتریاں، وہی قسم کی ترقیات ہیں جن پر خودکار تحقیق کار آزمائشی طریقے سے فوری طور پر اثر ڈال سکتے ہیں، جیسے کہ مختلف ڈیٹا پر ٹرینڈ کردہ مدلز کے لیے ابلاسیشن تجربات چلانا اور دیکھنا کہ مدل کی کارکردگی کیا ہوتی ہے۔ اس لیے، یہ ہمارے نتائج کے مکمل طور پر مطابق ہے: اگر AI ریسرچ اور ترقی خودکار ہو جائے، تو 2019 کے بعد سے پری ٹرینڈڈ میں ترقی کو بڑھانے والے ڈیٹا کے ترقیاتی مراحل ممکنہ طور پر بہت تیز ہو جائیں گے۔

ہم ایک بات کو واضح کرنا چاہتے ہیں: پری ٹرینڈ پیشرفت کو الگ تھلگ دیکھ کر یہ معلوم کرنا کہ یہ تیز ہو رہی ہے یا سست ہو رہی ہے، AI کی کل پیشرفت کا سب سے اہم سوال نہیں ہے، کیونکہ پچھلے دو سالوں کے بہت سے فوائد ری انفورسمنٹ لرننگ سے آئے ہیں۔

مستقبل کے تحقیقی رخ

یہ کچھ ایسے مستقبل کے تحقیقی رجحانات اور سوالات ہیں جو ہم اہم اور دلچسپ سمجھتے ہیں:

  • آپ اس تجربے کو بڑے پیمانے پر کر سکتے ہیں تاکہ دیکھ سکیں کہ کیا ڈیٹا یا ماڈل میں بہتری زیادہ تر سائز پر منحصر ہے، جس سے اگلے سطح کے شعبوں میں زیادہ اثر پڑے۔
  • آخری صلاحیت کے حوالے سے، پری ٹریننگ اور پوسٹ ٹریننگ میں اعلیٰ معیار کے نئے ڈیٹا کی حدی قیمت کیا ہے؟
  • ہم یہ جاننا چاہتے ہیں کہ مصنوعی ڈیٹا کا عملی اثر کیا ہے۔ ایک خاص مسئلہ جس کا مطالعہ کیا جا سکتا ہے: اگر آپ کے پاس ایک چھوٹا سا مجموعہ اعلی معیار کا ڈیٹا ہے، تو اسے مصنوعی ڈیٹا جنریشن کے ذریعے بڑھانے سے، اسی ڈیٹا کو براہ راست متعدد دفعات ٹرین کرنے کے مقابلے میں کتنا بہتر نتیجہ حاصل ہو سکتا ہے؟
  • آپ ڈیٹا کی ضمنی قیمت کا اندازہ لگا سکتے ہیں، جب آپ لیب میں ڈیٹا بروکر، ماحولیاتی پیداکاروں وغیرہ پر خرچ کو کمپوٹیشنل طاقت اور تحقیقی عملے پر خرچ کے تناسب کے ساتھ تقابل کرتے ہیں۔

ہم یہ جاننا چاہتے ہیں کہ ڈیٹا AI کی ترقی میں کس طرح کردار ادا کرتا ہے۔ اس سوال کو سمجھنے کے لیے کئی دوسرے طریقے بھی موجود ہیں، جن میں سے کچھ ہمارے طریقے سے زیادہ چالاک یا معلوماتی ہو سکتے ہیں۔ اور ہمارے تجربے بہت چھوٹے ہیں۔ ہمیں لگتا ہے کہ شاید ہم کچھ نظر انداز کر رہے ہیں، اور ہم دوسروں کو اس سوال کو کس طرح تحقیق کرنے کا خواہش رکھتے ہیں، بہترین صورت میں ان کے نتائج بھی دیکھنا چاہیں گے!

چارلی او'نیل کے بہت سے مفید بات چیت کے لیے خصوصی شکریہ۔

ضراب: طریقہ کار

ہم نے ان ماڈل ریسیپیز کو مختلف ڈیٹا کارپس پر صفر سے پری ٹرین کیا، مختلف کمپوٹیشنل بجٹ کے ساتھ اور متعدد مستقل سیڈز 6 استعمال کرتے ہوئے۔ ہمارا کمپوٹیشنل بجٹ: 1e17، 3.16e17، 1e18، 3.16e18 اور 1e19 FLOP ہے۔ کمپوٹیشن کی حساب کتاب کی روایت یہ ہے کہ نامی کمپوٹیشن C = 6ND (N غیر امبیڈنگ پیرامیٹرز کی تعداد ہے، D ڈیٹا ٹوکنز کی تعداد ہے)۔

ہر فلیٹ بجٹ کے لیے، ہم پیرامیٹرز کی تعداد کو ترتیب دیتے ہیں، جس سے ٹریننگ کے ٹوکنز کی تعداد تبدیل ہوتی ہے، تاکہ ہر ٹریننگ ریسیپ اور کارپس کے组合 کے لیے کمپوٹیشنل آپٹیمل ریشو معلوم کیا جا سکے۔ ہم اس کمپوٹیشنل آپٹیم پوائنٹ کو تعین کرنے کے لیے کارپس پر ہولڈ آؤٹ لاس استعمال کرتے ہیں۔ پھر ہم ہر组合 کے لیے ڈاؤن اسٹریم پرفارمنس کی کمپوٹیشنل اسکیلنگ کریو حاصل کرتے ہیں، جس سے آخرکار کمپوٹیشنل ملٹیپلر نکالا جاتا ہے۔

ہم تمام رننگز میں مشترکہ ٹوکنائزیشن اور کنٹیکس لمبائی کو فرض کرتے ہیں: GPT-2 BPE (tiktoken، 50257 الفاظ) اور T=2048، بیچ = 262144 ٹوکن۔

ہمارے تربیتی عمل کی آخری صلاحیتیں زیادہ تر اضافی پیرامیٹرز پر منحصر ہیں۔ واضح طور پر، تمام ممکنہ اضافی پیرامیٹرز کے کOMBINeSHNS کو ٹیسٹ کرنا ناممکن ہے، اور اضافی پیرامیٹرز کی ترتیب واقعی ایک نازک فن ہے! ہم اس کا جتنا ممکن ہو انتظام کرنے کی کوشش کرتے ہیں اور چوٹی کی سیکھنے کی شرح کو سب سے اہم کلیدی اضافی پیرامیٹر سمجھتے ہیں۔

کچھ الگورتھم ورژنز حقیقت میں اس بات کا معیار فراہم کرتے ہیں کہ پیک لرننگ ریٹ کو دیگر متعلقہ متغیرات جیسے ماڈل سائز، ڈیٹا بجٹ، بیچ سائز وغیرہ کے فنکشن کے طور پر کس قدر ترتیب دیا جائے۔ یہ ہمیں بہترین لرننگ ریٹ کا اندازہ لگانے کے لیے اچھا اولیہ فراہم کرتے ہیں۔

ہم نے پہلے 5 اینکر پوائنٹس پر سیکھنے کی شرح کا جائزہ لیا: 3 مختلف ماڈل سائزز اور 2 مختلف D/N نسبتوں کے ساتھ۔ ہم نے ان اینکر پوائنٹس کے لیے بہترین سیکھنے کی شرح متعین کی اور بہترین سیکھنے کی شرح کے پیرامیٹر فارم کو فٹ کیا۔

OLMo-2 کے علاوہ تمام ماڈل ریسیپیز کے لیے، ہم ایک مشترکہ ایکسپونینشل a اور b، اور ایک ماڈل خاص lr₀ کو فٹ کرتے ہیں۔ OLMo-2 کے لیے، ہم اس ماڈل ریسیپی میں تعین کیے گئے بہترین سیکھنے کی شرح استعمال کرتے ہیں۔ ہم OLMo-2 کو اس لیے الگ طرح سے سمجھتے ہیں کہ Ai2 نے اس ریسیپی کا حصہ کے طور پر چھوٹے ماڈل سٹیپس جاری کیے ہیں، جن میں ہمارے مطالعہ کے سائز پر بہترین超پیرامیٹرز تعین کیے گئے ہیں۔ ہم نے 3.16e18 FLOP کے کمپوٹیشنل آپٹموم پر بھی اپنی پروڈکشن سیکھنے کی شرح کو بہترین یا اس کے قریب تر تصدیق کر لیا ہے۔

اہم ٹیکنیکل نتائج

گراف میں کچھ غیر معمولی باتوں کی وضاحت

ہم نے مشاہدہ کیا ہے کہ ماڈل اور ڈیٹا دونوں ابعاد میں کمپوٹیشنل ایفیشنسی وقت کے ساتھ عام طور پر بہتر ہو رہی ہے، جو توقع کے مطابق ہے۔ ہم نے کچھ غیر معمولی اقدار کا مشاہدہ کیا:

  • NeoX، 1e19 پر GPT-2 کے مقابلے میں کم کارکردگی دکھاتا ہے (ہاں کہ 1e17 سے 3.16e18 کے دائرے میں بہتر کارکردگی دکھاتا ہے)۔ اس کا سبب OLMES ایوان میں شور ہو سکتا ہے۔ ہم نے یہ بھی نوٹ کیا ہے کہ FineWeb-Edu کارپس پر چھوڑے گئے پری ٹریننگ نقصان پر، NeoX GPT-2 سے بہتر ہے۔
  • پائل کا پرفارمنس اوپن ویب ٹیکسٹ کے مقابلے میں کافی کمزور لگتا ہے۔ یہ حیران کن نہیں کیونکہ پائل کا اہم ترین فائدہ ڈیٹا کارپس کی تنوع میں ہے، نہ کہ فلٹرنگ میں۔ اس میں 22 ذرائع کا ایک منصوبہ بند شدہ مکس ہے، جس میں پبل میڈ اور آر ایکسیو پیپرز، گٹھب کوڈ، قانونی رائے، پیٹنٹس اور پارلیمنٹ ریکارڈ شامل ہیں۔ ان ٹوکنز میں سے بہت سے کے لیے، OLMES (انگریزی ویب ادب ملٹی پل سلیکٹ) میں کراس ڈومین مائیگریشن ممکنہ طور پر بہت کم ہوگا، جس کے نتیجے میں کمپوٹیشنل ایفیشنسی کم ہو جاتی ہے۔ ہم نوٹ کرتے ہیں کہ بڑے پیمانے پر، چونکہ پائل بڑا ہے، اس لیے ہم اس کا تصور کرتے ہیں کہ یہ (بہت چھوٹے) اوپن ویب ٹیکسٹ کو بڑے پیمانے پر بالآخر آؤٹپرفارم کرے گا۔
  • یہ بھی قابل ذکر ہے کہ نیو ایکس اور پائل کے حسابی ضریب باہر کی طرف بڑھا کر حاصل کیے گئے ہیں، جس سے اضافی ممکنہ غلطیاں داخل ہوئی ہیں۔

ہارڈویئر کی طاقت کا گُنکر کیسے حساب لگایا جائے اور اس کی خطای کی حد

  • ہر نقطہ کیلئے کلکٹیو کمپیوٹیشنل پاور اسکیل کریکٹر پر متعدد مستقل بیج ٹریننگ رن سے حاصل کیا گیا ہے۔ وہاں کی خطوط کی خطا OLMES ایوان کا ان بیج پر معیاری انحراف ہے۔
  • کسی دی گئی کمپوٹیشنل پاور لیول پر کسی مخصوص ریفرنس پرفارمنس لیول کے لیے ریفرنس ماڈل یا ڈیٹا کارپس کو مدنظر رکھیں۔
  • ہم بعد میں، اس حوالہ کی کارکردگی کے سطح کو حاصل کرنے والے امیدوار ماڈل یا کارپس کی کمپوٹیشنل اسکیلنگ منحنی پر پہلا سب سے بائیں نقطہ تلاش کرکے کمپوٹیشنل گُنکر کا حساب لگاتے ہیں۔ حوالہ کے لیے درکار کمپوٹیشن اور امیدوار کے لیے درکار کمپوٹیشن کا نسبت، امیدوار کا کمپوٹیشنل گُنکر ہوتا ہے۔
  • کلک کے ضریب کی خطای کی حدیں پورے اندازے کے عمل کے پیرامیٹرز کے بُوت اسٹریپنگ سے حاصل کی گئی ہیں، جو ایک معیاری انحراف کے انٹرول کو ظاہر کرتی ہیں۔
  • ہم یہ واضح کرنا چاہتے ہیں کہ ہمیں لگتا ہے کہ ماڈل ریسیپی کے کمپوٹیشنل ملٹیپلیکر کی اصل عدم یقینیت، خطوط کی خطائی سے زیادہ ہے۔ اس کا سبب یہ ہے کہ ہم نے صرف محدود سی超参数 تلاش کی ہے، اور آخری صلاحیت یا رکھے گئے نقصان کا تعلق بالکل درست سیکھنے کی شرح، بیچ سائز وغیرہ کے انتخاب سے کافی حساس ہو سکتا ہے۔

یہ بھی نوٹ کرنا اہم ہے کہ ہمارے ابلاسیشن تجربات کے کئی وجوہات کی وجہ سے کمپوٹیشنل کارکردگی میں اضافے کے پورے دائرے کو مکمل طور پر نہیں پکڑا جا سکا۔ درحقیقت، 2019 سے 2025 تک، ہم نے ماڈل کی طرف سے سالانہ 1.24 گنا کمپوٹیشنل کارکردگی میں اضافہ دیکھا [1.19، 1.29]، اور ڈیٹا کی طرف سے 1.51 گنا [1.45، 1.57]۔ جب ان دونوں کو ملایا جاتا ہے، تو ہم نے سالانہ 1.57 گنا [1.49، 1.65] کمپوٹیشنل کارکردگی میں اضافہ دیکھا۔ یہ بالکل Anson Ho اور دیگر کے سالانہ 3 گنا کے اوسط اندازے سے کم ہے، جس کی وجوہات درج ذیل ہیں:

  • کئی فوائد سائے پر منحصر ہو سکتے ہیں، یا لمبے سیاق و سباق میں اہم ہو سکتے ہیں، جبکہ ہمارا عملی سائز بہت چھوٹا ہے کہ وہ کئی فوائد ظاہر نہ ہو سکیں۔ مثال کے طور پر، OLMo-2 کے لیئر نارم اور QK نارم، NeoX میں پیرلل اٹینشن کے ساتھ MLP بلاک۔
  • ہمارے تحقیق میں ریزننگ کی کارکردگی میں بہتری (جیسے LLama-3 کا GQA، جو ایک KV کیش کی بہتری ہے) کو کمپوٹیشنل ملٹیپلائر کے طور پر نہیں دکھایا جائے گا۔ ہم نے ٹوکنائزیشن میں بہتری کا بھی مطالعہ نہیں کیا۔
  • ہمیں جو کمپوٹیشنل پاور ملٹیپلر ملتا ہے، وہ ہر سال ہم اپنائے جانے والے ماڈل ریسیپ یا ڈیٹا کارپس کے لیے کافی حساس ہے۔ ہم نے اپنے لیے نمائندہ ماڈل ریسیپ یا ڈیٹا کارپس منتخب کیے ہیں، لیکن یہ ثابت نہیں کرتے کہ یہ ہر سال کے لیے بہترین ہیں۔
  • ہم کسی خاص پریکسیلیٹی اندیکس تک پہنچنے کے بجائے OLMES بنچ مارک (جو 10 قسم کے نسبتاً سادہ ٹاسکس کو ملا کر بنا ہے) کے حوالے سے کمپوٹیشنل ملٹیپلیکر پر توجہ دے رہے ہیں۔ اگر ہم دوسرے بنچ مارکس (جیسے کوڈنگ یا مسئلہ حل کرنے والے بنچ مارکس) دیکھیں، تو اعداد و شمار بالکل مختلف ہوں گے، جو ممکنہ طور پر مکمل طور پر مختلف ڈیٹا انجینئرنگ طریقہ کار کو انعام دیں گے۔

ہم یہ بھی اشارہ کرنا چاہتے ہیں کہ ہم نے دیگر ڈیٹا سائیڈ کے بہتریوں، جیسے نئے ذرائع سے زیادہ معیاری ڈیٹا کا اکٹھا کرنا، انسانی ماہرین کے ذریعہ تخلیق کردہ ڈیٹا، یا مرکب ڈیٹا تخلیق کے طریقے وغیرہ کا مطالعہ نہیں کیا۔ ہمارے مطالعے میں زیادہ تر کارپورا ایک ہی Common Crawl کے منظم (ذیلی) مجموعے ہیں، نہ کہ دستیاب ڈیٹا کے مجموعے کو وسعت دینا۔ یہ واضح طور پر محدود ذخیرے کا استعمال ہے، جس کا اثر محدود ہے۔

آمدنی مدل کے ریسیپی اور ڈیٹا سیٹ کی مستقلیت سے متعلق ہے

ہم نے ماڈل ریسیپی اور ڈیٹا سیٹ کے فائدے کے درمیان انحصار کو طے کرنے کے لیے درج ذیل تحقیق کی۔ ہم نے 3.16e18 FLOPs پر OLMES اسکور گرڈ کا جائزہ لیا۔ OLMES اسکور پر لینیئر ریگریشن کرتے ہوئے، ماڈل OLMES اسکور = اوسط + ماڈل اثر + ڈیٹا اثر کے ساتھ، R مربع 0.88 حاصل ہوا۔ اس کا مطلب ہے کہ OLMES اسکور کے 88% واریئنس کو ماڈل اور ڈیٹا میں بہتری کے جمع اثرات سے وضاحت کیا جا سکتا ہے، جبکہ صرف تقریباً 12% واریئنس انٹرایکشن ٹرمز یا اعلیٰ ترتیب والے عناصر اور جائزہ کے شور سے آتی ہے۔ اس سے پتہ چلتا ہے کہ پیچیدہ ماڈل اور ڈیٹا کے درمیان انٹرایکشن (یعنی کسی خاص ماڈل میں بہتری کسی خاص ڈیٹا انجینئرنگ پر منحصر ہو، یا اس کے برعکس) نسبتاً کم ہے۔

آنسن ہو اور دیگر نے نرم افزار کی کارکردگی میں بہتری (پری ٹریننگ میں) کو سالانہ 3 گنا (95% اعتماد کا انٹرویل: 1.5 گنا سے 64 گنا) کے طور پر تخمینہ لگایا۔ جیسا کہ ہو نے اس بلاگ میں ذکر کیا، “زیادہ تر نرم افزار کی ترقیات دراصل ڈیٹا کی معیار میں بہتری سے آتی ہیں”، اور “کچھ محدود تعداد میں سائز سے متعلق الگورتھمک تبدیلیوں کے وسعت سے”。

ہم طاقت کی حساب کتاب کے لیے C = 6ND کے معاہدے کا استعمال کرتے ہیں۔

2019 کا ماڈل ریسیپ GPT-2 ہے، 2025 کا ماڈل ریسیپ OLMo-2 ہے۔ 2019 کا ڈیٹا سیٹ OpenWebText ہے، 2025 کا ڈیٹا سیٹ UltraFineWeb ہے۔

ہم نے Pile پر GPT3 کو تربیت دیتے ہوئے کچھ تربیتی عدم استحکام کے مسائل (گریڈینٹ اسپائکس) کا سامنا کیا۔

اس میں شامل ہیں: آپٹیمائزر میں بہتری، گرم ہونے اور کم ہونے کا ایجنڈا، سیکھے گئے مطلق مقامات کی جگہ RoPE کا استعمال، RMSNorm کے ساتھ SwiGLU گیٹڈ MLP، Norm کا دوبارہ ترتیب، QK-norm، Z-loss ریگولرائزیشن اور صاف تر انیشلائزیشن۔

کلکی کی توسیع کے لیے، ہم نے ہر ایک کے لیے کم از کم 3 بیج استعمال کیے۔ 3.16e18 بجٹ کے تحت 7x7 گرڈ کے لیے ماڈل ریسیپی اور ڈیٹا سیٹ کے مجموعوں کے لیے، ہم نے صرف 1 بیج استعمال کیا۔

1.57 گنا مطابقتی ضرب، ماڈل اور کارپس کے 2019 سے 2025 تک کے مشترکہ بہتری کے ذریعے حساب کیا گیا ہے، نہ کہ ماڈل کی طرف 1.24 گنا بہتری اور ڈیٹا کی طرف 1.51 گنا بہتری کی ضرب کے ذریعے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔