এআই প্রি-ট্রেনিং দক্ষতায় ডেটা উন্নতি মডেল উন্নতির চেয়ে বেশি কার্যকর

iconTechFlow
শেয়ার
AI summary iconসারাংশ
টেকফ্লো দ্বারা উল্লিখিত একটি সাম্প্রতিক অধ্যয়ন দেখিয়েছে যে এআই প্রি-ট্রেনিং দক্ষতায় ডেটা উন্নতি মডেল উন্নতির চেয়ে দ্রুত এগিয়েছে। ২০১৯ থেকে ২০২৫ এর মধ্যে, ডেটা উন্নতি মডেল আপগ্রেডের চেয়ে ৩.২৪ গুণ বেশি কম্পিউট দক্ষতা বৃদ্ধি ঘটিয়েছে। অন-চেইন ডেটা বিশ্লেষণে দেখা গিয়েছে যে OLMES বেঞ্চমার্কের ৮৮% ভেরিয়েন্স যোগাত্মক ডেটা এবং মডেল প্রভাব থেকে এসেছে। এই ফলাফলগুলি মডেলগুলি বড় হওয়ার সাথে ডেটা পরিচালনার ভূমিকা উজাগর করে। মুদ্রাস্ফীতির ডেটা প্রবণতাগুলিও এআই অবকাঠামোর খরচ বৃদ্ধির দিকেই ইঙ্গিত করছে।

লেখক: Dwarkesh Patel

স্যাংচাও টেকফ্লো

শিনচাও পরিচয়: গত ছয় বছরে এআই মডেলের ক্ষমতা অসাধারণভাবে উন্নত হয়েছে, কিন্তু এই উন্নতি আসলে অ্যালগরিদম থেকে নাকি ডেটা থেকে? এই নিবন্ধটি একটি ছোট নিয়ন্ত্রিত পরীক্ষার সেট ব্যবহার করে একটি অপ্রত্যাশিত উপসংহার দেয়: ডেটা উন্নতির ফলে ক্যালকুলেশন দক্ষতা বৃদ্ধি মডেল উন্নতির চেয়ে তিনগুণেরও বেশি। এআই ইনফ্রাস্ট্রাকচার বিনিয়োগ এবং অগ্রণী ল্যাবের প্রতিযোগিতা নিয়ে আগ্রহীদের জন্য, এটি একটি অবহেলিত চালককে প্রকাশ করে: ডেটা ইঞ্জিনিয়ারিং।

গত কয়েক বছরে আমরা যে দ্রুত প্রগতি দেখেছি এআই ক্ষেত্রে, তার কতটা ডেটা উন্নতির কারণে এবং কতটা মডেল উন্নতির কারণে? এই প্রশ্নের উত্তরটি অগ্রগামী পরীক্ষাগারের অর্থনৈতিক মডেল এবং ভবিষ্যতের প্রগতির গতির জন্য বড় প্রভাব ফেলবে।

আমরা এই সমস্যার উপর একটি সাপেক্ষিক ছোট পর্যালোচনা করেছি, যা বিশেষভাবে 2019 থেকে 2025 সালের প্রি-ট্রেনিং-এর উপর ফোকাস করে। এই বছরগুলিতে, প্রতি বছর একটি নতুন ওপেন-সোর্স মডেল সেট প্রকাশিত হয়, যা ঐ বছরের জন্য প্রকাশিত ও পরিচিত অ্যালগরিদমিক উন্নতি (যেমন: আর্কিটেকচার, অপটিমাইজার, ইনিশিয়ালাইজেশন, লার্নিং রেট স্কেডুলিং, হাইপারপ্যারামিটার ইত্যাদির উন্নতি) সংকলন করে। একইসাথে, প্রতি বছর নতুন প্রকাশিত ডেটা কর্পাস (বড় পরিসরের ওয়েব-স্ক্র্যাপিং এবং নতুন কারিগিরি, এক্সট্র্যাকশন, ফিল্টারিং পদ্ধতির ফলে)ও প্রকাশিত হয়।

আমরা বিভিন্ন বছরের স্তরের জন্য এই মডেল স্কিমগুলি এবং ডেটা কর্পাসের বিভিন্ন সংমিশ্রণ প্রশিক্ষণ করেছি এবং বিভিন্ন প্রশিক্ষণ কম্পিউটিং স্কেলে (সর্বোচ্চ 1e19 FLOPs পর্যন্ত) এটি করেছি।

প্রকৃতপক্ষে, আমরা এই বিভিন্ন মডেলগুলির একটি নির্দিষ্ট ডেটাসেটের ক্রস-এনট্রপি লসের মাধ্যমে তুলনা করতে পারি না, কারণ আমরা তাদের যে ডেটাসেটে প্রশিক্ষণ দিচ্ছি তা পরিবর্তন করছি। তাই, আমরা এই মডেলগুলিকে চূড়ান্ত ক্ষমতার ভিত্তিতে মূল্যায়ন করি, যা OLMES মূল্যায়ন (যা 10টি আপেক্ষিকভাবে সহজ বেঞ্চমার্ককে সংকলন করে, যার বেশিরভাগই বহুনির্বাচনী প্রশ্নোত্তর) দ্বারা পরিমাপ করা হয়। দুর্ভাগ্যবশত, প্রিট্রেইনিং লসের পরিবর্তে চূড়ান্ত ক্ষমতা মূল্যায়ন করা আমাদের ফলাফলগুলিতে কিছু শব্দ যোগ করে, যা আপনি নীচের চিত্রে দেখতে পাবেন, তবে আমরা একাধিক র‍্যান্ডম সিডের মাধ্যমে আরও পরিষ্কার সীমানা পাওয়ার চেষ্টা করি।

আমরা দেখেছি যে 2019 থেকে 2025 এর মধ্যে, 1e19 FLOPs ক্যালকুলেশন বাজেটের অধীনে, 3.24 গুণের বেশি ক্যালকুলেশন দক্ষতা উন্নতি মডেল উন্নতির পরিবর্তে ডেটা উন্নতির কারণে হয়েছে (ডেটা: 12.0 গুণ, মডেল: 3.7 গুণ)।

নিচের গ্রিডটি দেখায় যে, 3.16e18 FLOPs ক্ষমতার অধীনে আমাদের প্রশিক্ষিত মডেলগুলি 2019 সালের ডেটা এবং আর্কিটেকচার বেসলাইনের তুলনায় চূড়ান্ত পরীক্ষার ক্ষমতায় কতটা উন্নতি করেছে।

আমরা দেখেছি যে ডেটা উন্নতি এবং মডেল উন্নতির ফলে লাভগুলি প্রায়শই পরস্পর স্বাধীন, এবং এদের মধ্যে কোনও পারস্পরিক ক্রিয়া নেই (অর্থাৎ, কোনও মডেল উন্নতির লাভ কোনও নির্দিষ্ট ট্রেনিং ডেটা সেটের উপর নির্ভর করে না, এবং বিপরীতেও)। রৈখিক মডেল ব্যবহার করে, OLMES স্কোরের 88% ভেদাঙ্ককে মডেল উন্নতি এবং ডেটা উন্নতির যোগফল প্রভাব দ্বারা ব্যাখ্যা করা যায়।

আলোচনা

প্রেক্ষাপট হিসেবে, 2019 থেকে 2025 এর মধ্যে ডেটা এবং মডেল দুই পক্ষেই কী পরিবর্তন ঘটেছে তা সংক্ষেপে সারসংক্ষেপ করি।

মডেল সাইডে, আমরা GPT-2 থেকে OLMo-2-এ এগিয়েছি, যা অপ্টিমাইজার, পজিশন এনকোডিং, নর্মালাইজেশন, এক্টিভেশন ফাংশন, ইনিশিয়ালাইজেশন ইত্যাদির কী উদ্ভাবনগুলি অন্তর্ভুক্ত করে।

ডেটা সাইডে, আমরা 2019 সালে OpenWebText দিয়ে শুরু করি, যা শুধুমাত্র Reddit-এ পর্যাপ্ত লাইক পাওয়া লিঙ্কযুক্ত ওয়েবপেজ অন্তর্ভুক্ত করে, যা ডুপ্লিকেট অপসারণ এবং ফিল্টারিংয়ের পরে শেষ পর্যন্ত প্রায় 9 বিলিয়ন টোকেনে সীমাবদ্ধ হয় (যা প্রায় GPT-2-এর ট্রেনিং ডেটা)। 2025 সালে, UltraFineWeb-এর মতো ওপেন-সোর্স ডেটা কর্পাস শুধুমাত্র অনেক বড় (সমগ্র ইন্টারনেটকে স্ক্র্যাপ করে), বরং অনেক জটিল ফিল্টারিং পদ্ধতি (যেমন, একটি ক্লাসিফায়ার ট্রেন করা, যা ভবিষ্যদ্বাণী করে কোন ডেটা আসলেই মডেলের পারফরম্যান্সকে উন্নত করবে) ব্যবহার করে।

আমাদের ফলাফলের একটি সহজ ব্যাখ্যা হল: 2019 থেকে 2024 এর মধ্যে (প্রি-ট্রেনিং যুগ) AI-এর বেশিরভাগ উন্নতি আসলে ভালো ডেটা ইঞ্জিনিয়ারিং (এক্সট্রাকশন, কারেশন ইত্যাদি) এর ফল, এবং সেই সময়ের সমস্ত মডেল কাজ ততটা গুরুত্বপূর্ণ ছিল না।

কিন্তু এটি মডেল উন্নতির মূল্য বিচারের একটি ভুল উপায় হতে পারে। মডেল উন্নতির প্রধান অবদান অবশ্যই ক্যালকুলেশন দক্ষতা, অর্থাৎ কম FLOPs ব্যবহার করে একই পারফরম্যান্স অর্জন করা নয়। বরং, এটি প্রথমতঃ বড় স্কেলের ক্যালকুলেশনকে উপলব্ধ করে দেয়। প্যারামিটারের সংখ্যা, কনটেক্সট দৈর্ঘ্য, রানটাইম এবং ক্লাস্টার সাইজ বৃদ্ধির সাথে বিভিন্ন সমস্যা সহজেই ব্যর্থ হয়ে যায় (গ্রেডিয়েন্ট এক্সপ্লোশন বা ভ্যানিশিং, মেমোরি এবং ব্যান্ডউইথের অভাব, ট্রেনিংকে অসম্ভবভাবে ধীর করে দেওয়া)। মডেল গবেষণার অনেকটা অংশই, এই স্কেলিং-এর সীমাবদ্ধতা সরিয়ে ফেলা বা পিছনে ঠেলে দেওয়া। অনেকগুলি সবচেয়ে গুরুত্বপূর্ণ উদ্ভাবনই এই শ্রেণিতে পড়ে, যেমন MoE, স্পারসিটি-ভিত্তিক অটেনশন ভ্যারিয়েন্ট, স্থিতিশীলতা-ভিত্তিক উদ্ভাবন (নরমালাইজেশনের অবস্থান, ইনিশিয়ালাইজেশন ইত্যাদি) এবং FlashAttention-এর মতো সিস্টেম-এবং-কার্নেল-লেভেলের অপটিমাইজেশন।

এখানে আমরা যে ডেটা উন্নতি নিয়ে আলোচনা করছি, তা বড় মডেলগুলির জন্য কম গুরুত্বপূর্ণ হতে পারে। ছোট মডেলগুলি (যেমন আমরা যেগুলি প্রশিক্ষণ দিয়েছি) ডেটার গুণগত উন্নতি থেকে উল্লেখযোগ্যভাবে লাভবান হয়, কারণ এগুলির ক্ষমতা সীমিত, তাই আপনাকে এতে কী ঢোকাবেন তা খুব সতর্কভাবে সিদ্ধান্ত নিতে হয়। অন্যদিকে, বড় মডেলগুলির অতিরিক্ত ক্ষমতা অসংখ্য, তাই আপনি সম্ভবত যতটা সম্ভব ডেটা ঢোকাতে চান, যদিও এর বেশিরভাগই বর্জ্য, তবুও র‍্যান্ডম গ্রেডিয়েন্ট ডাউনহিলের জাদুটি সংকেতকে শব্দ থেকে আলাদা করে দেবে। যদি আপনি আক্রমণাত্মকভাবে ফিল্টারিংয়ের পথই বেছে নেন, তবে আপনাকে দশগুণ-এরও বেশি epoch-এর প্রয়োজন হবে, এবং পরীক্ষামূলকভাবে, এটি গড় মানসম্পন্ন, কিন্তু আকারে বড় ডেটা-সেটগুলির ব্যবহারের চেয়েখারাপ।事实上,如果再考虑到前沿模型相对于 Chinchilla 最优标准最多过度训练 100 倍,以尽量减少用于强化学习和部署的推理算力,那么激进的数据策展危害就更大了।

একটি উপমা হতে পারে স্কুনার এবং কন্টেইনার জাহাজের মধ্যে পার্থক্য: কন্টেইনার জাহাজ অবশ্যই দ্রুত চলে না, কিন্তু এটি হাজার হাজার টন মাল বহন করতে পারে (যা শত শত ট্রিলিয়ন টোকেনের প্রি-ট্রেইনিং ডেটার সমতুল্য), এবং উচ্ছ্বাসিত সমুদ্রের উপরে উল্টে যায় না (যা লক্ষ লক্ষ GPU-এর উপর স্থিতিশীল ট্রেইনিং-এর সমতুল্য)।

এখন আমাদের আরও বড় এবং দৃঢ় কন্টেইনার জাহাজ রয়েছে, তাই আমাদের কী মাল লোড করতে হবে তা নিয়ে চিন্তা করার দরকার নেই; আমরা যা কিছুই সামান্যতম উপকারী মনে করি, তা সবই লোড করতে পারি। কিন্তু 2019 সালের ছোট এবং সুন্দর জাহাজগুলির জন্য, আপনাকে অত্যন্ত সতর্ক থাকতে হবে এবং শুধুমাত্র সবচেয়ে মূল্যবান মালই বহন করতে হবে।

কিন্তু যদি প্রি-ট্রেইনিং অগ্রগতির মূল স্বরূপ কেবল এই জাহাজে আরও বেশি পণ্য বোঝাই করা হয়, তাহলে কি আমাদের পণ্য শিগগিরই ফুরিয়ে যাবে না? এটি ডেটা-ওয়াল সমস্যার একটি দিক, এবং একই সঙ্গে কতটা মাত্রায় synthetic data আমাদের সেই দেয়াল পেরোতে সাহায্য করতে পারে—সেটির প্রশ্নও বটে। synthetic data স্পষ্টভাবেই বিভিন্ন ল্যাবরেটরিতে ইতিমধ্যে ব্যাপকভাবে ব্যবহৃত হচ্ছে, কিন্তু আমরা এখনো মোটেই গবেষণা করিনি যে এটি মডেলের পারফরম্যান্স ক্ষতিগ্রস্ত না করে ডেটা করপাসকে কার্যকরভাবে সম্প্রসারিত করতে পারে কি না। যদি এই ধরনের লাভ সীমিত হয়, তাহলে প্রি-ট্রেইনিং অগ্রগতির প্রধান চালিকাশক্তি স্থবির হয়ে যাবে, কারণ আমরা ইন্টারনেটে আর বেশি কনটেন্ট তৈরি করব না, এবং একটি স্থির ডেটাসেটকে যতটা কিউরেট করা যায়, তারও একটি সীমা আছে। উল্লেখ্য, বর্তমানে আমাদের কাছে এমনটি ঘটবে—এমন কোনো ইতিবাচক কারণ নেই। কিন্তু প্রি-ট্রেইনিং অগ্রগতিকে এগিয়ে নিতে ডেটা যে এতটা গুরুত্বপূর্ণ বলে মনে হচ্ছে, তা বিবেচনায় নিলে এটি একটি মূল প্রশ্ন বলে মনে হয়, যা আরও গবেষণার যোগ্য।

রায়ান গ্রিনব্ল্যাট বলেন যে, অনেক ঐতিহাসিক প্রি-ট্রেনিং ডেটা কর্পাস উন্নতি মনে হয় যেন স্বয়ংক্রিয় গবেষকদের পরীক্ষামূলকভাবে পরীক্ষা করে এগিয়ে নেওয়া যায় এমন ধরনের অগ্রগতি, যেমন বিভিন্ন ডেটা দিয়ে ট্রেন করা অ্যাবলেশন পরীক্ষা চালিয়ে মডেলের পারফরম্যান্স দেখা। তাই, এটি আমাদের ফলাফলের সাথে সম্পূর্ণভাবে সঙ্গতিপূর্ণ: যদি এআই গবেষণা-উন্নয়ন স্বয়ংক্রিয় হয়, তবে ২০১৯ সাল থেকেই প্রি-ট্রেনিং-এর উন্নতির জন্য ডেটা-ভিত্তিক অগ্রগতি অনেক বেশি দ্রুত হয়ে যাবে।

আমরা একটি বিষয় পরিষ্কার করতে চাই: প্রি-ট্রেনিং উন্নতির গতি একা দেখলে এটি ত্বরান্বিত হচ্ছে নাকি ধীর হচ্ছে, সেটাই সমগ্র AI উন্নতির সবচেয়ে গুরুত্বপূর্ণ প্রশ্ন নয়, কারণ গত দুই বছরের অনেক লাভ রিইনফোর্সমেন্ট লার্নিং থেকে এসেছে।

ভবিষ্যতের গবেষণার দিকনির্দেশ

নিম্নলিখিত কিছু ভবিষ্যতের গবেষণার দিক এবং প্রশ্ন রয়েছে যা আমরা খুব মজাদার এবং গুরুত্বপূর্ণ বলে মনে করি:

  • আপনি এই পরীক্ষাটি বড় স্কেলে চালাতে পারেন, যাতে দেখা যায় যে ডেটা বা মডেল উন্নতি কি আরও বেশি স্কেলের উপর নির্ভর করে, এবং এটি অগ্রগতির ক্ষেত্রে বড় প্রভাব ফেলে।
  • প্রিট্রেইনিং এবং পোস্ট-ট্রেইনিংয়ে উচ্চ মানের নতুন ডেটার প্রান্তিক মূল্য কত?
  • আমরা সিনথেটিক ডেটার বাস্তবিক কার্যকারিতা সম্পর্কে একটি সাধারণ ধারণা পেতে চাই। একটি গুরুত্বপূর্ণ প্রশ্ন হল: যদি আপনার কাছে কিছু উচ্চ-গুণগত ডেটা থাকে, তবে সিনথেটিক ডেটা জেনারেশন দ্বারা এটিকে বড় করা কি সরাসরি এই ডেটা দিয়ে একাধিক পুনরাবৃত্তি ট্রেনিংয়ের চেয়ে বেশি ভালো ফলাফল দেবে?
  • আপনি ডেটা ব্রোকার, পরিবেশ উৎপাদনকারী ইত্যাদির উপর খরচ এবং ক্যালকুলেশন ক্ষমতা এবং গবেষকদের খরচের অনুপাতের মাধ্যমে ডেটার অন্তর্নিহিত মূল্য অনুমান করতে পারেন।

আমরা চাই যে ডেটা কীভাবে এআই-এর উন্নতিতে ভূমিকা রাখে তা অনুসন্ধান করি। এই প্রশ্নটি অনুসন্ধানের জন্য অনেকগুলি অন্যান্য পদ্ধতি রয়েছে, যার কিছু আমাদের পদ্ধতির চেয়ে আরও প্রতিভাবান বা তথ্যপূর্ণ হতে পারে। এছাড়াও, আমাদের পরীক্ষার পরিসর খুবই ছোট। আমরা মনে করি আমরা কিছু বাদ দিয়েছি, এবং অন্যরা এই প্রশ্নটি কীভাবে অনুসন্ধান করবেন, এবং তাদের ফলাফলগুলি দেখতে পারি—এটি আমরা খুবই জানতে চাই!

চার্লি ও'নিলের অসংখ্য উপকারী আলোচনার জন্য বিশেষ ধন্যবাদ।

সংযোজন: পদ্ধতিগত পদ্ধতি

আমরা এই মডেল রেসিপিগুলি শূন্য থেকে বিভিন্ন ডেটা কর্পাসে প্রি-ট্রেন করি, বিভিন্ন কম্পিউটেশনাল বাজেট ব্যবহার করে এবং একাধিক স্বতন্ত্র সিড 6 সেট করে। আমাদের কম্পিউটেশনাল বাজেট: 1e17, 3.16e17, 1e18, 3.16e18 এবং 1e19 FLOP। কম্পিউটেশনাল গণনার প্রচলিত পদ্ধতি হল নামমাত্র কম্পিউটেশন C = 6ND (N হল এমবেডিং-ছাড়া প্যারামিটারের সংখ্যা, D হল ডেটা টোকেনের সংখ্যা)।

প্রতিটি কম্পিউটেশনাল বাজেটের জন্য, আমরা প্যারামিটার সংখ্যা সামঞ্জস্য করি, যার ফলে ট্রেনিং টোকেনের সংখ্যা পরিবর্তিত হয়, যাতে প্রতিটি ট্রেনিং রেসিপি এবং কর্পাস কম্বিনেশনের জন্য কম্পিউটেশনালি অপটিমাল অনুপাত নির্ধারণ করা যায়। আমরা কর্পাসের ওপর হোল্ডআউট লস ব্যবহার করি এই কম্পিউটেশনালি অপটিমাল পয়েন্টটি নির্ধারণের জন্য। তারপর আমরা প্রতিটি কম্বিনেশনের ডাউনস্ট্রিম পারফরম্যান্সের জন্য কম্পিউটেশনাল স্কেলিং কার্ভ পাই, এবং সেখান থেকে চূড়ান্তভাবে কম্পিউটেশনাল মালক বের করি।

আমরা সমস্ত রানে শেয়ার্ড টোকেনাইজার এবং কনটেক্সট দৈর্ঘ্য বাধ্যতামূলকভাবে ব্যবহার করি: GPT-2 BPE (tiktoken, 50257 ভোকাবুলারি) এবং T=2048, batch = 262144 টোকেন।

আমাদের প্রশিক্ষণ রানের চূড়ান্ত ক্ষমতা অত্যন্ত হাইপারপ্যারামিটারের উপর নির্ভর করে। স্পষ্টতই, সম্ভাব্য সমস্ত হাইপারপ্যারামিটার কম্বিনেশন পরীক্ষা করা সম্ভব নয়, এবং হাইপারপ্যারামিটার টিউনিং প্রকৃতপক্ষে একটি সূক্ষ্ম কলা! আমরা এটি নিয়ন্ত্রণের জন্য যথাসম্ভব চেষ্টা করি এবং শীর্ষ শিক্ষণ হারকে সবচেয়ে গুরুত্বপূর্ণ কী হাইপারপ্যারামিটার হিসেবে বিবেচনা করি।

কিছু অ্যালগরিদম সংস্করণ প্রকৃতপক্ষে শীর্ষ শিক্ষণ হারের জন্য নির্দিষ্ট মান প্রদান করে, যা অন্যান্য সম্পর্কিত চলক (যেমন মডেল আকার, ডেটা বাজেট, ব্যাচ আকার ইত্যাদি) এর ফাংশন হিসাবে। এগুলি আমাদের জন্য আদর্শ শিক্ষণ হার নির্ধারণের জন্য ভালো পূর্বধারণা প্রদান করে।

আমরা প্রথমে 5টি অ্যানকরে লার্নিং রেট স্ক্যান করি: 3টি ভিন্ন মডেল সাইজ এবং 2টি ভিন্ন D/N অনুপাত। আমরা এই অ্যানকরগুলির জন্য অপ্টিমাল লার্নিং রেট নির্ধারণ করি এবং অপ্টিমাল লার্নিং রেট প্যারামিটার ফর্মকে ফিট করি।

OLMo-2 ছাড়া সমস্ত মডেল রেসিপির জন্য, আমরা একটি সাধারণ সূচকীয় a এবং b ফিট করি, এবং একটি মডেল-নির্দিষ্ট lr₀ ব্যবহার করি। OLMo-2-এর জন্য, আমরা ঐ মডেল রেসিপিতে নির্ধারিত অপ্টিমাল লার্নিং রেট ব্যবহার করি। OLMo-2-এর জন্য এই পদ্ধতির কারণ হলো, Ai2 ছোট মডেল স্টেপগুলিকে রেসিপির অংশ হিসেবে প্রকাশ করেছে, যেখানে আমাদের অধ্যয়নকৃত সাইজের জন্য অপ্টিমাল হাইপারপ্যারামিটারগুলি নির্দিষ্ট করা হয়েছে। আমরা 3.16e18 FLOP-এর কম্পিউটেশনাল অপটিমাল পয়েন্টেও আমাদের প্রডাকশন লার্নিং রেটটি অপ্টিমালের সমান বা তার কাছাকাছি প্রমাণিত করেছি।

প্রধান প্রযুক্তিগত ফলাফল

চার্টের কিছু অস্বাভাবিকতা ব্যাখ্যা করুন

আমরা দেখেছি যে, মডেল এবং ডেটা উভয় মাত্রায়, ক্যালকুলেশন দক্ষতা সময়ের সাথে সাধারণত বৃদ্ধি পাচ্ছে, যা প্রত্যাশিত। আমরা যে কিছু ব্যতিক্রম দেখেছি:

  • 1e19 এর সময় NeoX এর পারফরম্যান্স GPT-2 এর চেয়ে খারাপ, যদিও 1e17 থেকে 3.16e18 পর্যন্ত এটি ভালো পারফরম্যান্স দেখায়। এটি OLMES মূল্যায়নের শব্দের কারণে হতে পারে। আমরা আরও লক্ষ্য করেছি যে, FineWeb-Edu কর্পাসের হোল্ডআউট প্রিট্রেইনিং লসের ক্ষেত্রে NeoX GPT-2 এর চেয়ে ভালো পারফরম্যান্স দেখিয়েছে।
  • Pile-এর পারফরম্যান্স মনে হচ্ছে OpenWebText-এর চেয়ে অনেক খারাপ। এটি আশ্চর্যজনক নয়, কারণ Pile-এর প্রধান উন্নতি ফিল্টারিংয়ের পরিবর্তে ডেটা কর্পাসের বৈচিত্র্যে। এটির একটি সুপরিকল্পিত 22-সোর্স মিশ্রণ রয়েছে, যার মধ্যে রয়েছে PubMed এবং arXiv পেপার, GitHub কোড, আইনি মতামত, পেটেন্ট এবং পার্লামেন্টারি রেকর্ড। এই token-গুলির অনেকগুলির জন্য OLMES (ইংরেজি ওয়েব প্রবন্ধ মাল্টিপল-চয়েস) এর দিকে ক্রস-ডোমেইন ট্রান্সফার খুবই কম হতে পারে, যা ফলে কম্পিউটেশনাল দক্ষতা কমে যায়। আমরা লক্ষ্য করি যে, আকারের কারণে, Pile-এর বড় স্কেলে (যা প্রকৃতপক্ষে খুবই ছোট) OpenWebText-এর চেয়ে চূড়ান্তভাবে ভালো পারফরম্যান্স দেখানোর আশা করা যায়।
  • এছাড়াও উল্লেখ্য যে, নিওএক্স এবং পাইলের ক্যালকুলেশন গুণক বহির্বিস্তারের মাধ্যমে পাওয়া গেছে, যা অতিরিক্ত সম্ভাব্য ত্রুটি প্রবেশ করিয়েছে।

হ্যাশরেট মালক কিভাবে গণনা করা হয় এবং এর ত্রুটি রেখা

  • ক্যালকুলেশন বিস্তার বক্ররেখার প্রতিটি পয়েন্ট একাধিক স্বাধীন সিড ট্রেনিং রান থেকে আসে। সেখানে ত্রুটি লাইনগুলি OLMES মূল্যায়নের স্ট্যান্ডার্ড ডিভিশন যা এই সিডগুলিতে প্রয়োগ করা হয়।
  • একটি নির্দিষ্ট কম্পিউটেশনাল ক্ষমতা স্তরে একটি নির্দিষ্ট রেফারেন্স পারফরম্যান্স লেভেলের জন্য রেফারেন্স মডেল বা ডেটা কর্পাস বিবেচনা করুন।
  • আমরা পরবর্তীতে সেই রেফারেন্স পারফরম্যান্স লেভেলটি প্রথম অর্জন করা প্রার্থী মডেল বা কর্পাসের কম্পিউটেশনাল স্কেলিং কার্ভের সবচেয়ে বামের পয়েন্টটি খুঁজে কম্পিউটেশনাল মাল্টিপ্লায়ার গণনা করি। রেফারেন্সের প্রয়োজনীয় কম্পিউটেশন এবং প্রার্থীর প্রয়োজনীয় কম্পিউটেশনের অনুপাতই হল প্রার্থীর কম্পিউটেশনাল মাল্টিপ্লায়ার।
  • ক্যালকুলেশন মাল্টিপ্লায়ারের ত্রুটি রেখাটি সম্পূর্ণ অনুমান প্রক্রিয়ার প্যারামিটারের বুটস্ট্র্যাপ থেকে আসে, যা 1 স্ট্যান্ডার্ড ডিভিশন ইন্টারভাল।
  • আমরা প্রকৃতপক্ষে জোর দিতে চাই যে, আমাদের মডেল রেসিপি ক্যালকুলেশন মাল্টিপ্লায়ারের অনিশ্চয়তা ত্রুটি লাইনগুলির চেয়ে বেশি হওয়ার সম্ভাবনা রয়েছে। এর কারণ হল আমরা সীমিত পরিসরে হাইপারপ্যারামিটার টিউনিং করেছি, এবং চূড়ান্ত ক্ষমতা বা রিজার্ভড লস শীর্ষ শিক্ষণ হার, ব্যাচ সাইজ ইত্যাদির নির্দিষ্ট বাছাইয়ের প্রতি প্রচুর সংবেদনশীল হতে পারে।

এছাড়াও গুরুত্বপূর্ণ যে, আমাদের অ্যাবলেশন পরীক্ষাগুলি ক্যালকুলেশন দক্ষতার উন্নতির সম্পূর্ণ পরিসরকে সম্পূর্ণভাবে ধরে রাখতে অনেক কারণে অক্ষম। বাস্তবে, 2019 থেকে 2025 এর মধ্যে, আমরা মডেল পাশে বার্ষিক ক্যালকুলেশন দক্ষতার উন্নতি 1.24 গুণ [1.19, 1.29] এবং ডেটা পাশে 1.51 গুণ [1.45, 1.57] পর্যবেক্ষণ করেছি। সংযুক্তভাবে পরিমাপ করলে, আমরা বার্ষিক ক্যালকুলেশন দক্ষতার উন্নতি 1.57 গুণ [1.49, 1.65] 7 পর্যবেক্ষণ করেছি। এটি সত্যিই Anson Ho এবং অন্যদের দ্বারা 3 গুণের বার্ষিক গড় অনুমানের তুলনায় অনেক কম, যার কারণগুলি নিম্নরূপ:

  • অনেক লাভ আকারের উপর নির্ভর করে বা দীর্ঘ প্রসঙ্গে বিশেষভাবে গুরুত্বপূর্ণ, কিন্তু আমাদের অপারেশনের আকার এতটাই ছোট যে অনেক লাভই প্রকাশ পায় না। উদাহরণস্বরূপ, OLMo-2-এর লেয়ার নর্ম এবং QK নর্ম, NeoX-এর প্যারালাল অ্যাটেনশন এবং MLP ব্লক।
  • আমাদের গবেষণায় রিজনিং দক্ষতা উন্নতি (যেমন LLama-3-এর GQA, যা একটি KV ক্যাশ অপ্টিমাইজেশন) ক্যালকুলেশন মাল্টিপ্লায়ার হিসাবে প্রতিফলিত হয় না। আমরা টোকেনাইজারের উন্নতি অধ্যয়নও করি নি।
  • আমাদের প্রাপ্ত ক্ষমতা গুণক প্রতি বছর আমরা যে মডেল রেসিপি বা ডেটা কর্পাস বেছে নিই, তার প্রতি অত্যন্ত সংবেদনশীল। আমরা যে মডেল রেসিপি বা ডেটা কর্পাসগুলি প্রতিনিধিত্বকারী বলে মনে করি, সেগুলি বেছে নিয়েছি। কিন্তু এগুলিই প্রতি বছরের সেরা নয়—এটি সম্পূর্ণভাবে প্রমাণিত হয়নি।
  • আমরা কোনো পারফিক্সিটি মেট্রিক পৌঁছানোর জন্য ক্যালকুলেশন মাল্টিপ্লায়ার নয়, বরং OLMES বেঞ্চমার্ক (যা 10টি সাপেক্ষিক সহজ টাস্ক টাইপকে অন্তর্ভুক্ত করে) এর তুলনায় ক্যালকুলেশন মাল্টিপ্লায়ার দেখছি। যদি আমরা অন্যান্য বেঞ্চমার্ক (যেমন কোডিং বা প্রবলেম সলভিং-বিশেষিত বেঞ্চমার্ক) দেখি, সংখ্যাগুলি অনেক ভিন্ন হবে, যেগুলি সম্ভবত সম্পূর্ণ ভিন্ন ডেটা ইঞ্জিনিয়ারিং পদ্ধতিকে পুরস্কৃত করবে।

আমরা আরও উল্লেখ করতে চাই যে, আমরা নতুন উৎস থেকে আরও উচ্চ মানের ডেটা সংগ্রহ, মানুষের বিশেষজ্ঞদের দ্বারা তৈরি ডেটা, সিনথেটিক ডেটা জেনারেশন পদ্ধতি ইত্যাদির মতো অন্যান্য ডেটা পক্ষের উন্নতি অধ্যয়ন করি নি। আমাদের গবেষণায় ব্যবহৃত বেশিরভাগ কর্পাসই Common Crawl-এর একই সংগঠিত (উপসেট) ছিল, যা উপলব্ধ ডেটা সেটকে বিস্তারিত করেনি। এটি স্পষ্টভাবে সীমিত স্টককে ব্যবহার করা, যা এই লিভারেজকে কতটা এগিয়ে নিয়ে যাওয়া যায়, তার সীমাবদ্ধতা।

আয় মডেল রেসিপি এবং ডেটাসেটের স্বাধীনতা

আমরা মডেল রেসিপি এবং ডেটাসেটের উপকারিতা কতটা স্বাধীন তা নির্ণয় করতে নিম্নলিখিত পর্যবেক্ষণ করেছি। আমরা 3.16e18 FLOPs-এ OLMES স্কোর গ্রিডটি পর্যালোচনা করেছি। OLMES স্কোরের উপর রৈখিক সম্প্রসারণ করে, মডেলটি OLMES স্কোর = গড় + মডেল প্রভাব + ডেটা প্রভাব, যার R-বর্গ 0.88। এর অর্থ হল যে OLMES স্কোরের 88% ভেদ মডেল এবং ডেটা উন্নতির যোগফল প্রভাব দ্বারা ব্যাখ্যা করা যায়, এবং কেবলমাত্র প্রায় 12% ভেদ ইন্টারঅ্যাকশন টার্ম বা উচ্চতর-ক্রমের উপাদানগুলি, এবং মূল্যায়নের শব্দের কারণে। এটি ইঙ্গিত করে যে জটিল মডেল-ডেটা ইন্টারঅ্যাকশন (অর্থাৎ, কোনো মডেল উন্নতির উপর নির্ভরশীলতা কোনো নির্দিষ্ট ডেটা ইঞ্জিনিয়ারিংয়ের, বা তারও বিপরীত) তুলনামূলকভাবে কম।

অ্যানসন হো এবং অন্যরা অনুমান করেছেন যে সফটওয়্যার দক্ষতার উন্নতি (প্রি-ট্রেনিংয়ে) প্রতি বছর 3 গুণ (95% আত্মবিশ্বাসের ব্যবধান: 1.5 গুণ থেকে 64 গুণ)। যেমন হো এই ব্লগে উল্লেখ করেছেন, “অধিকাংশ সফটওয়্যার উন্নতি আসলে ডেটা গুণগত উন্নতি থেকে আসে,” এবং “কয়েকটি সীমিত স্কেল-সংক্রান্ত অ্যালগরিদমিক পরিবর্তনের বিস্তার থেকে।”

আমরা ক্ষমতা গণনার জন্য C = 6ND নামমাত্র চুক্তি ব্যবহার করি।

2019 সালের মডেল রেসিপি ছিল GPT-2, 2025 সালের মডেল রেসিপি হল OLMo-2। 2019 সালের ডেটাসেট ছিল OpenWebText, 2025 সালের ডেটাসেট হল UltraFineWeb।

আমরা যে GPT3 বাস্তবায়ন করেছি তা Pile-এ কিছু প্রশিক্ষণ অস্থিতিশীলতার সম্মুখীন হয়েছে (গ্রেডিয়েন্ট শীর্ষ)।

এগুলি অপ্টিমাইজার উন্নতি, উষ্ণকরণ এবং হ্রাস স্কিডিউল, শেখা হওয়া পরম অবস্থানের পরিবর্তে RoPE ব্যবহার, RMSNorm এবং SwiGLU গেটিং MLP, Norm পুনর্বিন্যাস, QK-norm, Z-loss নিয়মীকরণ এবং পরিষ্কার ইনিশিয়ালাইজেশন অন্তর্ভুক্ত করে।

ক্যালকুলেশন বিস্তার গ্রাফের জন্য, আমরা প্রতিটি জন্য কমপক্ষে 3টি বীজ ব্যবহার করি। 3.16e18 বাজেটের অধীনে 7x7 গ্রিডের মডেল রেসিপি এবং ডেটাসেট কম্বিনেশনের জন্য, আমরা প্রতিটির জন্য শুধুমাত্র 1টি বীজ ব্যবহার করেছি।

1.57 গুণ বার্ষিক গুণকটি 2019 এর মডেল এবং কর্পাস থেকে 2025 এর মডেল এবং কর্পাসের যৌথ উন্নতি ব্যবহার করে গণনা করা হয়েছে, যা মডেল পাশে 1.24 গুণ উন্নতি এবং ডেটা পাশে 1.51 গুণ উন্নতির গুণফল নয়।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।