लेखक: Dwarkesh Patel
स्पेस टेकफ्लो
शेनचाओ का परिचय: पिछले छह वर्षों में AI मॉडल क्षमताएं तेजी से बढ़ी हैं, लेकिन यह प्रगति एल्गोरिदम या डेटा से आई है? यह लेख एक सेट छोटे नियंत्रित प्रयोगों का उपयोग करके एक अप्रत्याशित निष्कर्ष प्रस्तुत करता है: डेटा में सुधार से गणना की दक्षता में 3 गुना से अधिक की वृद्धि हुई है, जो मॉडल में सुधार से अधिक है। AI बुनियादी ढांचे के निवेश और अग्रणी प्रयोगशालाओं की प्रतिस्पर्धा पर ध्यान देने वालों के लिए, यह एक कम महत्व दिया गया ड्राइवर—डेटा इंजीनियरिंग—को प्रकट करता है।
पिछले कुछ वर्षों में हमने AI के क्षेत्र में जो तेजी से प्रगति देखी है, उसमें से कितना हिस्सा डेटा में सुधार और कितना हिस्सा मॉडल में सुधार का है? इस प्रश्न का उत्तर, अग्रणी प्रयोगशालाओं के आर्थिक मॉडल और भविष्य की प्रगति की गति पर गहरा प्रभाव डालता है।
हमने इस समस्या की एक अपेक्षाकृत सीमित जांच की है, जो विशेष रूप से 2019 से 2025 तक के प्री-ट्रेनिंग पर केंद्रित है। इन वर्षों में, प्रत्येक वर्ष एक नया ओपन-सोर्स मॉडल सेट प्रकाशित किया गया, जिसने उस वर्ष के लिए सार्वजनिक रूप से ज्ञात एल्गोरिदम सुधारों (जैसे आर्किटेक्चर, ऑप्टिमाइज़र, इनिशियलाइज़ेशन, लर्निंग रेट स्केड्यूलिंग, हाइपरपैरामीटर्स आदि) का सारांश प्रस्तुत किया। इसके साथ ही, प्रत्येक वर्ष नए सार्वजनिक डेटा कॉर्पस (बड़े पैमाने पर स्क्रैपिंग और नए करेशन, एक्सट्रैक्शन, फिल्टरिंग तकनीकों द्वारा उत्पन्न) प्रकट हुए।
हमने विभिन्न वर्षों के स्तरों को दर्शाने वाले मॉडल योजनाओं और डेटा कॉर्पस के विभिन्न संयोजनों को विभिन्न ट्रेनिंग कंप्यूटिंग स्केल पर प्रशिक्षित किया (अधिकतम 1e19 FLOPs तक)।
स्पष्ट रूप से, हम इन विभिन्न मॉडलों की तुलना उनके द्वारा किसी निश्चित डेटासेट पर प्राप्त क्रॉस-एंट्रॉपी नुकसान के आधार पर नहीं कर सकते, क्योंकि हम उनके द्वारा प्रशिक्षित डेटासेट को बदल रहे हैं। इसलिए, हम इन मॉडलों का मूल्यांकन अंतिम क्षमता के आधार पर करते हैं, जिसका मापदंड OLMES मूल्यांकन है (जो 10 अपेक्षाकृत सरल बेंचमार्क, जिनमें से अधिकांश बहुविकल्पीय प्रश्नोत्तर हैं, को समेटता है)। दुर्भाग्यवश, अंतिम क्षमता का मूल्यांकन करना, प्री-ट्रेनिंग नुकसान के बजाय, हमारे परिणामों में कुछ शोर जोड़ता है, जिसे आप नीचे के चित्र में देख सकते हैं, हालांकि हमने अधिक साफ सीमाएँ प्राप्त करने के लिए कई रैंडम सीड्स का उपयोग करने का प्रयास किया है।
हमने पाया कि 2019 से 2025 के बीच, 1e19 FLOPs के कैलकुलेशन बजट के तहत, 3.24 गुना से अधिक कैलकुलेशन दक्षता में सुधार डेटा में सुधार से आया है, न कि मॉडल में सुधार से (डेटा: 12.0 गुना, मॉडल: 3.7 गुना)।

नीचे दिया गया ग्रिड 3.16e18 FLOPs की क्षमता के साथ हमारे द्वारा प्रशिक्षित मॉडल की अंतिम परीक्षण क्षमता में 2019 के डेटा और आर्किटेक्चर बेसलाइन की तुलना में सुधार दर्शाता है।

हमने पाया कि डेटा में सुधार और मॉडल में सुधार से प्राप्त लाभ अधिकांशतः परस्पर स्वतंत्र हैं और एक-दूसरे के साथ कोई अंतःक्रिया नहीं है (अर्थात, किसी विशिष्ट मॉडल सुधार का लाभ किसी विशिष्ट ट्रेनिंग डेटा सेट पर निर्भर नहीं करता, और इसके विपरीत)। रैखिक मॉडल का उपयोग करके, OLMES स्कोर के 88% प्रसर को मॉडल सुधार और डेटा सुधार के योगात्मक प्रभावों द्वारा समझा जा सकता है।
चर्चा
पृष्ठभूमि के रूप में, आइए 2019 से 2025 तक डेटा और मॉडल पहलू में क्या परिवर्तन हुए, इसका संक्षिप्त सारांश दें।
मॉडल साइड पर, हम GPT-2 से OLMo-2 तक पहुँचे, जिसमें ऑप्टिमाइज़र, स्थानीय कोडिंग, नॉर्मलाइज़ेशन, एक्टिवेशन फंक्शन, इनिशियलाइज़ेशन आदि में महत्वपूर्ण नवाचार शामिल हैं।
डेटा की ओर से, हमने 2019 में OpenWebText से शुरुआत की, जिसमें केवल Reddit पर अच्छी तरह से लाइक किए गए लिंक वाली वेबसाइटें शामिल थीं, जिन्हें डुप्लिकेट हटाकर फ़िल्टर करने के बाद अंततः लगभग 90 अरब टोकन मिले (यह लगभग GPT-2 के ट्रेनिंग डेटा के बराबर है)। 2025 तक, UltraFineWeb जैसे ओपन सोर्स डेटा कॉर्पस का आकार काफी बड़ा हो गया है (पूरे इंटरनेट के स्क्रैपिंग से), और इनमें अधिक जटिल फ़िल्टरिंग विधियाँ शामिल हैं (जैसे कि एक वर्गीकरणकर्ता को प्रशिक्षित करना, जो यह पूर्वानुमान लगाए कि कौन सा डेटा वास्तव में मॉडल के प्रदर्शन में सुधार करेगा)।
हमारे परिणाम का एक सरल व्याख्या यह है कि 2019 से 2024 तक (प्री-ट्रेनिंग युग) के दौरान AI की अधिकांश प्रगति वास्तव में बेहतर डेटा इंजीनियरिंग (निकालना, संग्रहीत करना आदि) की थी, और उस समय के सभी मॉडल कार्य बहुत कम महत्वपूर्ण थे।
लेकिन यह मॉडल सुधार के मूल्य को देखने का गलत तरीका हो सकता है। मॉडल सुधार का मुख्य योगदान आवश्यक रूप से कैलकुलेशन दक्षता, यानी कम FLOPs के साथ समान प्रदर्शन प्राप्त करना नहीं होता है। विपरीत रूप से, यह पहले बड़े पैमाने पर कैलकुलेशन को उपलब्ध कराता है। पैरामीटर संख्या, संदर्भ लंबाई, चलने का समय और क्लस्टर आकार बढ़ने के साथ, विभिन्न समस्याएँ खराब होने लगती हैं (ग्रेडिएंट विस्फोट या लुप्त होना, मेमोरी और बैंडविड्थ का समाप्त होना, प्रशिक्षण असंभव रूप से धीमा हो जाना)। मॉडल अनुसंधान का एक बड़ा हिस्सा, इन विस्तार की सीमाओं को हटाने या धीमा करने में लगा होता है। सबसे महत्वपूर्ण नवाचारों में से कई इसी श्रेणी में आते हैं, जैसे MoE, स्पार्स ध्यान के विकल्प, स्थिरता में सुधार (नॉर्मलाइजेशन की स्थिति, प्रारंभिकीकरण आदि) और FlashAttention जैसे सिस्टम-और-कर्नल-स्तरीय अनुकूलन।
यहाँ हम जिन डेटा में सुधारों का अध्ययन कर रहे हैं, वे बड़े मॉडल्स के लिए कम महत्वपूर्ण हो सकते हैं। छोटे मॉडल्स (जैसे हमने जिन्हें प्रशिक्षित किया है) डेटा की गुणवत्ता में सुधार से काफी लाभ प्राप्त करते हैं, क्योंकि उनकी क्षमता सीमित होती है, इसलिए आपको इसमें क्या भरना है, इसका बहुत सावधानी से फैसला करना पड़ता है। जबकि बड़े मॉडल्स में बहुत अधिक अतिरिक्त क्षमता होती है, शायद आप केवल इतना ही डेटा डालना चाहते हैं कि जितना संभव हो, भले ही अधिकांश अपशिष्ट हो, रैंडम स्टोकेस्टिक ग्रेडिएंट डाउनहिल का जादू सिग्नल को शोर से अलग कर देगा। यदि आप एग्रेसिव फिल्टरिंग का चयन करते हैं, तो आपको कई दर्जन epoch करने पड़ते हैं, और प्रायोगिक परिणाम अक्सर कम औसत गुणवत्ता वाले, लेकिन बड़े डेटासेट के उपयोग से खराब होते हैं। वास्तव में, यदि हम ध्यान में रखें कि सबसे अग्रणी मॉडल Chinchilla के आदर्श मानक की तुलना में अधिकतम 100 गुना अधिक प्रशिक्षित होते हैं, ताकि प्रबलन सीखने और प्रसारण के लिए प्रसंस्करण की मात्रा कम हो, तो एग्रेसिव डेटा करेशन का हानिकारक प्रभाव और भी अधिक होता है।
एक उपमा सामान्य नाव और कंटेनर जहाज के बीच का अंतर हो सकता है: कंटेनर जहाज जरूरी नहीं कि तेज़ हो, लेकिन यह हजारों टन माल ढो सकता है (जो सैकड़ों ट्रिलियन टोकन के प्री-ट्रेनिंग डेटा के बराबर है), और उथल-पुथल वाले समुद्र पर उलट नहीं होता (जो लाखों GPU पर स्थिर ट्रेनिंग के बराबर है)।
अब हमारे पास अधिक क्षमता वाले और अधिक मजबूत कंटेनर जहाज हैं, इसलिए हमें यह चिंता करने की आवश्यकता नहीं है कि क्या माल लोड करें; हम सभी ऐसी चीजें लोड कर सकते हैं जो थोड़ी भी उपयोगी हों। लेकिन 2019 के छोटे और कमजोर यात्री जहाजों के लिए, आपको बहुत सावधान रहना पड़ता था और केवल सबसे मूल्यवान माल ही ले जाना पड़ता था।
लेकिन यदि प्री-ट्रेनिंग की प्रगति की मूल बात केवल इस जहाज में अधिक माल भरना है, तो क्या हम लगभग माल के अंत की ओर बढ़ रहे हैं? यह डेटा वॉल के बारे में है, और सिंथेटिक डेटा के बारे में है कि यह हमें इस दीवार को पार करने में कितनी मदद कर सकता है। सिंथेटिक डेटा स्पष्ट रूप से सभी प्रयोगशालाओं में व्यापक रूप से उपयोग किया जा रहा है, लेकिन हमने अभी तक यह अध्ययन नहीं किया है कि क्या यह मॉडल प्रदर्शन को क्षति पहुंचाए बिना डेटा कॉर्पस को प्रभावी ढंग से विस्तारित कर सकता है। यदि इस प्रकार के लाभ सीमित हैं, तो प्री-ट्रेनिंग प्रगति का मुख्य चालक बंद हो जाएगा, क्योंकि हम अधिक इंटरनेट सामग्री नहीं उत्पन्न करेंगे, और एक स्थिर डेटासेट को कितना सीमित रूप से संपादित किया जा सकता है। यह स्पष्ट करना महत्वपूर्ण है कि हमारे पास अभी तक कोई सकारात्मक कारण नहीं है कि ऐसा होगा। हालाँकि, चूंकि प्री-ट्रेनिंग प्रगति को आगे बढ़ाने में डेटा का महत्व स्पष्ट है, यह एक महत्वपूर्ण प्रश्न प्रतीत होता है, जिसकी आगे की शोध की आवश्यकता है।
रायन ग्रीनब्लैट ने बताया कि अनेक ऐतिहासिक प्री-ट्रेनिंग डेटा कॉर्पस में सुधार, ऐसे प्रगति के उदाहरण हैं जिन्हें स्वचालित शोधकर्ता सीधे प्रायोगिक परीक्षणों के माध्यम से आगे बढ़ा सकते हैं, जैसे कि विभिन्न डेटा पर प्रशिक्षित मॉडल के लिए एब्लेशन परीक्षण चलाकर देखना कि मॉडल का प्रदर्शन कैसा होता है। इसलिए, यह हमारे परिणामों के पूर्णतः संगत है: यदि AI अनुसंधान स्वचालित हो जाता है, तो 2019 के बाद से प्री-ट्रेनिंग में प्रगति को बढ़ावा देने वाले डेटा सुधार तेजी से त्वरित हो सकते हैं।
हम एक बात स्पष्ट करना चाहते हैं: प्री-ट्रेनिंग प्रगति को अकेले देखकर यह निर्धारित करना कि यह तेज़ हो रही है या धीमी हो रही है, AI प्रगति का सबसे महत्वपूर्ण पहलू नहीं है, क्योंकि पिछले दो वर्षों के अधिकांश लाभ रिइनफोर्समेंट लर्निंग से आए हैं।
भविष्य के अनुसंधान की दिशाएँ
निम्नलिखित कुछ ऐसे भविष्य के अनुसंधान के दिशानिर्देश और प्रश्न हैं जिन्हें हम बहुत दिलचस्प और महत्वपूर्ण मानते हैं:
- आप इस प्रयोग को बड़े पैमाने पर शुरू कर सकते हैं और देख सकते हैं कि क्या डेटा या मॉडल में सुधार अधिक स्केल पर निर्भर करता है, जिससे अग्रणी क्षेत्रों में अधिक प्रभाव पड़े।
- अंतिम क्षमता के आधार पर, प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग में उच्च गुणवत्ता वाले नए डेटा का सीमांत मूल्य क्या है?
- हम चाहते हैं कि सिंथेटिक डेटा के वास्तविक प्रभाव का एक सामान्य अंदाजा लगाएं। एक विशिष्ट अध्ययन योग्य प्रश्न यह है: यदि आपके पास एक छोटा, उच्च गुणवत्ता वाला डेटा सेट है, तो इसे सिंथेटिक डेटा जनरेशन के माध्यम से बढ़ाने से, इसी डेटा को सीधे कई चक्रों में प्रशिक्षित करने की तुलना में कितना बेहतर परिणाम मिलता है?
- आप डेटा के अंतर्निहित मूल्य की गणना लैब में डेटा ब्रोकर्स, एनवायरनमेंट प्रोड्यूसर्स आदि पर किए गए खर्च के आधार पर कर सकते हैं, जो कैलकुलेशन और शोधकर्ताओं पर खर्च की तुलना में है।
हम यह जानना चाहते हैं कि डेटा एआई के विकास में किस भूमिका निभाता है। इस प्रश्न को समझने के लिए कई अन्य तरीके भी हैं, जिनमें से कुछ हमारी विधि की तुलना में अधिक चतुर या अधिक सूचनाप्रद हो सकते हैं। इसके अलावा, हमारा प्रयोग बहुत छोटा है। हमें लगता है कि हम कुछ चीजें छूट गए होंगी, और हम जानना चाहते हैं कि अन्य लोग इस प्रश्न का अध्ययन कैसे करेंगे, साथ ही उनके परिणाम भी देखना चाहेंगे!
चार्ली ओ'नील के अनेक उपयोगी चर्चाओं के लिए विशेष धन्यवाद।
अनुलग्नक: विधि


हमने इन मॉडल रेसिपी को विभिन्न डेटा कॉर्पस पर शून्य से प्री-ट्रेन किया है, विभिन्न कैलकुलेशन बजट के साथ और कई स्वतंत्र बीज 6 सेट किए हैं। हमारा कैलकुलेशन बजट: 1e17, 3.16e17, 1e18, 3.16e18 और 1e19 FLOP है। कैलकुलेशन की परंपरा नाममात्र कैलकुलेशन C = 6ND (N अनिवार्य पैरामीटर की संख्या है, D डेटा टोकन की संख्या है) का उपयोग करना है।
हर कैलकुलेशन बजट के लिए, हम पैरामीटर की संख्या को समायोजित करते हैं, जिससे ट्रेनिंग के टोकन की संख्या बदल जाती है, ताकि हर ट्रेनिंग रेसिपी और कॉर्पस कॉम्बिनेशन के लिए कैलकुलेशन का ऑप्टिमल अनुपात निर्धारित किया जा सके। हम कॉर्पस पर आउट-ऑफ-सैम्पल लॉस का उपयोग करके इस कैलकुलेशन ऑप्टिमम को निर्धारित करते हैं। फिर हम प्रत्येक कॉम्बिनेशन के लिए डाउनस्ट्रीम प्रदर्शन की कैलकुलेशन स्केलिंग कर्व प्राप्त कर सकते हैं, जिससे हम अंततः कैलकुलेशन मल्टीप्लायर निकाल सकते हैं।
हम सभी रन में साझा टोकनाइज़र और संदर्भ लंबाई को अनिवार्य रूप से लागू करते हैं: GPT-2 BPE (tiktoken, 50257 शब्दावली) और T=2048, batch = 262144 टोकन।
हमारे प्रशिक्षण चलाने की अंतिम क्षमता अति-पैरामीटर पर अत्यधिक निर्भर करती है। स्पष्ट है कि सभी संभावित अति-पैरामीटर संयोजनों का अन्वेषण संभव नहीं है, और अति-पैरामीटर ऑप्टिमाइज़ेशन वास्तव में एक सूक्ष्म कला है! हम इसे नियंत्रित करने का प्रयास करते हैं और शीर्ष शिक्षण दर को मुख्य महत्वपूर्ण अति-पैरामीटर मानते हैं।
कुछ एल्गोरिथम संस्करण वास्तव में शीर्ष शिक्षण दर को अन्य संबंधित चरों (जैसे मॉडल आकार, डेटा बजट, बैच आकार आदि) के फ़ंक्शन के रूप में सेट करने का मानदंड प्रदान करते हैं। ये हमें आदर्श शिक्षण दर का निर्णय लेने में अच्छी पूर्वधारणा प्रदान करते हैं।
हमने पहले 5 अंकों पर लर्निंग रेट की जांच की: 3 अलग-अलग मॉडल साइज़ और 2 अलग-अलग D/N अनुपात। हमने इन अंकों के लिए आदर्श लर्निंग रेट निर्धारित किया और आदर्श लर्निंग रेट पैरामीटर फॉर्म को फिट किया।
OLMo-2 के अलावा सभी मॉडल रेसिपी के लिए, हम एक सामान्य घातांक a और b, और एक मॉडल-विशिष्ट lr₀ को फिट करते हैं। OLMo-2 के लिए, हम मॉडल रेसिपी द्वारा निर्धारित आदर्श शिक्षण दर का उपयोग करते हैं। हम OLMo-2 के साथ ऐसा इसलिए करते हैं क्योंकि Ai2 ने छोटे मॉडल स्टेप्स को रेसिपी का हिस्सा के रूप में प्रकाशित किया है, जिसमें हमारे अध्ययन के स्केल पर आदर्श हाइपरपैरामीटर निर्धारित किए गए हैं। हमने 3.16e18 FLOP के कैलकुलेशन ऑप्टिमम पर भी सत्यापित किया है कि हमारी उत्पादन शिक्षण दर आदर्श के समीप या उस पर है।
मुख्य तकनीकी परिणाम


चार्ट में कुछ असामान्यताओं की व्याख्या करें
हमने देखा कि मॉडल और डेटा दोनों आयामों में, कैलकुलेशन दक्षता समय के साथ सामान्य रूप से बढ़ रही है, जो अपेक्षित है। हमने कुछ अपवादों को देखा:
- NeoX, 1e19 पर GPT-2 की तुलना में कम प्रदर्शन करता है (हालाँकि 1e17 से 3.16e18 के रेंज में बेहतर प्रदर्शन करता है)। इसका कारण OLMES मूल्यांकन में शोर हो सकता है। हमने यह भी ध्यान दिया कि FineWeb-Edu कॉर्पस पर आउट-ऑफ-सैंपल प्री-ट्रेनिंग लॉस पर, NeoX GPT-2 से बेहतर प्रदर्शन करता है।
- Piles का प्रदर्शन OpenWebText की तुलना में काफी खराब लगता है। यह आश्चर्यजनक नहीं है, क्योंकि Pile का मुख्य सुधार डेटा कॉर्पस की विविधता में है, न कि फिल्टरिंग में। इसमें PubMed और arXiv पेपर्स, GitHub कोड, कानूनी राय, पेटेंट और संसदीय रिकॉर्ड सहित 22 स्रोतों का सावधानी से चयनित मिश्रण है। इन टोकन्स में से कई के लिए, OLMES (अंग्रेजी वेब निबंध बहुविकल्पीय) में क्रॉस-डोमेन ट्रांसफर संभवतः बहुत कम है, जिससे कैलकुलेशन की दक्षता कम होती है। हमने ध्यान दिया कि चूंकि Pile का आकार बड़ा है, हम अपेक्षा करते हैं कि बड़े पैमाने पर Pile, (वास्तव में बहुत छोटे) OpenWebText की तुलना में अंततः बेहतर प्रदर्शन करेगा।
- यह भी ध्यान देने योग्य है कि नियोएक्स और पाइल के हैशरेट गुणक को बाहरी अनुमान द्वारा प्राप्त किया गया है, जिससे अतिरिक्त संभावित त्रुटि शामिल होती है।
How is the hashrate multiplier calculated and its error line?
- हर बिंदु एकाधिक स्वतंत्र बीज प्रशिक्षण चलाने से आया है। वहाँ की त्रुटि रेखाएँ इन बीजों पर OLMES मूल्यांकन के मानक विचलन हैं।
- Consider the reference model or data corpus at a given reference performance level under a certain computational power level.
- हम बाद में, उस संदर्भ प्रदर्शन स्तर को पहली बार प्राप्त करने वाले उम्मीदवार मॉडल या कॉर्पस की कैलकुलेशन स्केलिंग वक्र के सबसे बाएं बिंदु को खोजकर कैलकुलेशन गुणक की गणना करते हैं। संदर्भ के लिए आवश्यक कैलकुलेशन और उम्मीदवार के लिए आवश्यक कैलकुलेशन का अनुपात ही उम्मीदवार का कैलकुलेशन गुणक होता है।
- The error bars for the hash rate multiplier come from a bootstrap of parameters across the entire estimation process and represent a 1 standard deviation interval.
- हम वास्तव में जोर देना चाहते हैं कि हमारा मानना है कि मॉडल रेसिपी कैलकुलेशन मल्टीप्लायर की वास्तविक अनिश्चितता, त्रुटि रेखाओं द्वारा दर्शाई गई अनिश्चितता से अधिक है। इसका कारण यह है कि हमने सीमित सीमा में हाइपरपैरामीटर ऑप्टिमाइजेशन किया है, और अंतिम क्षमता या लीव-आउट लॉस, शीर्ष शिक्षण दर, बैच आकार आदि के सटीक चयन के प्रति काफी संवेदनशील हो सकता है।
इसी तरह, ध्यान देना महत्वपूर्ण है कि हमारे अब्लेशन परीक्षणों के कई कारणों से कैलकुलेशन दक्षता में वृद्धि की पूरी श्रेणी को पूरी तरह से नहीं पकड़ा जा सकता। वास्तव में, 2019 से 2025 तक, हमने मॉडल की ओर से वार्षिक वृद्धि 1.24 गुना [1.19, 1.29] और डेटा की ओर से 1.51 गुना [1.45, 1.57] देखा है। संयुक्त मापन पर, हमने वार्षिक कैलकुलेशन दक्षता में 1.57 गुना [1.49, 1.65] की वृद्धि देखी है7। यह वास्तव में एंसन हो और सहयोगियों द्वारा अनुमानित 3 गुना की वार्षिक वृद्धि से काफी कम है, कारण निम्नलिखित हैं:
- कई लाभ आकार पर निर्भर कर सकते हैं, या लंबे संदर्भ में विशेष रूप से महत्वपूर्ण हो सकते हैं, जबकि हमारा ऑपरेशनल स्केल इतना छोटा है कि कई लाभों को दर्शाया नहीं जा सकता। उदाहरण के लिए, OLMo-2 के लेयर नॉर्म और QK नॉर्म, NeoX में पैरेलल अटेंशन के साथ MLP ब्लॉक।
- रीजनिंग दक्षता में सुधार (जैसे LLama-3 का GQA, जो एक KV कैश अनुकूलन है) हमारे अध्ययन में कैलकुलेशन गुणक के रूप में प्रतिबिंबित नहीं होता। हमने टोकनाइज़र में सुधार का भी अध्ययन नहीं किया है।
- हमें मिलने वाला गणना गुणक हमारे द्वारा प्रति वर्ष चुने गए मॉडल फॉर्मूला या डेटा कॉर्पस के प्रति काफी संवेदनशील है। हमने ऐसे मॉडल फॉर्मूला या डेटा कॉर्पस का चयन किया है जो हमें प्रतिनिधित्वपूर्ण लगते हैं। लेकिन यह साबित नहीं करता कि ये प्रति वर्ष सबसे अच्छे हैं।
- हम एक निश्चित परेक्सिटी स्कोर तक पहुँचने के लिए कैलकुलेशन मल्टीप्लायर के बजाय OLMES बेंचमार्क (जो 10 अपेक्षाकृत सरल टास्क प्रकारों को शामिल करता है) के सापेक्ष कैलकुलेशन मल्टीप्लायर पर ध्यान केंद्रित कर रहे हैं। यदि हम अन्य बेंचमार्क (जैसे कोडिंग या प्रॉब्लम सॉल्विंग-विशिष्ट बेंचमार्क) को देखें, तो संख्याएँ बहुत अलग होंगी, क्योंकि वे बिल्कुल अलग डेटा इंजीनियरिंग विधियों को पुरस्कृत कर सकते हैं।
हम यह भी उल्लेख करना चाहते हैं कि हमने अन्य डेटा साइड के सुधारों, जैसे कि नए स्रोतों से अधिक उच्च गुणवत्ता वाले डेटा का संग्रह, मानव विशेषज्ञ द्वारा उत्पादित डेटा, सिंथेटिक डेटा उत्पादन विधियों आदि का अध्ययन नहीं किया है। हमारे अध्ययन में अधिकांश कॉर्पस एक ही Common Crawl के संग्रहीत (उपसमूह) हैं, न कि उपलब्ध डेटा सेट का विस्तार। यह स्पष्ट रूप से सीमित स्टॉक का उपयोग करना है, और इस लीवर के माध्यम से कितना प्रगति की जा सकती है, वह सीमित है।
Returns independent of model recipe and dataset
हमने मॉडल फॉर्मूला और डेटासेट के लाभ के बीच कितनी स्वतंत्रता है, यह निर्धारित करने के लिए निम्नलिखित अध्ययन किया। हमने 3.16e18 FLOPs पर OLMES स्कोर ग्रिड का विश्लेषण किया। OLMES स्कोर पर रैखिक प्रतिगमन करते समय, मॉडल OLMES स्कोर = औसत + मॉडल प्रभाव + डेटा प्रभाव, का R-वर्ग 0.88 प्राप्त हुआ। इसका अर्थ है कि OLMES स्कोर के 88% प्रसरण को मॉडल और डेटा में सुधार के योगात्मक प्रभावों द्वारा समझाया जा सकता है, जबकि केवल लगभग 12% प्रसरण अंतःक्रियाओं या उच्चतर कोटि के पदों, और मूल्यांकन शोर से आता है। इससे संकेत मिलता है कि जटिल मॉडल-डेटा अंतःक्रियाएँ (अर्थात्, किसी विशिष्ट डेटा इंजीनियरिंग पर निर्भर करने वाले मॉडल सुधार, या इसके विपरीत) सापेक्ष रूप से छोटी हैं।

एंसन हो और अन्य द्वारा अनुमानित है कि सॉफ्टवेयर की दक्षता में सुधार (प्री-ट्रेनिंग में) प्रति वर्ष 3 गुना है (95% विश्वास अंतराल: 1.5 गुना से 64 गुना)। जैसा कि हो इस ब्लॉग में उल्लेख करते हैं, "अधिकांश सॉफ्टवेयर प्रगति वास्तव में डेटा गुणवत्ता में सुधार से आती है", और "कुछ कम संख्या में स्केल से संबंधित एल्गोरिदमिक परिवर्तनों के विस्तार से।"
हम गणना के लिए C = 6ND के नामित अनुबंध का उपयोग करते हैं।
2019 का मॉडल रेसिपी GPT-2 है, 2025 का मॉडल रेसिपी OLMo-2 है। 2019 का डेटासेट OpenWebText है, 2025 का डेटासेट UltraFineWeb है।
हमने Pile पर GPT3 को ट्रेन करते समय कुछ अस्थिरता की समस्याएँ (ग्रेडिएंट स्पाइक्स) का सामना किया।
इनमें शामिल हैं: ऑप्टिमाइज़र में सुधार, वॉर्म-अप और डिके स्केड्यूलिंग, शिक्षित निरपेक्ष स्थिति के स्थान पर RoPE का उपयोग, RMSNorm के साथ SwiGLU गेटेड MLP, Norm पुनर्व्यवस्था, QK-norm, Z-loss नियमन और अधिक साफ़ प्रारंभीकरण।
कैलकुलेशन एक्सपेंशन ग्राफ के लिए, हम प्रत्येक के लिए कम से कम 3 बीज का उपयोग करते हैं। 3.16e18 बजट के तहत 7x7 ग्रिड के लिए मॉडल रेसिपी और डेटासेट कॉम्बिनेशन के लिए, हमने प्रत्येक के लिए केवल 1 बीज का उपयोग किया।
1.57 गुना का वार्षिक गुणक, मॉडल की ओर से 1.24 गुना और डेटा की ओर से 1.51 गुना सुधार के गुणनफल के बजाय, 2019 के मॉडल और कॉर्पस से 2025 के मॉडल और कॉर्पस तक के संयुक्त सुधार का उपयोग करके गणना किया गया है।
