Penulis: Dwarkesh Patel
Diterjemahkan oleh Deep潮 TechFlow
Pengenalan DeepChao: Dalam enam tahun terakhir, kemampuan model AI telah meningkat pesat, tetapi kemajuan ini sebenarnya datang dari algoritma atau data? Artikel ini memberikan kesimpulan yang tidak intuitif melalui serangkaian eksperimen pembanding berskala kecil: peningkatan data meningkatkan kecekapan penggunaan komputasi lebih dari tiga kali ganda dibandingkan peningkatan model. Bagi mereka yang memperhatikan pelaburan infrastruktur AI dan persaingan di laboratorium terkini, artikel ini mengungkapkan satu pendorong yang terlalu diremehkan: rekabentuk data.
Dalam beberapa tahun terakhir, sejauh mana kemajuan pantas diberikan kepada peningkatan data berbanding peningkatan model dalam bidang AI? Jawapan kepada soalan ini memberi kesan besar terhadap model ekonomi makmal terkini dan kelajuan kemajuan masa depan.
Kami menjalankan penyelidikan berskala kecil terhadap isu ini, khususnya terhadap pra-pelatihan dari tahun 2019 hingga 2025. Dalam tahun-tahun ini, setiap tahun akan diterbitkan satu set model sumber terbuka baru yang merangkum penyesuaian algoritma yang diketahui secara awam pada tahun tersebut (contohnya: peningkatan dalam arsitektur, pengoptimum, inisialisasi, penjadualan kadar pembelajaran, dan parameter hiper). Pada masa yang sama, setiap tahun juga muncul korpus data awam baru (dihasilkan daripada pengambilan data dalam skala lebih besar serta teknik pengurusan, pengambilan, dan penapisan baru).
Kami melatih pelbagai kombinasi model dan korpus data yang mewakili tahap tahun yang berbeza, dengan pelbagai skala kuasa pengiraan latihan (hingga 1e19 FLOPs).
Jelas, kita tidak boleh membandingkan model-model berbeza ini berdasarkan kerugian entropi silang mereka terhadap set data tetap, kerana kita mengubah set data yang mereka latih. Oleh itu, kami sebaliknya menilai model-model ini berdasarkan kemampuan akhir mereka, dengan mengukur menggunakan penilaian OLMES (yang menggabungkan 10 tolok ukur相对 mudah, kebanyakannya soal jawab pilihan berganda). Sayangnya, menilai kemampuan akhir berbanding kerugian pra-pelatihan menambahkan sedikit kebisingan kepada hasil kami, yang akan anda lihat dalam graf di bawah, tetapi kami cuba mendapatkan sempadan yang lebih bersih dengan menggunakan pelbagai benih rawak.
Kami menemukan bahawa, dari tahun 2019 hingga 2025, peningkatan kecekapan pengiraan sebanyak 3.24 kali atau lebih dalam anggaran kuasa 1e19 FLOPs datang daripada peningkatan data, bukan peningkatan model (data: 12.0 kali, model: 3.7 kali).

Jadual di bawah menunjukkan peningkatan kemampuan model yang kami latih dalam ujian akhir berbanding garis dasar data dan arsitektur tahun 2019, di bawah kekuatan 3.16e18 FLOPs.

Kami mendapati bahawa keuntungan daripada peningkatan data dan peningkatan model sebahagian besar adalah saling bebas, tanpa interaksi antara satu sama lain (iaitu, keuntungan daripada mencapai peningkatan model tidak bergantung pada set data latihan tertentu, dan sebaliknya). Dengan menggunakan model linear, 88% varians dalam skor OLMES boleh dijelaskan oleh kesan additif daripada peningkatan model dan peningkatan data.
Perbincangan
Sebagai latar belakang, mari kita ringkaskan secara singkat perubahan yang berlaku di sisi data dan sisi model dari tahun 2019 hingga 2025.
Di sisi model, kami bergerak dari GPT-2 ke OLMo-2, termasuk inovasi penting dalam pengoptimum, pengkodan posisi, normalisasi, fungsi pengaktifan, dan inisialisasi.
Di sisi data, kami bermula pada tahun 2019 dengan OpenWebText, yang hanya mengandungi laman web yang disambungkan dan diberi suka tinggi di Reddit, dan selepas penghapusan duplikasi dan penapisan, akhirnya hanya berjumlah sekitar 9 miliar token (yang pada dasarnya adalah data latihan GPT-2). Pada tahun 2025, korpus data open-source seperti UltraFineWeb tidak hanya jauh lebih besar (melalui penggalian keseluruhan internet), tetapi juga menggunakan kaedah penapisan yang jauh lebih kompleks (contohnya, melatih pengklasifikasi untuk meramal data mana yang benar-benar dapat meningkatkan prestasi model).
Satu tafsiran sederhana terhadap hasil kami ialah: sebahagian besar kemajuan AI dari 2019 hingga 2024 (era pra-pelatihan) sebenarnya hanyalah kejuruteraan data yang lebih baik (pengambilan, pengurusan, dll.), dan semua kerja model pada masa itu jauh kurang penting.
Namun, ini mungkin cara yang salah untuk melihat nilai peningkatan model. Kontribusi utama peningkatan model tidak semestinya berupa kecekapan pengiraan, iaitu mencapai prestasi yang sama dengan FLOPs yang lebih sedikit. Sebaliknya, ia terlebih dahulu menjadikan pengiraan berskala besar boleh diakses. Seiring dengan peningkatan parameter, panjang konteks, tempoh pelatihan, dan saiz kluster, pelbagai masalah mudah berlaku (ledakan atau hilangnya gradien, habisnya memori dan bandwidth, pelatihan menjadi terlalu perlahan). Sebahagian besar kajian model berfokus pada menghapuskan atau menangguhkan had-had ini dalam pengembangan. Banyak inovasi paling penting termasuk dalam kategori ini, seperti MoE, variasi perhatian jarang, inovasi kestabilan (posisi normalisasi, inisialisasi, dll.), serta pengoptimuman peringkat sistem dan kernel seperti FlashAttention.
Perbaikan data yang kami teliti di sini mungkin kurang penting untuk model yang lebih besar. Model kecil (seperti model yang kami latih) mendapat manfaat signifikan dari peningkatan kualitas data, kerana kapasitasnya terbatas, jadi anda perlu sangat berhati-hati dalam menentukan apa yang dimasukkan ke dalamnya. Sebaliknya, model besar mempunyai kapasiti berlebihan yang besar, dan mungkin anda hanya ingin memasukkan sebanyak mungkin data, walaupun kebanyakannya adalah sampah, kerana keajaiban stochastic gradient descent akan memisahkan isyarat daripada bunyi. Jika anda memilih penyaringan agresif, anda terpaksa menjalani puluhan epoch, dan hasil empirik seringkali lebih buruk berbanding menggunakan set data yang lebih besar tetapi dengan kualiti purata lebih rendah. Sebenarnya, jika mempertimbangkan bahawa model terkini boleh dilatih berlebihan sehingga 100 kali ganda berbanding piawaian Chinchilla optimum untuk meminimumkan daya pengiraan inferens yang digunakan dalam pembelajaran penguatan dan pelaksanaan, maka bahaya pengurusan data yang agresif menjadi lebih besar.
Perbandingan mungkin adalah perbezaan antara kapal layar dan kapal kontena: kapal kontena tidak semestinya lebih laju, tetapi ia mampu mengangkut ribuan tan muatan (setara dengan ratusan trilion token data pra-latihan), dan tidak akan terguling di laut yang bergelora (setara dengan latihan stabil di ratusan ribu GPU).
Sekarang kita memiliki kapal kontainer yang lebih besar dan lebih kukuh, kita tidak perlu bimbang tentang apa yang perlu dimuat; kita boleh memuat semua barang yang sedikit pun berguna. Tetapi bagi kapal layar kecil dan rapuh pada tahun 2019, anda perlu sangat berhati-hati dan hanya membawa barang yang paling berharga.
Namun, jika esensi kemajuan pra-pelatihan hanyalah memuat lebih banyak muatan ke dalam kapal ini, apakah kita hampir kehabisan muatan? Ini adalah masalah dinding data, dan juga mengenai sejauh mana data sintetik dapat membantu kita melintasi dinding ini. Data sintetik jelas telah digunakan secara meluas di berbagai laboratorium, tetapi kita sama sekali belum menyelidiki sama ada ia boleh memperluaskan korpus data tanpa merosakkan prestasi model. Jika keuntungan sebegini terhad, maka penggerak utama kemajuan pra-pelatihan akan terhenti, kerana kita tidak akan menghasilkan lebih banyak kandungan internet, dan tahap pengurusan set data yang tetap juga terhad. Perlu ditekankan bahawa kita tidak mempunyai sebarang alasan positif untuk percaya bahawa ini benar-benar berlaku. Namun, mengingat betapa pentingnya data dalam mendorong kemajuan pra-pelatihan, ini nampaknya menjadi soalan kunci yang patut dikaji lebih lanjut.
Ryan Greenblatt menunjukkan bahawa banyak peningkatan korpus data pra-pelatihan bersejarah kelihatan seperti kemajuan yang boleh didorong secara langsung oleh penyelidik automatik melalui ujian empirikal, contohnya menjalankan eksperimen ablasian berdasarkan data yang berbeza untuk melihat bagaimana model berprestasi. Oleh itu, ia sepenuhnya selari dengan hasil kami: jika pembangunan AI diotomatiskan, kemajuan data yang telah mendorong perkembangan pra-pelatihan sejak 2019 mungkin akan dipercepat secara besar-besaran.
Kami ingin memperjelas satu perkara: memandang secara terpisah sama ada kemajuan pra-pelatihan mempercepat atau memperlambat bukanlah soal paling penting dalam kemajuan AI keseluruhan, kerana banyak keuntungan dalam dua tahun terakhir datang daripada pembelajaran penguatan.
Arah penyelidikan masa depan
Berikut adalah beberapa arah dan soalan penyelidikan masa depan yang kami anggap menarik dan penting:
- Anda boleh menjalankan eksperimen ini dalam skala yang lebih besar untuk melihat sama ada data atau peningkatan model lebih bergantung pada skala, dengan demikian memberi kesan yang lebih besar di bidang terkini.
- Dengan mengukur kemampuan akhir, berapakah nilai marjinal data baru yang berkualiti tinggi dalam pra-pelatihan dan pasca-pelatihan?
- Kami ingin mendapatkan gambaran umum tentang kesan sebenar data sintetik. Satu soalan spesifik yang layak dikaji ialah: jika anda mempunyai sekumpulan kecil data berkualiti tinggi, seberapa besar peningkatan prestasi yang boleh dicapai dengan memperbesarkan data tersebut melalui penghasilan data sintetik berbanding dengan melatihnya secara berulang-ulang secara langsung?
- Anda boleh mengira nilai tersirat data berdasarkan nisbah perbelanjaan terhadap agen data, pengeluar persekitaran, dan sebagainya berbanding perbelanjaan pada kuasa pengiraan dan penyelidik.
Kami ingin menyelidiki peranan data dalam mendorong kemajuan AI. Masih terdapat banyak kaedah lain untuk menyiasat soalan ini, dan beberapa di antaranya mungkin lebih bijak dan memberikan maklumat yang lebih banyak berbanding kaedah kami. Selain itu, eksperimen kami sangat kecil. Kami memang percaya bahawa mungkin ada perkara yang terlepas, dan sangat ingin mengetahui bagaimana orang lain akan menyelidiki soalan ini, serta lebih baik lagi jika dapat melihat keputusan mereka!
Terima kasih khusus kepada Charlie O'Neill atas banyak perbincangan yang bermanfaat.
Lampiran: Metodologi


Kami melatih semula model-model ini dari awal pada pelbagai korpus data, menggunakan anggaran kuasa komputasi yang berbeza, dan menetapkan beberapa benih bebas 6. Anggaran kuasa komputasi kami adalah: 1e17, 3.16e17, 1e18, 3.16e18, dan 1e19 FLOP. Konvensyen pengiraan kuasa komputasi menggunakan kuasa komputasi nominal C = 6ND (N ialah bilangan parameter bukan embbeding, D ialah bilangan token data).
Di bawah setiap anggaran daya pengiraan, kami menyesuaikan jumlah parameter untuk menyesuaikan jumlah token latihan, guna menentukan nisbah daya pengiraan optimum bagi setiap resepi latihan dan gabungan korpus. Kami menggunakan kehilangan peninggalan pada korpus untuk menentukan titik daya pengiraan optimum ini. Kemudian, kami boleh memperoleh lengkung pengembangan daya pengiraan bagi prestasi bawah bagi setiap gabungan, daripada mana kami akhirnya mengekstrak gandaan daya pengiraan.
Kami memaksa penggunaan tokenizer dan panjang konteks bersama dalam semua pelaksanaan: GPT-2 BPE (tiktoken, kamus 50257) dan T=2048, batch = 262144 token.
Kemampuan akhir pelatihan kami sangat bergantung pada hiperparameter. Jelas bahawa tidak mungkin untuk menguji semua kombinasi hiperparameter yang mungkin; penyesuaian hiperparameter memang merupakan seni yang halus! Kami berusaha mengawalnya sebaik mungkin dan menganggap kadar pembelajaran puncak sebagai hiperparameter utama.
Beberapa versi algoritma memang menyediakan garis panduan untuk menetapkan kadar pembelajaran puncak sebagai fungsi kepada pemboleh ubah berkaitan lain seperti saiz model, bajet data, saiz batch, dll. Ini memberikan prior yang baik untuk menilai kadar pembelajaran optimum.
Kami pertama sekali memindai kadar pembelajaran pada 5 titik pelik: 3 saiz model yang berbeza dan 2 nisbah D/N yang berbeza. Kami menentukan kadar pembelajaran optimum untuk titik-titik pelik ini, serta menyesuaikan bentuk parameter kadar pembelajaran optimum.
Untuk semua resepi model selain OLMo-2, kami menyesuaikan eksponen umum a dan b, serta lr₀ yang khas setiap model. Untuk OLMo-2, kami menggunakan kadar pembelajaran optimum yang ditentukan oleh resepi model tersebut. Kami memproses OLMo-2 dengan cara ini kerana Ai2 telah menerbitkan tangga model kecil sebagai sebahagian daripada resepi, yang menentukan parameter hiperoptimum untuk skala yang kami kaji. Kami juga telah mengesahkan bahawa kadar pembelajaran produksi kami berada pada atau berhampiran optimum pada titik komputasi 3.16e18 FLOP.
Keputusan teknikal utama


Terangkan beberapa penyimpangan dalam grafik
Kami memperhatikan bahawa kecekapan pengiraan meningkat secara amnya seiring masa dari segi model dan data, yang selari dengan jangkaan. Beberapa nilai anomali yang kami perhatikan:
- NeoX pada 1e19 menunjukkan prestasi yang kurang baik berbanding GPT-2 (walaupun lebih baik dalam julat 1e17 hingga 3.16e18). Ini mungkin disebabkan oleh kebisingan dalam penilaian OLMES. Kami juga memperhatikan bahawa NeoX menunjukkan prestasi lebih baik daripada GPT-2 pada kerugian pra-pelatihan yang ditinggalkan pada korpus FineWeb-Edu.
- Piles kelihatan jauh lebih lemah berbanding OpenWebText. Ini tidak mengejutkan, kerana peningkatan utama Pile terletak pada kepelbagaian korpus data, bukan penyaringan. Ia mempunyai campuran 22 sumber yang dirancang dengan teliti, termasuk kertas kerja PubMed dan arXiv, kod GitHub, pendapat undang-undang, paten, dan rekod parlimen. Bagi banyak token ini, perpindahan lintas bidang ke OLMES (英语网络散文多选题) mungkin sangat kecil, sehingga menyebabkan kecekapan pengkomputeran yang lebih rendah. Kami perhatikan bahawa, kerana skala yang lebih besar, kami mengharapkan Pile akhirnya akan mengatasi OpenWebText (yang skalanya sangat kecil) pada skala yang lebih besar.
- Perlu diperhatikan bahawa gandaan kuasa penggalian NeoX dan Pile diperoleh melalui ekstrapolasi, yang membawa kepada ralat potensial tambahan.
Bagaimana mengira gandaan kuasa pengiraan dan garis ralatnya
- Setiap titik pada lengkung ekspansi kuasa pengiraan berasal daripada beberapa run latihan benih yang berasingan. Garis ralat di sana adalah sisihan piawai penilaian OLMES pada benih-benih tersebut.
- Pertimbangkan model rujukan atau korpus data di bawah tahap kekuatan pengiraan tertentu pada tahap prestasi rujukan yang diberikan.
- Kami kemudian mengira gandaan komputasi dengan mencari titik paling kiri pada lengkung penskalaan komputasi model atau korpus calon yang pertama kali mencapai tahap prestasi rujukan tersebut. Nisbah komputasi yang diperlukan rujukan terhadap komputasi yang diperlukan calon merupakan gandaan komputasi calon.
- Garis ralat gandaan kuasa pengiraan berasaskan kaedah bootstrap parameter keseluruhan proses anggaran, sebagai selang satu sisihan piawai.
- Kami benar-benar ingin menekankan bahawa kami menganggap ketidakpastian sebenar bagi gandaan kuasa komputasi resepi model lebih tinggi daripada yang ditunjukkan oleh garis ralat. Ini disebabkan julat penyesuaian hiperparameter yang terhad kami lakukan, dan kemampuan akhir atau kerugian yang ditinggalkan mungkin sangat sensitif terhadap pilihan tepat bagi kadar pembelajaran puncak, saiz batch, dan sebagainya.
Sama pentingnya untuk diperhatikan bahawa eksperimen ablasi kami tidak dapat sepenuhnya menangkap seluruh julat peningkatan kecekapan pengkomputeran kerana banyak sebab. Sebenarnya, dari tahun 2019 hingga 2025, kami mengamati peningkatan kecekapan pengkomputeran tahunan berbanding tahun sebelumnya di sisi model sebanyak 1.24 kali [1.19, 1.29], dan di sisi data sebanyak 1.51 kali [1.45, 1.57]. Apabila diukur secara bersama, kami mengamati peningkatan kecekapan pengkomputeran tahunan berbanding tahun sebelumnya sebanyak 1.57 kali [1.49, 1.65]7. Ini memang jauh lebih rendah daripada anggaran purata 3 kali peningkatan tahunan oleh Anson Ho dkk., disebabkan perkara berikut:
- Banyak keuntungan mungkin bergantung pada skala, atau menjadi sangat penting dalam konteks yang lebih panjang, tetapi skala operasi kami terlalu kecil untuk menunjukkan banyak keuntungan tersebut. Sebagai contoh, norma lapisan dan norma QK OLMo-2, blok perhatian paralel dengan MLP dalam NeoX.
- Pengoptimuman kecekapan inferens (seperti GQA pada LLama-3, iaitu pengoptimuman cache KV) tidak menunjukkan faktor penggandaan kuasa pengiraan dalam penyelidikan kami. Kami juga tidak mengkaji peningkatan pada tokenizer.
- Kuasa pengganda yang kami peroleh sangat peka terhadap resepi model atau korpus data yang kami pilih setiap tahun. Kami memilih resepi model atau korpus data yang kami anggap mewakili. Namun, ini tidak membuktikan secara lengkap bahawa ini adalah yang terbaik setiap tahun.
- Kami memperhatikan gandaan kuasa pengiraan berbanding tolok OLMES (yang menggabungkan 10 jenis tugas yang相对 ringkas), bukan gandaan kuasa pengiraan untuk mencapai ukuran kebingungan tertentu. Jika kita melihat tolok lain (seperti tolok khas pengkodean atau penyelesaian masalah), nombor-nombor itu juga akan sangat berbeza, kerana tolok-tolok tersebut mungkin memberi ganjaran kepada kaedah rekabentuk data yang sama sekali berbeza.
Kami juga ingin menekankan bahawa kami tidak mengkaji peningkatan di sisi data lain, seperti mengumpul lebih banyak data berkualiti tinggi dari sumber baru, data yang dihasilkan oleh pakar manusia, atau kaedah penghasilan data sintetik. Kebanyakan korpus yang kami kaji adalah subset yang dipilih daripada Common Crawl yang sama, bukan ekspansi kepada koleksi data yang tersedia. Ini jelas merupakan penggunaan stok terhad, dan tahap kemajuan yang boleh dicapai melalui pemacu ini adalah terhad.
Keuntungan dan kemandirian terhadap resepi model dan set data
Kami melakukan penyelidikan berikut untuk menentukan sejauh mana keuntungan resepi model dan set data adalah bebas. Kami melihat grid skor OLMES pada 3.16e18 FLOPs. Regresi linear terhadap skor OLMES dengan model skor OLMES = min + kesan model + kesan data memberikan R kuasa dua sebanyak 0.88. Ini bermaksud 88% varians dalam skor OLMES boleh dijelaskan oleh kesan tambahan peningkatan model dan data, dengan hanya kira-kira 12% varians yang berasal daripada istilah interaksi atau orde lebih tinggi, serta gangguan penilaian. Ini menunjukkan bahawa interaksi kompleks antara model dan data (iaitu, pemanfaatan peningkatan model tertentu bergantung pada rekabentuk data tertentu, atau sebaliknya) adalah相对 kecil.

Anson Ho dan rakan-rakan menganggarkan peningkatan kecekapan perisian (dalam pra-pelatihan) sebanyak 3 kali setiap tahun (selang keyakinan 95%: 1.5 kali hingga 64 kali). Seperti yang disebutkan Ho dalam blog ini, “kebanyakan kemajuan perisian sebenarnya mungkin datang dari peningkatan kualiti data”, serta “daripada pengembangan perubahan algoritma yang sedikit dan berkaitan dengan skala”.
Kami menggunakan perjanjian nominal C = 6ND untuk menghitung kuasa pengiraan.
Resep model tahun 2019 adalah GPT-2, resep model tahun 2025 adalah OLMo-2. Dataset tahun 2019 adalah OpenWebText, dataset tahun 2025 adalah UltraFineWeb.
Kami mengalami beberapa masalah ketidakstabilan latihan pada Pile dengan GPT3 (puncak gradien).
Ini termasuk: peningkatan pengoptimum, penjadualan pemanasan dan pelembapan, penggantian posisi mutlak yang dipelajari dengan RoPE, RMSNorm dengan SwiGLU gated MLP, penyusunan semula Norm, QK-norm, regularisasi Z-loss, serta inisialisasi yang lebih bersih.
Untuk grafik pengembangan daya pengiraan, kami menggunakan sekurang-kurangnya 3 biji untuk setiapnya. Untuk grid 7x7 kombinasi resepi model dan set data di bawah bajet 3.16e18, kami hanya menggunakan 1 biji untuk setiapnya.
Pengganda tahun ke tahun 1.57 kali dihitung menggunakan peningkatan bersama dari model dan korpus 2019 ke model dan korpus 2025, bukan hasil darab peningkatan 1.24 kali di sisi model dan peningkatan 1.51 kali di sisi data.
