ChainCatcher 消息,Dwarkesh Patel 與 Jerry Han 於 2026 年 9 月 8 日發布研究,拆解 2019 至 2025 年預訓練進展中數據與模型改進的貢獻。研究在較小規模、針對預訓練進行,每年對應當年公開的模型配方與公開數據語料,並在最高 1e19 FLOPs 的訓練計算規模上組合訓練。結果顯示,在 1e19 FLOPs 計算預算下,數據改進帶來的計算效率增益為 12.0 倍,模型改進為 3.7 倍,數據側增益約為模型側的 3.24 倍。數據與模型改進的增益大體獨立、幾乎不交互,線性模型下二者加性效應可解釋 OLMES 分數 88% 的方差。模型側從 GPT-2 演進至 OLMo-2,涵蓋優化器、位置編碼、歸一化、激活函數與初始化等。數據側從 2019 年約 90 億 token 的 OpenWebText,演進至 2025 年規模更大、過濾更精細的 UltraFineWeb 等語料。
研究:2019 年至 2025 年,資料改進的速度快於預訓練效率中的模型進步
Chaincatcher分享
由 Dwarkesh Patel 和 Jerry Han 於 2026 年 9 月 8 日發表的研究顯示,2019 年至 2025 年間,預訓練效率的數據改進幅度超越了模型進步。鏈上數據帶來了 12.0 倍的計算效率提升,而在 1e19 FLOPs 的預算下,模型改進僅帶來 3.7 倍的提升。通脹數據趨勢表明,數據品質現已成為效率提升的主要驅動力。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。