source avatarMinty

分享

更快的標記化能否消除訓練大型 AI 模型的主要瓶頸? Gigatoken 是一個開源標記化工具,旨在通過直接從檔案讀取訓練資料並將工作分配到多個 CPU 核心,大幅加快此過程。 在原始文字可用於訓練之前,必須將其轉換為模型可處理的標記。對於小型資料集而言,這通常無關緊要,但標記化較大的資料集則需要更多時間和 CPU 資源。 在一台高端伺服器上,Gigatoken 約在半秒內處理了 27 億個 GPT-2 標記,其速度比該專案基準測試中 Hugging Face 的標記化工具快近 1,000 倍。 對於大型訓練實驗室和資料提供者而言,這意味著用於資料準備的 CPU 數量可以減少,並且在資料集或標記化工具變更時能更快地迭代。

No.0 picture
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露