更快的標記化能否消除訓練大型 AI 模型的主要瓶頸? Gigatoken 是一個開源標記化工具,旨在通過直接從檔案讀取訓練資料並將工作分配到多個 CPU 核心,大幅加快此過程。 在原始文字可用於訓練之前,必須將其轉換為模型可處理的標記。對於小型資料集而言,這通常無關緊要,但標記化較大的資料集則需要更多時間和 CPU 資源。 在一台高端伺服器上,Gigatoken 約在半秒內處理了 27 億個 GPT-2 標記,其速度比該專案基準測試中 Hugging Face 的標記化工具快近 1,000 倍。 對於大型訓練實驗室和資料提供者而言,這意味著用於資料準備的 CPU 數量可以減少,並且在資料集或標記化工具變更時能更快地迭代。


