source avatarMinty

I-share

Maaari ba ng mas mabilis na tokenization ang alisin ang isang malaking bottleneck sa pagtatrain ng malalaking AI models? Ang Gigatoken ay isang open-source tokenizer na disenyo upang gawing mas mabilis ang prosesong ito sa pamamagitan ng pagbabasa ng training data diretso mula sa mga file at pagpapamahagi ng trabaho sa mga maraming CPU cores. Bago gamitin ang raw text para sa pagtatrain, kailangan itong i-convert sa mga token na kayang proesuhin ng model. Karaniwang hindi ito mahalaga para sa maliit na dataset, ngunit ang pag-tokenize ng mas malalaking dataset ay nangangailangan ng higit pang oras at CPU resources. Ang Gigatoken ay pinroseso ang halos 2.7 bilyong GPT-2 tokens sa halos kalahating segundo sa isang high-end server, na halos 1,000x mas mabilis kaysa sa tokenizer ng Hugging Face sa benchmark ng proyekto. Para sa malalaking training labs at data providers, maaaring ibig sabihin nito na mas kaunting CPU ang nakalaan para sa paghahanda ng data at mas mabilis na iteration kahit anong pagbabago sa dataset o tokenizer.

No.0 picture
Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.