source avatarMinty

Kongsi

Bisakah tokenisasi yang lebih pantas menghilangkan halangan utama dalam melatih model AI berskala besar? Gigatoken ialah tokenizer sumber terbuka yang direka untuk mempercepat proses ini dengan membaca data latihan secara langsung daripada fail dan mengagihkan kerja di antara beberapa teras CPU. Sebelum teks mentah boleh digunakan untuk latihan, ia perlu ditukar menjadi token yang boleh diproses oleh model. Ini biasanya tidak menjadi masalah untuk set data kecil, tetapi tokenisasi set data yang lebih besar memerlukan lebih banyak masa dan sumber CPU. Gigatoken memproses kira-kira 2.7 bilion token GPT-2 dalam masa separuh saat sahaja pada pelayan berteknologi tinggi, yang hampir 1,000 kali lebih pantas berbanding tokenizer Hugging Face dalam ujian projek tersebut. Untuk makmal latihan berskala besar dan penyedia data, ini boleh bermakna lebih sedikit CPU yang diperuntukkan untuk menyediakan data dan peningkatan pantas setiap kali set data atau tokenizer berubah.

No.0 picture
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.