ByteDance dilaporkan sedang bersiap untuk pra-latih model AI dengan sekitar 10 trilion parameter, skala yang akan melebihi semua sistem AI Cina yang diketahui dan menempatkan syarikat itu dalam persaingan langsung dengan makmal Barat yang paling canggih. Usaha ini memerlukan kira-kira 30,000 GPU dan anggaran 3 hingga 6 bulan pra-latihan berterusan.
Untuk memberikan gambaran mengenai 10 trilion parameter, jumlah ini lebih daripada tiga kali ganda saiz Kimi K3 daripada Moonshot AI, yang berada pada 2.8 trilion parameter dan kini berada di antara model terbesar yang dihasilkan di China. Parameter pada dasarnya ialah tombol yang disetel oleh model AI semasa latihan untuk mempelajari corak dalam data.
Apa yang sebenarnya dibina oleh ByteDance
Model yang dimaksud menggunakan arsitektur Mixture of Experts (MoE). Alih-alih mengaktifkan setiap parameter untuk setiap permintaan, model MoE mengarahkan setiap input ke subset sub-jaringan "pakar" khusus. Ini membuatnya jauh lebih efisien dijalankan pada waktu inferensi dibandingkan model padat dengan ukuran total yang sama.
Pasukan Seed AI ByteDance, yang dilaporkan terdiri daripada sekitar 2,000 orang staf, memimpin usaha ini. Pasukan ini mempunyai pengalaman sebelum ini dalam menskala latihan, sebelum ini melatih model sehingga 175 bilion parameter menggunakan kira-kira 12,000 GPU. ByteDance telah menerbitkan penyelidikan mengenai infrastruktur MegaScale mereka, yang direka untuk mengurus sistem latihan teragih yang melebihi 10,000 GPU.
Fasa pra-pelatihan hanyalah langkah pertama. Selepas pemeriksaan awal, model akan mengalami penyesuaian halus sebelum sebarang pelepasan awam. Pencipta ByteDance, Zhang Yiming, dilaporkan telah mengarahkan pasukan Seed AI untuk fokus pada terobosan teknologi sejati daripada bergantung kepada pengekstrakan daripada sistem AI Barat.
Mengapa ByteDance percaya ia boleh berjaya melakukan ini
ByteDance mempunyai beberapa kelebihan struktur yang menjadikan ini lebih daripada sekadar projek simbolik. Syarikat ini mengendalikan TikTok, yang melayani lebih daripada satu bilion pengguna secara global, dan Doubao, salah satu pembantu AI yang paling banyak digunakan di China. Jejak pengguna ini menghasilkan volum data interaksi yang sangat besar yang boleh membantu membuat keputusan pelatihan dan penyesuaian halus.
Gajah di ruangan itu, tentu saja, adalah sekatan eksport AS terhadap cip AI canggih. Washington telah secara berterusan memperketat kawalan terhadap penjualan GPU Nvidia kelas tinggi dan akselerator lain kepada entiti China. ByteDance tidak telah menerangkan secara awam model GPU spesifik yang dirancang untuk latihan ini, tetapi kemampuan syarikat untuk menghimpun 30,000 unit tersebut menunjukkan ia telah menemui jalan yang boleh dilaksanakan melalui sekatan tersebut.
Lanskap persaingan yang diubah bentuk ini
ByteDance bukanlah satu-satunya makmal AI Cina dengan ambisi besar. Pasukan Qwen Alibaba, Baidu, dan permulaan seperti DeepSeek dan Moonshot AI semuanya telah mendorong sempadan skala model. Tetapi model dengan 10 trilion parameter akan mewakili lompatan besar melebihi apa yang telah diumumkan atau dilaksanakan oleh mana-mana daripada mereka.
Sasaran tersebut juga menempatkan ByteDance dalam perbincangan dengan makmal sempadan Barat. Sistem terkini Anthropic, tolok ukur persaingan yang dilaporkan ingin dicapai oleh ByteDance, mewakili had semasa kemampuan AI yang diketahui awam.
Jendela pra-pelatihan 3 hingga 6 bulan bermaksud hasil, atau komplikasi, boleh mula muncul sebelum akhir 2026.
