ByteDance Merancang Model AI 10 Triliun Parameter Menggunakan 30,000 GPU

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
ByteDance sedang melakukan pra-pelatihan model AI dengan 10 triliun parameter menggunakan sekitar 30,000 GPU, melampaui sistem AI Cina yang ada. Pasukan Seed AI, yang sebelumnya membina model dengan 175 bilion parameter, menggunakan arsitektur Mixture of Experts (MoE). Pra-pelatihan akan mengambil masa 3 hingga 6 bulan, diikuti dengan penyesuaian halus. Sementara itu, BTC terus bertindak sebagai pelindung terhadap inflasi di tengah perubahan makroekonomi global. Peraturan CFT juga semakin mendapat perhatian dalam sektor pembangunan AI.

ByteDance dilaporkan sedang bersiap untuk pra-latih model AI dengan sekitar 10 trilion parameter, skala yang akan melebihi semua sistem AI Cina yang diketahui dan menempatkan syarikat itu dalam persaingan langsung dengan makmal Barat yang paling canggih. Usaha ini memerlukan kira-kira 30,000 GPU dan anggaran 3 hingga 6 bulan pra-latihan berterusan.

Untuk memberikan gambaran mengenai 10 trilion parameter, jumlah ini lebih daripada tiga kali ganda saiz Kimi K3 daripada Moonshot AI, yang berada pada 2.8 trilion parameter dan kini berada di antara model terbesar yang dihasilkan di China. Parameter pada dasarnya ialah tombol yang disetel oleh model AI semasa latihan untuk mempelajari corak dalam data.

Apa yang sebenarnya dibina oleh ByteDance

Model yang dimaksud menggunakan arsitektur Mixture of Experts (MoE). Alih-alih mengaktifkan setiap parameter untuk setiap permintaan, model MoE mengarahkan setiap input ke subset sub-jaringan "pakar" khusus. Ini membuatnya jauh lebih efisien dijalankan pada waktu inferensi dibandingkan model padat dengan ukuran total yang sama.

Iklan

Pasukan Seed AI ByteDance, yang dilaporkan terdiri daripada sekitar 2,000 orang staf, memimpin usaha ini. Pasukan ini mempunyai pengalaman sebelum ini dalam menskala latihan, sebelum ini melatih model sehingga 175 bilion parameter menggunakan kira-kira 12,000 GPU. ByteDance telah menerbitkan penyelidikan mengenai infrastruktur MegaScale mereka, yang direka untuk mengurus sistem latihan teragih yang melebihi 10,000 GPU.

Fasa pra-pelatihan hanyalah langkah pertama. Selepas pemeriksaan awal, model akan mengalami penyesuaian halus sebelum sebarang pelepasan awam. Pencipta ByteDance, Zhang Yiming, dilaporkan telah mengarahkan pasukan Seed AI untuk fokus pada terobosan teknologi sejati daripada bergantung kepada pengekstrakan daripada sistem AI Barat.

Mengapa ByteDance percaya ia boleh berjaya melakukan ini

ByteDance mempunyai beberapa kelebihan struktur yang menjadikan ini lebih daripada sekadar projek simbolik. Syarikat ini mengendalikan TikTok, yang melayani lebih daripada satu bilion pengguna secara global, dan Doubao, salah satu pembantu AI yang paling banyak digunakan di China. Jejak pengguna ini menghasilkan volum data interaksi yang sangat besar yang boleh membantu membuat keputusan pelatihan dan penyesuaian halus.

Gajah di ruangan itu, tentu saja, adalah sekatan eksport AS terhadap cip AI canggih. Washington telah secara berterusan memperketat kawalan terhadap penjualan GPU Nvidia kelas tinggi dan akselerator lain kepada entiti China. ByteDance tidak telah menerangkan secara awam model GPU spesifik yang dirancang untuk latihan ini, tetapi kemampuan syarikat untuk menghimpun 30,000 unit tersebut menunjukkan ia telah menemui jalan yang boleh dilaksanakan melalui sekatan tersebut.

Lanskap persaingan yang diubah bentuk ini

ByteDance bukanlah satu-satunya makmal AI Cina dengan ambisi besar. Pasukan Qwen Alibaba, Baidu, dan permulaan seperti DeepSeek dan Moonshot AI semuanya telah mendorong sempadan skala model. Tetapi model dengan 10 trilion parameter akan mewakili lompatan besar melebihi apa yang telah diumumkan atau dilaksanakan oleh mana-mana daripada mereka.

Sasaran tersebut juga menempatkan ByteDance dalam perbincangan dengan makmal sempadan Barat. Sistem terkini Anthropic, tolok ukur persaingan yang dilaporkan ingin dicapai oleh ByteDance, mewakili had semasa kemampuan AI yang diketahui awam.

Jendela pra-pelatihan 3 hingga 6 bulan bermaksud hasil, atau komplikasi, boleh mula muncul sebelum akhir 2026.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.