Iplan ng ByteDance ang 10-trilyong-parameter na AI model gamit ang 30,000 na GPU

iconCryptoBriefing
I-share
AI summary iconSummary
Ang ByteDance ay nagsasagawa ng pre-training sa isang 10 trilyong parameter na AI model gamit ang halos 30,000 na GPUs, na lumalampas sa mga umiiral na Chinese AI system. Ang Seed AI team, na dating nagbuo ng isang 175 bilyong parameter na model, ay gumagamit ng Mixture of Experts (MoE) architecture. Ang pre-training ay magtatagal ng 3 hanggang 6 na buwan, kasunod ng fine-tuning. Samantala, patuloy na nagiging hedge ang BTC laban sa inflation sa gitna ng mga global na makroekonomikong pagbabago. Dumadami rin ang pagtanggap sa CFT regulations sa mga sektor ng AI development.

Ibinabahagi ng ByteDance na handa na ito na mag-pre-train ng isang AI model na may halos 10 trilyon na parameter, isang sukat na lalampas sa lahat ng kilalang Chinese AI system at ilalagay ang kumpanya sa direktaan na kompetisyon sa mga pinakamalalim na Western lab. Ang pagsisikap na ito ay nangangailangan ng halos 30,000 na GPU at isang inaasahang 3 hanggang 6 na buwan ng tuloy-tuloy na pre-training.

Upang maipaliwanag ang 10 trilyon na parameter, mas malaki ito ng higit sa tatlong beses kaysa sa Moonshot AI’s Kimi K3 na may 2.8 trilyon na parameter at kasalukuyang nasa listahan ng pinakamalalaking modelo na nilikha sa China. Ang mga parameter ay ang mga panao na tinutukoy ng isang AI model habang nagtatrabaho upang matutunan ang mga pattern sa data.

Ano talaga ang binubuo ng ByteDance

Ang modelo na ito ay gumagamit ng arkitekturang Mixture of Experts (MoE). Sa halip na i-activate ang bawat parameter para sa bawat query, ang mga modelo na MoE ay nagr-routes sa bawat input sa isang subset ng mga espesyalisadong “expert” na sub-network. Ito ang nagiging sanhi ng mas malaking efficiency sa pagpapatakbo nito sa inference time kumpara sa isang dense model na may parehong kabuuang laki.

Paghahayag

Ang Seed AI team ng ByteDance, na rito ay mayroong halos 2,000 mga empleyado, ang nangunguna sa pagsisikap. May karanasan na ang team sa pag-scales ng mga training run, kung saan dati nilang tinraining ang mga model na may hanggang 175 bilyon na parameter gamit ang halos 12,000 na GPUs. Ang ByteDance ay nag-publish ng pananaliksik tungkol sa kanilang MegaScale infrastructure, na disenyo upang pamahalaan ang mga distributed training system na hihigit sa 10,000 na GPUs.

Ang pre-training phase ay kailangang maging unang hakbang. Pagkatapos ng unang pagpapatakbo, ang modelo ay magiging pagsasabay-bay bago anumang posibleng pampublikong paglabas. Ayon sa mga ulat, pinadala ni Zhang Yiming, ang tagapagtatag ng ByteDance, ang Seed AI team na mag-focus sa totoong teknolohikal na pagbubukas kaysa mag-asa sa distillation mula sa mga Western AI systems.

Bakit naniniwala ang ByteDance na kayang gawin ito

May ilang estruktural na kalamangan ang ByteDance na ginagawa itong higit pa sa isang proyektong pang-impresyon. Nagpapatakbo ang kumpanya ng TikTok, na naglilingkod sa higit sa isang bilyon na gumagamit sa buong mundo, at Doubao, isa sa mga pinakamalawak na ginagamit na AI assistant sa China. Ang malaking consumer footprint na ito ay nagpapagawa ng napakalaking dami ng data sa interaksyon na maaaring magbigay-daan sa mga desisyon sa pag-train at pag-fine-tune.

Ang malaking elepante sa silid, natural lang, ay ang mga pagtigil sa pag-export ng US sa mga advanced AI chip. Pinapalakas ng Washington ang mga kontrol sa pagbebenta ng mga high-end Nvidia GPU at iba pang accelerators sa mga Chinese entity. Hindi pa nagbigay ng detalye ang ByteDance kung anong mga partikular na GPU model ang plano nilang gamitin para sa training na ito, ngunit ang kakayahan ng kumpanya na makalikom ng 30,000 dito ay nagpapakita na mayroon silang maaaring paraan upang lumampas sa mga pagtigil.

Ang kompetitibong landscape na binabago nito

Hindi lang ang ByteDance ang Chinese AI lab na may malalaking pangarap. Ang Qwen team ng Alibaba, Baidu, at mga startup tulad ng DeepSeek at Moonshot AI ay lahat ay nagpapalawak sa hangganan ng sukat ng modelo. Ngunit ang isang 10 trilyon parameter na modelo ay magiging malaking paglalakbay kaysa sa anumang kanilang pampublikong inanunsyo o ipinadeploy.

Ang layunin ay naglalagay din si ByteDance sa usapan kasama ang mga Western frontier labs. Ang pinakabagong mga sistema ni Anthropic, ang kompetitibong benchmark na sinasabing hinahabol ni ByteDance, ay kumakatawan sa kasalukuyang hangganan ng kilalang kapasidad ng AI.

Ang 3 hanggang 6 na buwang pre-training window ay nangangahulugan na ang mga resulta, o komplikasyon, ay maaaring magsimula na lumabas bago ang katapusan ng 2026.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.