Ibinabahagi ng ByteDance na handa na ito na mag-pre-train ng isang AI model na may halos 10 trilyon na parameter, isang sukat na lalampas sa lahat ng kilalang Chinese AI system at ilalagay ang kumpanya sa direktaan na kompetisyon sa mga pinakamalalim na Western lab. Ang pagsisikap na ito ay nangangailangan ng halos 30,000 na GPU at isang inaasahang 3 hanggang 6 na buwan ng tuloy-tuloy na pre-training.
Upang maipaliwanag ang 10 trilyon na parameter, mas malaki ito ng higit sa tatlong beses kaysa sa Moonshot AI’s Kimi K3 na may 2.8 trilyon na parameter at kasalukuyang nasa listahan ng pinakamalalaking modelo na nilikha sa China. Ang mga parameter ay ang mga panao na tinutukoy ng isang AI model habang nagtatrabaho upang matutunan ang mga pattern sa data.
Ano talaga ang binubuo ng ByteDance
Ang modelo na ito ay gumagamit ng arkitekturang Mixture of Experts (MoE). Sa halip na i-activate ang bawat parameter para sa bawat query, ang mga modelo na MoE ay nagr-routes sa bawat input sa isang subset ng mga espesyalisadong “expert” na sub-network. Ito ang nagiging sanhi ng mas malaking efficiency sa pagpapatakbo nito sa inference time kumpara sa isang dense model na may parehong kabuuang laki.
Ang Seed AI team ng ByteDance, na rito ay mayroong halos 2,000 mga empleyado, ang nangunguna sa pagsisikap. May karanasan na ang team sa pag-scales ng mga training run, kung saan dati nilang tinraining ang mga model na may hanggang 175 bilyon na parameter gamit ang halos 12,000 na GPUs. Ang ByteDance ay nag-publish ng pananaliksik tungkol sa kanilang MegaScale infrastructure, na disenyo upang pamahalaan ang mga distributed training system na hihigit sa 10,000 na GPUs.
Ang pre-training phase ay kailangang maging unang hakbang. Pagkatapos ng unang pagpapatakbo, ang modelo ay magiging pagsasabay-bay bago anumang posibleng pampublikong paglabas. Ayon sa mga ulat, pinadala ni Zhang Yiming, ang tagapagtatag ng ByteDance, ang Seed AI team na mag-focus sa totoong teknolohikal na pagbubukas kaysa mag-asa sa distillation mula sa mga Western AI systems.
Bakit naniniwala ang ByteDance na kayang gawin ito
May ilang estruktural na kalamangan ang ByteDance na ginagawa itong higit pa sa isang proyektong pang-impresyon. Nagpapatakbo ang kumpanya ng TikTok, na naglilingkod sa higit sa isang bilyon na gumagamit sa buong mundo, at Doubao, isa sa mga pinakamalawak na ginagamit na AI assistant sa China. Ang malaking consumer footprint na ito ay nagpapagawa ng napakalaking dami ng data sa interaksyon na maaaring magbigay-daan sa mga desisyon sa pag-train at pag-fine-tune.
Ang malaking elepante sa silid, natural lang, ay ang mga pagtigil sa pag-export ng US sa mga advanced AI chip. Pinapalakas ng Washington ang mga kontrol sa pagbebenta ng mga high-end Nvidia GPU at iba pang accelerators sa mga Chinese entity. Hindi pa nagbigay ng detalye ang ByteDance kung anong mga partikular na GPU model ang plano nilang gamitin para sa training na ito, ngunit ang kakayahan ng kumpanya na makalikom ng 30,000 dito ay nagpapakita na mayroon silang maaaring paraan upang lumampas sa mga pagtigil.
Ang kompetitibong landscape na binabago nito
Hindi lang ang ByteDance ang Chinese AI lab na may malalaking pangarap. Ang Qwen team ng Alibaba, Baidu, at mga startup tulad ng DeepSeek at Moonshot AI ay lahat ay nagpapalawak sa hangganan ng sukat ng modelo. Ngunit ang isang 10 trilyon parameter na modelo ay magiging malaking paglalakbay kaysa sa anumang kanilang pampublikong inanunsyo o ipinadeploy.
Ang layunin ay naglalagay din si ByteDance sa usapan kasama ang mga Western frontier labs. Ang pinakabagong mga sistema ni Anthropic, ang kompetitibong benchmark na sinasabing hinahabol ni ByteDance, ay kumakatawan sa kasalukuyang hangganan ng kilalang kapasidad ng AI.
Ang 3 hanggang 6 na buwang pre-training window ay nangangahulugan na ang mga resulta, o komplikasyon, ay maaaring magsimula na lumabas bago ang katapusan ng 2026.
