Ginawa ang pampublikong paglalathala na ginamit ng GPT-6 Astra ang higit sa 100,000 na Grace Blackwell GPU para sa pagtatrain, na nangangahulugan na ang kompetisyon sa mga unang modelo ay nasa panahon na ng sobrang malalaking cluster.May-akda ng artikulo, pinagkukunan: ME News

TL;DR:
- Ginawa ang pampublikong paglalathala na ginamit ng GPT-6 Astra ang higit sa 100,000 na Grace Blackwell GPU para sa pagtatrain, na nangangahulugan na ang kompetisyon sa mga unang modelo ay nasa panahon na ng sobrang malalaking cluster.
- Hindi walang malaking computing power ang mga pangunahing kompanya ng model sa Tsina, ngunit ipinapakita ng mga pampublikong impormasyon na mayroon pa ring malinaw na pagkakaiba sa mga avanzadong henerasyon ng GPU at sa sukat ng isang beses na pag-deploy.
- Ang mga pagtatayo ng computing power ng mga kumpanya tulad ng ByteDance, Kimi, at DeepSeek ay patuloy na lumalawak, ngunit kasalukuyang mas nakatuon sa mga arkitekturang Hopper o lokal na alternatibo, at mayroon pa ring kalayuan mula sa mga cluster na Blackwell-level.
- Ang susi sa kompetisyon sa AI ay nagsalikway mula sa “may GPU ba” patungo sa “kakayahan na makakuha ng pinakabagong henerasyon ng GPU at epektibong organisahin ang libu-libo hanggang daan-daang libo ng chip.”
- Kahit na hindi na ang Blackwell ang pinakabagong arkitektura ng NVIDIA, ang patuloy na pagbaba ng gastos sa pag-train ng Rubin ay nangangahulugan na ang malaking pagkakaiba ay maaaring patuloy na magkonsentrado sa kakayahan sa infrastruktura.
Sa likod ng 100,000 na Blackwell, pumasok na ang kompetisyon sa malalaking modelo sa panahon ng infrastraktura ng computing power
Noong ipinakita ni Huang Renxun ang laki ng pagsasanay ng GPT-6 Astra, ang pagmamasid ng labas ay hindi lamang ang numero na “100,000 na GPU,” kundi ang uri ng bagong paradigm sa kompetisyon sa AI na kinakatawan nito.
Sa mga nakaraang taon, ang kompetisyon sa malalaking modelo ay karaniwang binabatay sa pagkakaroon ng kakayahan sa algoritmo, data, at inhinyeriya. Ang pag-inobatiba sa arkitektura ng modelo, ang pagpapabuti sa paraan ng pag-train, at ang pagpapabuti sa efficiency ng pag-interpret ay talagang nagpasya sa huling kakayahan ng mga produkto sa AI. Ngunit mula noong 2026, isang lalong malinaw na trend ang umuusbong: kapag patuloy na lumalaki ang laki ng mga modelo, ang kakayahan sa imprastruktura mismo ay naging mahalagang salik sa pagtukoy sa hangganan ng teknolohiya.
Ayon sa pampublikong pagpapahayag ni Huang Renxun, ang pag-train ng GPT-6 Astra ay gumamit ng higit sa 100,000 na Grace Blackwell GPU, na pinag-uugnay sa isang mabilis na network sa pamamagitan ng NVLink72. Sinabi rin niya na ang susunod na batch ay may 400,000 na GPU na papanoorin, ngunit hindi isinagawa ang pagpapahayag ng partikular na modelo at pagkakakilanlan.
Anuman ang mga detalye ng susunod na pagpapalawak, malinaw ang signal na ibinibigay ng impormasyong ito: ang pagtatrain ng pinakamataas na antas ng mga modelo, ay nagpapalit mula sa kompetisyon ng mga parametrong ilang trilyon at libo-libong GPU, patungo sa kompetisyon ng mga cluster ng mga advanced na GPU na may sukat na ilang libo hanggang sampung libo.
Hindi lamang ang dami ang mahalaga dito.
Kung titingnan lang ang bilang ng GPU, hindi ganap na walang malalaking mapagkukunan ng computing power ang mga Chinese company. Ang totoong pagkakaiba ay kung makakakuha ba sila ng pinakabagong henerasyon ng high-performance GPU, at kung makakapagbigay ba sila ng mataas na efisyensiya sa pagkakasundo ng mga GPU sa iisang training task.
Para sa mga malalaking modelo, ang peak performance ng isang GPU ay simpleng base. Ang pag-train ng isang malaking modelo ay nangangailangan ng patuloy na pagbabago ng mga parameter at data sa pagitan ng maraming GPU. Kung ang efficiency ng pag-uugnay ay hindi sapat, kahit mayroon kang maraming chip, hindi ito makakabuo ng epektibong computing power.
Kaya ang kompetisyon sa AI infrastructure ay nagsulong mula sa “ilang mga card ang bibilhin” patungo sa “paano itatayo ang computing system”.
Ang pagkakasunod-sunod ng computing power ng mga kumpanyang modelong lider sa Tsina ay may pagkakaiba sa henerasyon kumpara sa Blackwell era.
Ang kasalukuyang publikong impormasyon ay nagpapakita na ang computing power ng mga pangunahing model company sa Tsina ay mabilis na umuunlad, ngunit may malinaw na pagkakaiba kumpara sa Blackwell-class training cluster na kinakatawan ng GPT-6 Astra.
Ang ByteDance ay isa sa mga kompanya sa loob ng bansa na pinakamalapit sa antas ng mga lider sa mundo sa pagpapalaganap ng computing power. Sa taong ito, ang ByteDance ay nakapag-access ng higit sa 36,000 na B200 GPU sa Malaysia. Ang mga chip na ito ay bahagi ng Blackwell architecture ng NVIDIA at kabilang sa parehong henerasyon kasama ang GB200 na ginagamit ng Astra.
Gayon, mahalagang tandaan na ang mga B200 na ito ay ipinapalabas sa labas ng bansa. Habang ang ByteDance ay pormal na ipinapakita ang mga AI infrastructure sa loob ng Tsina, ang pangunahing ginagamit ay ang H20 na Chinese-specific version na may Hopper architecture, pati na rin ang mga chip tulad ng H800 na nakakuha na dati.
Hindi ito simpleng pagkakaiba sa dami, kundi pagkakaiba sa supply chain at deployment environment.
Ang Blackwell ay may pagpapabuti sa kapasidad ng pagkalkula, memorya ng video, at kakayahan sa pag-uugnay kumpara sa Hopper. Lalo na ang GB200, na hindi lamang isang GPU kundi isang pagkakaisa ng Grace CPU at Blackwell GPU, na pinag-uugnay sa pamamagitan ng NVL72 system upang i-connect ang 72 mga GPU sa isang parehong mataas na bilis na koneksyon na domain.
Para sa pag-train ng malalaking modelo, ang kahalagahan ng ganitong uri ng disenyo sa sistema ay patuloy na lumalaki. Dahil mas malaki ang modelo, mas mataas ang proporsyon ng komunikasyon sa pagitan ng mga GPU, at ang kakayahan ng mga chip na magtrabaho nang epektibo ay direktang nakakaapekto sa efficiency ng pag-train.
Ipinakita rin na ang Moonlight Shadow sa likod ng Kimi ay nakakuha ng higit sa 20,000 mga Hopper GPU sa pamamagitan ng Alibaba. Ayon sa Bloomberg, ang partikular na modelo ay H200, ngunit tinanggihan ng Alibaba ang pagkakaroon ng modelo na H200.
Kung batay sa H200, ito ay kabilang pa sa nakaraang henerasyon ng Hopper architecture, samantalang ang B200 ay nasa panahon na ng Blackwell. Hindi ito simpleng pagbabago mula sa lumang bagong bersyon, kundi nagpapakita ng iba’t ibang yugto ng kakayahan sa AI infrastructure.
Mas espesyal ang sitwasyon ng DeepSeek.
Ang DeepSeek ay nag-ambil ng global na atensyon noong unang bahagi ng 2025 dahil sa mataas na epektibong modelo, at ang kanilang teknikal na landas ay nagpatunay na ang pag-optimize ng algorithm at pagpapahusay ng inhinyeriya ay maaaring bahagya ring bawasan ang pangangailangan sa computing power. Gayunpaman, batay sa mga pampublikong impormasyon, ang kumpanya ay hindi naglathala ng kompletong mga kagamitan sa pag-train para sa V4.
Ang transkripsyon ng pagpupulong ng mga investor ni Liang Wenfeng ay nagpapakita na ang kompanya ay may halos 20,000 H-equivalent na computing power noong Mayo, kung saan ang karamihan ay bago lang dumating, at ang mga susunod na pagbili ay “lubos na NVIDIA.” Ang 950 na kapasidad na ibinigay ng Huawei sa DeepSeek ay humigit-kumulang 16,000 unit. Sinabi ni Liang Wenfeng na ang mga lokal na kartang ito ay katumbas ng humigit-kumulang 4,000 NVIDIA B-series, na sapat lamang para sa pag-train ng kasalukuyang henerasyon ng model.
Ang mga impormasyong ito ay nagpapakita ng isang katotohanan: bagaman ang mga Chinese na kumpanya ay may malaking dami ng AI computing power, mayroon pa rin silang pagkakaiba sa sukat kumpara sa isang pag-train na gawain na gumagamit ng 100,000 parehong henerasyon na advanced GPU.
Totoo ngang ang tunay na kahinaan ng China sa AI computing power ay hindi ang kakulangan ng chip, kundi ang kakulangan ng advanced clustering capability
Sa pag-uusap tungkol sa Chinese AI computing power, madalas maging bahagi ng dalawang extremo.
Isang pananaw ay nagsasabing kumpleto ang kakulangan ng China sa mga advanced AI chip, kaya hindi makakapag-ambag sa kompetisyon; samantalang ang ibang pananaw ay nagsasabing kahit anong dami ng lokal na chip, maaari itong mabilis na matapos ang NVIDIA.
Sa totoo lang, mas kumplikado ang sitwasyon.
Ang kakayahan sa pag-train ng AI ay tinukoy ng maraming bahagi, kabilang ang performance ng chip, advanced process, kapasidad ng video memory, high-speed interconnection, disenyo ng server, pagpapagana ng data center, software ecosystem, at kakayahan sa malawakang pag-schedule.
Ang GPU ay ang pinakamahalagang bahagi lamang, hindi lahat.
Hindi lamang mula sa GPU hardware ang matagal nang itinatag na kahusayan ni NVIDIA, kundi mula sa CUDA ecosystem, teknolohiya ng network connectivity, mga solusyon sa server, at ang buong sistema na nabuo kasama ang mga provider ng cloud computing.
Sa panahon ng Blackwell, mas pinakalakas ang mga katangiang ito ng sistema.
Kapag kailangan ng isang pagtatrabaho sa pagtratrabaho ng modelo ang 100,000 na GPU, ang problema ay hindi na kung paano bibilhin ang ilang libo libong chip, kundi kung paano itayo ang isang malaking factory ng kompyutasyon na kayang magtrabaho nang tama.
Ito rin ang dahilan kung bakit ang mga pampublikong impormasyon ay hindi pa naglalathala ng anumang kaso kung saan ang isang Chinese company ay gumamit ng 100,000 parehong henerasyon na advanced GPU para sa isang pag-train ng model.
Ang mga Chinese company ay nagpapalakas ng kanilang kakayahan sa pamamagitan ng iba't ibang paraan, kabilang ang pagpapalaki ng pag-deploy ng computing power sa abroad, pagpapalawak ng pagkakasya ng lokal na chip, pagpapabuti ng arkitektura ng model, at pagpapataas ng efficiency sa pag-train. Ang lahat ng mga landas na ito ay may halaga, ngunit mahirap itong palitan ang pangunahing kakayahan na dala ng pinakamataas na antas na GPU cluster sa maikling panahon.
Sa mga nakalipas na taon, patunay ng Chinese AI industry na ang pagkakaroon ng algoritmo ay maaaring makapagpaliit nang malaki sa ilang pagkakaiba.
Ang pagkakaroon ng mga kumpanya tulad ng DeepSeek ay nagpapakita na ang mga mahusay na koponan ng inhinyero ay maaaring makamit ang isang pagbubukas sa pamamagitan ng pag-optimize ng istruktura ng modelo, pag-adjust ng mga estratehiya sa pagtuturo, at pagpapabuti ng efisiyensiya sa paggamit ng mga yunit sa ilalim ng limitadong computing power.
Ngunit isa pang katotohanan ay umiiral: habang ang pandaigdigang kompetisyon ay pumapasok sa susunod na henerasyon ng mga pangunahing modelo, ang kahalagahan ng laki ng computing power ay patuloy na lalala.
Ang pagpapabuti ng efisensya ay maaaring mabawasan ang gastos, ngunit mahirap lubos na baguhin ang mga hangganan ng kakayahan na dala ng mga advanced na hardware at malalaking cluster.
Pagkatapos ng Blackwell, maaaring paigtingin ng Rubinstein era ang pagkakaiba sa imprastruktura
Mas mahalaga na tandaan na ang Blackwell ay hindi ang katapusan ng kasalukuyang teknolohiya ng NVIDIA.
Ang susunod na henerasyon ng NVIDIA, ang Vera Rubin architecture, ay nasa pagsasagawa na. Ayon sa pampublikong pagtataya ng NVIDIA, sa pag-train ng malalaking MoE models, ang bilang ng GPU na kailangan ng Rubin ay maaaring bawasan sa halos isang-kapat ng bilang ng Blackwell.
Ito ay nangangahulugan na magkakaroon ng isang bagong siklo sa pagtatampok ng AI sa hinaharap.
Ang mga lider sa industriya ay may mga pinakabagong arkitektura, kaya sila ay makakapag-train ng mas malalaking modelo gamit ang mas kaunting chip; ang mas mababang gastos sa pag-train ay nagpapadali sa mga kompanya na gawin ang mas maraming eksperimento, na nagpapalakas pa ng kakayahan ng modelo.
Kung ang mga kompanya na nasa likod ay kailangan lamang magamit ang nakaraang henerasyon ng hardware, maaaring makaharap sila sa dalawang problema: isa, mababa ang efficiency sa pag-train, at dalawa, mahirap makilahok sa kompetisyon ng pinakamalalaking modelo.
Hindi ibig sabihin nito na walang pagkakataon ang mga Chinese AI company.
Patunay na marami nang beses sa kasaysayan ng AI na ang kompetisyon sa teknolohiya ay hindi ganap na tinukoy ng isang uri ng hardware. Ang pag-inobatiba ng modelo, mga aplikasyon, kakayahan sa komersyalisasyon, at efisyensiya sa inhinyeriya ay maaaring magdulot ng mga bagong pagbubukas.
Ngunit kung tingnan mula sa pananaw ng imprastruktura, ang pangyayaring gumagamit ang GPT-6 Astra ng 100,000 na Blackwell GPU ay tunay na ipinapakita ang isang pagbabago na nangyayari: ang pangunahing harapan ng pandaigdigang kompetisyon sa AI ay patuloy na lumilipat mula sa antas ng modelo patungo sa antas ng imprastruktura ng computing power.
Sa mga susunod na taon, ang hindi lamang kakayahan na train ang isang mahusay na model ang magdedesisyon sa kompetitibong kakayahan ng isang AI company, kundi ang kakayahan na magtatag ng patuloy na pag-train sa susunod na henerasyon ng mga model.
Para sa industriya ng AI sa Tsina, ang tunay na kailangang abutin ay hindi isang partikular na modelo o isang partikular na pagpapahayag, kundi ang buong sistema ng kakayahan mula sa pagkuha ng chip, pagtatayo ng data center, pag-schedule ng cluster, hanggang sa software ecosystem.
Ang kahalagahan ng 100,000 na Blackwell ay hindi nasa paglikha ng isang nakakagulat na numero, kundi sa pagpapalabas sa merkado: ang artificial intelligence ay pumasok na sa yugto ng industriyalisasyon, at ang huling pagtataya sa industriyalisasyong kompetisyon ay ang infrastraktura.
Sanggunian:
- Official NVIDIA materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
- Mga impormasyon tungkol sa pampublikong talakayan at mga interbyu ng Huang Renxun.
- Ang Bloomberg tungkol sa pagbili ng computing power ni Kimi at mga ulat kaugnay ng H200.
- Ang mga ipinahayag na impormasyon ng ByteDance tungkol sa AI infrastructure at deployment ng computing power sa abroad.
- Mga pampublikong impormasyon ng DeepSeek at transkripsyon ng mga talakayan sa mga investor ni Liang Wenfeng.
- Mga pampublikong impormasyon ng Alibaba Cloud tungkol sa pagkakasundo sa infrastruktura ng AI at kapasidad ng pagkalkula para sa malalaking modelo.
