Ang Amazon Web Services, ang pinakamalaking provider ng cloud sa mundo, ay naglabas ng mga panloob na direksyon na hinihingi mula sa kanilang mga ekipo ng inhinyeriyo na bawasan ang pagkalansay ng CPU at linisin ang mga hindi sapat na ginagamit na EC2 instances. Ang dahilan ay simpleng: ang pangangailangan para sa compute, na malaki ang tulong mula sa AI workloads, ay mas malaki kaysa sa suplay, at ang mga inhinyero na humihingi ng bagong CPU capacity ay ngayon ay naghihintay ng ilang araw para makakuha nito.
Ano ang tunay na nangyayari sa loob ng AWS
Ang mga direksyon ay nagmula sa mga panloob na pagpupulong noong Mayo, kung saan pinahalagahan ng pamamahala ang pangangailangan na maksimisahin ang umiiral na imprastruktura bago umaasa sa pagdating ng bagong hardware. Binigyan ng mga deadline ang mga inhinyero upang matukoy at bawasan ang mga walang ginagawang EC2 instances, isang kategorya na ayon sa mga ulat ay nagsisilbing humigit-kumulang 65% ng lahat ng aktibong instances na hindi sapat na ginagamit.
Ang optimization playbook na ipinopush ng AWS sa loob ay kasama ang mas mahusay na rightsizing (pagsasalungat ng mga instance type sa tunay na pangangailangan ng workload), automated shutdowns para sa mga hindi aktibong instance, at mas malawakang pagpapabuti ng efficiency sa paraan kung paano tinatapos at pinag-aaralan ng mga team ang mga resource.
Ang maraming araw na pagkaantala para sa bagong kapasidad ng CPU server ang pinakamalinaw na sintomas. Noong nakaraan, gumagana ang AWS may sapat na headroom upang maaaring mabilis na i-spin up ang mga resources ng mga loob na koponan. Kapag lumalawak ang mga timeline ng pagprobisyon mula sa mga oras patungo sa mga araw, mas malapit na ang infrastruktura sa redline kaysa sa anumang gustong nais ng sinuman.
Ang AI ay kumakain ng data center
Hindi lang AWS ang naramdaman ang presyon. Kinilala ng Microsoft Azure at Google Cloud ang mga limitasyon sa kapasidad sa kanilang huling mga ulat sa kikitain, lalo na ang availability ng GPU na naging bottleneck sa buong industriya. Ngunit ang pagiging maikli ng CPU capacity sa AWS ay isang bagong pag-unlad, at nagpapakita na ang presyon ay umiikot sa labas ng mga GPU cluster na kadalasang pinapansin.
Ang Amazon ay nag-iinvest nang malaki sa mga custom silicon, kabilang ang kanilang Graviton processors para sa pangkalahatang compute at Trainium chips para sa AI training, bahagyan upang mabawasan ang pagkakasalalay sa mga panlabas na supplier at bahagyan upang mapabuti ang performance per watt. Ngunit ang mga timeline ng chip fabrication ay nangangahulugan na ang mga investmeng ito ay kailangan ng mga kuartal o taon upang maging deployed capacity.
Ano ang ibig sabihin nito para sa mga customer ng cloud at sa mas malawak na merkado
Para sa mga kumpanya na nagpapatakbo ng mga workload sa AWS, ang pagkakaroon ng presyur sa kapasidad sa loob ng provider ay maaaring makita sa iba’t ibang paraan. Maaaring mas mahirap i-reserve ang ilang uri ng instance sa partikular na rehiyon. Ang presyo ng spot instance, na nagbabago batay sa available na sobrang kapasidad, ay maaaring tumaas habang bumababa ang sobrang kapasidad. Nakapag-adjust na ang AWS sa publikong presyo ng reserved capacities, kabilang ang isang makabuluhang pagtaas ng halos 15% sa lahat ng GPU families noong maagang 2026.
Ang mga enterprise customer na pinakamalaking posibilidad na makaramdam ng epekto ay ang mga nagpapatakbo ng resource-intensive na aplikasyon nang walang komitment sa reserved capacity. Ang mga kumpanya na nakalock ng capacity sa pamamagitan ng savings plans o reserved instances ay medyo nakakapag-iiwas. Ang mga nag-aabang sa on-demand provisioning ay maaaring makaharap sa mga pagkakamali sa availability o magbabayad ng premium pricing sa panahon ng peak demand.
