Sa AWS re:Invent 2025, ang CEO ng AWS na si Matt Garman ay ipinakita ang isang simplengunit mahalagang datos: ang AI inference ay kasalukuyang nagtatampok ng halos dalawang-kalahati ng lahat ng demand sa AI compute. Ito ay tumaas mula sa halos isang-kalahati noong 2023.
Ang pagtuturo ay ang pagtuturo sa isang modelo na mag-isip. Ang inference ay ang paggawa nito na mag-isip. Ang industriya ay nag-spent ng milyon-milyon sa pagtuturo sa mga modelo na ito, at ngayon ay umuusbong ang pagkakaspend patungo sa paggamit sa kanila.
Si Garman, na naging CEO ng AWS noong Hunyo 2024 pagkatapos magsuksok kay Adam Selipsky, ay naglarawan ng inference bilang “isang bagong Lego” sa computing. Sinasabi niya na ang inference ay nagsisiging maging pangunahing bahagi na gagamitin ng mga negosyo upang awtomatikuhin ang mga gawain, patakbuhin ang mga AI agent, at magbago nang fundamental sa paraan ng pagpapatakbo ng mga negosyo.
Lumikha siya ng higit pa, at inaasahan na 80-90% ng halaga ng enterprise AI ay mabubuo sa mga agent na nagpapagana sa inference. Hindi ang mga chatbot na nagpapaliwanag ng iyong mga email, kundi ang mga autonomous system na talagang natatapos ang mga gawain.
Ang AWS ay naglalagay din ng hardware para sa pagtitiwala na ito. Ipakita ng kumpanya ang kanilang mga chip na Trainium3 sa re:Invent, na disenyo nang espesyal para sa inference workloads kesa sa mga GPU na optimized para sa training na naging pangunahing balita at mga ulat ng kita ni Nvidia.
Mahalaga ang pagbabagong ito para sa sektor ng crypto mining, na nasa gitna ng sariling krisis ng pagkakakilanlan. Habang nagmaliit ang margin ng Bitcoin mining pagkatapos ng halving noong Abril 2024, ilang malalaking miner ay umiikot patungo sa pagtataguyod ng mga serbisyo sa AI at high-performance computing. Ang mga kumpanya tulad ng Core Scientific, Hut 8, at iba pa ay nagpapalit ng kanilang mga GPU fleet at kapasidad ng data center upang sirain ang mga AI training workload.
Ngunit kung tama si Garman, at ang kurba ng demand ay umuukol nang malakas patungo sa inference, nagbabago ang mga kinakailangang hardware. Ang pagtuturo ay nangangailangan ng malaking parallel processing sa mga cluster ng mga GPU ng pinakamataas na antas na gumagana ng ilang linggo o buwan. Ang inference naman ay nangangailangan ng iba’t ibang optimisasyon: mas mababang latency, mas mataas na throughput bawat query, at madalas ay iba’t ibang arkitektura ng chip.
Para sa mga investor na native sa cryptocurrency, ang signal dito ay tungkol sa pagkakaroon ng katatagan ng teorya ng “AI pivot” na nagtustos sa ilang mga stock ng mining. Panatilihin ang pagmamasid kung aling mga kompanya ng mining ang magpapahayag ng mga pakikipagtulungan sa mga cloud provider o mag-invest sa inference-optimized na hardware. Ang mga kompanyang patuloy na nagpapakita ng generic GPU access para sa training ay maaaring makakatagpo sa maling panig ng isang demand curve na nangyari na ang pagbabago.
Ang mga decentralized compute networks tulad ng Render, Akash, at io.net ay nagpapahiwatig na sila ay mga alternatiba sa mga sentralisadong cloud provider para sa AI workloads. Kung tumataas ang demand sa inference sa rate na ilarawan ni Garman, maaaring makaranas ng pagtaas sa paggamit ang mga protokol na ito, ngunit lamang kung kayang magbigay sila ng serbisyo na may mababang latency at mataas na reliability na kailangan ng inference. Ang training ay mapapagkakatiwalaan kahit may mga problema sa network. Hindi naman ang inference.





