Ang AI inference market ay tahimik na binabago mula sa ilalim. Dalawang decentralized platform, ang Chutes at Surplus Intelligence, ay kumukuha ng lalong maraming bahagi ng onchain inference requests sa pamamagitan ng isang simpleng bagay na nagpapakita ng pagkakamali: ginagawang mas mura ang pagpapatakbo ng AI models.
Ang Chutes, na binuo sa Subnet 64 ng Bittensor, ay nakaproseso ng higit sa 34 trilyon na token kumulatibo, na may araw-araw na peak na hihigit sa 120 bilyon na token. Ang Surplus Intelligence, na ipinakilala lamang dalawang buwan ang nakalipas, ay nakapag-spikes na sa 2.5 milyon na kahilingan at 107 bilyon na input token. Kasama nila, ito ay nagpapakita ng lumalaking teorya na ang mga sentralisadong AI provider ay sobrang tatawagin para sa isang komodidad na compute.
Paano naging default ang Chutes
Ipinakilala ang Chutes sa publiko noong huling bahagi ng Enero 2025 bilang isang decentralized, serverless inference platform. Ang mga independiyenteng miner na may karagdagang graphics cards ay naglalathala ng open-source AI models ayon sa pangangailangan, at ang mga user ay nagbabayad batay sa bawat token na prosesado.
Ang presyo ang nagpapakita ng kuwento. Ang Chutes ay nag-uugnay ng maliit na bahagi ng sentimo sa bawat milyong token para sa ilang mga modelo, isang maliit na bahagi ng ano ang karaniwang hinihingi ng mga sentralisadong alternatibo para sa katumbas na workload.
Pagkatapos magsimula ang monetisasyon pagkatapos ng paglunsad, tumataas ang araw-araw na token throughput patungo sa 120 bilyon na numero. Gumagamit ang platform ng permissionless GPU miners na sinusuri batay sa kapasidad, bilis, at availability, at gumagawa ng isang kompetitibong merkado kung saan ang pinakamahusay na hardware ang nananatili sa higit pang mga trabaho.
Sinisiguro ang seguridad sa pamamagitan ng Trusted Execution Environments, o TEEs. Ito ay mga hardware-level na isolation zones na nagpapanatili ng privacy ng data kahit mula sa mga miner na nagproseso nito. Ang hardware verification ay tumatakbo sa isang teknolohiya na tinatawag na GraVal, na nagpapatotoo na ang mga miner ay talagang gumagamit ng mga GPU na sinasabing ginagamit nila.
Lahat ng pagkakasundo ay nangyayari onchain sa USDC, walang mga siklo ng invoice o mga termino ng pagbabayad.
Dalawang buwang pagsabog ng Surplus Intelligence
Ipinakilala ng Surplus Intelligence noong huling bahagi ng Mayo 2026 bilang isang marketplace para sa hindi ginagamit na AI inference capacity, isang order book kung saan tumutokoy ang mga bumibili at nagbebenta ng compute.
Sa huling bahagi ng Mayo 2026, inilahad ng Surplus ang 47,000 na mga kahilingan at 1.7 bilyon na mga input token. Sa huling bahagi ng Hulyo 2026, tumabas ang mga numero sa 2.5 milyon na mga kahilingan at 107 bilyon na mga token—tumataas nang halos 50 beses sa loob ng dalawang buwan.
Ang Surplus ay nagrereport ng savings ng 40-60% kumpara sa tradisyonal na inference providers. Ang marketplace model ay nagpapahintulot sa dynamic price discovery, kaya ang mga presyo ay nag-aadjust batay sa tunay na suplay at demand. Tulad ng Chutes, ang Surplus ay nagsettle sa USDC onchain.
Ang pagkakaiba ng dalawang platform ay ang kanilang pagkakaroon ng pagkakasunod-sunod sa suplay. Ang Chutes ay nagtatanggap ng GPU miners sa isang permissionless network na iskore ng performance metrics. Ang Surplus naman ay gumagana tulad ng isang secondary market, na nag-uugnay sa mga entidad na may sobrang inference capacity sa mga nangangailangan nito.
Ano ang ibig sabihin nito para sa merkado ng AI compute
Para sa Bittensor ecosystem, ang position ni Chutes sa Subnet 64 ay nagpapatibay sa utility narrative ng TAO. Kapag isang subnet ay nagproseso ng 120 bilyon na token araw-araw, ang token economics ay naging nakabatay sa tunay na throughput kaysa sa spekulasyon tungkol sa pagtanggap sa hinaharap.
Ang panganib sa decentralized infrastructure ay ang reliability. Ang centralized providers ay nag-aalok ng SLA, dedikadong suporta, at garantisadong uptime. Ang permissionless miner networks ay nag-aalok ng mas mababang presyo at censorship resistance, ngunit ang pag-offline ng isang miner sa gitna ng inference ay iba’t ibang uri ng pagkabigo kaysa sa pag-down ng isang AWS region.
Ang mga platapormang ito ay karamihan ay naglilingkod sa mga open-source na modelo. Kung ang iyong workload ay nangangailangan ng proprietary na frontier models mula sa OpenAI o Anthropic, ang decentralized inference ay hindi pa isang opsyon.

