Di AWS re:Invent 2025, CEO AWS Matt Garman memaparkan satu data penting yang ringkas: inferens AI kini menyumbang kira-kira dua pertiga daripada semua permintaan pengiraan AI. Ia meningkat daripada kira-kira satu pertiga pada tahun 2023.
Latihan ialah mengajar model untuk berfikir. Inferens ialah benar-benar membuatnya berfikir. Industri ini menghabiskan berbilion dolar untuk mengajar model-model ini, dan kini perbelanjaan berpindah kepada menggunakannya.
Garman, yang mengambil alih sebagai CEO AWS pada Jun 2024 selepas menggantikan Adam Selipsky, menggambarkan inferens sebagai “Lego baru” dalam komputasi. Beliau menyatakan bahawa inferens sedang menjadi blok asas yang akan disambungkan oleh perusahaan untuk mengautomasi tugas, menjalankan agen AI, dan mengubah secara mendasar cara operasi perniagaan.
Dia melangkah lebih jauh, meramalkan bahawa 80-90% nilai AI perniagaan akannya datang daripada agen berkuasa inferens. Bukan chatbot yang merumuskan e-mel anda, tetapi sistem autonom yang benar-benar menyelesaikan tugas.
AWS juga menyokong pelaburan ini dengan peranti keras. Syarikat tersebut mempamerkan cip Trainium3 di re:Invent, direka khas untuk beban kerja inferens, bukan GPU yang dioptimakan untuk latihan yang telah mendominasi berita dan laporan keuntungan Nvidia.
Perubahan ini sangat penting bagi sektor penambangan kripto, yang sedang berada di tengah krisis identitas sendiri. Sebagai akibat margin penambangan Bitcoin yang menyempit setelah halving April 2024, beberapa penambang besar beralih ke penyediaan perkhidmatan AI dan komputasi berprestasi tinggi. Syarikat-syarikat seperti Core Scientific, Hut 8, dan lain-lain telah mengubah semula armada GPU dan kapasiti pusat data mereka untuk melayani beban latihan AI.
Tetapi jika Garman betul, dan lengkung permintaan bengkok dengan ketat ke arah inferens, keperluan peranti keras berubah. Pelatihan memerlukan pemprosesan selari besar-besaran di seluruh kumpulan GPU kelas atas yang beroperasi selama berminggu-minggu atau berbulan-bulan. Inferens memerlukan pengoptimuman yang berbeza: latensi yang lebih rendah, throughput yang lebih tinggi setiap permintaan, dan seringkali arsitektur cip yang berbeza sepenuhnya.
Untuk pelabur berasaskan kripto, isyarat di sini berkaitan dengan kesinambungan teksi “pivoting AI” yang telah menyokong beberapa saham penambang. Pantau syarikat penambang yang mengumumkan perkongsian dengan penyedia awan atau melabur dalam peralatan yang dioptimakan untuk inferens. Syarikat yang masih menawarkan akses GPU generik untuk latihan mungkin berada di sisi yang salah bagi lengkung permintaan yang sudah berubah.
Rangkaian komputasi terdesentralisasi seperti Render, Akash, dan io.net telah menempatkan diri mereka sebagai alternatif kepada penyedia awan terpusat untuk beban kerja AI. Jika permintaan inferens meningkat pada kadar yang digambarkan oleh Garman, protokol-protokol ini boleh mengalami peningkatan penggunaan, tetapi hanya jika mereka mampu menawarkan perkhidmatan latensi rendah dan kebolehpercayaan tinggi yang diperlukan oleh inferens. Pelatihan boleh memaafkan gangguan rangkaian. Inferens tidak.





