Tại AWS re:Invent 2025, CEO của AWS Matt Garman đã đưa ra một dữ liệu đơn giản nhưng quan trọng: inference AI hiện chiếm khoảng hai phần ba tổng nhu cầu tính toán AI. Con số này tăng từ khoảng một phần ba vào năm 2023.
Huấn luyện là việc dạy mô hình suy nghĩ. Suy luận mới là thực sự khiến nó suy nghĩ. Ngành công nghiệp đã chi hàng tỷ đô la để dạy các mô hình này, và hiện nay chi tiêu đang chuyển hướng sang việc tận dụng chúng.
Garman, người kế nhiệm Adam Selipsky và trở thành CEO của AWS vào tháng 6 năm 2024, đã mô tả inference là “một mảnh Lego mới” trong lĩnh vực máy tính. Ông cho rằng inference đang trở thành một khối xây dựng cơ bản mà các doanh nghiệp sẽ ghép nối lại để tự động hóa các tác vụ, chạy các tác nhân AI và thay đổi căn bản cách thức hoạt động của doanh nghiệp.
Anh ấy còn đi xa hơn khi dự đoán rằng 80-90% giá trị AI doanh nghiệp sẽ cuối cùng đến từ các tác nhân được thúc đẩy bởi suy luận—không phải các chatbot tóm tắt email của bạn, mà là các hệ thống tự chủ thực sự hoàn thành các nhiệm vụ.
AWS cũng đang đầu tư phần cứng vào khoản cược này. Công ty đã trình diễn các chip Trainium3 tại re:Invent, được thiết kế đặc biệt cho các tác vụ suy luận, thay vì các GPU tối ưu hóa đào tạo đã thống trị các tin tức và báo cáo lợi nhuận của Nvidia.
Sự chuyển dịch này cực kỳ quan trọng đối với ngành khai thác tiền điện tử, vốn đang ở giữa cuộc khủng hoảng nhận diện của chính mình. Khi biên lợi nhuận khai thác bitcoin thu hẹp sau đợt halving tháng 4 năm 2024, một số nhà khai thác lớn đã chuyển hướng sang cung cấp các dịch vụ AI và tính toán hiệu năng cao. Các công ty như Core Scientific, Hut 8 và những công ty khác đã tái mục đích đội ngũ GPU và năng lực trung tâm dữ liệu của họ để phục vụ các công việc đào tạo AI.
Nhưng nếu Garman đúng và đường cầu đang uốn cong mạnh về phía suy luận, thì yêu cầu phần cứng sẽ thay đổi. Việc huấn luyện đòi hỏi xử lý song song quy mô lớn trên các cụm GPU hàng đầu chạy trong vài tuần hoặc vài tháng. Suy luận cần tối ưu hóa khác biệt: độ trễ thấp hơn, thông lượng cao hơn mỗi truy vấn, và thường là các kiến trúc chip hoàn toàn khác nhau.
Đối với các nhà đầu tư thuần crypto, tín hiệu ở đây là về tính bền vững của luận điểm “chuyển hướng sang AI” đã hỗ trợ nhiều cổ phiếu khai thác. Theo dõi xem những công ty khai thác nào công bố hợp tác với các nhà cung cấp đám mây hoặc đầu tư vào phần cứng tối ưu hóa suy luận. Những công ty vẫn tiếp tục quảng bá việc truy cập GPU chung cho việc huấn luyện có thể đang đứng về phía sai của đường cầu đã thay đổi.
Các mạng tính toán phi tập trung như Render, Akash và io.net đã tự định vị mình là các lựa chọn thay thế cho các nhà cung cấp đám mây tập trung trong các tác vụ AI. Nếu nhu cầu suy luận đang tăng trưởng với tốc độ mà Garman mô tả, các giao thức này có thể chứng kiến mức độ sử dụng tăng lên, nhưng chỉ khi chúng có thể cung cấp dịch vụ độ trễ thấp và độ tin cậy cao mà suy luận yêu cầu. Việc huấn luyện có thể dung thứ cho những gián đoạn mạng. Suy luận thì không.





