Thị trường suy luận AI đang lặng lẽ được tái cấu trúc từ phía dưới. Hai nền tảng phi tập trung, Chutes và Surplus Intelligence, đang thu hút ngày càng nhiều yêu cầu suy luận trên chuỗi bằng cách thực hiện một điều tưởng chừng đơn giản: làm giảm chi phí chạy các mô hình AI.
Chutes, được xây dựng trên Subnet 64 của Bittensor, đã xử lý hơn 34 nghìn tỷ token tích lũy, với đỉnh điểm hàng ngày vượt quá 120 tỷ token. Surplus Intelligence, vừa ra mắt cách đây hai tháng, đã tăng vọt lên 2,5 triệu yêu cầu và 107 tỷ token đầu vào. Cùng nhau, chúng đại diện cho một luận điểm ngày càng phát triển rằng các nhà cung cấp AI tập trung đang thu phí quá cao cho những gì về cơ bản là năng lực tính toán thông thường.
Cách Chutes trở thành mặc định
Chutes được phát hành công khai vào cuối tháng 1 năm 2025 như một nền tảng suy luận phi tập trung không máy chủ. Các thợ đào độc lập với card đồ họa dư thừa cung cấp các mô hình AI mã nguồn mở theo yêu cầu, và người dùng trả phí theo từng token được xử lý.
Giá cả nói lên tất cả. Chutes tính phí vài xu ở mức số có một chữ số cho mỗi triệu token đối với một số mô hình, chỉ là một phần nhỏ so với những gì các giải pháp tập trung thường yêu cầu cho các khối lượng công việc tương đương.
Sau khi việc kiếm tiền được kích hoạt sau khi ra mắt, lưu lượng token hàng ngày đã tăng lên mức 120 tỷ. Nền tảng sử dụng các thợ khai thác GPU không cần phép, được đánh giá dựa trên dung lượng, tốc độ và khả năng sẵn sàng, tạo ra một thị trường cạnh tranh nơi phần cứng hoạt động tốt nhất sẽ nhận được nhiều công việc hơn.
Bảo mật được xử lý thông qua Các Môi trường Thực thi Tin cậy, hay TEE. Đây là các vùng cô lập cấp phần cứng giúp giữ dữ liệu riêng tư ngay cả với những thợ đào đang xử lý nó. Việc xác minh phần cứng được thực hiện thông qua công nghệ gọi là GraVal, xác nhận rằng các thợ đào thực sự đang chạy các GPU mà họ tuyên bố đang sử dụng.
Tất cả các khoản thanh toán đều được thực hiện trên chuỗi bằng USDC, không có chu kỳ hóa đơn hoặc điều khoản thanh toán.
Hai tháng bùng nổ của Surplus Intelligence
Surplus Intelligence ra mắt vào cuối tháng 5 năm 2026 như một thị trường cho công suất suy luận AI chưa được sử dụng, một sổ lệnh nơi người mua và người bán tính toán gặp gỡ trực tiếp.
Vào cuối tháng 5 năm 2026, Surplus đã xử lý 47.000 yêu cầu và 1,7 tỷ token đầu vào. Đến cuối tháng 7 năm 2026, những con số này đã tăng lên 2,5 triệu yêu cầu và 107 tỷ token — tăng khoảng 50 lần trong hai tháng.
Surplus báo cáo rằng người dùng tiết kiệm được 40-60% so với các nhà cung cấp suy luận truyền thống. Mô hình thị trường cho phép phát hiện giá động, nghĩa là giá điều chỉnh dựa trên cung và cầu thực tế. Giống như Chutes, Surplus thanh toán bằng USDC trên chuỗi.
Điểm khác biệt giữa hai nền tảng là cách tiếp cận đối với nguồn cung. Chutes thu hút các thợ khai thác GPU vào một mạng lưới không cần phép, được đánh giá dựa trên các chỉ số hiệu suất. Surplus hoạt động giống như một thị trường thứ cấp, kết nối các thực thể có dư thừa năng lực suy luận với những người cần nó.
Điều này có nghĩa gì đối với thị trường tính toán AI
Đối với hệ sinh thái Bittensor cụ thể, vị thế của Chutes trên Subnet 64 củng cố câu chuyện về tính hữu dụng của TAO. Khi một subnet đang xử lý 120 tỷ token mỗi ngày, kinh tế token trở nên dựa trên lưu lượng thực tế thay vì sự đồn đoán về sự chấp nhận trong tương lai.
Rủi ro với cơ sở hạ tầng phi tập trung là độ tin cậy. Các nhà cung cấp tập trung cung cấp SLA, hỗ trợ chuyên biệt và thời gian hoạt động được đảm bảo. Các mạng thợ khai thác không cần phép cho giá thấp hơn và khả năng chống kiểm duyệt, nhưng việc một thợ khai thác bị offline giữa chừng trong quá trình suy luận là một kiểu lỗi khác với việc một khu vực AWS bị ngừng hoạt động.
Các nền tảng này cũng chủ yếu phục vụ các mô hình mã nguồn mở. Nếu công việc của bạn yêu cầu các mô hình tiên tiến sở hữu bởi OpenAI hoặc Anthropic, thì việc suy luận phi tập trung chưa khả thi.

