El mercado de inferencia de IA está siendo silenciosamente reconfigurado desde abajo. Dos plataformas descentralizadas, Chutes y Surplus Intelligence, están captando una parte creciente de las solicitudes de inferencia en cadena al hacer algo aparentemente sencillo: reducir el costo de ejecutar modelos de IA.
Chutes, construido en el Subnet 64 de Bittensor, ha procesado más de 34 billones de tokens en total, con picos diarios que superan los 120 mil millones de tokens. Surplus Intelligence, que se lanzó hace solo dos meses, ya ha alcanzado 2,5 millones de solicitudes y 107 mil millones de tokens de entrada. Juntos, representan una tesis creciente: los proveedores centralizados de IA cobran demasiado por lo que, en esencia, es cómputo commodity.
Cómo Chutes se convirtió en el predeterminado
Los chutes se lanzaron públicamente a finales de enero de 2025 como una plataforma descentralizada de inferencia sin servidor. Mineros independientes con tarjetas gráficas sobrantes sirven modelos de IA de código abierto bajo demanda, y los usuarios pagan por cada token procesado.
El precio lo dice todo. Chutes cobra centavos de un solo dígito por millón de tokens para ciertos modelos, una fracción de lo que suelen cobrar las alternativas centralizadas para cargas de trabajo equivalentes.
Después de que se activara la monetización tras el lanzamiento, el volumen diario de tokens aumentó hasta alcanzar esa cifra de 120 mil millones. La plataforma utiliza mineros GPU sin permiso, que son evaluados según capacidad, velocidad y disponibilidad, creando un mercado competitivo donde el hardware de mejor rendimiento obtiene más trabajos.
La seguridad se gestiona a través de Entornos de Ejecución Confiables, o TEEs. Estas son zonas de aislamiento a nivel de hardware que mantienen los datos privados incluso de los mineros que los procesan. La verificación de hardware se realiza mediante una tecnología llamada GraVal, que confirma que los mineros realmente están ejecutando las GPUs que afirman estar utilizando.
Todos los asentamientos ocurren en la cadena en USDC, sin ciclos de facturación ni plazos de pago.
Los dos meses explosivos de Surplus Intelligence
Surplus Intelligence se estrenó a finales de mayo de 2026 como un mercado para la capacidad de inferencia de IA no utilizada, un libro de órdenes donde los compradores y vendedores de cómputo se encuentran directamente.
A finales de mayo de 2026, Surplus gestionó 47.000 solicitudes y 1,7 mil millones de tokens de entrada. Para finales de julio de 2026, esas cifras habían aumentado a 2,5 millones de solicitudes y 107 mil millones de tokens, aproximadamente un aumento de 50 veces en dos meses.
Surplus informa que los ahorros del usuario son del 40-60% en comparación con proveedores tradicionales de inferencia. El modelo de mercado permite la descubrimiento dinámico de precios, lo que significa que los precios se ajustan según la oferta y la demanda reales. Al igual que Chutes, Surplus liquida en USDC en la cadena.
La diferencia entre las dos plataformas radica en su enfoque hacia la oferta. Chutes recluta mineros GPU en una red sin permisos evaluada según métricas de rendimiento. Surplus opera más como un mercado secundario, conectando entidades que tienen capacidad de inferencia excedente con quienes la necesitan.
Qué significa esto para el mercado de cómputo de IA
Para el ecosistema de Bittensor específicamente, la posición de Chutes sobre el Subnet 64 refuerza la narrativa de utilidad de TAO. Cuando un subnet procesa 120 mil millones de tokens diariamente, la economía del token se fundamenta en un rendimiento real en lugar de especulaciones sobre la adopción futura.
El riesgo con la infraestructura descentralizada es la confiabilidad. Los proveedores centralizados ofrecen SLA, soporte dedicado y tiempo de actividad garantizado. Las redes de mineros sin permiso ofrecen precios más bajos y resistencia a la censura, pero que un minero se desconecte durante la inferencia es un modo de falla diferente al de que una región de AWS se caiga.
Estas plataformas también sirven principalmente modelos de código abierto. Si su carga de trabajo requiere modelos frontera propietarios de OpenAI o Anthropic, la inferencia descentralizada aún no es una opción.

