Por qué están bajando los costos de los tokens de IA: La guerra de precios de los LLM, los agentes de IA y el futuro de la inferencia

Por qué están bajando los costos de los tokens de IA: La guerra de precios de los LLM, los agentes de IA y el futuro de la inferencia

Imagen personalizada
El costo de generar y procesar tokens de modelos de lenguaje grandes ha colapsado a un ritmo que pocas industrias han igualado. A principios de septiembre de 2026, el Índice de Gasto en Tokens de LLM de Silicon Data, un indicador ponderado por el uso de los precios de mercado efectivos, alcanzó un mínimo récord de 97 centavos por millón de tokens, más de la mitad de su pico estival y una fracción de los niveles observados hace solo unos años. Esta caída refleja la intensa competencia entre los laboratorios de vanguardia, el rápido surgimiento de modelos de peso abierto capaces desarrollados por empresas chinas, mejoras en la eficiencia del software y el hardware, y patrones de demanda cambiantes impulsados por agentes de IA.
 
El resultado es un mercado en el que la inferencia de alto volumen se ha vuelto drásticamente más asequible, aunque los flujos de trabajo avanzados de agentes multietapa consumen mucho más tokens que las interacciones de chat simples. La caída en los precios de los tokens se debe principalmente a la presión competitiva y la eficiencia técnica, en lugar de una destrucción pura de la demanda, lo que permite aplicaciones agentes más amplias mientras crea presión sobre los proveedores de modelos y obliga a las empresas a optimizar cuidadosamente el enrutamiento y la selección de modelos.

Precios récord bajos de tokens señalan una competencia creciente en el mercado

El Índice de Gasto en Tokens LLM de Silicon Data, publicado bajo el ticker Bloomberg SDLLMTK, bajó a 0,97 dólares por millón de tokens el 1 de septiembre de 2026, según datos de la empresa y reportes contemporáneos. Esto marcó la lectura más baja desde el lanzamiento del índice y representó una caída de más del 50 por ciento respecto a los picos registrados a principios del verano. Un análisis más amplio mostró que los costos promedio de inferencia cayeron desde aproximadamente 2,04 dólares a finales de mayo de 2026 hasta el rango de 1,16–1,18 dólares a principios de agosto, antes de continuar bajando. Estas cifras capturan los precios efectivos ponderados por uso a través de una mezcla de modelos de vanguardia y abiertos observados mediante plataformas de enrutamiento multi-proveedor, ofreciendo una imagen más clara de lo que realmente paga el mercado que los precios de lista por sí solos.
 
El contexto a largo plazo subraya la magnitud del cambio: el rendimiento de la clase GPT-3.5 que costaba alrededor de 20 dólares por millón de tokens a finales de 2022 ya había caído a aproximadamente 0,07 dólares en octubre de 2024 según el seguimiento de Stanford HAI, con una mayor compresión desde entonces. En muchos casos, los costos ajustados por capacidad han disminuido aún más rápido, con estimaciones de mejoras anuales de 5 a 10 veces en la frontera de precio-rendimiento para ciertos benchmarks. La aceleración reciente coincide con movimientos competitivos específicos, más que con una caída repentina en el uso general de IA. Las empresas y los desarrolladores continúan ampliando el consumo de tokens, sin embargo, el precio combinado pagado sigue bajando a medida que las opciones más económicas capturan cuota de mercado y los proveedores ajustan sus tarifas listadas. Esta dinámica ha hecho que tareas antiguamente costosas y de alto volumen sean más viables, al tiempo que resalta la diferencia entre la economía por unidad y el gasto total.

Los recortes agresivos de precios de GPT-5.6 de OpenAI aceleran la caída

A finales de julio de 2026, OpenAI redujo los precios de su familia GPT-5.6 solo semanas después de su disponibilidad general. La categoría Luna experimentó una reducción del 80 por ciento, llevando los tokens de entrada a 0,20 dólares y los tokens de salida a 1,20 dólares por millón. El modelo Terra de nivel intermedio recibió una reducción del 20 por ciento, a 2 dólares de entrada y 12 dólares de salida. El modelo insignia Sol mantuvo inicialmente su precio de 5/30 antes de una posterior reducción promocional de más del 20 por ciento durante un período de tres meses. Los comunicados de la empresa atribuyeron los cambios en parte a mejoras de eficiencia interna derivadas de los propios modelos, incluyendo una optimización mejorada del código y la eficiencia de servicio. Estos movimientos se produjeron mientras las empresas aumentaban el escrutinio de las facturas de IA y alternativas de menor costo ganaban popularidad.
 
La programación, la revalorización tan pronto después del lanzamiento, señaló una disposición a priorizar el volumen y la posición en el mercado sobre el margen a corto plazo en el tráfico de niveles medios y bajos. Las cargas de trabajo de alto volumen, como clasificación, extracción, enrutamiento y las etapas iniciales de los bucles de agentes, se benefician más, ya que ahora pueden ejecutarse a escala en modelos capaces sin la barrera de costo anterior. Los ajustes posteriores y la introducción de modos más rápidos con precios premium ilustran una estrategia por niveles que mantiene diferenciada la capacidad de vanguardia mientras hace más accesible la inteligencia cotidiana. Los recortes contribuyeron directamente a la compresión observada en los índices de mercado combinados.

Los modelos de código abierto chinos redefinen el piso competitivo

Los desarrolladores chinos han presentado modelos de peso abierto y de bajo costo que reducen significativamente los precios de vanguardia occidentales. Las ofertas de DeepSeek han aparecido con frecuencia entre las opciones más económicas en plataformas de enrutamiento, con ciertas configuraciones históricamente preciadas en los bajos diez centavos por millón de tokens, y las iteraciones posteriores manteniendo tarifas agresivas incluso después de los ajustes para períodos pico y fuera de pico. Los modelos Kimi de Moonshot AI, incluyendo la serie K3, ofrecen otro vector competitivo con precios de lista que, aunque superiores a las opciones abiertas más baratas, aún subestiman muchas ofertas propietarias de nivel medio en términos de rendimiento ajustado en cargas de trabajo específicas.
 
Los informes de mediados de 2026 indicaron que los modelos chinos capturaron una cuota significativa en las plataformas agregadoras, con algunos análisis señalando que los cuatro modelos más populares en un router principal fueron chinos en ciertos momentos del año. Las brechas de capacidad se han reducido en muchas tareas prácticas, como programación, resumen y trabajo de conocimiento general, permitiendo que los usuarios sensibles al costo y las startups desplacen volumen. Esta presión obliga a los proveedores propietarios a responder con sus propios recortes o arriesgarse a perder segmentos de alto volumen. Los pesos abiertos también permiten el autoalojamiento y el alojamiento de terceros a costos efectivos aún más reducidos para organizaciones con capacidad operativa. El efecto acumulativo se refleja en los índices combinados, ya que el uso se desplaza hacia alternativas de menor precio para tareas adecuadas.

Mejoras en la eficiencia del software y servicio que generan presión de precios compuesta

Más allá de la competencia por precios de lista, el progreso técnico ha reducido el costo subyacente de generar cada token. La cuantización, la decodificación especulativa, la mejora en la gestión de la caché KV, el mejor agrupamiento y las optimizaciones específicas del modelo han reducido todos ellos la cantidad de cómputo requerida por token. Los ingenieros de OpenAI discutieron públicamente optimizaciones exclusivamente software a mediados de 2026 que redujeron más de la mitad ciertos costos de inferencia, permitiendo que el tráfico de invitados en ChatGPT se ejecute con una huella de GPU considerablemente más pequeña de lo que sugerían estimaciones anteriores. Los aceleradores personalizados y el co-diseño más cercano entre modelos y hardware continúan aumentando la utilización.
 
Estas ganancias permiten a los proveedores reducir precios mientras protegen o incluso mejoran los márgenes en el tráfico de alto valor restante. Las mejoras en el rendimiento por precio del hardware de aproximadamente 30 por ciento anual y los aumentos en la eficiencia energética cercanos al 40 por ciento, según se señala en análisis industriales relacionados, proporcionan un viento favorable estructural. La combinación significa que, incluso sin presión competitiva, el piso de costos continuaría disminuyendo, aunque más lentamente. Cuando se suma a la competencia de modelos abiertos y respuestas agresivas en precios, el resultado es la rápida compresión observada. Los proveedores que no capturan estas eficiencias corren el riesgo de ser superados con mayor severidad.

Los agentes de IA impulsan volúmenes de tokens más altos a pesar de los costos unitarios más bajos

Aunque el precio por token ha caído bruscamente, el gasto total en inferencia no ha disminuido necesariamente en paralelo. Los sistemas agentes, flujos de trabajo de múltiples pasos que planifican, llaman herramientas, verifican resultados e iteran, consumen significativamente más tokens que las aplicaciones tradicionales de chat o de un solo turno. Los análisis indican que los agentes pueden requerir de 5 a 30 veces más tokens para tareas equivalentes debido a la transmisión repetida de contexto, razonamiento intermedio, salidas de herramientas y bucles de autocorrección. Un agente de codificación que funcione durante una hora podría procesar millones de tokens, mientras que un chatbot simple utiliza decenas de miles.
 
Gartner y otras proyecciones de investigación sugieren que los costos de inferencia para flujos de trabajo agentes podrían aumentar varios veces, incluso mientras los precios unitarios disminuyen, reflejando tanto un mayor volumen como la necesidad frecuente de modelos de razonamiento más potentes. Este patrón recuerda la paradoja de Jevons: una inteligencia más barata amplía el conjunto de usos económicamente viables, aumentando el consumo total. Las empresas que implementan agentes a gran escala enfrentan, por lo tanto, facturas absolutas crecientes a menos que implementen enrutamiento cuidadoso, almacenamiento en caché, cascadas de modelos y optimización de indicaciones. El costo unitario decreciente es precisamente lo que hace factible la implementación a gran escala de agentes; sin él, muchos de estos sistemas seguirían siendo demasiado caros para su uso en producción.

Los costos ajustados por capacidad caen más rápido que los precios nominales de los tokens

Las cifras nominales por token subestiman la mejora real porque los modelos siguen ganando capacidad. Un dólar gastado en 2026 compra tokens más baratos y sistemas más capaces que el mismo dólar comprado años antes. El seguimiento de Stanford HAI y Epoch AI muestra reducciones de costos a niveles de capacidad fijos de aproximadamente 10 veces por año en muchos casos, con mejoras específicas de tareas aún mayores. Los modelos frontera se han vuelto más baratos en generaciones sucesivas, incluso mientras aumenta el rendimiento absoluto.
 
La inteligencia de clase GPT-4, que antes costaba decenas de dólares por millón de tokens, ahora está disponible a una fracción pequeña de ese costo de múltiples proveedores. Por lo tanto, las métricas ajustadas por calidad muestran caídas aún más pronunciadas que el índice principal. Este doble movimiento, precios unitarios más bajos más capacidad creciente, explica por qué las cargas de trabajo de cómputo agente y en tiempo de prueba que eran poco económicas en 2023–2024 se han vuelto rutinarias. Las organizaciones que evalúan el costo total de propiedad deben tener en cuenta ambas dimensiones en lugar de centrarse únicamente en los precios de lista.

Los modelos de peso abierto y la competencia de alojamiento amplían la oferta

La disponibilidad de modelos de peso abierto potentes ha ampliado la oferta efectiva de capacidad de inferencia mucho más allá de los laboratorios propietarios. Los proveedores de nube y los hosts especializados en inferencia pueden ofrecer tarifas competitivas para modelos de la clase Llama, DeepSeek, Qwen y similares sin asumir el costo completo del entrenamiento de vanguardia. Esto crea una restricción competitiva permanente sobre los precios propietarios. Las plataformas de enrutamiento han visto aumentar sustancialmente la cuota de tráfico de código abierto o de peso abierto durante períodos de lanzamientos agresivos de modelos chinos.
 
Las empresas con requisitos de seguridad o residencia de datos que antes evitaban estos modelos están evaluándolos cada vez más para cargas de trabajo no sensibles. La autoalojamiento reduce aún más los costos marginales para las organizaciones que pueden amortizar el hardware y el esfuerzo de ingeniería. El resultado neto es un mercado bifurcado en el que los modelos propietarios de mayor capacidad cobran una prima, mientras que una gran y creciente parte del volumen se migra a alternativas de menor costo. Por lo tanto, los proveedores deben competir tanto en capacidad absoluta como en rendimiento-precio en todo el espectro de la demanda.

Los patrones de gasto empresarial se desplazan hacia la optimización y el enrutamiento

A medida que los precios unitarios disminuyen y los volúmenes de agentes aumentan, los compradores sofisticados han respondido implementando enrutamiento por modelo, cascada, almacenamiento en caché y controles de uso. Empresas de legal-tech y otras firmas especializadas han reportado reducciones de costos múltiples al combinar modelos de prima para pasos críticos con alternativas más económicas para procesamiento rutinario, sin pérdida medible de calidad en sus cargas de trabajo. Los agregadores y pasarelas internas ahora hacen práctico enviar cada solicitud al modelo de menor costo que cumpla con el umbral de calidad requerido.
 
El almacenamiento en caché de indicaciones, el procesamiento por lotes y los modos más lentos no urgentes comprimen aún más los costos efectivos. Algunas organizaciones que agotaron sus presupuestos anuales de IA a principios del año han impuesto límites internos o han optado por modelos de menor nivel. Estas conductas intensifican la presión a la baja sobre los precios de mercado combinados, al tiempo que permiten que la adopción general de la IA siga expandiéndose. Los ganadores en este entorno son los equipos que tratan la selección de modelos y la infraestructura como problemas de optimización continuos, en lugar de como decisiones estáticas de proveedor.

La presión sobre el margen aumenta entre los proveedores del modelo Frontier

Las caídas rápidas de precios generan desafíos claros para las empresas que han invertido mucho en entrenar modelos de vanguardia. Un ingreso por token más bajo por unidad de capacidad puede comprimir la ruta hacia la rentabilidad, incluso mientras crece el uso total. Tanto OpenAI como Anthropic han enfrentado un escrutinio aumentado sobre su poder de fijación de precios y márgenes futuros, particularmente en el contexto de posibles presentaciones ante mercados públicos. Los laboratorios chinos que entrenan con costos y precios reportados más bajos capturan agresivamente volumen que de otro modo apoyaría precios más altos en Occidente.
 
Al mismo tiempo, el cambio hacia cargas de trabajo agentes que favorecen modelos de razonamiento más potentes proporciona cierto contrapeso, ya que esos modelos aún comandan primas significativas. Los proveedores están respondiendo con precios por niveles, reducciones de costos impulsadas por la eficiencia y diferenciación de productos. Si estas estrategias pueden restaurar economías unitarias atractivas mientras defienden cuota de mercado sigue siendo una pregunta abierta que dará forma a la intensidad de capital y la estructura competitiva de la industria en los próximos años.

La economía de hardware e infraestructura continúa evolucionando

Los costos subyacentes de cómputo forman la base del precio de la inferencia. Las mejoras en la utilización de GPU, aceleradores especializados, ancho de banda de memoria y redes contribuyen todos a reducir el costo por token. Los chips personalizados diseñados específicamente para cargas de trabajo de transformadores prometen mayores ganancias una vez que alcancen la producción en masa. Las mejoras en la eficiencia energética reducen los gastos operativos a gran escala. Estas tendencias estructurales respaldan continuas caídas de precios independientemente de la intensidad competitiva.
 
Al mismo tiempo, el enorme capital requerido para construir y operar grandes clusters crea barreras y determina qué empresas pueden competir en la frontera. La interacción entre el progreso del hardware y la optimización del software determinará qué tan rápido continúa bajando el piso de costos y si los modelos de peso abierto pueden cerrar las brechas de capacidad restantes con economías comparables.

El futuro de la inferencia apunta hacia sistemas especializados y en cascada

Mirando hacia adelante, la combinación de costos decrecientes de tokens y creciente complejidad de agentes apunta hacia arquitecturas de inferencia más sofisticadas. Sistemas en cascada que utilicen modelos económicos para filtrado inicial y modelos costosos solo cuando sea necesario, enrutamiento de mezcla de expertos, modelos pequeños especializados para subtareas comunes y almacenamiento en caché avanzado se volverán estándar. Las técnicas de cómputo en tiempo de prueba que intercambian tokens adicionales por mayor confiabilidad se vuelven más atractivas a medida que disminuye el precio de esos tokens.
 
La viabilidad económica de los agentes en segundo plano continuos y la automatización a gran escala se amplía. Las organizaciones que construyan una infraestructura sólida de evaluación, enrutamiento y monitoreo de costos extraerán el mayor valor. La guerra de precios en sí misma es poco probable que termine bruscamente; en cambio, es probable que evolucione hacia una competencia continua a través de niveles de calidad, niveles de latencia y especialización.

Efectos prácticos para desarrolladores y empresas

Los desarrolladores y las empresas ahora operan en un entorno donde el costo marginal de la inteligencia es lo suficientemente bajo como para experimentar de forma agresiva, pero el gasto total aún puede aumentar rápidamente con la implementación de agentes. Las mejores prácticas incluyen la evaluación continua del rendimiento-precio entre proveedores, el uso agresivo de caché y modos por lotes, una ingeniería cuidadosa de prompts para reducir tokens innecesarios y una presupuestación interna clara para cargas de trabajo de agentes.
 
Elegir el modelo adecuado para cada paso de un flujo de trabajo a menudo genera mayores ahorros que negociar descuentos sobre los precios de lista. Monitorear los costos ponderados por uso en lugar de los precios de lista proporciona una imagen más precisa de la economía real. Las empresas que traten la gestión de costos de inferencia como una disciplina de ingeniería fundamental, y no como una consideración posterior, escalarán las aplicaciones de IA de manera más efectiva a medida que el mercado siga evolucionando.

Preguntas frecuentes

¿Cuánto han caído realmente los precios de los tokens de IA en los últimos años?

Los datos a largo plazo de Stanford HAI y los rastreadores relacionados muestran que los costos de inferencia de la clase GPT-3.5 disminuyeron más de 280 veces entre finales de 2022 y finales de 2024, con una mayor compresión hasta 2026. Las medidas ajustadas por capacidad a menudo muestran mejoras anuales aún más pronunciadas de aproximadamente 5 a 10 veces o más en benchmarks específicos. Índices combinados recientes, como el de Silicon Data, alcanzaron mínimos récord cerca de 97 centavos por millón de tokens a principios de septiembre de 2026 tras mayores caídas a lo largo del año.
 

¿Qué causó específicamente la caída pronunciada a mediados y finales de 2026?

Los principales impulsores a corto plazo fueron las reducciones sustanciales de precios de OpenAI en los modelos GPT-5.6 Luna y Terra a finales de julio de 2026, combinadas con precios agresivos continuos y mejoras en capacidad de modelos abiertos chinos, como los de DeepSeek y Moonshot. Estos movimientos desplazaron el uso hacia opciones de menor costo y forzaron ajustes más amplios en el mercado visibles en índices ponderados por uso.
 

¿Significa que los precios de los tokens están cayendo que las facturas totales de IA están disminuyendo?

No necesariamente. Los sistemas agentes consumen mucho más tokens por tarea completada, a menudo de 5 a 30 veces más que las interacciones simples, debido al razonamiento iterativo, el uso de herramientas y la retransmisión del contexto. Muchas organizaciones ven, por lo tanto, aumentar el gasto absoluto incluso cuando el precio por token disminuye, una ilustración clásica de la expansión del uso tras la caída de los costos.
 

¿Cómo se comparan los modelos chinos en precio y capacidad?

Los modelos chinos de código abierto y API suelen ofrecer precios significativamente más bajos que los modelos occidentales de vanguardia en cargas de trabajo comparables, con algunas configuraciones históricamente disponibles por menos de un dólar por millón de tokens, y las ofertas posteriores manteniéndose altamente competitivas. La capacidad ha mejorado rápidamente en tareas prácticas, lo que ha llevado a ganancias medibles de cuota en plataformas de enrutamiento, aunque aún existen diferencias en los benchmarks de razonamiento de máxima gama y especializados.
 

¿Qué papel juegan las mejoras en la eficiencia en comparación con la competencia pura por precios?

Ambos son importantes. Las optimizaciones de software, como una cuantización mejorada, la decodificación especulativa y las técnicas de servicio, han reducido el costo real de producir tokens, permitiendo a los proveedores reducir precios mientras protegen los márgenes. Los avances en hardware refuerzan esta tendencia. La presión competitiva de los modelos abiertos y otros laboratorios rivales acelera la transformación de estas eficiencias en precios más bajos y precios de mercado efectivos.
 

¿Deberían las empresas cambiar completamente a los modelos más económicos disponibles?

Raramente. El enfoque óptimo suele ser la enrutamiento selectivo: utilizar modelos de menor costo para pasos de alto volumen y baja relevancia, y reservar modelos más potentes para razonamiento crítico o tareas con alto costo por error. Muchas organizaciones logran ahorros sustanciales mediante selección basada en cascadas y evaluación sin sacrificar la calidad general de la salida.

🔥 KuCoin ofrece una opción más estable en un mercado volátil

Si te preocupan los frecuentes altibajos del mercado y buscas una opción más estable para ganar dinero de forma pasiva, KuCoin es el lugar adecuado para venir:
 
Imagen personalizada
 
Simple Earn: Deposita y retira tokens en cualquier momento, obteniendo rendimientos estables.
KuCoin Earn: Gana beneficios estables con gestión profesional de activos.
Hold to Earn: Gana recompensas al mantener activos en Cuentas de Financiación, Operaciones, Margen, Futuros, Minería y Cuenta Unificada.
Staking: Desbloquea el potencial de ganancias de los activos en cadena.
Inversiones avanzadas: Las inversiones avanzadas ofrecen una variedad de productos estructurados para ayudar a que tu dinero crezca en cualquier mercado.
Shark Fin: Protección del principal y ganancias garantizadas
Inversión dual: Compra a bajo precio y vende a alto, con cálculos de rendimiento transparentes.
Bola de nieve: Rendimientos altos, con protección de precio.
Compra con descuento: Compra criptomonedas a precios con descuento.
KCS Loyalty: Sube de nivel para disfrutar de beneficios exclusivos al hacer staking de al menos 1 KCS.
KuCoin Wealth: Descubre el valor futuro y comienza tu viaje de inversión inteligente.
Beneficios de KCS: Mantén y stakea KCS para acceder a beneficios en toda la plataforma.
KCS Staking 2.0: Participa en la gobernanza en cadena de KCS para obtener rendimiento.

Descargo de responsabilidad: Este contenido tiene fines informativos únicamente y no constituye asesoramiento de inversión. Las inversiones en criptomonedas conllevan riesgos. Por favor, realiza tu propia investigación (DYOR).
 

Aviso: Esta página fue traducida utilizando tecnología de IA para tu conveniencia. Para obtener la información más precisa, consulta la versión original en inglés.