Aunque los grandes modelos de IA nacionales superan a Estados Unidos en volumen de consultas durante nueve semanas, su costo real en escenarios de programación intensiva supera ampliamente el paquete de GPT Codex. Zhipu registró pérdidas superiores a 3.000 millones de yuanes en 2025, y paquetes como Kimi tienen cuotas limitadas y restricciones de tráfico durante horas pico. La causa principal es la insuficiencia de la infraestructura de cómputo china (449 centros de datos frente a 5.427 en Estados Unidos), lo que impide ofrecer paquetes de alto rendimiento y bajo costo similares a Codex. Actualmente, los desarrolladores deben equilibrar rendimiento, precio y estabilidad; los modelos nacionales solo se acercan a los modelos internacionales de élite en algunos indicadores de rendimiento y siguen enfrentando la dificultad de ser bien valorados pero poco adoptados.Autor y fuente del artículo: FunTalk
En el último mes, el mundo de la IA en Silicon Valley ha lanzado una serie de innovaciones: GPT-5.6, fable5 y Grok-4.5 han aparecido consecutivamente.
Durante un tiempo, la comunidad de desarrolladores y programadores locales se entusiasmó enormemente, con discusiones y evaluaciones sobre modelos avanzados como GPT-5.6 que surgieron una tras otra.
Aunque este mes también ha surgido un nuevo modelo nacional como Kimi-K3, en general, los grandes modelos nacionales siguen estando en una situación de “muy bien valorados pero poco adoptados” entre la comunidad de desarrolladores principales.

Según los datos más recientes, en términos de uso: los datos de OpenRouter del 22 al 28 de junio muestran que los modelos chinos alcanzaron un volumen semanal de 20,39 billones de tokens, mientras que los modelos estadounidenses alcanzaron 4,25 billones; los primeros llevan nueve semanas consecutivas liderando.
Sin embargo, en contraste, el desempeño en ingresos de las seis "unicornios" de IA en China no ha sido muy alentador: según los estados financieros públicos, Zhipu generó ingresos de 724 millones de yuanes en 2025, pero registró pérdidas de más de 3.000 millones de yuanes; MiniMax obtuvo 79 millones de dólares estadounidenses (aproximadamente 570 millones de yuanes); las otras cuatro empresas, como Moonshot, aún no han divulgado sus ingresos anuales completos.
Incluso las empresas líderes mantienen sus ingresos en el rango de miles de millones de yuanes.
En comparación, Anthropic, una empresa líder en IA, ya ha alcanzado un ARR de aproximadamente 60.000 a 70.000 millones de dólares, impulsado principalmente por API B2B y escenarios de codificación con IA.
Esto plantea inevitablemente una pregunta aguda:
¿Por qué los modelos nacionales, que se promocionan como "baratos" y con "alto volumen de uso", aún no logran popularidad y siguen siendo incapaces de competir directamente con los modelos líderes extranjeros en escenarios de alto valor como la codificación de IA?
Recientemente, tras profundizar en esta cuestión con varios desarrolladores de primera línea, descubrí un hecho muy contraintuitivo:
Los modelos grandes nacionales son, en cierta medida, realmente "caros".
Precisamente por este "costo elevado", ciertos modelos nacionales que han logrado avances en rendimiento tienen dificultades para mostrar plenamente sus puntos fuertes.
01 La ilusión de "bajo precio"
Cuando se mencionan los grandes modelos nacionales, mucha gente piensa en representantes como DeepSeek o Kimi, y uno de los etiquetas más asociadas con ellos es el bajo precio y la economía;
Si se considera únicamente el precio por token, los modelos nacionales tienen una ventaja significativa en comparación con modelos de élite como GPT-5.6 y Fable 5. Por ejemplo, GLM-5.2 cuesta $1.4/$4.4 por millón de tokens de entrada/salida, mientras que DeepSeek-V4-Pro cuesta $0.435/$0.87; GPT-5.6 Sol cuesta $5/$30, y Claude Fable 5 cuesta $10/$50.
Pero en realidad, esta impresión de “bajo precio” es un error prolongado de los ajenos al sector.
En escenarios de programación intensiva, el precio unitario de los grandes modelos nacionales no solo no tiene ventaja, sino que incluso es varias veces más caro que GPT y Claude con paquetes.
Li Guang (nombre ficticio) es un investigador en el campo de la IA que, debido a las necesidades de su trabajo, consume miles de millones de tokens diariamente en escenarios de AI Coding. Con este nivel de consumo, utilizar modelos locales como GLM-5.2 haría que el costo total fuera extremadamente elevado.

El estado de cuenta de Token mostrado por Li Guang
El día de la conversación, los tokens consumidos por Li Guang se acercaron a 4 mil millones. Si se utiliza GLM-5.2, el costo aproximado es: (86,39 millones de entradas normales × 1,4 dólares + 3,380 millones de entradas en caché × 0,26 dólares + 19,06 millones de salidas e inferencia × 4,4 dólares) ≈ 1.084 dólares. Al tipo de cambio de 1 dólar = 7,2 yuanes chinos, equivale aproximadamente a 7.800 yuanes chinos.
La razón por la que Li Guang puede gastar tantos Token libremente es porque contrató el paquete CodeX de GPT,
Aquí se explica brevemente la forma concreta del paquete CodeX: en términos sencillos, es un paquete diseñado para escenarios de programación; estrictamente hablando, no es ilimitado, sino que incorpora Codex en la suscripción de ChatGPT: Plus cuesta 20 dólares/mes, Pro comienza en 100 dólares/mes, con un límite aproximadamente 5 o 20 veces mayor que Plus; después de agotar el límite, se pueden comprar Créditos para seguir utilizando el servicio.
Del mismo modo, Claude Code de Anthropic ofrece un conjunto similar de planes: Claude Pro cuesta 20 dólares/mes, Max 5x y Max 20x cuestan 100 y 200 dólares/mes respectivamente; el límite de 5 horas y semanal en la versión web de Claude y Claude Code se comparte, y tras agotarlo, se puede continuar utilizando según los precios de la API.
Under this package structure, the massive Token cost is effectively offset.
Para los desarrolladores en el país, consumir miles de millones o incluso decenas de miles de millones de tokens al día en escenarios de AI Coding de alta intensidad es una norma muy común.
Xiao Liu también es un desarrollador intensivo de AI Coding; gasta realmente 300 yuanes chinos por semana en Codex, incluso sin reembolso de la empresa.
Pero incluso con este costo, sigue siendo mucho más barato en comparación con los modelos nacionales, ya que con los mismos 300 yuanes no se pueden comprar la misma cantidad de tokens que GLM 5.2.

La factura de tokens de Xiao Liu
Para los desarrolladores en China, el paquete Codex de GPT es actualmente el token más barato que se puede comprar, mucho más económico que Qwen o Kimi. Esto puede parecer contraintuitivo, pero la realidad es que los modelos nacionales no pueden competir en relación calidad-precio en escenarios de codificación intensiva.
Hay que aclarar que Codex no es un plan ilimitado en el sentido estricto; si se considera el plan más alto de 200 dólares, el límite semanal es aproximadamente de 2 mil millones.
Sin embargo, debido a que algunos desarrolladores utilizan modelos a través de "estaciones intermedias" u otros métodos, el costo real de ciertos modelos es mucho más bajo que el de los canales oficiales, lo que permite a veces comprar más tokens a precios más bajos, dando lugar al fenómeno de poder comprar 12.000 millones de tokens con 300 yuanes.
De hecho, los modelos nacionales no han lanzado paquetes similares, pero si se analiza con detalle, estos paquetes presentan limitaciones significativas en cuanto a los límites en comparación con Codex.
02 El dolor de la fijación de precios nacional
La situación actual de los grandes modelos nacionales en términos de precios se puede describir con una sola frase:
Pensaste que entrabas a un buffet, pero al final te diste cuenta de que el comerciante aún cobra por peso.
Por ejemplo, en cuanto a los planes, en China, Kimi y GLM-5.2: Kimi Code ofrecen cuatro niveles de precios: 49, 99, 199 y 699 yuanes, con cuotas que se reinician semanalmente; el Plan de Codificación GLM Lite, Pro y Max ofrecen aproximadamente 80, 400 y 1600 prompts cada 5 horas, o alrededor de 400, 2000 y 8000 prompts por semana, y durante las horas pico de GLM-5.2, el consumo se multiplica por tres.
Tomando como ejemplo Qoder de Alibaba, según el relato de un amigo del autor que se dedica al soporte de clientes B, llamado Ami (nombre ficticio): “Qoder era anteriormente el mejor IDE de IA de China, pero su nuevo modelo de precios eliminó esa ventaja.”
En cuanto a los planes: Qoder CN Personal Pro y Pro+ cuestan 59 y 169 yuanes/mes, respectivamente, e incluyen 2000 y 6000 créditos; las versiones Teams y VPC cuestan 99 y 199 yuanes por puesto/mes, ambas incluyen 3000 créditos, y la versión VPC se vende a partir de 50 puestos.
Después de que este año fusionaron Lingma y ajustaron los precios, según lo que sé, al menos veinte o treinta empresas decidieron no renovar sus suscripciones.
Según las pruebas de Ami, el plan Qoder Enterprise Edition 199 se agota en tres días según su uso; si se utiliza como un desarrollador intensivo, probablemente se agote en un día.
Igualmente, en cuanto a los paquetes, GLM-5.2 también ha generado sentimientos encontrados entre los usuarios nacionales.
Según la desarrolladora Xiao Wei: "Los paquetes de GLM-5.2 son prácticamente inútiles; incluso si los hay, aún hay limitación de tráfico durante las horas pico, y además ocurren casos de 'traición' a los usuarios."
Según el informe de 36Kr: los paquetes de GLM-5.2 antes eran más difíciles de conseguir que entradas para conciertos; se actualizaban exactamente a las 10:00 de la mañana todos los días, y si podías conseguir uno dependía completamente de tu rapidez.
En enero de 2026, Zhipu anunció que, debido a la escasez de capacidad de cómputo, redujo directamente la cantidad diaria disponible para la venta al 20% del original, liberando un pequeño lote cada mañana a las 10:00, que se agotaba en minutos.
En última instancia, la escasez de los modelos nacionales en cuanto a paquetes y precios es esencialmente una consecuencia de la falta de capacidad de cómputo.
Según los datos de 2025 del Instituto de Comunicaciones de China y el Ministerio de Industria y Tecnología de la Información, China tiene 449 centros de datos activos, mientras que Estados Unidos tiene 5.427. En cuanto a la capacidad total de cómputo, China cuenta con 1.053 EFLOPS, mientras que Estados Unidos tiene 2.400.
Pero lo clave aquí es que, en los 2,400 EFLOPS de Estados Unidos, la proporción de GPU de gama alta es muy alta; en la capacidad de cómputo de China, gran parte son chips nacionales como Huawei Ascend y Cambricon, cuyo rendimiento por tarjeta aún tiene una brecha generacional con respecto al H100.
Para hacer frente a la creciente demanda de poder de cómputo, a partir de marzo de 2026, Zhipu, Alibaba Cloud, Tencent Cloud y Baidu aumentaron colectivamente los precios de los tokens, con incrementos que variaron entre un 5 % y un 460 %.
En resumen, el “bajo precio” y la “guerra de precios” de los modelos nacionales ya son cosa del pasado.
No es que los modelos nacionales no quieran hacer buffet; es porque hicimos los cálculos: con los costos actuales de cómputo y el estado de pérdidas, ofrecer un plan mensual equivale a apostar con una tarifa fija mensual a que los usuarios no agoten el sistema. Dado el uso de desarrolladores y programadores en China, que a menudo gastan decenas o incluso cientos de miles de millones de tokens al día, este modelo de negocio se verá rápidamente superado por los costos.
Mientras tanto, los paquetes de programación de OpenAI y Anthropic se dirigen a clientes corporativos de alto patrimonio: clientes importantes como Cursor y GitHub Copilot pueden generar ingresos de 1.400 millones de dólares anuales para Anthropic.
Con el apoyo de alta potencia de cálculo, este modelo de negocio intercambia una "tarifa mensual fija" por "fidelización a largo plazo", con clientes de alta calidad y un ARPU relativamente alto, lo que permite distribuir bien los costos.
En comparación, aunque en el país hay gigantes de la nube como Alibaba, el problema es que el EBITA ajustado de Alibaba Cloud para el ejercicio fiscal 2026 es solo del 7,5%; aunque el grupo de inteligencia en la nube experimenta un rápido crecimiento de ingresos, sus ganancias no son muy altas.
Además, los proveedores tradicionales de nube se atreven a vender "servidores en la nube ilimitados" porque los usuarios no operan a plena carga las 24 horas. Un servidor ECS puede tener una utilización real de CPU de solo el 10%, lo que permite a los proveedores de nube vender excesivamente una máquina física a diez personas.
Pero la inferencia de modelos grandes es diferente: cada token que se genera requiere un consumo real de potencia de cálculo de la GPU. Si un usuario realiza solicitudes continuas las 24 horas, los costos fijos del proveedor en la nube —memoria HBM, núcleos de GPU y electricidad— son gastos inevitables, sin posibilidad de sobreventa.
03 El "triángulo dorado" del modelo
Además de los factores relacionados con el precio, la razón por la que los desarrolladores locales eligen Codex y Claude Code es sin duda su excelente rendimiento de programación.
Sin embargo, en términos de rendimiento, los modelos nacionales no son como ciertos estereotipos sugieren.
Tras hablar con varios desarrolladores, se ha identificado una opinión bastante común: los modelos de gran tamaño nacionales, especialmente los más recientes como GLM-5.2, ya pueden asumir tareas auxiliares y secundarias, como realizar pruebas y corregir errores.
Sin embargo, en tareas asíncronas más complejas y de larga duración, los modelos nacionales aún presentan una gran brecha en comparación con modelos líderes como GPT y Claude.
El desarrollador Xiao Zhang utilizó un modelo nacional en marzo de este año para programar; al comparar GLM, Qwen y GPT en la misma tarea, solo GPT la completó y cumplió con los requisitos de la página, se trataba de un proyecto de comparación de contenido multinivel y multicolumna con generación de resultados.
Sin embargo, otra desarrolladora, Xiao Wei, indicó que, según su experiencia, Kimi 2.7 y Doubao 2.1 Pro también tienen un rendimiento aceptable, pero en general son un nivel inferior (pertenecen al segundo grupo), aunque aún superan a Claude Sonnet 4.6.
Actualmente, el consenso general en la comunidad de desarrolladores es que GLM-5.2 es el primer modelo nacional que alcanza el nivel Opus.
Es disponible y tiene un lugar en la ejecución de tareas asíncronas reales, complejas y de larga duración.
A pesar de que, en muchos aspectos, como el conocimiento mundial, aún existe una gran brecha con el modelo Opus real, esto no impide que se convierta en un nuevo hito para los modelos nacionales.
Pero la realidad es: esto acaba de comenzar, y unos pocos "mejores estudiantes" han sido arrastrados por factores no relacionados con el rendimiento.
Específicamente, factores como una baja eficiencia de caché y limitación de tasa aún durante horas pico hacen que la experiencia real de los desarrolladores sea muy mala.
Esto lleva a otro dimensión en la comparación actual de modelos: la estabilidad.
En la experiencia de desarrolladores y programadores en primera línea, la elección del modelo ya no es una simple comparación de rendimiento, sino—
La "triángulo dorado" de rendimiento, precio y estabilidad.
En estos tres aspectos, los modelos nacionales solo lograron obtener parcialmente algunas métricas del primer aspecto.
Recientemente, Kimi lanzó su último modelo insignia, K3: un modelo de peso abierto con 2.8 billones de parámetros, multimodalidad nativa y 1 millón de tokens de contexto, diseñado principalmente para programación de larga duración, trabajo de conocimiento e inferencia profunda.

En múltiples evaluaciones, su índice de inteligencia en Artificial Analysis es de 57 puntos, ocupando el tercer lugar mundial; lidera la lista de programación frontal de Arena con 1679 puntos, e incluso circulan rumores de que su rendimiento ya puede competir con Claude Fable 5.
Sin embargo, detrás de las impresionantes puntuaciones y clasificaciones, la palabra que más preocupa a los desarrolladores sigue siendo: relación calidad-precio.
Después del lanzamiento de K3, muchos desarrolladores indicaron que Kimi sigue siendo caro, carece de relación calidad-precio en comparación con Codex y tiene cuotas insuficientes. Solo mirando los precios de la API, K3 tampoco puede considerarse "barato": los precios por millón de tokens para caché/entrada/salida son de 2/20/100 yuanes; GPT-5.6 Sol cuesta 0.5/5/30 dólares, K3 es más barato que Sol pero claramente más caro que GPT-5.6 Luna, que cuesta 0.1/1/6 dólares.
Durante el uso de K3, los desarrolladores indicaron que también se produjeron desconexiones de la API, incluso una desconexión que duró toda la mañana.
En la situación actual, los desarrolladores nacionales no se niegan a pagar por modelos nacionales, sino que debido a la escasez de capacidad de cómputo y los altos costos, no pueden permitirse paquetes con buena relación calidad-precio como Codex, y solo pueden optar por paquetes de "Dianping" que parecen bufé libre pero en realidad tienen límites (como el Coding Plan de Zhipu).
La experiencia inestable del paquete y su relación calidad-precio ambigua hacen que los usuarios tengan dificultades para retenerse tras usarlo. En esencia, esta es una elección racional de los usuarios ante los altos costos actuales de la infraestructura de hash.
Todo lo anterior no pretende alentar a otros ni desanimarnos a nosotros mismos, sino simplemente señalar un riesgo.
Actualmente, los modelos nacionales, en su esfuerzo por alcanzar a GPT y Claude, tienden a enfatizar mucho el rendimiento, pero lo que los modelos grandes nacionales deben superar, desde su desarrollo hasta su aplicación, va mucho más allá de solo esta montaña del rendimiento.
Lo que necesitamos es esperar hasta que la base de poder de cómputo nacional se produzca en masa y, en términos de tecnología, precio y estabilidad, logre una sinergia; entonces nuestro producto podrá cumplir con las expectativas de los usuarios.
