Modelos de IA chineses enfrentam altos custos apesar do alto uso

iconMetaEra
Compartilhar
AI summary iconResumo
Os modelos de IA chineses permanecem populares apesar do aumento dos custos operacionais, com o uso de tokens liderando por nove semanas consecutivas. No entanto, altos custos e serviço instável prejudicam sua eficácia de custo em comparação com o GPT Codex. Modelos nacionais como GLM-5.2 e Kimi enfrentam limites de cota e redução de desempenho em horários de pico, enquanto a Zhipu AI relatou prejuízos de 3 bilhões de yuans até 2025. Os dados de inflação destacam a pressão sobre as empresas, já que a China está atrasada na infraestrutura de computação, com apenas 449 centros de dados contra 5.427 nos EUA. O índice de medo e ganância para desenvolvedores de IA mostra preocupação crescente quanto à sustentabilidade a longo prazo.
Embora os grandes modelos de IA domésticos liderem em volume de chamadas por nove semanas em relação aos dos EUA, seus custos reais em cenários de programação intensiva superam amplamente os pacotes do GPT Codex. O Zhipu registrou prejuízo superior a 3 bilhões de yuans em 2025, enquanto pacotes como o Kimi têm cotas limitadas e sofreram restrições durante picos. A principal razão é a insuficiência da infraestrutura de computação na China (449 centros de dados contra 5.427 nos EUA), o que impede o lançamento de pacotes de alto custo-benefício similares ao Codex. Atualmente, os desenvolvedores precisam equilibrar desempenho, preço e estabilidade; os modelos domésticos apenas se aproximam dos modelos internacionais de ponta em alguns indicadores de desempenho e ainda enfrentam a dificuldade de serem bem avaliados, mas pouco adotados.

Autor e fonte do artigo: FunTalk

Neste último mês, o setor de IA da Silicon Valley lançou uma série de novidades: GPT-5.6, fable5 e Grok-4.5 foram lançados em sequência.

Por um momento, a comunidade de desenvolvedores e programadores no país entrou em ebulição, com discussões e avaliações sobre modelos avançados como o GPT-5.6 surgindo em sequência.

Embora este mês tenha surgido um novo modelo nacional como o Kimi-K3, em geral, os grandes modelos nacionais permanecem em um estado de “elogios, mas pouca adoção” entre os desenvolvedores principais.

De acordo com os dados mais recentes, em termos de uso: os dados da OpenRouter de 22 a 28 de junho mostram que o modelo chinês atingiu 2,039 trilhões de tokens semanais, enquanto o modelo americano atingiu 425 bilhões, com o primeiro liderando por nove semanas consecutivas.

Em contraste, o desempenho das seis "unicórnios" de IA domésticas em termos de receita não foi muito satisfatório: relatórios financeiros públicos mostram que Zhipu teve uma receita de 724 milhões de yuans em 2025, mas sofreu prejuízos superiores a 3 bilhões de yuans; MiniMax registrou 79 milhões de dólares americanos (aproximadamente 570 milhões de yuans); as outras quatro empresas, como Moonshot, ainda não divulgaram suas receitas anuais completas.

Mesmo as empresas líderes ainda têm receitas na ordem de centenas de milhões de yuans.

Em comparação, a Anthropic, uma empresa líder em IA, já atingiu um ARR de aproximadamente US$ 60 bilhões a US$ 70 bilhões, impulsionado principalmente por API B2B e cenários de codificação com IA.

Isso levanta uma questão aguda:

Por que modelos nacionais, apesar de serem anunciados como "baratos" e com "alto volume de uso", ainda são bem avaliados, mas não amplamente adotados, e continuam incapazes de competir diretamente com os modelos internacionais de ponta em cenários de alto valor, como AI Coding?

Recentemente, após discutir profundamente esse problema com vários desenvolvedores de primeira linha, descobri um fato muito contra-intuitivo:

Os grandes modelos nacionais são, em certa medida, muito "caros".

É exatamente esse "custo elevado" que impede certos modelos nacionais com avanços em desempenho de demonstrar plenamente suas qualidades.

01 Ilusão de "preço baixo"

Ao mencionar grandes modelos nacionais, muitas pessoas pensam em representantes como DeepSeek e Kimi, e um dos rótulos mais associados a eles é baixo custo, econômico;

Se considerarmos apenas o preço por token, os modelos nacionais apresentam uma vantagem significativa em comparação com modelos de ponta como GPT-5.6 e Fable5. Por exemplo, comparando GLM-5.2 e DeepSeek V4: o GLM-5.2 custa US$ 1,4/US$ 4,4 por milhão de tokens de entrada/saída, enquanto o DeepSeek-V4-Pro custa US$ 0,435/US$ 0,87; já o GPT-5.6 Sol custa US$ 5/US$ 30, e o Claude Fable 5 custa US$ 10/US$ 50.

Na verdade, essa impressão de “preço baixo” é um equívoco persistente de pessoas externas ao setor.

Em cenários de programação intensiva, o preço unitário dos grandes modelos nacionais não apenas não é vantajoso, mas também é várias vezes mais caro do que o GPT e o Claude com pacotes.

Li Guang (nome fictício) é um pesquisador na área de IA que, por exigências do trabalho, consome bilhões de tokens diariamente em cenários de AI Coding. Sob esse volume de consumo, o uso de modelos grandes nacionais, como o GLM-5.2, tornaria o custo total extremamente elevado.

Extrato de tokens apresentado por Li Guang

No dia da conversa, os tokens consumidos por Li Guang aproximavam-se de 4 bilhões. Aproximadamente, se ele tivesse usado o GLM-5.2, o custo seria: (86,39 milhões de entradas comuns × 1,4 dólares + 3,38 bilhões de entradas em cache × 0,26 dólares + 19,06 milhões de saídas e inferência × 4,4 dólares) ≈ 1.084 dólares. Considerando a taxa de câmbio de 1 dólar = 7,2 yuan chinês, equivale a aproximadamente 7.800 yuan chinês.

E a razão pela qual Li Guang pode gastar tanto em tokens é porque ele assinou o pacote CodeX da GPT,

Aqui está uma explicação simples sobre a forma exata do pacote CodeX: em resumo, é um pacote lançado especificamente para cenários de programação; tecnicamente, não é ilimitado, mas sim integra o Codex à assinatura do ChatGPT: o Plus custa US$ 20/mês, e o Pro começa em US$ 100/mês, com um limite aproximadamente 5 a 20 vezes maior que o Plus; após atingir o limite, é possível comprar Credits para continuar usando.

Da mesma forma, o Claude Code da Anthropic oferece um conjunto semelhante de planos: Claude Pro por US$ 20/mês, Max 5x e Max 20x a US$ 100 e US$ 200/mês, respectivamente; o site do Claude e o Claude Code compartilham os limites de 5 horas e semanais, e após esgotá-los, é possível continuar usando ao preço da API.

Under this package deal, the massive Token cost is effectively offset.

Para desenvolvedores no país, consumir bilhões ou até centenas de bilhões de tokens por dia em cenários intensivos de AI Coding é uma realidade comum.

Xiao Liu também é um desenvolvedor intensivo de AI Coding; ele gasta realmente 300 yuan chineses por semana no Codex, mesmo sem reembolso da empresa.

Mas mesmo esse custo ainda é considerado “muito mais barato” em comparação com modelos nacionais, pois com os mesmos 300 yuan, é impossível comprar o mesmo número de tokens do GLM 5.2.

Extrato de tokens de Xiao Liu

Para desenvolvedores na China, o pacote Codex da GPT é o token mais barato disponível no mercado, várias vezes mais barato que os modelos ZhiPu e Kimi. Isso pode parecer contra-intuitivo, mas a realidade é que os modelos nacionais não conseguem competir em custo-benefício em cenários intensivos de codificação.

É importante esclarecer que o Codex não é realmente um plano ilimitado; se considerarmos o plano mais alto de 200 dólares, o limite semanal é de aproximadamente 2 bilhões.

No entanto, como alguns desenvolvedores utilizam modelos por meio de "estações intermediárias" e outros métodos, o custo real de certos modelos é muito menor do que pelos canais oficiais, o que permite, às vezes, comprar mais tokens por um preço mais baixo, resultando no fenômeno de se conseguir 12 bilhões de tokens com apenas 300 reais.

Na verdade, os modelos nacionais já lançaram pacotes semelhantes, mas, se analisados detalhadamente, esses pacotes apresentam grandes restrições em termos de limites em comparação com o Codex.

02 A dor da precificação nacional

A situação atual dos grandes modelos nacionais em termos de precificação pode ser descrita em uma frase:

Você pensou que estava entrando em um buffet, mas acabou descobrindo que o comerciante ainda cobra pelo peso.

Por exemplo, em termos de planos, os modelos Kimi e GLM-5.2 na China oferecem quatro níveis de preço: 49, 99, 199 e 699 yuan, com créditos renovados semanalmente; o GLM Coding Plan, nas versões Lite, Pro e Max, oferece aproximadamente 80, 400 e 1600 prompts a cada 5 horas, totalizando cerca de 400, 2000 e 8000 prompts por semana, e durante os horários de pico, o GLM-5.2 consome três vezes mais créditos.

Tomando como exemplo o Qoder da Alibaba, segundo um amigo do autor, que trabalha com manutenção de clientes B e cujo nome fictício é Ami: “O Qoder já foi o melhor IDE de IA da China, mas seu novo preço acabou eliminando essa vantagem.”

Nos planos: Qoder CN Individual Pro e Pro+ custam 59 e 169 yuan/mês, respectivamente, incluindo 2.000 e 6.000 Credits; as versões Teams e VPC custam 99 e 199 yuan por usuário/mês, ambas incluindo 3.000 Credits, sendo que a versão VPC tem início mínimo de 50 usuários.

“Depois que eles combinaram e ajustaram os preços este ano, pelo que sei, pelo menos vinte ou trinta empresas deixaram de renovar suas assinaturas,” explicou A Mi posteriormente.

De acordo com os testes de Ami, o plano Qoder Enterprise Edition 199 esgota-se em três dias conforme seu uso; se usado por um desenvolvedor intensivo, provavelmente esgota-se em um dia.

Da mesma forma, no que diz respeito aos pacotes, o GLM-5.2 também deixou os usuários domésticos com sentimentos mistos.

Segundo a desenvolvedora Xiao Wei: "Os pacotes do GLM-5.2 são praticamente inexistente; mesmo que existam, ainda há limitação de tráfego nos horários de pico, além de ocorrerem práticas que prejudicam os usuários."

De acordo com a reportagem da 36Kr: os pacotes do GLM-5.2 eram mais difíceis de conseguir do que ingressos para shows, com atualização automática todos os dias às 10h da manhã, e a aquisição dependia totalmente da velocidade de clique.

Em janeiro de 2026, Zhipu anunciou que, devido à escassez de poder de computação, reduziu imediatamente a quantidade diária disponível para venda para apenas 20% do valor original, liberando um pouco de quota todos os dias às 10h da manhã, que esgotava em poucos minutos.

No fim das contas, a parcimônia dos modelos nacionais em termos de pacotes e preços é, em essência, uma situação difícil causada pela falta de capacidade de processamento.

De acordo com dados de 2025 do China Academy of Information and Communications Technology e do Ministério da Indústria e Tecnologia da Informação da China, a China possui 449 centros de dados atuais, enquanto os Estados Unidos possuem 5.427. Em termos de capacidade total de processamento, a China é de 1.053 EFLOPS, enquanto os Estados Unidos são de 2.400.

Mas o ponto chave aqui é que, nos 2.400 EFLOPS dos Estados Unidos, a proporção de GPUs de alto desempenho é muito alta; na capacidade de computação da China, grande parte são chips nacionais como o Huawei Ascend e o Cambricon, cujo desempenho por unidade ainda apresenta uma lacuna geracional em relação ao H100.

Para atender à crescente demanda por poder de computação, a partir de março de 2026, Zhipu, Alibaba Cloud, Tencent Cloud e Baidu aumentaram coletivamente os preços dos tokens, com aumentos variando de 5% a 460%.

Em suma, o “baixo preço” e a “guerra de preços” dos modelos nacionais já são coisa do passado.

Não é que os modelos nacionais não queiram fazer o buffet; é porque fizemos as contas: com os custos atuais de computação e o estado de prejuízo, oferecer assinatura mensal equivale a apostar com uma taxa fixa mensal que os usuários não esgotarão o sistema. Considerando o uso típico de desenvolvedores e programadores nacionais, que consomem dezenas ou até centenas de bilhões de tokens por dia, esse modelo de negócios será rapidamente esgotado além da linha de custo.

Já os pacotes de programação da OpenAI e da Anthropic vendem para clientes corporativos de alto patrimônio — clientes grandes, como Cursor e GitHub Copilot, podem gerar para a Anthropic uma receita de US$ 1,4 bilhão por ano.

Com o suporte de alta capacidade de processamento, esse modelo de negócios troca uma "taxa mensal fixa" por "retenção de clientes a longo prazo", resultando em clientes de alta qualidade e ARPU relativamente elevado, o que distribui bem os custos.

Em comparação, embora haja gigantes de nuvem como Alibaba no mercado doméstico, o problema é que a margem EBITA ajustada da Alibaba Cloud para o FY2026 é de apenas 7,5%; embora o grupo de inteligência em nuvem tenha um rápido crescimento de receita, seus lucros não são substanciais.

Além disso, os fornecedores tradicionais de nuvem ousam vender "servidores em nuvem ilimitados" porque os usuários não operam em carga máxima 24 horas por dia. Um ECS pode ter uma utilização real da CPU de apenas 10%, permitindo que o fornecedor de nuvem oversell uma máquina física para dez pessoas.

Mas a inferência de grandes modelos é diferente: para cada token, é necessário consumir realmente a capacidade de processamento da GPU. Se o usuário gerar continuamente 24 horas por dia, a memória HBM da nuvem, os núcleos da GPU e os custos de energia são despesas rígidas, sem qualquer espaço para superreserva.

03 O "triângulo dourado" do modelo

Além dos fatores relacionados ao preço, a razão pela qual os desenvolvedores locais escolhem Codex e Claude Code é, sem dúvida, seu desempenho de programação poderoso.

No entanto, em termos de desempenho, os modelos nacionais não são como certos estereótipos sugerem.

Após conversar com vários desenvolvedores, o autor descobriu uma opinião bastante comum: os grandes modelos nacionais, especialmente os mais recentes, como o GLM-5.2, já podem assumir tarefas auxiliares e secundárias, como realizar testes e corrigir bugs.

No entanto, em tarefas assíncronas mais complexas e de longa duração, os modelos nacionais ainda apresentam uma grande lacuna em comparação com modelos de ponta como GPT e Claude.

O desenvolvedor Xiao Zhang usou um modelo nacional em março deste ano para programação, comparando GLM, Qwen e GPT na mesma tarefa; apenas o GPT concluiu com sucesso e atendeu aos requisitos da página, em um projeto de comparação de conteúdo multinível e multicolumna e geração de resultados.

Já outra desenvolvedora, Xiao Wei, afirmou que, com base em sua experiência, o Kimi 2.7 e o DouBao 2.1 Pro também apresentam desempenho aceitável, mas, em geral, estão um nível abaixo (pertencem ao segundo escalão); no entanto, ainda superam o Claude Sonnet 4.6.

Atualmente, o consenso geral na comunidade de desenvolvedores é que o GLM-5.2 é o primeiro modelo nacional a atingir o nível Opus.

Ele é disponível e estabeleceu sua posição ao executar tarefas assíncronas reais, complexas e de longa duração.

Embora ainda haja uma grande lacuna em muitas dimensões, como conhecimento mundial, em comparação com o verdadeiro modelo Opus, isso não impede que se torre um novo patamar para modelos nacionais.

Mas a realidade é: isso acabou de surgir, e alguns "alunos destaque" foram prejudicados por fatores não relacionados ao desempenho.

Especificamente, fatores como baixa eficiência de cache e limitação de taxa ainda durante horários de pico resultam em uma experiência muito ruim para os desenvolvedores.

Isso traz à tona outro维度 no comparativo atual de modelos: estabilidade.

Na experiência de desenvolvedores e programadores na linha de frente, a escolha do modelo já não é mais uma simples comparação de desempenho, mas sim—

O "triângulo dourado" de desempenho, preço e estabilidade.

Nesses três dimensionais, os modelos nacionais apenas conseguiram alcançar parcialmente algumas métricas do primeiro dimensionais.

Recentemente, a Kimi doméstica lançou seu mais recente modelo de ponta, o K3: um modelo de peso aberto com 2,8 trilhões de parâmetros, multimodalidade nativa e contexto de 1 milhão de tokens, voltado principalmente para programação de longo prazo, trabalho com conhecimento e raciocínio profundo.

Em diversas avaliações, seu índice de inteligência no Artificial Analysis é de 57 pontos, ocupando o terceiro lugar mundial; lidera o ranking de programação front-end da Arena com 1679 pontos, e há até rumores de que seu desempenho já pode rivalizar com o Claude Fable 5.

No entanto, por trás das pontuações e classificações brilhantes, a preocupação mais importante dos desenvolvedores continua sendo uma palavra: custo-benefício.

Após o lançamento do K3, muitos desenvolvedores afirmaram que o Kimi ainda é caro, não oferece custo-benefício em comparação com o Codex e possui limites insuficientes. Analisando apenas os preços da API, o K3 também não pode ser considerado "barato": os custos por milhão de tokens para cache/entrada/saída são de 2/20/100 yuan; para o GPT-5.6 Sol, são de 0,5/5/30 dólares; embora o K3 seja mais barato que o Sol, é claramente mais caro que o GPT-5.6 Luna, cujos preços são de 0,1/1/6 dólares.

Durante o uso do K3, os desenvolvedores relataram que ocorreram desconexões da API, incluindo uma interrupção que durou toda a manhã.

Atualmente, os desenvolvedores locais não se recusam a pagar por modelos nacionais; em vez disso, devido à escassez de capacidade de processamento e aos altos custos, não conseguem acessar pacotes com boa relação custo-benefício como o Codex, e só podem optar por pacotes que parecem ser "bufê livre", mas na realidade são limitados — como o "pacote Dazhong Dianping" (semelhante ao Coding Plan da Zhipu).

A experiência instável e a falta de clareza sobre a relação custo-benefício dos pacotes levam os usuários a dificilmente permanecerem após o uso. Essencialmente, trata-se da escolha racional dos usuários diante dos altos custos da infraestrutura de hash atual.

Tudo isso não é para exaltar os outros e diminuir nossa própria força, mas sim para alertar sobre um risco.

Atualmente, enquanto os modelos nacionais buscam alcançar o GPT e o Claude, tendem a enfatizar muito o desempenho; no entanto, o caminho que os grandes modelos nacionais precisam percorrer, desde o desenvolvimento até a aplicação, vai muito além do desempenho.

Precisamos apenas esperar até que a base de poder de computação nacional seja produzida em grande escala, quando tecnologia, preço e estabilidade se unirem em sinergia, nosso produto poderá atender às expectativas dos usuários.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.