A Moonshot AI Kimi K3 suspendeu a inscrição de novos usuários dentro de 48 horas após o volume de solicitações dos usuários superar drasticamente as previsões, forçando um "corte de capacidade". O K3 possui um total de 2,8 trilhões de parâmetros e utiliza o mecanismo de atenção linear híbrida KDA, reduzindo a complexidade computacional das camadas de atenção de quadrática para linear, cortando o cache KV em até 75% e aumentando o throughput de decodificação em seis vezes com comprimento de contexto de 1 milhão. Essa arquitetura é considerada uma prática do "Teorema Tao" na área de IA, alcançando um salto de desempenho por meio de inovações arquiteturais em nível de sistema. O K3 obteve uma pontuação geral de 57 em avaliações globais de modelos de IA, ocupando a terceira posição, atrás apenas do Claude Fable 5 e do GPT-5.6. No mercado financeiro, no dia do lançamento do K3, a capitalização de mercado da NVIDIA caiu cerca de US$ 111,1 bilhões, enquanto a avaliação da Moonshot AI saltou de US$ 4,3 bilhões para US$ 31,5 bilhões em seis meses.Autor e fonte do artigo: 36氪
Kimi também tem seu próprio "Princípio Tao".
K3 está em alta, mas Kimi precisa apertar o botão de pausa.
Na madrugada de 19 de julho, a equipe Kimi da Moon Shadow anunciou que, devido à demanda de usuários ter superado significativamente as previsões nas primeiras 48 horas após o lançamento do Kimi K3, e em razão da escassez de recursos de computação, a inscrição de novos usuários para o Kimi foi suspensa, com os recursos computacionais limitados sendo priorizados para os usuários já inscritos.
O sistema de membros foi dividido em direitos principais do Kimi e direitos do Code, para alocar recursos com precisão. De acordo com a resposta oficial posterior, o Kimi não ajustou o sistema de membros, mas apenas reequilibrou a experiência do usuário sob capacidade computacional limitada.
O K3 atingiu o limite de capacidade de mineração, só pode recusar novos clientes e se concentrar no atendimento aos usuários existentes.
A "Lei de Tao" de Kimi
Atualmente, todas as empresas de modelos estão se esforçando ao máximo para aumentar sua base de usuários, atraindo novos clientes por meio de estratégias de alto custo-benefício, como serviços gratuitos e redução de preços. Em contraste, a abordagem reversa da Kimi parece um pouco “verdadeiramente chique”.
Mas quanto mais poderoso o modelo, mais longo o contexto e mais frequente o uso pelo usuário, maior o consumo de poder de inferência. Sob a condição de “a quantidade de solicitações K3 se aproximando do limite de capacidade do cluster de computação atual”, o Kimi também enfrenta o mesmo problema do “DouBao”: quanto mais usuários finais, menos a contribuição para a receita, mas os GPUs não aguentam.
Como o primeiro modelo MoE da Moonshot com 3 trilhões de parâmetros, o K3 possui um total de 2,8 trilhões de parâmetros. De acordo com a compreensão convencional, um modelo dessa escala consome poder de processamento de forma exponencial a cada saída. No entanto, com o suporte de sua arquitetura central única, alcança o efeito da "Lei Tao" proposta pela Huawei no campo de chips.
Essa arquitetura também é vista como um supermotor, implementando três tecnologias-chave: atenção híbrida linear KDA (Kimi Delta Attention), resíduos de atenção e MoE de alta esparsidade, levando à máxima eficiência a conversão de cada unidade de poder de cálculo em desempenho do modelo.
Por muito tempo, a indústria de chips dependeu da Lei de Moore, aumentando o desempenho ao reduzir o tamanho dos transistores. Mas, à medida que os processos avançados se aproximam dos limites físicos e os custos dispararam, o modelo de crescimento baseado apenas em empilhamento de hardware entrou em um impasse.
A "Lei Tao" proposta pela Huawei este ano sai da abordagem tradicional de "miniaturização espacial" e passa para a "miniaturização temporal": por meio de dobramento lógico, empilhamento tridimensional e otimização da arquitetura de ponta a ponta, reduz a latência de transmissão de sinal e minimiza a transferência redundante de dados, alcançando um salto na eficiência energética em processos maduros, comparável ao desempenho de processos avançados.
Sua metodologia central é: alcançar um salto de desempenho por meio de inovações arquiteturais em nível de sistema, sob restrições de hardware ou custo.
Na minha opinião, o mecanismo de atenção híbrida linear KDA adotado pelo K3 é uma prática da Lei Tao no campo da IA.
É importante saber que a arquitetura Transformer consome mais poder de processamento na atenção. A atenção padrão cresce quadraticamente com o comprimento da sequência; em tarefas de contexto de milhões de tokens, a maior parte do poder de processamento é consumida para manter a matriz de atenção de sequência longa. O mecanismo KDA reduz a complexidade computacional da maioria das camadas de atenção de quadrática para linear.
De acordo com o relatório técnico anteriormente publicado pela Moonshot, ao utilizar uma proporção híbrida de KDA e MLA em modelos experimentais, o uso máximo de cache KV foi reduzido em até 75%, e o throughput de decodificação com comprimento de contexto de 1 milhão aumentou seis vezes. Em conjunto com a técnica de resíduo de atenção e MoE de alta esparsidade, a eficiência de treinamento aumentou cerca de 25%, com custo adicional inferior a 2%.
Esta é uma reestruturação da “eficiência de produção do modelo”. Se a abordagem Transformer dominante na Silicon Valley é um carro a combustão que confia na força bruta para obter resultados surpreendentes, o KDA é mais como um motor híbrido que busca a máxima eficiência térmica.
O relatório da SemiAnalysis aponta que o KDA aumenta a velocidade de inferência em 300%, mantendo ao mesmo tempo desempenho próximo ao do Transformer em processamento de contextos longos. Isso significa que, com o mesmo investimento em capacidade de cálculo, o K3 pode produzir mais inteligência eficaz.
Feedback from the developer community shows that K3 excels in long-process Agent tasks and code generation, demonstrating the capability to compete with leading international models.
Em essência, o K3 ainda segue a Lei de Escalabilidade, mas direciona o golpe ao desperdício algorítmico grosseiro. Enquanto empresas de IA da Silicon Valley continuam acumulando chips e aumentando a capacidade de processamento, o Kimi reestrutura a cadeia de algoritmos e reduz a redundância computacional, alcançando um equilíbrio entre desempenho e eficiência sob capacidade computacional limitada, traçando um caminho que maximiza a inteligência produzida por watt.
Isso surpreendeu observadores e investidores de Wall Street, que, assim como se agitaram com o DeepSeek, voltaram a questionar se os bilhões de dólares investidos na Silicon Valley em IA obterão retornos correspondentes e se a vantagem dos EUA em IA foi enfraquecida.
Ao mesmo tempo, usuários corporativos e desenvolvedores também começaram a prestar atenção ao custo de uso da IA. Alguns desenvolvedores já estão utilizando o serviço de “roteamento de modelo” (Model Routing), que automaticamente seleciona o modelo de IA mais barato e eficiente para cada tarefa, incluindo modelos chineses como o Kimi.
Yang Zhilin reaches for the height
Olhando para trás, a superação da capacidade de computação do Kimi foi um efeito colateral do sucesso técnico: o aumento da eficiência do modelo reduziu o custo por uso, mas estimulou um aumento massivo na demanda total.
É digno de nota que, em 11 de julho, Tang Jie, fundador do Zhipu, anunciou o "Plano Touch High", afirmando diretamente: "Não alcançar o topo é fracasso", e declarou claramente que, nos próximos dois anos, não buscará monetização imediata de aplicações, mas concentrará recursos para avançar nas quatro direções principais da AGI, com planos de arrecadar fundos e alocar recursos na ordem de bilhões para superar a tecnologia de interpretabilidade mecânica.
Se dissermos que o "salto" da Zhipu é uma luta pela sobrevivência após a listagem, espera-se que ela consolide a narrativa de ser "a primeira empresa de grandes modelos do mundo", ao atingir o limite da tecnologia, e alivie a ansiedade real.
Também vejo o Kimi alcançando alturas em três dimensões nas decisões de Yang Zhilin:
Primeiro, otimize a capacidade de processamento, passando de uma mentalidade baseada em tráfego para uma baseada em valor. Informações públicas mostram que a receita proveniente dos serviços de API do Kimi já ultrapassou 70%, sendo muito diferente do modelo anterior baseado em assinaturas de usuários finais. Manter os usuários existentes e rejeitar novos clientes é, na realidade, direcionar a capacidade limitada de processamento para cenários de alto valor, evitando que o tráfego genérico de usuários finais ocupe a quota já essencial para os negócios B2B.
O custo também é evidente. Por exemplo, os critérios de execução de "priorizar os usuários existentes" não são transparentes; quais solicitações são atendidas com prioridade e quais são degradadas, se mal gerenciadas, diluirão a confiança dos usuários.
A long term, para completar a transição de estrela tecnológica para uma empresa de IA madura, o Kimi precisa fortalecer infraestruturas como pool de capacidade de computação elástica, mecanismos de resposta hierárquica e capacidade de agendamento dinâmico.
Em segundo lugar, há uma pressão para elevar os preços, com o Kimi realizando um teste de estresse da transição de um buffet barato para uma estrutura de valor segmentada. A menção na declaração sobre “separar os direitos principais do Kimi dos direitos de Code” é tanto um ajuste temporário para lidar com a escassez de capacidade de processamento quanto um possível sinal do início de uma reestruturação de seu sistema de precificação.
No passado, independentemente de os usuários escreverem código, pesquisarem informações ou simplesmente conversarem, pagavam o mesmo custo e consumiam a mesma quantidade de poder de processamento. Quando a proporção de usuários de código que consomem alto poder de processamento aumentou, esse modelo levou inevitavelmente a um desequilíbrio estrutural.
Kimi está aproveitando esta oportunidade para dividir os benefícios dos membros e redefinir os preços conforme os cenários de uso: usuários leves desfrutam de serviços básicos, enquanto usuários intensivos pagam um prêmio por capacidades de alto valor.
Isso é uma tentativa de disputar o poder de precificação dos modelos por meio da segmentação de usuários por valor. Atualmente, a taxa de cobrança da K3 atingiu US$ 2,3 por milhão de tokens, embora inferior aos modelos líderes no exterior, já estabeleceu um novo recorde para modelos nacionais.
Talvez o Kimi também queira deixar para trás o modelo de baixo custo e transmitir uma mensagem externa: modelos de alto desempenho possuem capacidade de definição de preços. A seguir, a competição entre grandes modelos também passará de “competição por parâmetros” para “competição por infraestrutura” e “competição por precificação de custos”.
Este passo é mais difícil do que alcançar o topo da lista e mais próximo da essência do negócio.
Terceiro, elevação do status: Kimi passa de variável geopolítica a ponto de referência de precificação.
Após o lançamento do K3, atraiu rapidamente atenção global. No mais recente "Índice de Inteligência" publicado pela agência independente de avaliação de modelos de IA, Artificial Analysis, seu escore total alcançou 57 pontos, ocupando a terceira posição mundial, atrás apenas do Claude Fable 5 (60 pontos) e do GPT-5.6 Sol (59 pontos), e à frente do Claude Opus 4.8 (56 pontos).
Este resultado também acabou quebrando o consenso da indústria de que o código aberto fica meio ciclo atrás do código fechado.
Ao mesmo tempo, a influência do K3 transcendeu o círculo tecnológico. Uma instituição de investimento em tecnologia dos Estados Unidos o considera um “ponto de inflexão” no desenvolvimento da IA, acreditando que modelos de código aberto de alta qualidade estão acelerando a disseminação de capacidades; um professor de ciência da computação da Universidade da Califórnia, Berkeley, afirmou que o K3 reduziu a lacuna entre os modelos de código aberto chineses e os modelos avançados americanos para 2 a 3 meses.
A reação do mercado de capitais foi igualmente intensa: no primeiro dia de negociação da K3, a capitalização de mercado da NVIDIA caiu cerca de US$ 111,1 bilhões em um único dia; analistas do JPMorgan chamaram diretamente isso de "DeepSeek 2.0" em seu relatório.
This acceleration is what changes the pricing logic.
Além disso, o ARR (receita anualizada) da Luna Dark atingiu quase 300 milhões de dólares até junho, com um crescimento externo de 400% e aumento de receita após um reajuste de 60%, o que, combinado, indica que o modelo “open source + eficiência” do Kimi pode ser escalonado para geração de receita.
Além disso, relatos indicam que Moon Shadow está buscando uma listagem em Hong Kong em até seis meses, com sua avaliação aumentando de US$ 4,3 bilhões para US$ 31,5 bilhões em seis meses, uma alta de mais de sete vezes.
Estes são todos sinais do mercado de capitais validando um caminho não convencional fora da Vale do Silício. Ao apostar em “SOTA com modelo econômico viável”, eles também demonstram que o Kimi possui uma lógica de valoração independente, não precisando mais se comparar à OpenAI ou Anthropic para provar seu valor.

Lado oculto da Lua | Fonte da imagem: informações da internet
Mas ainda há um longo caminho a percorrer para que o K3 alcance o AGI. Por exemplo, nos testes de desempenho, embora o K3 esteja apenas 3 pontos abaixo do Fable 5, a diferença subjacente ainda é significativa.
Além disso, o Kimi também reconheceu em seu relatório técnico duas falhas no nível de implantação: primeiro, o K3 mantém o histórico completo de pensamento durante o treinamento; se o chamador não enviar corretamente o processo de raciocínio anterior ou mudar de outro modelo para o K3 durante a sessão, a qualidade da saída diminui significativamente;
Em segundo lugar, o K3 tende a ser "excessivamente proativo" quando as tarefas são ambíguas, preferindo tomar decisões em nome do usuário. Esse comportamento "autocrático" pode desencadear erros em cadeia em processos de engenharia que exigem execução precisa.
Outro problema fácil de ignorar, mas extremamente importante: ilusões. A Artificial Analysis destacou especificamente que a taxa de ilusões do K3 aumentou em comparação com a geração anterior, K2.6.
Em certa medida, o brilho e as preocupações ocultas da K3 são um reflexo do desequilíbrio entre oferta e demanda de capacidade de mineração em toda a indústria, bem como uma dor coletiva da indústria chinesa de IA sob a pressão de gargalos na capacidade de computação, comercialização não fechada e expectativas excessivas dos usuários.
Cada sobrecarga e cada “corte” dessas empresas de IA são obstáculos que a IA chinesa precisa superar para alcançar novos patamares. Pode-se afirmar que um novo ciclo de competição já começou, e os grandes modelos passarão da disputa por capacidade para a disputa por poder de computação.
Aqueles que conseguirem estabelecer vantagem em infraestrutura, como algoritmos e reserva de poder computacional, serão os últimos a sorrir e definirão os padrões de sobrevivência para as próximas gerações de empresas de IA.
Referências:
Ranking de letras, "Lançamento do K3 em 48 horas"
Seda, "Tudo por culpa do Kimi"
Este artigo é do canal oficial do WeChat "Tang Chen Tong Xue", autor: Tang Chen, publicado com permissão da 36Kr.
