Organizado e compilado por Shenchao TechFlow

Convidados: Jordan e Max, analistas da SemiAnalysis
Apresentador: Jordan (Diálogo interno da SemiAnalysis)
Fonte do podcast: SemiAnalysis
Título original: [Episódio de Emergência] O Kimi K3 da Moonshot chegou! A China tem um modelo de fronteira
Data de transmissão: 18 de julho de 2026
Resumo dos principais pontos
Moonshot (Luna da Face Escura) lançou o Kimi K3, superando o Google e o Meta em vários benchmarks integrados, tornando-se o terceiro melhor modelo do mundo, atrás apenas do Fable da Anthropic e do Soul 5.6 da OpenAI. Os analistas da SemiAnalysis, Jordan e Max, desmontaram o significado deste lançamento em um programa de emergência: o modelo de 2,8T parâmetros oferece serviços ao mesmo preço do Sonnet (3/15 por milhão de tokens); se ele for comparável em escala aos modelos fechados de ponta, então a margem de lucro de 10/50 da Anthropic pode ser de nível mindboggling.
Um julgamento mais agudo vem de Jordan: a lacuna de ponta está se reduzindo, e ele atribui isso às restrições do governo dos EUA sobre a liberação dos modelos mais fortes da Anthropic/OpenAI, criando artificialmente uma janela de tempo para os perseguidores. O código aberto realmente não conseguiu alcançar. Enquanto isso, o código aberto ocidental está totalmente vazio — nenhuma modelo de código aberto de uma empresa americana consegue alcançar o quinto melhor da China. A competição de modelos está se transformando em uma competição de harness (uso de ferramentas) e geopolítica.
Resumo de ideias interessantes
Sobre a posição do Kimi K3
- Se você olhar a classificação geral de todos os principais benchmarks, hoje há um top three muito claro: Fable, Soul 5.6 e Kimi K3. Eles sempre ficam acima de todos os outros, incluindo DeepSeek, bem como Google, Meta e xAI.
- O Google deveria se sentir muito constrangido. Em novembro e dezembro de 2025, todos ainda acreditavam que os três grandes da IA eram Google, Anthropic e OpenAI. Hoje, ao conversar com alguns "velhos tempos", eles ainda pensam assim, mas claramente já não é mais assim.
- Pode ser o segundo melhor modelo do mundo, pois toda vez que tento fazer algo sério com o Fable, sou recusado e redirecionado para o Opus. Embora não tenha certeza se ele é melhor que o Opus, pelo menos não sou recusado.
Sobre a margem de lucro dos modelos de ponta
- If Kimi is unlikely to be selling K3 at 3/15 at a loss, then Fable, with a similar scale, charging 10/50, should completely alleviate concerns that AI labs are unprofitable businesses. Selling tokens at API prices may even be more profitable than SaaS.
- O preço subiu mais de três vezes de K2.7 para K3, de 0.95/4 para 3/15. Mas não acho que ainda haja muito espaço para aumentos, pois muitas tarefas já podem ser realizadas com GLM ou MiniMax M3.
Sobre o governo dos Estados Unidos e a lacuna
- Acredito que essa lacuna foi reduzida squarely devido às restrições do governo dos EUA sobre a Anthropic, o que nos impediu de acessar os modelos mais poderosos dessas empresas. Eles estão se esforçando artificialmente para alcançar.
- Só podemos acessá-lo se a inteligência avançada for permitida. Isso na verdade representa uma oportunidade para os jogadores nas posições quatro, cinco, seis e sete.
Sobre o vácuo aberto ocidental
- Ainda me surpreende que, com todo o mercado sendo tão ineficiente, não tenhamos nenhuma empresa americana que consiga pelo menos igualar a quinta melhor da China.
- Mesmo que o governo não proíba modelos de código aberto da China, grandes empresas americanas comuns não querem alimentar seus dados proprietários a modelos de código aberto chineses. Mesmo que você carregue os pesos em um data center isolado, mesmo que o CCP não veja seus dados, os executivos não aceitarão.
Sobre o Harness
- Testar o Kimi K3 me fez examinar pela primeira vez seriamente o Open Code, o Hermes e o Pi. O Harness ainda é totalmente parte do produto.
- Coisas simples podem me fazer escolher este modelo em vez daquele: é possível instalá-lo em um servidor SSH remoto? As atalhos são fáceis de usar? Esses detalhes nos harnesses realmente afetam onde envio meus tokens, ou seja, onde aplico meu orçamento.
Sobre "ainda é cedo"
- Na semana passada fui ao ICML, e na semana anterior fui ao AI Engineer Conference. É um evento nominalmente de IA, e mais de 80% das pessoas nunca ouviram falar do SemiAnalysis. Você se diz trabalhador na indústria de IA, mas nem sequer leu o SemiAnalysis? Ainda estamos muito cedo.
Is Kimi K3 the third-best model in the world?
Jordan: Comentário rápido, o Kimi K3 é agora o terceiro melhor modelo do mundo?
Max: A resposta é claramente "sim". Todos gostam de criticar os benchmarks, e os benchmarks realmente têm problemas, mas se você olhar para a classificação combinada de todos os principais benchmarks, eles sempre apontam na direção correta. Hoje há um top three muito claro: Fable, Soul 5.6 e Kimi K3, sempre acima de todos os outros, incluindo jogadores open source como o DeepSeek, e também claramente acima da Google, Meta e xAI. Essa é uma conquista extremamente notável para a equipe da Moonshot.
O Google deveria se sentir muito envergonhado. Em novembro e dezembro de 2025, todos ainda acreditavam que os três grandes da IA eram Google, Anthropic e OpenAI. Hoje, ao conversar com alguns "velhos tempos", eles ainda pensam assim, mas claramente já não é mais assim.
Em geral, ainda acho que ela não é tão boa quanto Fable e Soul 5.6. É um pouco engraçado que eles também afirmaram isso claramente no blog de lançamento do próprio modelo. Talvez seja a velha modéstia chinesa, ou talvez eles não queiram atrair a atenção da governança americana, já que o lançamento do Fable 5.6 também teve algum atraso. Mas, de qualquer forma, é muito impressionante.
Jordan: Eles escreveram na seção de limitações do blog: "Embora o K3 seja, no geral, um modelo altamente competitivo, ainda existe uma diferença clara em relação à experiência do usuário entre ele e o Fable 5 e o GPT 5.6." Minha experiência pessoal de uso é que ele é realmente bom, mas é muito lento, o que é irritante. Isso me deu pela primeira vez a motivação para experimentar o harness de código aberto. Sinceramente, sinto que aprendi mais sobre o harness do que sobre o modelo, porque todos esses modelos são suficientemente bons para realizar as tarefas básicas que faço atualmente, e tenho dificuldade em encontrar tarefas complexas que ele não consiga realizar.
Este pode ser o segundo melhor modelo do mundo para mim, pois toda vez que uso o Fable para algo sério, sou recusado e redirecionado para o Opus. Embora não tenha certeza se ele é melhor que o Opus, o fato de não ser recusado já é menos irritante. No entanto, ao usar uma chave API com pagamento por uso, nunca sou recusado — só encontro limites ao usar o console web ou a pesquisa aprofundada. Eles claramente não têm GPU suficiente para atender à demanda gerada por este modelo. Anteriormente, esse problema era resolvido com uma estratégia de código aberto, liberando os pesos para que outros os servissem. Mas desta vez ainda não liberaram os pesos; eles disseram que os liberarão em 10 dias.
Por que adiar 10 dias para abrir o peso?
Jordan: Qual é a sua estratégia para esse atraso?
Max: Para ser claro, tudo isso são apenas minhas suposições. Uma grande razão pode ser que eles precisam dar tempo suficiente às equipes dos motores de inferência, como vLLM e SGLang, para garantir que consigam servir esse modelo com alto desempenho. Se liberarem os pesos hoje e todos os serviços conseguirem apenas 20 tokens/segundo, isso seria muito ruim para a percepção da marca deles. Agora eles têm uma ótima oportunidade de obter grande cobertura de mídia e adoção; se o lançamento for prejudicado pelo desempenho, isso pode enfraquecer o impulso.
Outra possibilidade é que eles estejam negociando parcerias de licenciamento com fornecedores de serviços de inferência como Together AI, Fireworks, Nebius e Groq, para que eles usem os chips mais recentes, como o GB300, para atender à capacidade adicional. Essas duas possibilidades são provavelmente as principais razões para o adiamento de 10 dias.
Lucros excessivos dos modelos de ponta
Jordan: Vamos falar sobre a arquitetura do modelo. Ele tem 2,8 trilhões de parâmetros e não cabe no B200; você precisa de um B300, GB300 ou AMD MI355X para executá-lo em um único servidor HGX com 8 GPUs. Claro, você pode fazer pipeline parallelism entre nós, mas isso afetará drasticamente o desempenho. Portanto, apenas quem possui os chips mais recentes poderá executar esse modelo.
Voltando ao que você disse sobre o Google, este modelo já atingiu competitividade de ponta com 2,8T parâmetros, o que nos dá algumas pistas sobre o tamanho dos modelos de ponta fechados. Se eles estiverem comparando com modelos de 10T parâmetros, fica ainda mais vergonhoso. Temos que assumir que está na mesma ordem de grandeza que Soul e Fable.
Max: Sim, você está certo. Ainda acredito na capacidade e na perspicácia da equipe de pesquisa da Anthropic. Se alguém no Twitter disser que os modelos atuais fechados têm 10T parâmetros ou algo assim, e se for verdade, cara, já era: a ação da NVIDIA cairia 50% amanhã e tudo acabaria.
Tenho uma certeza razoável de que o Kimi K3 não é muito menor do que os modelos proprietários líderes atuais, e pode até ser um pouco maior. Se isso for verdade, isso reforça ainda mais um ponto que sempre enfatizamos na SemiAnalysis: os márgens de lucro desses laboratórios proprietários são absolutamente espantosas. Se o Kimi provavelmente não está operando com prejuízo ao oferecer o K3 por $3/$15 — da mesma forma que o Sonnet — e o Fable, de tamanho semelhante, cobra $10/$50, então qualquer preocupação sobre a viabilidade financeira dos laboratórios de IA deve ser descartada completamente. Vender tokens, calculado pelo preço da API, pode ser mais lucrativo do que SaaS hoje em dia.
Jordan: Sem custos de funcionários, apenas GPU. E em comparação com os preços anteriores? Você mencionou 3/15, mas a versão anterior do Moonshot tinha um preço direto de 0,95/4, então o preço subiu mais de três vezes de K2,7 para K3. Quanto espaço ainda resta para eles aumentarem os preços?
Max: Não acho que eles ainda tenham muito espaço para elevar os preços. Mesmo no nível de 3/15, muita gente considerará muito caro. Suas tarefas são suficientemente atendidas por GLM ou MiniMax M3. Há aqui um divisor interessante: aqueles como a SemiAnalysis, que não se importam em gastar tokens do Dylan, continuarão usando o Fable para quase tudo; já os extremamente sensíveis a custos, como Tesla e Uber, que gastam apenas US$ 200 por semana em tokens, seguirão a camada de preços do GLM. Então, quem realmente mudará para o Kimi K3? Provavelmente um grupo de pessoas filosoficamente apaixonadas por open source e que querem apoiar novos modelos. Se grandes empresas realmente adotarão esse modelo, não me surpreenderia se a resposta for não.
Nova arquitetura e próximos passos
Jordan: Esta é uma nova arquitetura. 2,8T parâmetros, com delta attention do Kimi, potential residuals e stable latent — basicamente uma versão ampliada do modelo anterior, cerca de duas vezes maior. Anteriormente, com o K2.5, vimos o Cursor usá-lo como composer, com base em continued pre-training e MRL, e depois lançaram checkpoints como 2.5, 2.6, 2.6.7, etc. Este é um novo modelo base, mas já está bastante completo, sem as bordas rústicas comuns nos modelos originais. E agora? Quando sairá o 3.1? O preço mudará? Haverá um composer baseado no K3?
Max: Não haverá composer baseado no K3; a equipe do Cursor já decidiu treinar seu próprio modelo do zero. Quanto às versões K3.1, K3.2, é provável que haja duas a três atualizações nos próximos um ou dois meses, continuando com o pós-treinamento. Suponho que os preços permanecerão inalterados, pois eles não conseguirão operar em novos hardwares nos próximos dois ou três meses, sem aumento de throughput para justificar uma redução de preço. Talvez um engenheiro de kernel extremamente habilidoso consiga reduzir os custos ao nível do DeepSeek V4, mas duvido que um modelo de 3T parâmetros consiga isso. Os preços atuais do GLM e do MiniMax provavelmente já estão no limite do que modelos de 1T a 1,5T parâmetros podem oferecer.
O código aberto conseguirá alcançar o código fechado?
Max: A questão mais interessante é se a lacuna entre open source e closed source continuará a se reduzir e se o open source poderá realmente alcançar a paridade com os níveis mais avançados. Se isso acontecer, terá um impacto enorme em toda a nossa indústria. O que você acha?
Jordan: Minha opinião é que a lacuna agora diminuiu, e a causa é diretamente atribuída às restrições do governo dos EUA sobre a Anthropic, o que nos impede de acessar os modelos mais poderosos dessas empresas. Eles foram alcançados artificialmente.
Podemos ver a comparação entre Mythos e Fable. Não consigo usar Mythos, e para usar Fable, preciso pedir muito e só consigo ocasionalmente. 5.6 Soul — nossa avaliação interna é que não é o maior modelo treinado pela OpenAI, e não é tão grande quanto o 4.5. Eles têm um ainda maior. O resultado é que só conseguimos acessá-lo quando a inteligência de ponta for permitida pelo governo.
Para os jogadores nas posições quarta, quinta, sexta e sétima, isso na verdade representa uma oportunidade de liberar tudo dentro de um certo limite e começar a conquistar participação de usuários, mas nunca alcançar a verdadeira fronteira. Acho que a fronteira pode dar um grande passo adiante no final deste verão, ou pode haver uma pequena mudança na direção política. Também é possível que comecemos a encontrar modalidades além da codificação, permitindo que eles explorem verdadeiramente esses domínios.
Por falar nisso, o lançamento do Inkling da Thinking Machines, a entrada de áudio nativa me parece muito interessante, é um sinal do futuro.
Max: Sobre o Inkling, o Ocidente realmente, realmente, realmente precisa de um modelo open source que não seja ruim. O mercado ainda é tão ineficiente que não temos nenhuma empresa americana sequer capaz de alcançar o quinto melhor modelo chinês — isso me surpreende. Por um lado, a proibição total dos modelos open source chineses pelo governo americano pode ser apenas uma questão de tempo. Por outro lado, mesmo que não seja proibido, grandes empresas americanas comuns não querem alimentar seus dados proprietários em modelos open source chineses. Mesmo que você carregue os pesos em um data center com arco-isolado, onde o CCP não consiga ver seus dados, os executivos não aceitarão. Muitas empresas se importam com o orçamento de tokens e só querem executar modelos ocidentais ou não chineses. O Inkling é o melhor OSS ocidental que conseguimos agora, mas ainda está muito longe da vanguarda open source — isso me surpreende.
Jordan: Antes era Neotron, agora é Inkling. Acho que a estratégia do Inkling tem duas oportunidades: primeiro, eles precisam ser melhores que a maioria dos modelos open-source chineses para entrar no jogo. Segundo, eles precisam ser melhores que os modelos secundários e terciários dos laboratórios de ponta, melhores que o Sonnet, porque você pode obter inteligência próxima à ponta usando Bedrock ou Foundry e economizar dinheiro com modelos secundários fechados. Sempre tive dificuldade em entender o ponto de vista ocidental de que o open-source "ajuda as pessoas a economizar". É claro que impulsionar modelos para ecossistemas como Fireworks, Together e Base10 é algo positivo, mas a maior parte do mercado está no nível governamental.
Desenvolvido para aceleradores nacionais chineses
Jordan: Outro ponto relevante é que o blog da K3 mencionou que, na fase SFT, foi feito quantização usando MXFP4 e MXFP8 para pesos e ativações; a declaração oficial é de "compatibilidade ampla com hardware". Você acha que a Moonshot se importa com algum outro hardware?
Max: Tenho uma lista de 11 aceleradores chineses; você deveria se inscrever no modelo de aceleradores da SemiAnalysis para saber mais. Chips como Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads aparecem nos artigos e também no código. Executar modelos de ponta em aceleradores nacionais já é uma prioridade nacional na China. Se ainda em finais de 2025 dissermos que o Google é um laboratório de ponta, então agora também precisamos chamar o Moonshot de laboratório de ponta.
Jordan: Por falar nisso, meu pai está em viagem de negócios na China e disse que todos os hotéis estão cheios, porque Xi Jinping vai fazer um discurso naquela região sobre a IA ser a principal prioridade da China. Muito do que você disse está correto.
Harness é o produto em si
Jordan: A maior lição que tirei ao usar esses modelos é que, primeiro, está ficando cada vez mais difícil distinguir entre usar o modelo mais avançado com o modo max thinking e usar o modo de esforço médio. Em tarefas cotidianas, realmente não consigo encontrar nada que esses modelos não consigam resolver. Meu comportamento padrão é sempre ativar o modo mais potente e difícil, porque não me importo com o orçamento do Dylan.
Mas há um nível em que o harness é parte integrante do produto. Testar o Kimi K3 me fez analisar pela primeira vez seriamente o Open Code, o Hermes e o Pi. O harness é totalmente parte do produto. Detalhes simples me fazem escolher este modelo em vez daquele: é possível instalá-lo em um servidor SSH remoto? As atalhos são fáceis de usar? É possível editar comandos anteriores? Esses pequenos detalhes dentro do harness realmente influenciam para onde envio meus tokens, ou seja, para onde direciono meu orçamento.
Max: Muitas pessoas falam sobre orçamento de tokens, mas, com base na sua descrição do fluxo de trabalho, mesmo para tarefas que o GLM consegue realizar, eu ainda prefiro roteá-las para o Fable usando a inteligência do Max, pois o ROI ainda vale o custo. Os benchmarks dizem que muitas tarefas podem ser migradas para o GLM, mas você ainda prefere permanecer nos modelos da Anthropic ou OpenAI.
Jordan: Basicamente, sim. Mas uso muitos bots do Slack e não sei quais modelos estão rodando por trás. Por exemplo, a integração do Slack do Perplexity — se ela começar a encaminhar para K3, para GLM, para Sonnet, na verdade não me importo. Só descobri o quanto os modelos da OpenAI estavam sendo usados ao analisar o uso, porque foi uma decisão tomada por ela mesma. Essa parte de justificativa é feita pelo harness.
Max: Isso é, na verdade, uma oportunidade para pricing baseado em resultado. Se um laboratório adotar pricing baseado em resultado, pode alcançar uma margem bruta de mais de 95%, pois as tarefas pelas quais você paga um preço estável hoje podem ser resolvidas com facilidade.
Jordan: Segundo ponto, não acho que esses laboratórios já tenham esgotado todas as ideias. Eles podem continuar treinando modelos impressionantes para competir no lado de codificação do RSI, mas não nos liberar, mantendo sua “classe inferior permanente”. Eles podem continuar a fazer distilação, nos dando um gostinho, enquanto exploram outras aplicações, como geração de vídeo, áudio para áudio, pesquisa aprofundada — coisas que não são tão parecidas com codificação. Robótica e modelos do mundo são uma direção simples. E se a Anthropic mudar seu foco do trabalho intelectual para o trabalho físico? Não acredito que eles não consigam usar a melhor tecnologia do mundo para construir um negócio sustentável com bom ROI.
Ainda estamos muito cedo
Max: Mesmo sem falar sobre isso, uso esses modelos diariamente em grande escala; meus amigos que são engenheiros de software os usam dez vezes menos e gastam dez vezes menos. Uma pessoa que usa Fable usa tanto quanto alguém que usa Sonnet, mas a pessoa que usa Fable gasta dez vezes mais, com 90% de margem bruta, sustentando a maior parte do negócio. Assim que essas pessoas começarem a usar modelos maiores e com mais frequência, a demanda só aumentará — os modelos nem precisam ficar melhores. E ainda tenho que conversar com vizinhos que não trabalham com tecnologia; entre eles, certamente sou 0,1% ou até 0,01%, com potencial de crescimento de até mil vezes. Voltando à "curva do índice ganso de ouro" do Masa-san (Masayoshi Son).
Jordan: O que ela disse de que “ainda é muito cedo” está totalmente correto, e é por isso que acho que o Kimi K3 não vai desacelerar o aumento líquido de ARR da Anthropic e da OpenAI. Mesmo que uma parte das pessoas que hoje usam Fable e 5.6 se mudem inegavelmente para o Kimi K3, essas pessoas serão completamente superadas por aquelas que ainda não experimentaram seriamente essa tecnologia. Essas pessoas estão descobrindo novos casos de uso com alto ROI todos os dias, e ainda assim continuarão usando o 5.6 Soul ou o Fable 5 para desbloquear esses novos cenários. Você não verá uma desaceleração na taxa de crescimento do ARR.
Max: Pense em quantas pessoas ainda não se inscreveram neste podcast ou não seguem a SemiAnalysis. Na semana passada, fui ao ICML, e na semana anterior, fui à conferência AI Engineer, que é uma conferência oficial de IA, e mais de 80% das pessoas nunca ouviram falar da SemiAnalysis. Você se diz trabalhador na indústria de IA, mas nem sequer leu a SemiAnalysis? Ainda estamos muito no início.
Jordan: Isso é um check de ego para você mesmo, Max, acalme-se.
