Resumo gerado por IA: Em julho de 2026, Moon Shadow lançou abertamente o modelo Kimi K3 e divulgou pela primeira vez a lista de 401 contribuidores. A avaliação mais recente da empresa atingiu 31,5 bilhões de dólares, com uma equipe de mais de 300 pessoas, idade média inferior a 30 anos, ou seja, cada membro sustenta uma avaliação de 700 milhões de dólares. A equipe central inclui os três cofundadores: Zhou Xinyu, responsável por algoritmos; Wu Yuxin, arquiteto; e Zhang Yutao, CTO, além de outros membros-chave provenientes de universidades de ponta como Tsinghua e CMU. A equipe realizou inovações em tecnologias fundamentais, como o mecanismo de atenção híbrida MoBA, a arquitetura de inferência desacoplada Mooncake e o otimizador Muon, recebendo reconhecimentos como o Melhor Artigo da conferência FAST 2025 em armazenamento. Essa jovem equipe de entusiastas é conhecida por sua gestão plana, levando à excelência a eficiência de engenharia baseada nos princípios "longo, rápido e econômico", tornando-se uma força importante no campo de modelos de grande porte na China.Autor e fonte do artigo: Leiphone
Em 27 de julho, Moonshot apresentou toda sua sinceridade, lançando totalmente o modelo Kimi K3 de 2.8T em código aberto. No final do relatório técnico, eles divulgaram pela primeira vez a lista real de contribuidores por trás do Kimi K3; contamos 401 membros, o que representa uma apresentação completa da equipe de talentos da Moonshot.
Da equipe inicial, cuja avaliação era de apenas alguns centos de milhões de dólares, até o verdadeiro "orgulho dos grandes modelos nacionais", a Moonlight Dark Side tornou-se uma das poucas equipes de entusiastas capazes de enfrentar os modelos de ponta como Claude Fable 5 e GPT-5.6 Sol na mesa global.
Com o lançamento do K3, a avaliação mais recente da Moon Shadow subiu para 31,5 bilhões de dólares, cerca de 210 bilhões de yuans, sustentada por uma equipe extremamente jovem.
De acordo com informações públicas, a Lua da Sombra tem cerca de 300 pessoas, com idade média inferior a 30 anos, das quais 80% são do tipo I. Se fizermos a conversão, basicamente cada pessoa suporta uma avaliação de 700 milhões de yuans.
A estrutura organizacional da Luna Obscura é extremamente plana. A Luna Obscura tem cinco fundadores, cada um diretamente conectado a 40 a 50 pessoas em média. Internamente, é conhecida por “sem hierarquias, sem KPIs e sem barreiras departamentais”; os funcionários podem desafiar seus líderes a qualquer momento. Um detalhe interessante é que, na reunião de reflexão no início de 2025, um funcionário apresentou uma sugestão ousada; após ouvi-la, Yang ZhiLin foi ainda mais longe do que sugerido, abandonando diretamente o K1 para se concentrar no K2.
Essa diversidade também está presente na "alma" da empresa. Como entusiasta de rock, Yang Zhilin nomeou as salas de reunião após bandas lendárias como Rolling Stones, Nirvana e Radiohead, e até mesmo os planos de assinatura do Kimi são nomeados com termos musicais como Adagio e Allegro.
A Lua Escura acredita que, na era atual, em que a capacidade de processamento e os dados estão cada vez mais homogeneizados, o "gosto" é o impulso central para construir barreiras de diferenciação. Esse gosto não apenas se manifesta no aprimoramento dos modelos, mas também se reflete profundamente na exigência e no desejo por talentos.
A Lua da Sombra gosta de contratar CEOs e tem uma forte preferência por pessoas com "aura de empreendedor" ou "gene de apostador". Dados públicos mostram que, internamente, pelo menos 50 pessoas fundaram ou se juntaram a startups. No último ano, mais de 100 dos novos contratados da Lua da Sombra foram indicados internamente.
Hoje, seguindo a lista, realizamos uma investigação abrangente e reunimos todas as informações públicas e confiáveis sobre os contribuidores do K3. O contexto central e a competência técnica robusta deste time de elite de entusiastas são totalmente revelados.
01 Kimi - Fundação principal do sistema técnico
Zhou Xinyu:
Zhou Xinyu é um dos cofundadores principais da Moon Shadow e também é o responsável pela equipe de algoritmos.
Zhou Xinyu e Yang Zhilin já se conheciam há muito tempo; um detalhe interessante é que Zhou Xinyu já foi guitarrista da banda Splay da Universidade Tsinghua, e o baterista era justamente Yang Zhilin.
Antes de se juntar à Moonshot, Zhou Xinyu trabalhou na Megvii na produção em escala de algoritmos e pesquisa de modelos para dispositivos móveis. Ele colaborou estreitamente com Zhang Xiangyu, então responsável pela pesquisa básica da Megvii e atual cientista-chefe da Jieyue Xingchen, sendo autor principal e desenvolvedor direto da obra de rede leve ShuffleNet.
O foco principal de Zhou Xinyu é a produção em massa de algoritmos de grandes modelos, com habilidade em transformar eficientemente e com baixo custo os algoritmos mais avançados de laboratório em sistemas de linha de produção em larga escala. Ele também é especialista em otimização de arquiteturas híbridas; na AMA da comunidade Reddit, foi o primeiro a desmontar as vantagens comparativas da arquitetura híbrida Kimi K3 KDA combinada com NoPE MLA, comprovando que essa arquitetura consome menos poder computacional e é mais rápida tanto no pré-treinamento quanto no aprendizado por reforço.
Wu Yuxin:
Wu Yuxin é um dos cofundadores da Moonshot. Ao mesmo tempo, é um especialista de ponta e arquiteto estrela na área de inteligência artificial, com profundo conhecimento nas infraestruturas e arquiteturas de baixo nível de aprendizado profundo, visão computacional (CV) e modelos de linguagem de grande porte (LLM).
Wu Yuxin e Yang Zhilin têm a mesma formação educacional, graduando-se em Ciência da Computação na Universidade Tsinghua e posteriormente prosseguindo estudos na Universidade Carnegie Mellon (CMU) nos Estados Unidos. Ele trabalhou como engenheiro de pesquisa no laboratório de pesquisa da Meta AI (FAIR), onde liderou e contribuiu para várias tecnologias marcantes em visão computacional.
Antes de fundar a Moonshot com Yang Zhilin, Wu Yuxin já havia deixado dois resultados de padrão industrial na área de aprendizado profundo e visão computacional:
Um deles, como um dos principais criadores e desenvolvedores do Detectron2, este projeto redefiniu diretamente o ecossistema de pós-graduação em visão computacional global, tornando-se a “base universal” para milhares de modelos visuais e projetos de detecção de objetos em todo o mundo.
Mais inovador ainda, ele publicou em 2018, em colaboração com o renomado acadêmico Kaiming He, um trabalho seminal sobre Group Normalization, recebendo menção honrosa de melhor artigo na ECCV 2018.
Este artigo clássico superou diretamente o gargalo fatal da Normalização em Lote em treinamentos com pequenas amostras. A capacidade de “reescrever as regras globais de treinamento de IA” com apenas algumas linhas de inovação de baixo nível conferiu a Wu Yuxin uma enorme influência técnica no mundo open source.
Na face oculta da lua, ele foi quem construiu a base. Ele participou profundamente na otimização da arquitetura de grandes modelos e da eficiência de treinamento, e até compareceu pessoalmente à conferência global de desenvolvedores PyTorch, desmontando detalhadamente para o mundo inteiro a contribuição fundamental do Kimi para a infraestrutura de código aberto global.
A especialização de Wu Yuxin completou perfeitamente o último pedaço do quebra-cabeça necessário para o Kimi desafiar os limites da próxima geração de textos longos multimodais. Ele é especialista em otimização de sistemas de aprendizado profundo de alto desempenho, resolvendo como fazer com que modelos grandes operem de forma mais estável, calculem mais rapidamente e consumam menos memória mesmo com trilhões de parâmetros — exatamente a barreira tecnológica que permite ao Kimi manter uma experiência suave sob textos longos e alta concorrência.
Como um dos principais autores do MoCo v1, obra marcante no campo do aprendizado profundo, ele permitiu que o Kimi não apenas possuísse o cérebro mais poderoso da indústria (compreensão de linguagem natural), mas também esteja desenvolvendo olhos capazes de compreender profundamente o mundo físico real (visão multimodal).
Zhang Yutao:
Zhang Yutao é um dos cofundadores da Moonshot AI e também seu CTO. Ele e Yang Zhilin são colegas da Universidade Tsinghua, e Tang Jie, fundador de Zhipu, é seu professor.
Em 2016, Zhang Yutao e Yang Zhilin fundaram conjuntamente "Circula Intelligence", e posteriormente, ele e Yang Zhilin fundaram "Lado Escuro da Lua". Se Yang Zhilin é o "navegador" do Lado Escuro da Lua, então Zhang Yutao é o engenheiro-chefe responsável por ajustar o sistema de propulsão do navio "Inteligência" ao seu máximo. O Kimi conseguiu uma evolução significativa em textos longos, raciocínio complexo e execução de tarefas de Agent, graças em grande parte a Zhang Yutao.
Antes de se juntar à Lua da Sombra, ele já havia deixado diversos resultados de impacto de nível "industrial" na área de grafos de conhecimento e fusão de dados heterogêneos.
Um dos seus marcadores técnicos mais conhecidos é ter liderado, como responsável técnico, o desenvolvimento da plataforma de análise de big data acadêmico AMiner. A tecnologia central de fusão de dados heterogêneos por trás desta plataforma, que hoje serve milhões de acadêmicos em todo o mundo, inclui capacidades fundamentais desenvolvidas por Zhang Yutao durante seu doutorado na Universidade Tsinghua. Essa profunda compreensão de “como grandes volumes de conhecimento são absorvidos, compreendidos e recuperados por máquinas” formam diretamente a base técnica da capacidade do Kimi de processar textos ultra longos.
Em contribuições acadêmicas, publicou diversos artigos altamente citados em conferências de computação de alto nível, como KDD e CIKM. Ele não apenas se destaca em dotar a IA com “senso lógico” por meio de grafos de conhecimento, mas também liderou o desenvolvimento da “Plataforma AI de Mil Ciclos Zero Shot” durante a era da inteligência cíclica, realizando a implementação em escala de modelos de grande porte da indústria em cenários de serviços empresariais.
A área de especialização de Zhang Yutao previu com precisão cada ponto de transição da IA da fase "capaz de conversar" para a fase "capaz de realizar tarefas". Ele se concentra em impulsionar a tecnologia de janelas de contexto longo e arquiteturas de rede de expansão dinâmica, resolvendo como manter a IA "alerta" em meio a grandes volumes de informações.
Na mais recente conferência técnica de julho de 2026, ele esclareceu de forma precisa as três linhas tecnológicas da engenharia industrial: em 2023, foi a era do Prompt, focada em "como fazer perguntas"; em 2024, evoluiu para a era do Contexto, centrada em "fornecer informações suficientes"; e em 2026, os grandes modelos entraram oficialmente na nova fase da engenharia Harness. Atualmente, ele está liderando sua equipe para resolver o confronto final dos Agentes: "como construir ambientes de execução que permitam que a IA se corrija automaticamente em caso de falhas".
Xu Xinran:
Xu Xiran é vice-presidente de engenharia e responsável por infraestrutura de IA da Moonshot AI.
Ele possui experiência em desenvolvimento de camada completa e anteriormente trabalhou na MegEngine (Tianyuan) e no sistema de busca de vetores em bilhões na Megvii. Atualmente, ele é responsável pelo design geral da arquitetura de treinamento, inferência e infraestrutura dos grandes modelos da Moonshot.
Na extremidade de inferência de grandes modelos, para o cenário de negócios de texto longo do Kimi, ele e sua equipe projetaram conjuntamente a arquitetura de inferência separada Mooncake, centrada no KV Cache. Este resultado, que separa completamente as fases de pré-preenchimento (Prefill) e decodificação (Decode), aliviando a pressão de memória gráfica e I/O em contextos ultra-longos de milhões de tokens, recebeu o prêmio de Melhor Artigo da conferência de armazenamento de alto nível FAST 2025.
Ao mesmo tempo, como um dos principais autores do mecanismo MoBA (Mixed Block Attention), ele implementou significativa redução de custos e aumento de eficiência no treinamento e na inferência do Kimi por meio da divisão de atenção em nível de bloco.
Na fase de treinamento do modelo, ele participou do desenvolvimento do projeto de código aberto Moonlight e de seu otimizador subjacente, Muon, substituindo o AdamW tradicional por orthogonalização matricial, reduzindo o custo de computação em modelos de trilhões de parâmetros durante o treinamento distribuído.
Com base nessa série de práticas em armazenamento distribuído e inferência em grandes volumes de texto, ele foi convidado a palestrar na GOSIM China, uma conferência global de código aberto. Sua área de especialização sempre se concentrou na arquitetura de modelos de grande escala, buscando suportar inferência de texto longo de alta inteligência com menor consumo de FLOPs e menor uso de KV Cache.
He Weiran:
Como responsável pelo sistema de raciocínio da Lua Oculta, ele é o autor principal do artigo premiado como o melhor no FAST 2025 e um dos principais engenheiros técnicos responsáveis pela implementação da arquitetura de raciocínio de longos textos do Kimi. Desde o Kimi k1.5, Kimi-VL, K2 até Kimi Linear, Kimi-Audio, e ainda aos artigos fundamentais MoBA, Muon e AttnRes, seu nome aparece em todas as seis gerações de tecnologias, com todo o seu trabalho centrado em um único objetivo: trocar design de sistema por eficiência, tornando os grandes modelos verdadeiramente acessíveis.
Antes de se juntar à Moonshot, He Weiran já havia se dedicado por muitos anos à área de computação de alta eficiência. Formado pelo Departamento de Ciência da Computação da Universidade Tsinghua, ele se especializou nos primeiros anos em roteamento de chips e otimização de desempenho em nível inferior; durante seu período na Megvii, liderou o desenvolvimento de chips de IA próprios e redes neurais de baixa precisão, trabalhando ao mesmo tempo que Zhou Xinyu, futuro co-fundador da Moonshot — Zhou Xinyu é justamente o primeiro inventor da solução clássica de detecção de texto OCR, chamada EAST.
Após se juntar à Lua do Lado Escuro em 2023, ele aplicou toda a sua experiência de anos em engenharia de sistemas ao serviço de inferência de modelos com trilhões de parâmetros.
Seu resultado mais representativo é a arquitetura de inferência separada KVCache, chamada Mooncake. Este sistema quebrou os padrões tradicionais de arquitetura de serviços de inferência, isolando e centralizando o cache de memória mais exigente em termos de memória gráfica dos grandes modelos, aumentando a capacidade de requisições do Kimi em mais de 75% sem aumentar a escala de computação, por meio de reutilização global de cache e roteamento refinado. Em 2024, durante a conferência QCon, ele revelou que, com base nessa arquitetura e otimizações contínuas de engenharia, o custo unitário do cluster de inferência do Kimi caiu mais de 20 vezes em um ano.
Em fevereiro de 2025, o artigo sobre Mooncake recebeu o Prêmio de Melhor Artigo Eric Riedl da conferência FAST — um dos maiores reconhecimentos da área de sistemas de armazenamento. Mais importante ainda, antes mesmo do artigo ser oficialmente premiado, essa arquitetura já estava em operação estável em milhares de nós do ambiente de produção do Kimi, processando bilhões de tokens de solicitações dos usuários por dia.
Embora o relatório técnico da K3 não divulgue divisões individuais específicas, várias conquistas centrais seguem a linha técnica de sua equipe: para resolver o problema de falha de cache de prefixo tradicional sob a arquitetura híbrida KDA+MLA, a equipe contribuiu com uma implementação oficial adaptada para a comunidade vLLM; para solicitações longas de milhões de tokens, o cluster adota uma estratégia de roteamento e agendamento consciente de cache, maximizando a eficiência de reutilização de cache. O resultado final da K3 é um custo de inferência de apenas 38% em comparação com o Claude Fable 5, e otimização de KVCache, cache de prefixo e controle de custos são exatamente as principais questões do sistema Mooncake.
Da roteamento de chips à inferência de modelos de trilhões de parâmetros, o caminho técnico de He Weiran sempre foi claro: perseguir incansavelmente a eficiência do sistema, trocando design de engenharia por custos computacionais mais baixos. Se pesquisadores de algoritmos de ponta elevaram o limite de capacidade do Kimi, ele e sua equipe fizeram o trabalho de colocar essa capacidade de topo em prática, tornando-a acessível e estável para um número maior de usuários comuns.
02 Especialistas consolidados · Líderes práticos
Du Yulun:
Du Yulun é responsável pelas áreas de pré-treinamento e escalonamento na Moonshot.
Ele se formou pela Universidade de Illinois em Urbana-Champaign e pela Universidade Carnegie Mellon, com especialização em inteligência artificial. Posteriormente, juntou-se à CirculAI, atuando como pesquisador e responsável pelo AI Lab, sendo um dos principais pioneiros técnicos da Moonshot.
Como responsável central pelo pré-treinamento e escalonamento da base do modelo, suas contribuições técnicas abrangem integralmente as bases principais de todas as gerações do Kimi, bem como o design arquitetural de toda a série multimodal, incluindo VL e Áudio.
Nas descobertas tecnológicas subjacentes, ele é coautor dos artigos "Attention Residuals", "MoBA (Mixed Block Attention)" e do otimizador de pré-treinamento "Muon is Scalable for LLM Training". Seu trabalho centra-se em aliviar o problema de atenuação de sinal em redes ultra profundas por meio da divisão de atenção em nível de bloco e reestruturação do fluxo de treinamento, aumentando significativamente a eficiência do treinamento distribuído de modelos de trilhões de parâmetros.
Na camada de código aberto de engenharia, ele é um contribuidor central ativo nos projetos de código aberto oficiais da MoonshotAI. De acordo com os registros de colaboração de código, Du Yulun trabalha em alta frequência em conjunto com os especialistas em algoritmos Su Jianlin e o responsável pelo sistema de inferência He Weiran, formando juntos o闭环 técnico subjacente que sustenta o Kimi no processamento eficiente de textos longos em escala de milhões e na流转 de múltiplos modais.
Zhang Yu:
Zhang Yu é o arquiteto-chefe da Moonshot, especializado no design de arquiteturas eficientes, escaláveis e amigáveis ao hardware para modelos de linguagem grandes. Como pioneiro nas abordagens não-Transformer e atenção linear, ele se dedica a superar o desafio operacional de que textos mais longos ficam cada vez mais lentos e extremamente custosos.
Na academia e na prática de engenharia, Zhang Yu obteve grandes conquistas. Ele não apenas foi co-primeiro autor do artigo "Attention Residuals" sobre conexões residuais, mas também o principal pesquisador por trás da arquitetura eficiente do modelo da Moonlight Dark Side.
O modelo Kimi Linear, por ele liderado como código aberto, foi o primeiro a aplicar com sucesso o mecanismo de atenção linear em tarefas de contexto ultra longo, alcançando um salto de eficiência revolucionário. Além disso, o relato “Jornada de Desenvolvimento do Kimi Linear”, compartilhado por ele em comunidades técnicas como Zhihu, continua sendo considerado um guia obrigatório por inúmeros engenheiros de dados de grandes modelos.
Da quebra das bases do modelo de 7B até ajudar na ascensão de modelos de trilhões de parâmetros ao primeiro escalão global, Zhang Yu desloca-se com facilidade entre o mundo acadêmico e o industrial, deixando numerosos códigos avançados em conferências acadêmicas de alto nível e comunidades de código aberto.
Essas inovações surgem de seu aprofundamento nas tecnologias centrais: no design de arquiteturas de modelos eficientes, ele se concentrou na otimização de gargalos de comunicação e memória durante a expansão da profundidade do modelo; no aumento da dinâmica e eficiência de treinamento, ele resolveu fundamentalmente os problemas de diluição de gradiente e explosão de estado oculto causados pelo PreNorm em grandes modelos, por meio da reestruturação do fluxo residual subjacente.
Lai Guokun:
Lai Guokun é um ex-aluno duplo da Tsinghua e da Universidade Carnegie Mellon de Yang Zhilin.
Ele é um dos pesquisadores com mais artigos da equipe Kimi, com mais de dez publicações; não apenas é uma das figuras representativas do "Clube dos Gênios" da Moonshot, mas também um contribuidor central do Kimi K3 e um especialista com realizações "definidoras" na comunidade acadêmica.
Antes de se juntar à Lua da Face Escura, Lai Guokun já havia deixado dois resultados de padrão industrial na área de PNL (Processamento de Linguagem Natural).
Um deles criou um dos maiores conjuntos de dados de compreensão de leitura por máquina do mundo, o conjunto de dados RACE, que treina IA diretamente com questões de exames de inglês de estudantes chineses, tornando-se a referência global para compreensão de leitura por máquina.
Mais impressionante ainda, seu artigo de graduação sobre algoritmos de recomendação, intitulado “Explicit factor models for explainable recommendation”, recebeu o Prêmio SIGIR Test of Time em 2024, uma das mais altas honrarias na área de recuperação de informações, concedido exclusivamente a artigos publicados há dez anos que resistiram ao teste do tempo e tiveram impacto duradouro na indústria.
Essas pessoas que, já na graduação, possuem a capacidade de “definir a rota tecnológica dos próximos dez anos” não são exceções na Luna Obscura.
A área de especialização de Lai Guokun é muito alinhada com as capacidades centrais do Kimi, como sua expertise em "compreensão de leitura por máquina", que aborda como fazer com que a IA compreenda documentos longos e responda perguntas — exatamente a base tecnológica central da capacidade de texto longo do Kimi.
O treinamento prévio de grandes modelos foi um dos principais focos de sua pesquisa durante o período na CMU, além de se dedicar à busca de arquiteturas neurais, estudando como permitir que a IA projete automaticamente estruturas de rede melhores. Também trabalhou com sistemas de recomendação explicáveis, para que a IA não apenas recomende conteúdo, mas também explique aos usuários por que aquele conteúdo foi recomendado.
Guo Haiqing:
Haiqing Guo foi um dos primeiros membros centrais da equipe Kimi da Moonshot, sendo uma figura sênior da equipe e participando integralmente no desenvolvimento e iteração de diversos projetos principais da Kimi.
Os projetos publicamente verificáveis incluem o relatório técnico Kimi k1.5, o relatório técnico Kimi K2, o artigo da arquitetura central AttnRes e o relatório técnico Kimi K3. O AttnRes é uma das duas inovações arquiteturais centrais do Kimi K3.
Pela trajetória assinada, ele acompanhou todo o ciclo de iteração dos modelos principais do Kimi, da k1.5 ao K3, participando em todas as etapas centrais de desenvolvimento de múltiplas gerações de produtos, sendo um participante contínuo essencial da equipe técnica do Kimi. Atualmente, os canais públicos ainda não divulgaram seu cargo específico nem suas atribuições detalhadas de desenvolvimento.
Chen Guangyu:
Chen Guangyu provavelmente é o pesquisador mais jovem da Moon Shadow, nascido em 2009, com 17 anos, um jovem que fez Elon Musk excluir publicamente no X: “Impressive”.
Ao lançar o flagship Kimi K3, com 2,8 trilhões de parâmetros que chocou o mundo, ele já estava ao lado de especialistas em tecnologia como Su Jianlin e outros, como coautor principal do trabalho fundamental da arquitetura central do Kimi K3, intitulado “Attention Residuals”.
O mecanismo de Attention Residuals em que ele participou diretamente reformulou a conexão residual padrão utilizada há dez anos na área de aprendizado profundo, permitindo que o modelo "olhasse para trás" de forma inteligente por meio de "atenção profunda aprendível". Essa reconstrução fundamental aumentou a eficiência de escala do modelo em 1,25 vezes, permitindo que empresas chinesas avançassem mais rápido no cenário de batalha por capacidade de computação de trilhões, com custos mais baixos. Sua história de entrada na Luna Dark é bastante extraordinária. Há um ano, ele nem sabia o que era um Transformer; foi descoberto por uma startup da Vale do Silício após propor, em um hackathon, a ideia de "um terceiro braço mecânico auxiliar humano". Sete semanas depois, foi totalmente notado pela equipe Kimi e integrado de forma excepcional ao grupo central de pesquisa da empresa. Na primeira semana de contratação, ele quebrou todas as convenções, desmontou diretamente o sistema e venceu o campeonato interno da Kimi em um hackathon de 48 horas.
Du Angang:
No relatório técnico do Kimi, o nome Du Angang aparece sempre em primeiro lugar. Ele é um dos principais pilares do sistema multimodal da Moonshot, sendo um dos poucos pesquisadores a participar de todas as cinco gerações no relatório técnico do Kimi. Ele já ocupou a primeira posição na lista de autores da equipe duas vezes, sugerindo que sua contribuição central no Kimi K3 está no campo visual.
Antes de se juntar à Lua da Face Escura, Du Angang já havia estabelecido duas bases sólidas no campo da visão computacional.
Um foco profundo na visão microscópica subaquática. Durante sete anos de graduação e mestrado no Laboratório de Visão Subaquática da Universidade Oceanográfica da China, especializei-me na classificação de imagens microscópicas de plâncton — uma tarefa de extrema dificuldade, que exige que a IA identifique com precisão as menores formas de vida no oceano, em imagens microscópicas com foco borrado, amostras escassas e diferenças entre espécies extremamente sutis.
Em 2020, ele publicou como primeiro autor um estudo relevante no Global OCEANS, utilizando modelagem de características de segunda ordem para resolver o desafio da classificação de granularidade fina — o único resultado nessa linha de pesquisa nos últimos dez anos do laboratório com um aluno de mestrado como primeiro autor.
O que tem mais impacto na indústria são suas contribuições durante seu período na Megvii. Sua pesquisa sobre estimativa de postura multi-pessoa foi aceita pela conferência de ponta em visão computacional ECCV 2020, acumulando mais de 300 citações e tornando-se uma referência importante no campo de estimativa de postura humana. Entre os coautores deste trabalho estão figuras líderes na área de visão, como Sun Jian e Zhang Xiangyu, bem como Zhou Xinyu, co-fundador da Moonshot AI.
Após chegar à Kimi, ele se aprofundou no design de codificadores visuais, alinhamento multimodal e tecnologias de agentes visuais, sendo especialmente especialista em compreensão de imagens de alta resolução, análise de vídeos de longa sequência e aprendizado por reforço multimodal — exatamente a base tecnológica central das capacidades multimodais nativas da Kimi. Além disso, suas competências se estendem para baixo até a infraestrutura de treinamento de grandes modelos — desde a estabilidade de otimizadores até a síntese de dados de agentes, formando uma capacidade completa que abrange desde algoritmos visuais de baixo nível, treinamento de modelos até a implementação de agentes de nível superior.
Em 2025, ele publicou como primeiro autor o modelo multimodal de código aberto Kimi-VL, desenvolvendo o codificador visual MoonViT, que nativamente suporta entradas de alta resolução, combinado com a capacidade de contexto longo de 128K, permitindo que o Kimi adquirisse pela primeira vez a compreensão multimodal de textos longos, como vídeos e documentos extensos, estabelecendo a base técnica para toda a família multimodal do Kimi.
Na fase K2, ele participou profundamente no desenvolvimento do otimizador MuonClip, combinando-se com o mecanismo QK-Clip para resolver o problema da instabilidade no treinamento de grandes modelos, permitindo a realização de treinamento em escala de 15,5 trilhões de tokens com “picos de perda zero” e reduzindo significativamente o custo e o risco computacional do treinamento; na fase K3, a pipeline de síntese de dados por agentes que ele liderou permitiu que o modelo gerasse automaticamente dados de treinamento de alta qualidade, fornecendo suporte crucial para que o K3 se posicionasse entre os primeiros do mundo em tarefas complexas como programação e agentes.
Para o Kimi, sua contribuição percorreu toda a trajetória de evolução das capacidades multimodais.
Qu Bo Wen:
Bowen Qu (Brian Qu) pertence à equipe de pós-treinamento de modelos. Graduou-se no Colégio de Eletrônica, Informação e Comunicação da Universidade de Ciência e Tecnologia da China Central e obteve seu mestrado no Colégio de Eletrônica da Universidade de Pequim. Sua pesquisa se concentra em direções relacionadas a modelos multimodais, abrangendo especificamente aprendizado por reforço multimodal, modelos visuais-linguísticos, agentes de IA e avaliação da qualidade de conteúdo AIGC.
Após se juntar à Moonshot, Qu BoWen concentrou seu trabalho principal na construção das capacidades multimodais da série Kimi, participando profundamente do projeto Kimi-K2.5 e envolvendo-se no desenvolvimento de direções de aprendizado por reforço multimodal nativo. Kimi-K2.5 é um modelo de agente multimodal nativo lançado pela Moonshot, com um total de 1T de parâmetros e 32B de parâmetros ativados.
O sistema de aprendizado por reforço multimodal nativo liderado por Qu Bowen sai do caminho tradicional de modelos multimodais, que primeiro realizam o fine-tuning supervisionado visual e depois iniciam o aprendizado por reforço. Ele propõe um método de treinamento que parte de um modelo de raciocínio puramente textual sem fine-tuning supervisionado visual, adquirindo diretamente capacidades de raciocínio visual por meio de aprendizado por reforço visual, evitando assim a interferência de dados visuais de baixa qualidade na capacidade nativa de raciocínio linguístico do modelo.
A pesquisa de Qu Bowen começou na área de avaliação da qualidade de conteúdo AIGC, com resultados publicados em conferências internacionais como ICME 2024 e CVPRW 2024. O artigo publicado no ICME 2024 abordou o problema de que os sistemas de avaliação de imagens geradas por IA na época se concentravam apenas na beleza visual e clareza, ignorando a correspondência entre o conteúdo gerado e as instruções do usuário, propondo uma solução que incorporasse prompts de texto ao sistema de avaliação da qualidade das imagens geradas, construindo um padrão de avaliação que abrangia tanto a qualidade visual quanto a aderência às instruções, aumentando a abrangência da avaliação de conteúdo gerado por IA e sua alinhamento com a percepção humana.
Qu Bo Wen também aparece na lista de contribuidores das versões multimodais da série Kimi. Como jovem pesquisador, a trajetória de pesquisa de Qu Bo Wen se estendeu da construção de sistemas de avaliação para o desenvolvimento de capacidades de modelos, e posteriormente para a pesquisa em capacidades avançadas de agentes, com resultados fortemente alinhados às necessidades práticas da indústria e diretamente voltados para a iteração e atualização de modelos em produção.
Lu Enzhe:
Na lista de mais de 400 contribuidores do Kimi K3, Lu Enzhe não está entre os nomes listados mais prominentemente, mas suas ações são excepcionalmente precisas. Cada resultado atinge exatamente os principais desafios na implementação de grandes modelos, sendo um dos construtores-chave do sistema de alta eficiência de computação do Kimi.
A área de pesquisa de Lu Enzhe pode ser resumida precisamente em três palavras: longo, rápido, econômico. Seu objetivo central é permitir que modelos grandes processem textos mais longos com menor custo e maior velocidade. Para o Kimi, ele é responsável pela melhoria de eficiência em toda a cadeia, desde o treinamento até a inferência.
Em fevereiro de 2025, ele publicou, como primeiro autor, o mecanismo de atenção híbrida de bloco MoBA, transferindo a ideia de seleção de especialistas do MoE para a camada de atenção, permitindo que o modelo, ao processar solicitações, chamasse apenas os blocos de contexto mais relevantes para cálculo. Com 95% de esparsidade, o desempenho foi equivalente ao da atenção completa, alcançando aceleração de 6,5 vezes para inferência de milhões de tokens e 16 vezes para inferência de dezenas de milhões de tokens, solidificando diretamente a arquitetura subjacente da capacidade de contexto ultra longo do Kimi.
No dia do lançamento, o artigo foi apresentado simultaneamente com o artigo da DeepSeek sobre a NSA, tornando-se o evento de conflito tecnológico mais acompanhado do ano no círculo de grandes modelos domésticos; o valor de engenharia é ainda mais evidente pelo fato de que, antes de ser aceito como artigo Spotlight no NeurIPS 2025, essa solução já estava operando de forma estável no ambiente de produção do Kimi, atendendo a solicitações de contexto longo por quase um ano.
Além disso, desde a atenção KDA do MoBA até o Kimi Linear, ele dedicou-se integralmente ao design da arquitetura para maximizar a eficiência de inferência em hardware; no lado do treinamento, a implementação distribuída do otimizador Muon que ele contribuiu desenvolveu o uso de memória ideal e comunicação eficiente, reduzindo concretamente os custos de computação para o treinamento de grandes modelos. Considerando os relatórios técnicos da AttnRes e das gerações K1.5, K2 e Kimi-VL, seu trabalho cobre integralmente toda a cadeia de tecnologias para modelos grandes eficientes.
Dentro da equipe, ele é parceiro fixo de Qiu Jiezhong, um dos autores de correspondência do artigo MoBA: um avança para o terreno, enquanto o outro orienta a direção, com excelente química.
Wang Yuzhi:
Wang Yuzhi é um pesquisador da Moonshot AI e um dos autores mais frequentemente citados nos relatórios técnicos da série Kimi.
Da K1.5 de janeiro de 2025 ao Kimi K3 de julho de 2026, seu nome aparece em quase todos os documentos técnicos dessa empresa, abrangendo visão, áudio, arquiteturas de atenção, otimizadores de treinamento, modelos principais e até frameworks avançados de governança de riscos de IA.
Ele é graduado pela Universidade de Ciência e Tecnologia de Xi'an e doutor pelo Departamento de Engenharia Eletrônica da Universidade Tsinghua; após ingressar no Instituto Megvii, atuou como engenheiro de pesquisa; em 2024, juntou-se à Moonshot AI como pesquisador e permanece nesse cargo até hoje.
Antes de se juntar à Moonshot, suas pesquisas se concentraram em fotografia computacional e visão de baixo nível. Resultados representativos incluem: como primeiro autor, publicar um artigo sobre redução de ruído de imagens RAW em dispositivos móveis na ECCV 2020, uma direção que ainda é considerada uma referência na imagem móvel; como membro da equipe Megvii, conquistar o primeiro lugar global no desafio NTIRE 2019 de remoção de ruído de imagens reais na trilha raw-RGB; e como coautor, participar do trabalho clássico no campo de OCR, EAST (CVPR 2017, mais de 2.500 citações).
Durante a fase da face oculta da lua, ele participou da assinatura de dez documentos técnicos, incluindo: k1.5, K2, K3, Kimi-VL, Kimi-Audio, MoBA, Muon, Kimi Linear, quatro artigos sobre arquitetura e eficiência do Attention Residuals, e um framework avançado de gestão de riscos de IA.
É importante notar que ele está listado como autor em todas as quatro obras da empresa sobre arquitetura e eficiência, uma abrangência rara entre os cerca de quatrocentos contribuidores. As responsabilidades específicas dele na K3 ainda não estão disponíveis publicamente.
Mao Shaoguang:
Mao Shaoguang é um pilar central da linha técnica do Kimi Agent, participou integralmente do desenvolvimento das quatro gerações principais: K2, K2-Thinking, K2.5 e K3, e é um dos poucos pesquisadores do setor a ter vivenciado integralmente as duas transições de paradigma da indústria de Agentes.
Antes de se juntar à Lua da Face Oculta, ele já era um dos primeiros profissionais no país a implementar Agentes.
Graduado com mestrado em Ciência da Computação da Universidade Tsinghua, classificado entre os 0,2% superiores durante a faculdade e recebedor da Bolsa Nacional. Atuou como assistente de pesquisa na Universidade Chinesa de Hong Kong e realizou estágio no grupo de voz do Microsoft Research Asia. Após a formatura, trabalhou por quase seis anos na Microsoft, evoluindo de engenheiro do instituto de pesquisa para engenheiro sênior de desenvolvimento.
Em 2023, participou do desenvolvimento do TaskMatrix.AI, integrando o ChatGPT a centenas de milhares de APIs; posteriormente, propôs conjuntamente o método Solo Performance Prompting, permitindo que um único modelo desempenhe múltiplos papéis para simular a colaboração de múltiplos agentes inteligentes, com tecnologias relacionadas implementadas no Microsoft 365 Word.
Essa é a "era dos frameworks" do Agent — todas as capacidades dependem de ferramentas externas e são guiadas por prompts, e ele foi tanto um participante quanto um construtor dessa abordagem tecnológica.
Mas Mao Shaoguang, que havia percorrido pessoalmente esse caminho, foi o primeiro a enxergar as limitações do antigo paradigma. Em junho de 2025, ele escreveu no Zhihu: "Este caminho está se tornando cada vez menos interessante, com uma sensação de declínio acelerado."
Após se juntar à Moonshot em fevereiro de 2025, ele mudou completamente para a abordagem end-to-end de “modelo como agente”. Em apenas quatro meses, participou da entrega do primeiro produto agente da Kimi, o Kimi Researcher:
Treinado inteiramente por aprendizado por reforço end-to-end, sem qualquer pré-definição de fluxo, realiza em média 23 passos de raciocínio por tarefa, varre automaticamente 206 páginas da web e produz relatórios de pesquisa de dez mil palavras com citações padronizadas, alcançando 26,9% no benchmark HLE, superando o nível mais alto global na época. Ele também é um dos dois autores listados na descrição técnica oficial do produto.
Depois disso, ele participou profundamente de todo o desenvolvimento das quatro gerações de produtos principais, de K2 a K3. O indicador HLE subiu de 8,6% para 26,9%, e essa curva de desempenho quase inteiramente impulsionada por aprendizado por reforço é exatamente o seu histórico de resultados com a nova rota tecnológica.
Da extensão de capacidades por meio de APIs externas para grandes modelos até a capacidade inerente dos modelos de chamar ferramentas e concluir tarefas complexas autonomamente, a trajetória profissional de Mao Shaoguang nos últimos dez anos reflete exatamente a evolução completa da indústria de Agentes, passando da “montagem e combinação” para o “crescimento nativo”. Ao ter participado diretamente do antigo paradigma e, em seguida, traçado um novo caminho, suas análises sobre a indústria são sustentadas por resultados práticos mais sólidos.
Qin Ruoyu:
Qin Ruoyu é doutorando no laboratório MADSys do Departamento de Ciência da Computação da Universidade Tsinghua, orientado pelo professor associado Zhang Mingxing. Sua pesquisa concentra-se em sistemas de aprendizado de máquina eficientes, abrangendo especificamente dois grandes aspectos: serviço de inferência de modelos linguísticos grandes em larga escala e sistemas de rollout de aprendizado por reforço.
Mooncake, desenvolvido em parceria entre Qin Ruoyu e a equipe da Moon's Dark Side, é uma arquitetura de inferência desacoplada centrada no KVCache. Essa arquitetura separa as fases de Prefill e Decode para operarem em clusters independentes, enquanto integra os recursos ociosos de CPU, memória e SSD no cluster GPU em um pool de cache distribuído. Este resultado recebeu o prêmio Erik Riedel de Melhor Artigo no FAST 2025, o principal encontro da área de armazenamento.
Mooncake é uma plataforma de serviço de produção já implementada; o resumo do artigo inicia explicitamente com "Mooncake é a plataforma de atendimento para Kimi". Sob carga de negócio real, o Mooncake aumenta a capacidade de processamento de requisições do Kimi em 75%; em cenários de contexto longo, a capacidade de processamento de requisições eficazes aumenta de 59% a 498%. Atualmente, esse sistema já está implantado em milhares de nós e processa mais de 100 bilhões de tokens por dia.
Em 2024, a Moon River e o laboratório MADSys da Universidade Tsinghua lançaram conjuntamente o projeto Mooncake (repositório open source: kvcache-ai/Mooncake), e até o momento o número de estrelas no GitHub do projeto ultrapassou 6.000. Os dados e informações relacionados podem ser consultados no artigo do arXiv (número 2407.00079), no anúncio oficial do site do Departamento de Ciência da Computação da Tsinghua e no repositório open source do projeto.
Após o Mooncake, a pesquisa de Qin Ruoyu continuou a aprofundar-se na direção de sistemas de raciocínio. O artigo Seer, do qual ele foi o primeiro autor, foi selecionado para o OSDI 2026; este trabalho aborda o gargalo de desempenho em rollout no aprendizado por reforço, por meio de técnicas de divisão de rollout, agendamento sensível ao contexto e decodificação especulativa em grupo, alcançando um aumento máximo de 2,04 vezes no throughput de rollout end-to-end e redução de 72% a 94% na latência da cauda longa. Outro artigo como primeiro autor, Prefill-as-a-Service, propôs ainda mais uma abordagem de arquitetura de raciocínio de próxima geração para compartilhamento de KVCache entre centros de dados.
Qin Ruoyu também aparece na lista de contribuidores do projeto K3. O desempenho do produto do modelo grande é sustentado por duas capacidades: o desenvolvimento do modelo determina o limite de capacidade do modelo, enquanto a engenharia de sistema determina a disponibilidade e o custo de operação do serviço em cenários de alta concorrência.
A competição atual na indústria de grandes modelos está se expandindo gradualmente da disputa de capacidades de treinamento para a competição em capacidades de engenharia de serviços. Como estudante de doutorado, Qin Ruoyu conseguiu produzir resultados de nível melhor artigo de conferência de topo nesse campo, principalmente porque sua pesquisa é diretamente voltada para cenários de produção e seus resultados foram implementados em sistemas de negócios reais.
Yuan Enming:
Membros principais da equipe de pesquisa da Luna Dark Kimi, com trajetórias de pesquisa abrangendo biologia computacional, sistemas de recomendação e grandes modelos, participaram integralmente da iteração técnica das múltiplas gerações do modelo Kimi.
Anteriormente, ele trabalhou no grupo de pesquisa de Zhenyang Jian no Instituto de Informática Interdisciplinar da Universidade Tsinghua, focando em IA para descoberta de fármacos. Entre 2020 e 2021, sua pesquisa sobre um framework de reutilização de medicamentos contra a gripe foi publicada no preprint bioRxiv e na revista Signal Transduction and Targeted Therapy; além disso, resultados relacionados à separação da proteína da cápside nuclear foram publicados em Protein & Cell.
De 2022 a 2023, Yuan Enming trabalhou no Laboratório Noah's Ark da Huawei, focando em pesquisas sobre sistemas de recomendação, com resultados apresentados em vários congressos acadêmicos internacionais de alto nível. Entre eles, o artigo que ele liderou como primeiro autor sobre recomendação de sequências de múltiplas ações foi selecionado para o SIGIR 2022, e outros trabalhos em colaboração foram selecionados para o CIKM 2022 e o WWW 2023.
Após se juntar à Moonshot, Yuan Enming participou profundamente no desenvolvimento de múltiplos modelos e projetos técnicos principais do Kimi. Projetos publicamente verificáveis com sua autoria incluem o relatório técnico de aprendizado por reforço Kimi k1.5, a pesquisa técnica MoBA, o relatório técnico Kimi-VL, o relatório técnico do grande modelo Kimi K2, o relatório técnico Kimi Linear, o relatório técnico do modelo multimodal Kimi K2.5 e o relatório técnico do modelo principal Kimi K3.
Seu escopo de participação abrange várias direções tecnológicas centrais, incluindo treinamento de aprendizado por reforço, capacidades multimodais, arquitetura de modelos básicos e sistemas de longo contexto, abrangendo integralmente o ciclo de iteração das três gerações de modelos principais do Kimi, do k1.5 ao K3, sendo um dos principais desenvolvedores da equipe com a maior cobertura técnica.
Atualmente, os canais públicos ainda não divulgaram o cargo específico de Yuan Enming na Moonshot ou sua divisão detalhada de pesquisa. A partir das trajetórias de autoria públicas, sua formação interdisciplinar sustenta sua capacidade de participar em múltiplas direções técnicas de modelos grandes, sendo um participante contínuo importante no processo de iteração da arquitetura Kimi.
Hsu Wei-Hsin:
Xu Weixin é pesquisador da Moonshot AI, com foco em arquitetura básica de grandes modelos, mecanismos de treinamento eficientes e otimização de mecanismos de Attention.
Xu Weixin participou profundamente no desenvolvimento dos modelos centrais e das tecnologias subjacentes de múltiplas gerações do Kimi, com projetos de autoria pública abrangendo todo o ciclo de iteração do produto, desde o k1.5 até o K3. Após o lançamento do K3, a Moonshot AI divulgou oficialmente três tecnologias principais desenvolvidas internamente — o otimizador Muon, a atenção linear Kimi Linear e os resíduos de atenção Attention Residuals. Xu Weixin é o único contribuidor atualmente verificável cujo nome aparece em todos os três artigos correspondentes às tecnologias centrais, com posição entre os 15 primeiros em cada um, sendo um dos principais desenvolvedores responsáveis pela melhoria de desempenho da arquitetura K3.
Em termos de resultados concretos, ele figura como o oitavo autor no artigo do Muon Optimizer, lançado em fevereiro de 2025, um otimizador com eficiência computacional cerca de duas vezes superior à do AdamW, e também participou da implementação de treinamento Moonlight, posteriormente disponibilizada como código aberto;
No artigo técnico Kimi Linear, publicado em outubro de 2025, ele ocupou a 15ª posição; o mecanismo KDA proposto por essa arquitetura pode reduzir o volume do KV Cache em até 75% e aumentar o throughput de decodificação em até 6 vezes em cenários de um milhão de tokens;
Na publicação do artigo Attention Residuals em março de 2026 (um dos dois principais inovadores arquiteturais do K3), ele ocupou a quarta posição, sendo o primeiro contribuidor-chave após os três autores principais; a tecnologia relacionada foi profundamente integrada na arquitetura do modelo base Kimi K3.
Além disso, seu nome também aparece na lista de contribuidores dos relatórios técnicos do Kimi k1.5 de aprendizado por reforço, do relatório técnico do Kimi-VL, dos relatórios técnicos do Kimi K2 e K2.5, bem como do mais recente relatório técnico do modelo旗舰 Kimi K3, com participação abrangendo múltiplas direções de pesquisa centrais, como modelo básico, multimodalidade e aprendizado por reforço. Deve-se esclarecer que o autor da论文 MoBA não consta na lista de autores, e não há nenhuma relação de desenvolvimento publicamente verificável entre os dois.
Além disso, ele participou de várias pesquisas na área de visão tridimensional, incluindo preenchimento de cena semântica 3D OccDepth, distilação por aprendizado ativo PVD-AL e reconstrução implícita de SDF na ACCV 2024, com resultados acadêmicos abrangendo múltiplos subcampos, como compressão de modelos, reconstrução 3D e compreensão de cenas semânticas.
A partir das trajetórias de assinatura pública, o caminho de pesquisa de Xu Weixin evoluiu gradualmente da implantação de modelos na borda e da percepção visual tridimensional para inovações na arquitetura subjacente de grandes modelos, com foco contínuo em computação eficiente e uma ampla cobertura tecnológica, sendo um participante central contínuo na iteração da pilha tecnológica subjacente da Moonshot.
Du Chenzhuang:
Du Chenzhuang é um pesquisador-chave da Moon Shadow, sendo o principal membro da equipe responsável pelo aprendizado por reforço e pela expansão das capacidades de raciocínio.
Ele se formou em Gestão e Sistemas de Informação na Universidade de Aeronáutica e Astronáutica de Pequim e, em seguida, ingressou no "Huangpu Military Academy" de talentos em grandes modelos — o Instituto de Informação Interdisciplinar da Universidade Tsinghua para doutorado.
Durante seu tempo em Tsinghua, ele estudou sob o renomado especialista em inteligência artificial, Zhao Xing, e juntou-se ao prestigiado MARS Lab (Laboratório de Multimodalidade e Raciocínio Autônomo), começando a se concentrar em aprendizado multimodal, aprendizado por reforço e mecanismos de refino de grandes modelos de linguagem.
Durante seus estudos de doutorado, ele foi autor principal no desenvolvimento da arquitetura revolucionária "ChatDB", propondo inovadoramente "usar bancos de dados como módulos de memória simbólica para aprimorar grandes modelos", causando sensação imediata na comunidade acadêmica e industrial de IA na época.
Para acumular experiência prática em sistemas industriais de grande escala o mais cedo possível, ele também se juntou ao Instituto de Inteligência Artificial Haihua de Pequim como estagiário durante seu doutorado, participando profundamente de um projeto de pesquisa intensivo que envolvia a construção de um sistema básico do zero. Isso lhe permitiu acumular considerável experiência nas áreas de multimodalidade e aprendizado por reforço, além de desenvolver uma visão mais profunda combinando sistema e algoritmo.
Após se formar, ele se juntou à Moonshot AI e apareceu frequentemente em relatórios técnicos dos modelos principais. Ele participou diretamente do importante artigo que explora as leis de escala de aprendizado por reforço, “Kimi k1.5: Scaling Reinforcement Learning with LLMs”, e também desempenhou um papel de contribuidor-chave nos relatórios técnicos dos modelos principais Kimi K2 e K2.5.
Ele também participou profundamente como coautor principal no desenvolvimento do modelo visual multimodal Kimi, relatório técnico《Kimi-VL Technical Report》, com foco em aprimorar a percepção e a capacidade de raciocínio multimodal avançado do modelo em relação a imagens complexas, gráficos e informações visuais do mundo real.
A área principal de Du Chenzhuang é a engenharia de treinamento de grandes modelos de linguagem (LLM) em escala massiva, com foco no gerenciamento de recursos, treinamento estável e otimização de sistema limite de modelos de trilhões de parâmetros (arquitetura MoE) em superclusters; além disso, pesquisa a fusão de aprendizado por reforço e multimodalidade, estudando como os modelos podem superar seus limites inteligentes em tarefas complexas e de longo raciocínio por meio de auto-supervisão e aprendizado por reforço, e alcançar uma fusão eficiente em nível básico entre informações visuais e modelos de linguagem.
Yanru Chen:
Yanru Chen é pesquisadora principal da Moonshot, focada no desenvolvimento e implementação de arquiteturas de modelos grandes, tecnologias de textos longos, otimização de poder computacional e engenharia multimodal.
Como coautor do artigo "Attention Residuals", ele participou na reestruturação do fluxo de informações na direção profunda de grandes modelos, superando com sucesso os desafios da indústria relacionados à baixa eficiência no treinamento de redes superprofundas e ao bloqueio do fluxo de informações.
Na tecnologia central de textos longos, como coautor do MoBA (Mixed Block Attention), liderou e participou do desenvolvimento dos mecanismos fundamentais mais importantes do Kimi, resolvendo diretamente o problema do alto consumo de poder computacional em contextos ultra-longos de milhões de tokens durante o pré-treinamento e a inferência, por meio da divisão de atenção por bloco, tornando-se a base central para a redução extrema de custos e aumento de eficiência do Kimi.
Ao mesmo tempo, ele é coautor do artigo "Muon is Scalable for LLM Training" e participou profundamente no desenvolvimento do importante projeto de código aberto Moonlight e seu otimizador subjacente Muon, desafiando o AdamW tradicional por meio de ortogonalização de matrizes e reduzindo efetivamente o custo computacional no treinamento distribuído de modelos de trilhões de parâmetros.
Na iteração do modelo principal, ele integrou profundamente o ciclo de vida completo de desenvolvimento dos principais modelos anteriores do Kimi (k1.5, K2, K2.5, K3), resolvendo os desafios de estabilidade e alocação de recursos sob aprendizado por reforço em grande escala e expansão para trilhões de parâmetros.
Além disso, no desenvolvimento técnico do Kimi Multimodal (Linear, VL, Audio), ele explorou ativamente inovações em atenção linear fora da estrutura tradicional Transformer e liderou a implementação prática dos relatórios técnicos multimodais de visão e áudio do Kimi, resolvendo eficientemente os gargalos de eficiência na fusão de fluxos de informações multimodais na camada inferior.
Liu Shaowei:
Liu Shaowei é membro central do laboratório MADSys, do laboratório de sistemas computacionais de ponta da Universidade Tsinghua, e também é especialista líder da equipe de infraestrutura (Infra) da Luna Obscura.
Quando você se maravilha com o Kimi possuindo trilhões de parâmetros, mas com preços de API extremamente baixos, por trás disso está a “arte quantitativa extrema” que ele e sua equipe perseguem incansavelmente. Ele dedica-se constantemente à inferência de custo extremamente baixo para modelos de trilhões de parâmetros, quantização nativa e design de topologias de computação distribuída em larga escala.
Na comunidade de código aberto mais rigorosa do mundo, o Reddit LocalLLaMA, ele publicou um extenso artigo técnico intitulado “Kimi infra team: Quantization is not a compromise, it's the next paradigm”, sob a identidade de especialista oficial da Kimi, gerando grande comoção no círculo de entusiastas internacionais. Este artigo revelou em profundidade o formato nativo de quantização INT4 extremamente avançado da base do Kimi K2 e K2.5.
Ele não apenas foi coautor principal do MoBA (Mecanismo de Atenção Híbrida de Bloco), mas também participou profundamente no desenvolvimento da arquitetura distribuída do projeto de código aberto Moonlight e de seu otimizador subjacente Muon, reduzindo drasticamente o custo computacional no treinamento distribuído de modelos de trilhões de parâmetros por meio de ortogonalização matricial.
Ele ainda é um dos principais iniciadores e mantenedores de código do importante projeto de código aberto da Moonshot, o KTransformers, tendo pessoalmente superado a barreira de computação para inferência híbrida de modelos MoE de trilhões em clusters heterogêneos.
Chen Guanduo:
Chen Guanduo é pesquisador principal da equipe de Infra da Moonshot AI. Ele possui uma forte capacidade interdisciplinar de pesquisa e desenvolvimento em "sistema + algoritmo", com foco altamente especializado em infraestrutura de grandes modelos, arquitetura de mecanismos de atenção eficientes, aceleração de fine-tuning de grandes modelos e otimização de armazenamento e recuperação em larga escala.
Ele se formou em graduação e mestrado no Departamento de Ciência da Computação da Universidade Fudan, estabelecendo uma sólida base profissional em sistemas distribuídos e arquitetura de baixo nível. Posteriormente, ele prosseguiu seus estudos na Universidade Tecnológica de Nanyang e na Universidade de Ciência e Tecnologia de Hong Kong, estudando sob os renomados acadêmicos Yuan Binhang e Luo Siqiang, especialistas em computação de alto desempenho e infraestrutura de grandes modelos, adquirindo uma visão acadêmica e experiência de pesquisa de ponta.
Antes de se juntar oficialmente à Moonshot, ele aprofundou sua experiência nos departamentos centrais de grandes empresas de internet. Ele atuou como estagiário de pesquisa nas equipes de desenvolvimento de sistemas de banco de dados da ByteDance e na equipe de infraestrutura do Meituan, participando ativamente do desenvolvimento e da otimização de arquiteturas de sistemas distribuídos em larga escala e de alta concorrência em ambiente industrial.
Durante esse período, como autor principal, ele apresentou diretamente dois resultados significativos. Em termos de armazenamento básico, ele desenvolveu e publicou o "Oasis", propondo um filtro de intervalo de aprendizado de partição disjunta ótima, resolvendo diretamente o gargalo de índice nas bases de dados subjacentes durante consultas de intervalo em larga escala;
Na implementação na camada de aplicação, ele publicou o "Gar", utilizando um método de "geração e ordenação" que aumentou significativamente a precisão dos grandes modelos em compreender com precisão as intenções humanas complexas e convertê-las em consultas de banco de dados SQL (Text-to-SQL).
Chen Guanduo juntou oficialmente a Moonshot em março de 2025. Como pilar da equipe de Infra, ele não apenas foi coautor principal dos modelos principais da Moonshot, Kimi K2 e Kimi K2.5, mas também produziu intensamente uma série de avanços técnicos em direções como aceleração de fine-tuning de grandes modelos, arquiteturas de atenção eficientes e até mesmo reestruturação da arquitetura da rede final.
Para resolver o problema do alto consumo de memória GPU durante o fine-tuning de grandes modelos, Chen Guanduo liderou a publicação do artigo "Ce-lora", apresentando um método de fine-tuning LoRA altamente eficiente em termos de cálculo. Essa tecnologia reduz diretamente o consumo de memória GPU e a carga computacional durante o fine-tuning de parâmetros de grandes modelos, aumentando significativamente o throughput de treinamento na camada de infraestrutura, sendo considerada uma "cirurgia de emagrecimento de memória" para o fine-tuning de grandes modelos.
Diante do problema de complexidade computacional que cresce de forma quadrática com textos longos, ele participou do desenvolvimento e publicou a arquitetura revolucionária no ecossistema de código aberto chamada “Kimi Linear”. Trata-se de uma arquitetura de atenção linear, expressiva e eficiente, que reduz drasticamente a complexidade computacional de textos longos, mantendo ao mesmo tempo a poderosa capacidade de representação do modelo. Conseguiu reduzir em até 75% o uso de KV Cache (cache de chave-valor) e alcançou um throughput de decodificação seis vezes maior em textos de até um milhão de tokens, servindo como a base técnica fundamental para o contínuo aprofundamento da Kimi em tecnologias de textos longos.
He is also one of the co-authors of Attention Residuals.
Da filtragem de armazenamento de baixo nível a algoritmos de fine-tuning computacionalmente eficientes e até à arquitetura revolucionária de próxima geração Transformer, a trajetória profissional de Chen Guanduo se alinha perfeitamente com a paradigma da indústria atual, que passa de uma simples "volumetria de parâmetros" para a busca por eficiência computacional extrema e implementação prática.
Encerramento
A equipe de desenvolvimento da K3 sempre foi discreta e misteriosa; durante a análise dos dados, foi difícil esclarecer individualmente as responsabilidades e históricos completos de todos os membros. Mas por meio desta lista pesada e significativa, a resposta já emerge: por que a Lua da Sombra? Por que eles conseguiram sustentar uma avaliação superior de 700 milhões por pessoa?
Este grupo de jovens, com idade média inferior a 30 anos, são arquitetos de sistema que realmente entendem a economia de poder de processamento. Desde o agendamento de armazenamento premiado com o melhor artigo em conferências de topo até inovações fundamentais na reestruturação do mecanismo de atenção, eles levaram a eficiência de engenharia “longo, rápido e econômico” ao extremo.
É exatamente essa integração completa, desde os algoritmos de nível superior até o hardware de nível inferior, que confere à Moonshot a barreira central para quebrar o encanto da homogeneização da capacidade de processamento.
Outro detalhe interessante é que, no final da lista completa, o Kimi K3 também se tornou um membro importante de toda a equipe de desenvolvimento. Criadores e criados agora estão lado a lado na mesma lista; a era "dourada" dos grandes modelos chineses já chegou, rugindo.
