Résumé généré par l’IA : En juillet 2026, Moon Shadow a open-sourcé le modèle Kimi K3 et révélé pour la première fois la liste des 401 contributeurs. La dernière évaluation de l’entreprise s’élève à 31,5 milliards de dollars, avec une équipe d’environ 300 personnes, dont l’âge moyen est inférieur à 30 ans, soit une valeur de 700 millions de dollars par personne. L’équipe fondatrice comprend les trois cofondateurs : Zhou Xinyu, responsable des algorithmes, Wu Yuxin, architecte, et Zhang Yutao, CTO, ainsi que d’autres membres clés issus d’universités de premier plan telles que Tsinghua et CMU. L’équipe a réalisé plusieurs innovations dans des technologies fondamentales telles que le mécanisme d’attention hybride MoBA, l’architecture d’inférence découplée Mooncake et l’optimiseur Muon, et a reçu des distinctions prestigieuses, notamment le meilleur article du FAST 2025, la conférence de pointe en stockage. Cette équipe jeune et passionnée, réputée pour sa gestion horizontale, pousse l’efficacité ingénierie « long, rapide, économique » à son extrême, devenant ainsi une force majeure dans le domaine des grands modèles en Chine.Auteur et source de l'article : Leifengwang
Le 27 juillet, Moonshot a dévoilé toute sa sincérité en open-sourçant directement le modèle Kimi K3 complet à 2,8 T. Dans la dernière partie du rapport technique, ils ont révélé pour la première fois la liste des contributeurs réels derrière Kimi K3 ; nous avons compté 401 membres, ce qui constitue une présentation complète de l'équipe talentueuse de Moonshot.
De l'équipe de départ, évaluée à quelques centaines de millions de dollars, à la véritable « lueur des grands modèles nationaux », Moonshot a désormais rejoint les rares équipes de passionnés capables de rivaliser sur la table mondiale avec des modèles de pointe comme Claude Fable 5 et GPT-5.6 Sol.
Avec le lancement de K3, l'évaluation la plus récente de Moonshot a atteint 31,5 milliards de dollars américains, soit environ 210 milliards de yuans, soutenue par une équipe extrêmement jeune.
Selon les informations publiques, Moonshot compte environ 300 personnes, avec une moyenne d'âge inférieure à 30 ans, dont 80 % sont des I. Si on calcule, cela revient à environ 700 millions de yuans d'évaluation par personne.
La structure organisationnelle de Moonshot est extrêmement plate. Moonshot compte cinq fondateurs, chacun gérant directement entre 40 et 50 personnes. L'entreprise est réputée pour « aucun niveau hiérarchique, aucune KPI, aucune barrière départementale » ; les employés peuvent défier leurs supérieurs à tout moment. Un détail : lors d'une réunion de réflexion au début de 2025, un employé a proposé une idée radicale ; après l'avoir entendue, Yang Zhilin a fait encore plus radical, abandonnant directement K1 pour se concentrer sur K2.
Ce même esprit non conventionnel se reflète dans l'âme de l'entreprise. Passionné de rock, Yang Zhilin a nommé les salles de réunion d'après des légendes du rock comme les Rolling Stones, Nirvana et Radiohead, et a même baptisé les abonnements Kimi avec des termes musicaux tels qu'Adagio et Allegro.
Lune Obscure croit fermement qu'aujourd'hui, où la puissance de calcul et les données deviennent de plus en plus homogènes, le « goût » est le moteur central pour établir un avantage différenciant. Ce goût se manifeste non seulement dans l'affinement des modèles, mais aussi profondément dans leur exigence et leur soif de talents.
Lune Obscure aime embaucher des PDG et privilégie particulièrement les personnes ayant « un halo d'entrepreneur » ou « un gène de joueur ». Selon les données publiques, au moins 50 personnes au sein de l'entreprise ont fondé ou rejoint une startup. Au cours de la dernière année, plus de 100 nouveaux recrutés de Lune Obscure ont été embauchés via des recommandations internes.
Aujourd'hui, selon la liste, nous effectuons une recherche approfondie et regroupons toutes les informations publiques et fiables concernant les contributeurs de K3. Les antécédents et les compétences techniques de cette équipe d'experts de haut niveau sont entièrement révélés.
01 Kimi : fondement technologique de base
Zhou Xinyu :
Zhou Xinyu est l'un des cofondateurs principaux de Moonshot, ainsi que le responsable de l'équipe algorithmique.
Zhou Xinyu et Yang Zhilin se connaissaient déjà depuis longtemps ; un détail intéressant est que Zhou Xinyu était guitariste du groupe Splay de l'Université Tsinghua, tandis que le batteur était précisément Yang Zhilin.
Avant de rejoindre Moonshot, Zhou Xinyu a travaillé chez Megvii sur la production d'algorithmes et la recherche de modèles mobiles. Il a collaboré étroitement avec Zhang Xiangyu, responsable des recherches fondamentales chez Megvii à l'époque et actuel scientifique en chef de Jieyue Xingchen, en tant qu'auteur principal ayant rédigé le réseau léger ShuffleNet.
Les domaines d'expertise de Zhou Xinyu incluent la mise en production à grande échelle des algorithmes de grands modèles, avec une capacité à transformer efficacement et à faible coût les algorithmes les plus avancés issus des laboratoires en systèmes de chaîne de production à grande échelle. Il est également spécialisé dans l'optimisation des architectures hybrides ; lors d'une session AMA sur la communauté Reddit, il a été le premier à analyser les avantages comparatifs de l'architecture hybride Kimi K3 KDA combinée à NoPE MLA, démontrant que cette architecture nécessite moins de puissance de calcul et offre une vitesse supérieure lors de la pré-formation et de l'apprentissage par renforcement.
Wu Yuxin :
Wu Yuxin est l'un des cofondateurs de Moonshot. Il est également un expert de premier plan et un architecte éminent dans le domaine de l'intelligence artificielle, avec une expertise approfondie dans les infrastructures et l'architecture de base du deep learning, de la vision par ordinateur (CV) et des grands modèles linguistiques (LLM).
Wu Yuxin et Yang Zhilin partagent le même parcours éducatif : ils ont obtenu leur licence en informatique à l'Université Tsinghua, puis ont poursuivi leurs études à l'Université Carnegie Mellon (CMU) aux États-Unis. Wu Yuxin a travaillé comme ingénieur de recherche au laboratoire de recherche Meta AI (FAIR), où il a dirigé et contribué à plusieurs technologies marquantes en vision par ordinateur.
Avant de cofonder Moonshot avec Yang Zhilin, Wu Yuxin avait déjà produit deux résultats majeurs de niveau standard de l'industrie dans les domaines de l'apprentissage profond et de la vision par ordinateur :
L’un étant l’un des créateurs et développeurs principaux de Detectron2, ce projet a directement redéfini l’écosystème des études supérieures en vision par ordinateur à l’échelle mondiale, devenant la « base universelle » pour des milliers de modèles visuels et de projets de détection d’objets dans le monde.
Plus innovant encore, il a publié en 2018 une œuvre majeure sur la Group Normalization en collaboration avec le chercheur de premier plan Kaiming He, se voyant attribuer une mention d'honneur pour le meilleur article à ECCV 2018.
Cet article classique brise directement le goulot d'étranglement mortel de la normalisation par lot lors de l'entraînement sur de petits échantillons. Cette capacité à « réécrire les règles mondiales de l'entraînement de l'IA » avec seulement quelques lignes d'innovation sous-jacente confère à Wu Yuxin une forte attractivité technique dans le monde open source.
Dans l'ombre de la lune, il est celui qui a posé les fondations. Il a profondément participé à l'optimisation de l'architecture des grands modèles et de l'efficacité de l'entraînement, et s'est même rendu au congrès mondial des développeurs PyTorch pour démontrer en détail, devant le monde entier, la contribution fondamentale de Kimi à l'infrastructure open source mondiale.
Les domaines d'expertise de Wu Yuxin complètent parfaitement la dernière pièce du puzzle nécessaire à Kimi pour repousser les limites des modèles multimodaux à long texte de la prochaine génération. Il excelle dans l'optimisation de systèmes d'apprentissage profond à haute performance, résolvant les défis consistant à faire fonctionner des modèles à des milliers de milliards de paramètres de manière plus stable, plus rapide et avec une consommation mémoire réduite — ce qui constitue la barrière technologique inébranlable permettant à Kimi de maintenir une expérience fluide même sous des charges de texte long et un haut niveau de concurrence.
En tant que l'un des auteurs principaux de MoCo v1, une œuvre marquante en apprentissage profond, il permet à Kimi non seulement d'avoir le cerveau le plus puissant de l'industrie (compréhension du langage naturel), mais aussi de développer des yeux capables de comprendre en profondeur le monde physique réel (vision multimodale).
Zhang Yutao:
Zhang Yutao est l'un des cofondateurs de Moonshot AI et en est également le CTO. Il est camarade de classe de Yang Zhilin à Tsinghua, et Tang Jie, fondateur de Zhipu, est son professeur.
En 2016, Zhang Yutao a cofondé « Circular Intelligence » avec Yang Zhilin, puis il a cofondé « Dark Side of the Moon » avec Yang Zhilin. Si Yang Zhilin est le « navigateur » de Dark Side of the Moon, alors Zhang Yutao est le chef ingénieur chargé d’ajuster au maximum le système de propulsion du navire « intelligent ». Kimi a accompli une évolution spectaculaire en matière de traitement de textes longs, de raisonnement complexe et d’exécution de tâches Agent, grâce en grande partie à Zhang Yutao.
Avant de rejoindre Moonshot, il a laissé plusieurs résultats majeurs de niveau « industriel » dans les domaines des graphes de connaissances et de la fusion de données hétérogènes.
L'une des contributions techniques pour lesquelles il est le plus connu est d'avoir dirigé, en tant que responsable technique, le développement de la plateforme d'analyse de données scientifiques AMiner. Les technologies fondamentales de fusion de données hétérogènes à la base de cette plateforme, qui sert désormais des millions de chercheurs dans le monde, incluent des capacités conçues par Zhang Yutao pendant son doctorat à Tsinghua. Cette compréhension approfondie de la manière dont les connaissances massives peuvent être absorbées, comprises et récupérées par les machines constitue directement la base technique des capacités de traitement de textes ultra-longs de Kimi.
Sur le plan académique, il a publié de nombreux articles hautement cités dans des conférences informatiques de premier plan telles que KDD et CIKM. Il excelle à doter l’IA d’un « sens logique » grâce aux graphes de connaissances et a dirigé le développement de la plateforme « Mille Cycles Zéro-Shot AI » dès l’ère de l’intelligence cyclique, permettant le déploiement à grande échelle des grands modèles d’IA dans des scénarios de services aux entreprises.
Les domaines d'expertise de Zhang Yutao ont permis de prédire avec précision chaque étape de la transition de l'IA de « capable de converser » à « capable d'accomplir des tâches ». Il se concentre sur le développement des techniques de fenêtres de contexte longues et des architectures de réseau à extension dynamique, afin de résoudre le défi consistant à maintenir la « clarté » de l'IA face à une quantité massive d'informations.
Lors de la dernière conférence technologique de juillet 2026, il a clairement tracé les trois lignes technologiques de l'ingénierie du secteur : 2023 était l'ère du Prompt, centrée sur la question « comment poser la question » ; 2024 a évolué vers l'ère du Context, axée sur « fournir suffisamment d'informations » ; et en 2026, les grands modèles sont entrés officiellement dans une nouvelle phase d'ingénierie Harness. Aujourd'hui, il dirige son équipe pour résoudre le défi ultime des Agents : « comment construire un environnement d'exécution permettant à l'IA de se corriger automatiquement en cas de problème ».
Xu Xinran:
Xu Xiran est vice-présidente ingénierie et responsable des infrastructures IA chez Moonshot AI.
Il possède une expérience complète en développement de couche fondamentale et a précédemment dirigé le développement du cadre d'apprentissage profond MegEngine (Tianyuan) et du système de recherche vectorielle à échelle milliardaire à Megvii. Actuellement, il est principalement chargé de la conception globale de l'architecture pour l'entraînement, l'inférence et les infrastructures des grands modèles de Moonshot.
Sur le côté inférence des grands modèles, pour les scénarios de traitement de textes longs de Kimi, il a conçu en collaboration avec son équipe une architecture d'inférence séparée centrée sur le KV Cache, appelée Mooncake. Ce résultat, qui sépare complètement les phases de pré-remplissage (Prefill) et de décodage (Decode), soulage la pression sur la mémoire vidéo et les I/O causée par des contextes ultra-longs de plusieurs millions de tokens, a reçu le prix de la meilleure publication de la conférence de stockage de premier plan FAST 2025.
En tant que l'un des principaux auteurs du mécanisme MoBA (Mixture of Block Attention), il a permis de réduire considérablement les coûts et d'améliorer l'efficacité de Kimi, tant lors de l'entraînement que de l'inférence, grâce à une segmentation par attention au niveau des blocs.
Sur le volet de l'entraînement des modèles, il a participé au développement du projet open source Moonlight et de son optimiseur sous-jacent, Muon, en remplaçant l'optimiseur AdamW traditionnel par une approche de orthogonalisation matricielle, réduisant ainsi les coûts de calcul des modèles à des milliers de milliards de paramètres lors de l'entraînement distribué.
Grâce à cette série de pratiques en stockage distribué et en inférence sur de grands volumes de textes, il a été invité à donner une conférence lors du sommet mondial open source GOSIM China. Ses domaines d'expertise se concentrent toujours sur l'architecture full-stack de grands modèles, en visant à soutenir l'inférence de textes longs à haute intelligence avec une réduction des pertes FLOPs et une occupation minimale du KV Cache.
He Weiran :
En tant que responsable du système de raisonnement de Moonshot, il est l'auteur principal du meilleur article du conférence FAST 2025 et un pilier technique central dans la mise en œuvre de l'architecture de raisonnement à long contexte de Kimi. De Kimi k1.5, Kimi-VL, K2 à Kimi Linear, Kimi-Audio, puis aux articles clés sur MoBA, Muon et AttnRes, son nom apparaît dans toutes les six générations de technologies ; tous ses travaux sont centrés sur un même objectif : échanger une conception système contre une efficacité accrue, afin de rendre les grands modèles véritablement accessibles.
Avant de rejoindre Moonshot, He Weiran avait déjà passé de nombreuses années à travailler dans le domaine du calcul haute performance. Diplômé du département d'informatique de l'Université Tsinghua, il s'est spécialisé au début de sa carrière dans la routage des puces et l'optimisation des performances de bas niveau ; pendant son passage chez Megvii, il a principalement travaillé sur le développement de puces IA propriétaires et de réseaux neuronaux à faible précision, en collaborant au même moment que Zhou Xinyu, futur cofondateur de Moonshot — Zhou Xinyu étant précisément le premier inventeur de la solution classique de détection de texte OCR, EAST.
Après avoir rejoint Moonshot en 2023, il a appliqué son expérience de plusieurs années en ingénierie système au service d'inférence de modèles de taille trillions de paramètres.
Son résultat le plus emblématique est l'architecture d'inférence séparée KVCache, Mooncake. Ce système rompt avec les modèles traditionnels de services d'inférence en isolant et en centralisant le cache de mémoire le plus gourmand en mémoire GPU, permettant une réutilisation globale du cache et un routage finement optimisé. Sans augmenter la capacité de calcul, cette approche a augmenté la capacité de traitement des requêtes de Kimi de plus de 75 %. Il a révélé lors de la conférence QCon 2024 que, grâce à cette architecture et à des optimisations techniques continues, le coût unitaire du cluster d'inférence Kimi a diminué de plus de 20 fois en un an.
En février 2025, l'article sur Mooncake a remporté le prix de la meilleure article Eric Riedl de la conférence FAST — l'une des récompenses les plus prestigieuses dans le domaine des systèmes de stockage. Ce qui illustre encore mieux sa valeur technique, c'est que cette architecture fonctionnait déjà de manière stable dans l'environnement de production de Kimi, sur des milliers de nœuds, traitant des milliards de requêtes utilisateur par jour avant même la récompense officielle de l'article.
Bien que le rapport technique de K3 n'ait pas révélé de répartition spécifique des tâches individuelles, plusieurs avancées fondamentales s'inscrivent dans la continuité de l'expertise technique de son équipe : face au problème de l'invalidation des caches de préfixes dans l'architecture hybride KDA+MLA, l'équipe a contribué une implémentation officielle adaptée à la communauté vLLM ; pour les requêtes longues de plusieurs millions de tokens, le cluster utilise une stratégie de routage et d'ordonnancement sensible au cache, maximisant ainsi l'efficacité de la réutilisation du cache. Le résultat final de K3 est un coût d'inférence représentant seulement 38 % de celui de Claude Fable 5 — or, l'optimisation du KVCache, le cache de préfixes et la maîtrise des coûts constituent précisément les enjeux centraux du système Mooncake.
De la conception des circuits intégrés à l'inférence de modèles de mille milliards de paramètres, le parcours technologique de He Weiran a toujours été clair : s'attacher à l'efficacité système, échanger des conceptions d'ingénierie contre des coûts de calcul plus bas. Si les chercheurs en algorithmes de pointe ont élevé la limite de capacité de Kimi, ce qu'il et son équipe ont accompli, c'est concrétiser cette capacité de pointe afin que davantage d'utilisateurs ordinaires puissent l'utiliser à un prix abordable et avec fiabilité.
02 Renforts de niveau opérationnel
Du Yulun:
Du Yulun est chargé des domaines de pré-entraînement et de mise à l'échelle chez Moonshot.
Il est diplômé de l'Université de l'Illinois à Urbana-Champaign et de l'Université Carnegie Mellon en intelligence artificielle. Il a ensuite rejoint Cycle Intelligence, où il a occupé les postes de chercheur et de responsable du AI Lab, et est l'un des pionniers technologiques de Moonshot.
En tant que responsable principal du pré-entraînement et de la mise à l'échelle des modèles de base, ses contributions techniques ont entièrement parcouru les bases phares successives de Kimi, ainsi que la conception architecturale de l'ensemble de la série multimodale, incluant VL, Audio, etc.
Dans les avancées technologiques fondamentales, il est co-auteur des articles « Attention Residuals », « MoBA (Mixture of Block Attention) » et de l’article sur l’optimiseur de pré-entraînement « Muon is Scalable for LLM Training ». Son travail repose sur la réduction de l’atténuation du signal dans les réseaux ultra-profonds grâce à la segmentation de l’attention au niveau des blocs et à la重构 des flux d’entraînement, améliorant ainsi de manière significative l’efficacité de l’entraînement distribué des modèles de taille trillions.
Au niveau de l'open source ingénierie, il est un contributeur actif et central des projets open source officiels de MoonshotAI. Selon les registres de collaboration code, Du Yulun collabore fréquemment et effectue des revues de code avec l'expert en algorithmes Su Jianlin et le responsable du système d'inférence He Weiran ; ensemble, ils forment un cycle technique fondamental soutenant les longs textes à échelle百万 et le flux efficace multi-modal de Kimi.
Zhang Yu :
Zhang Yu est l'architecte principal de Moonshot AI, spécialisé dans la conception d'architectures efficaces, évolutives et adaptées aux matériels pour les grands modèles linguistiques. En tant que pionnier des approches non Transformer et de l'attention linéaire, il s'efforce de surmonter le défi technique consistant à ce que les textes longs deviennent de plus en plus lents et extrêmement coûteux.
Sur le plan académique et pratique en ingénierie, Zhang Yu a obtenu de nombreux résultats. Il est co-premier auteur de l'article « Attention Residuals » sur les connexions résiduelles et principal développeur de l'architecture de modèle efficace de Moonshot.
Le modèle Kimi Linear, qu'il a conduit en open source, a été le premier à appliquer avec succès le mécanisme d'attention linéaire à des tâches à contexte extrêmement long, réalisant une amélioration efficace révolutionnaire. De plus, son récit intitulé « Le parcours de développement de Kimi Linear », partagé sur des communautés techniques comme Zhihu, reste至今 un guide incontournable pour des centaines de data engineers spécialisés dans les grands modèles.
Passant avec aisance entre le monde académique et l'industrie, Zhang Yu a contribué des codes robustes lors de conférences académiques de premier plan et dans la communauté open source, depuis la mise en œuvre du modèle 7B jusqu'à l'aide décisive apportée à un modèle de mille milliards de paramètres pour intégrer le premier rang mondial.
Ces percées résultent de son approfondissement des technologies fondamentales : dans la conception d’architectures de modèles efficaces, il se concentre sur l’optimisation des goulots d’étranglement en communication et en mémoire lors de l’extension de la profondeur du modèle ; en matière de dynamique et d’efficacité d’entraînement, il résout fondamentalement les problèmes de dilution du gradient et d’explosion des états cachés causés par PreNorm dans les grands modèles grâce à une重构 du flux résiduel sous-jacent.
Lai Guokun:
Lai Guokun est un ancien élève double de Tsinghua et de l'Université Carnegie Mellon de Yang Zhilin.
Il est l'un des chercheurs ayant publié le plus d'articles sur l'équipe Kimi, avec plus d'une dizaine d'articles. Il est non seulement l'une des figures emblématiques du « Club des génies » de Moonshot, un contributeur clé de Kimi K3, mais aussi une légende dans le milieu académique avec des résultats considérés comme « définitifs ».
Avant de rejoindre Moonshot, Lai Guokun avait déjà laissé deux résultats majeurs de niveau standard de l'industrie dans le domaine du traitement du langage naturel (NLP).
L’un d’eux a créé l’un des plus grands jeux de données au monde pour la compréhension de texte par les machines, le jeu de données RACE, qui a entraîné l’IA à l’aide de questions d’examen d’anglais pour des élèves chinois, devenant ainsi la référence mondiale en matière de compréhension de texte par les machines.
Plus impressionnant encore, son article universitaire sur les algorithmes de recommandation, intitulé « Explicit factor models for explainable recommendation », a reçu en 2024, dix ans plus tard, le prix SIGIR Test of Time, l'une des plus hautes distinctions dans le domaine de la recherche d'information, décerné aux articles publiés il y a dix ans et ayant démontré un impact durable sur l'industrie.
Ce type de personne, capable de définir la trajectoire technologique des dix prochaines années dès le niveau licence, n’est pas un cas isolé chez Moonshot.
Les domaines d'expertise de Lai Guokun correspondent parfaitement aux capacités fondamentales de Kimi, notamment son aptitude à la « compréhension machine du texte », qui vise à permettre à l'IA de comprendre des documents longs et d'y répondre — exactement la base technologique centrale de la capacité de Kimi à traiter de longs textes.
L'un des axes de recherche principaux pendant son séjour à la CMU a été les grands modèles pré-entraînés, en plus de se concentrer sur la recherche d'architectures neuronales, consistant à permettre à l'IA de concevoir automatiquement de meilleures structures de réseau, ainsi que des systèmes de recommandation interprétables, permettant à l'IA de non seulement recommander du contenu, mais aussi d'expliquer à l'utilisateur pourquoi cette recommandation a été faite.
Guo Haiqing :
Haiqing Guo est l'un des premiers membres clés de l'équipe Kimi de Moonshot, considéré comme un pionnier de l'équipe, ayant participé à l'ensemble du développement et des itérations des projets principaux de Kimi.
Les projets vérifiables publiquement incluent le rapport technique Kimi k1.5, le rapport technique Kimi K2, l'article sur l'architecture centrale AttnRes, et le rapport technique Kimi K3. AttnRes est l'une des deux innovations architecturales centrales de Kimi K3.
D'après les traces de signature, il a couvert l'ensemble du cycle d'itération de Kimi, de la version phare k1.5 à K3, et a participé aux étapes clés du développement de plusieurs générations de produits, en étant un participant constant de l'équipe technique de Kimi. À ce jour, aucun canal public n'a révélé son poste exact ni ses responsabilités spécifiques en matière de développement.
Chen Guangyu :
Chen Guangyu est probablement le plus jeune chercheur de Moon Shadow, né en 2009, âgé de 17 ans, un adolescent qui a fait s'exclamer publiquement Elon Musk sur X : « Impressive ».
Lors du lancement de Kimi K3, le modèle phare de 2,8 billions de paramètres de Moonshot, il était déjà co-premier auteur de l'article fondateur de l'architecture de Kimi K3, intitulé « Attention Residuals », aux côtés d'experts techniques tels que Su Jianlin.
Il a révolutionné les connexions résiduelles standard utilisées depuis dix ans dans le domaine de l'apprentissage profond en introduisant le mécanisme des « attention residuals », permettant au modèle de « regarder en arrière » de manière intelligente grâce à une « attention profonde apprenable ». Cette重构 fondamentale a augmenté l'efficacité d'extension du modèle de 1,25 fois, permettant aux entreprises chinoises de progresser plus rapidement à moindre coût dans la bataille des capacités de calcul de mille milliards. Son arrivée chez Moonshot est tout simplement extraordinaire : il ne savait même pas ce qu'était un Transformer il y a un an, mais a été repéré par une start-up de la Silicon Valley après avoir proposé l'idée d'une « troisième main mécanique d'assistance humaine » lors d'un hackathon. Sept semaines plus tard, il a été recruté d'urgence par l'équipe Kimi et intégré au groupe de recherche central de l'entreprise. Durant sa première semaine, il a brisé toutes les conventions en remportant directement le titre de champion du marathon de hacking interne de 48 heures de Kimi.
Du Angang :
Dans le rapport technique de Kimi, le nom de Du Angang apparaît toujours en première position. Il est l'un des piliers centraux de l'architecture multimodale de Moonshot, et l'un des rares chercheurs à avoir participé à toutes les cinq générations dans le rapport technique de Kimi. Il a obtenu deux fois la première position dans la liste des auteurs de l'équipe, ce qui suggère que ses contributions principales dans Kimi K3 portent sur le domaine visuel.
Avant de rejoindre Moonshot, Du Angang avait déjà établi deux fondations solides dans le domaine de la vision par ordinateur.
Un axe de recherche approfondi dans le domaine de la vision microscopique sous-marine. Pendant sept ans, à l’université océanique de Chine, dans le laboratoire de vision sous-marine, j’ai spécialisé mon travail sur la classification d’images microscopiques de plancton — une tâche extrêmement difficile consistant à permettre à l’IA d’identifier avec précision les plus petites formes de vie marine dans des images microscopiques floues, avec des échantillons rares et des différences entre espèces extrêmement subtiles.
En 2020, il a publié une étude connexe en tant que premier auteur dans Global OCEANS, utilisant une modélisation de caractéristiques du second ordre pour résoudre le problème de la classification fine-grained ; il s'agit du seul résultat obtenu dans ce domaine au cours des dix dernières années au laboratoire avec un étudiant en master en tant que premier auteur.
Ce qui a eu le plus d’impact dans le secteur, ce sont ses réalisations durant son passage à Megvii. Il a participé à une étude sur l’estimation de la posture multi-personne acceptée par la conférence de pointe en vision par ordinateur ECCV 2020 ; son article a été cité plus de 300 fois et est devenu une référence majeure dans le domaine de l’estimation de la posture humaine. Parmi les co-auteurs de ce travail figurent des figures de proue du domaine de la vision, telles que Sun Jian et Zhang Xiangyu, ainsi que Zhou Xinyu, cofondateur de Moonshot.
Après avoir rejoint Kimi, il s'est concentré sur la conception d'encodeurs visuels, l'alignement multimodal et les technologies d'agents visuels, avec une expertise particulière dans la compréhension d'images haute résolution, l'analyse de vidéos à long terme et l'apprentissage par renforcement multimodal — les technologies fondamentales sous-jacentes aux capacités multimodales natives de Kimi. En outre, ses compétences s'étendent vers l'infrastructure d'entraînement des grands modèles — de la stabilité des optimiseurs à la synthèse de données pour les agents — formant ainsi une capacité complète allant des algorithmes visuels de base à l'entraînement des modèles, en passant par la mise en œuvre des agents en haut niveau.
En 2025, il a publié en tant qu'auteur principal le modèle multimodal open source Kimi-VL, avec son encodeur visuel MoonViT développé en interne, qui prend en charge nativement des entrées à très haute résolution, associé à une capacité de contexte long de 128K, permettant à Kimi de comprendre pour la première fois des textes multimodaux longs tels que des vidéos longues et des documents étendus, établissant ainsi la base technologique des capacités multimodales de toute la série Kimi.
À la phase K2, il a activement participé au développement de l'optimiseur MuonClip, en combinant le mécanisme QK-Clip pour résoudre le problème industriel majeur de la fluctuation lors de l'entraînement de grands modèles, permettant ainsi de réaliser un entraînement à très grande échelle de 15,5 billions de tokens avec « zéro pic de perte » et réduisant considérablement les coûts et les risques liés à la puissance de calcul. À la phase K3, il a dirigé la chaîne de synthèse de données pour agents, permettant au modèle de générer automatiquement des données d'entraînement de haute qualité, fournissant un soutien essentiel pour positionner K3 parmi les premiers mondiaux dans les tâches exigeantes telles que la programmation et les agents.
Pour Kimi, sa contribution traverse toute la trajectoire d'évolution des capacités multimodales.
Qu Bo Wen :
Bowen Qu (Brian Qu) fait partie de l'équipe d'entraînement postérieur des modèles. Il a obtenu sa licence à l'École d'électronique, d'information et de communication de l'Université des sciences et technologies de Chine centrale, et sa maîtrise à l'École d'électronique de l'Université de Pékin. Ses recherches se concentrent sur les modèles multimodaux, notamment l'apprentissage par renforcement multimodal, les modèles visuo-linguistiques, les agents IA et l'évaluation de la qualité des contenus générés par l'IA.
Après avoir rejoint Moonshot, Qu BoWen a principalement travaillé sur le développement des capacités multimodales de la série de modèles Kimi, en participant activement au projet Kimi-K2.5 et à la recherche sur l'apprentissage par renforcement multimodal natif. Kimi-K2.5 est un modèle d'agent multimodal natif lancé par Moonshot, avec un total de 1 trillion de paramètres et 32 milliards de paramètres activés.
Le système d'apprentissage par renforcement multimodal natif dirigé par Qu Bowen contourne la méthode traditionnelle consistant à effectuer d'abord un fine-tuning supervisé visuel, puis à entreprendre l'apprentissage par renforcement. Il propose une approche qui part d'un modèle de raisonnement purement textuel sans fine-tuning supervisé visuel, et acquiert directement des capacités de raisonnement visuel par le biais de l'apprentissage par renforcement visuel, évitant ainsi les interférences causées par des données visuelles de faible qualité sur les capacités natives de raisonnement linguistique du modèle.
Les recherches de Qu Bowen ont commencé dans le domaine de l'évaluation de la qualité des contenus AIGC, avec des résultats publiés successivement dans des conférences internationales telles que ICME 2024 et CVPRW 2024. L'article publié à ICME 2024 aborde le fait que les systèmes d'évaluation des images générées par IA se concentraient uniquement sur l'esthétique et la clarté visuelles, tout en ignorant la correspondance entre le contenu généré et les instructions de l'utilisateur. Il propose une approche intégrant les prompts textuels dans le système d'évaluation de la qualité des images générées, établissant ainsi une norme d'évaluation couvrant à la fois la qualité visuelle et la conformité aux instructions, ce qui améliore la complétude de l'évaluation des contenus générés par IA et son alignement avec la perception humaine.
Qu Bo Wen figure également sur la liste des contributeurs des versions multimodales de Kimi. En tant que jeune chercheur, le parcours de recherche de Qu Bo Wen s’est étendu de la construction de systèmes d’évaluation à la mise en place des capacités des modèles, puis à la recherche sur les capacités avancées des agents, avec des résultats étroitement alignés sur les besoins pratiques de l’industrie et directement dédiés à l’itération et à l’amélioration des modèles de production.
Lu Enzhe :
Parmi les plus de 400 contributeurs de Kimi K3, Lu Enzhe n'est pas celui dont le nom apparaît en première position, mais ses interventions sont exceptionnellement précises. Chaque résultat cible directement les points douloureux clés du déploiement des grands modèles, en faisant un acteur essentiel de la construction du système de puissance de calcul efficace de Kimi.
Les domaines de recherche de Lu Enzhe peuvent être résumés précisément par trois mots : long, rapide, économique. Son objectif principal est de permettre aux grands modèles de traiter des textes plus longs à un coût inférieur et à une vitesse plus élevée. Pour Kimi, il est chargé de l'amélioration de l'efficacité sur l'ensemble de la chaîne, de l'entraînement à l'inférence.
En février 2025, il a publié, en tant que premier auteur, le mécanisme d'attention hybride MoBA, transférant l'idée de sélection d'experts de MoE à la couche d'attention, permettant au modèle de n'effectuer des calculs qu'avec les blocs de contexte les plus pertinents lors du traitement des requêtes. Avec une sparsité de 95 %, ses performances équivalent à celles de l'attention complète, réalisant une accélération de 6,5 fois pour l'inférence de millions de tokens et de 16 fois pour les dizaines de millions de tokens, posant ainsi les fondations de la capacité de Kimi à gérer des contextes extrêmement longs.
Le jour de sa publication, cet article a été présenté en même temps que l'article de DeepSeek sur l'NSA, devenant l'un des événements technologiques les plus suivis de l'année dans la communauté des grands modèles en Chine ; sa valeur d'ingénierie est encore plus manifeste par le fait que cette solution avait déjà supporté de manière stable, pendant près d'un an, les requêtes utilisateur à long contexte dans l'environnement de production de Kimi, avant d'être acceptée en tant que Spotlight paper à NeurIPS 2025.
En outre, de l'attention KDA de MoBA à Kimi Linear, il a consacré tout son travail à optimiser l'efficacité de l'inférence matérielle ; du côté de l'entraînement, il a contribué à la mise en œuvre distribuée de l'optimiseur Muon, réalisant une utilisation mémoire optimale et une communication à faible coût, réduisant concrètement les coûts de calcul pour l'entraînement de grands modèles. En incluant les rapports techniques d'AttnRes ainsi que des générations K1.5, K2 et Kimi-VL, ses publications couvrent intégralement l'ensemble des technologies liées aux grands modèles efficaces.
Au sein de l'équipe, il est le partenaire fixe de Qiu Jiezhong, l'un des auteurs correspondants de l'article MoBA : l'un se charge de l'attaque, l'autre oriente la stratégie, et leur collaboration est excellente.
Wang Yuzhi:
Wang Yuzhi est chercheur chez Moonshot AI et l'un des auteurs les plus fréquemment cités dans les rapports techniques de la série Kimi.
De K1.5 en janvier 2025 à Kimi K3 en juillet 2026, son nom apparaît sur presque chaque document technique de cette entreprise, couvrant les architectures visuelles, audio, d'attention, les optimiseurs d'entraînement, les modèles phares et même les cadres de gouvernance des risques IA les plus avancés.
Il est diplômé de l'Université de science et technologie du Xi'an en licence et détient un doctorat en génie électronique de l'Université Tsinghua. Après avoir rejoint l'Institut de recherche Megvii, il a occupé le poste d'ingénieur de recherche ; il a rejoint Moonshot AI en 2024 en tant que chercheur et occupe toujours ce poste.
Avant de rejoindre Moonshot, ses recherches se concentraient sur la photographie computationnelle et la vision de base. Ses réalisations notables incluent : en tant qu'auteur principal, la publication d'un article sur le débruitage d'images RAW sur smartphone à ECCV 2020, une référence majeure dans le domaine de l'imagerie mobile à ce jour ; en tant que membre de l'équipe Megvii, la victoire au défi NTIRE 2019 sur la piste raw-RGB pour le débruitage d'images réelles ; et en tant qu'auteur co-signataire, la contribution à l'œuvre classique dans le domaine de l'OCR, EAST (CVPR 2017, plus de 2 500 citations).
Pendant la période de la face cachée de la lune, il a signé dix documents techniques, notamment : k1.5, K2, K3, Kimi-VL, Kimi-Audio, MoBA, Muon, Kimi Linear, ainsi que quatre articles sur l'architecture et l'efficacité des Attention Residuals, et un cadre avancé de gestion des risques liés à l'IA.
Il est à noter qu’il figure parmi les auteurs des quatre articles de l’entreprise sur l’architecture et l’efficacité, une couverture aussi étendue est rare parmi les environ quatre cents contributeurs. Ses responsabilités spécifiques au sein de K3 ne sont pas publiques pour le moment.
Mao Shaoguang :
Mao Shaoguang est un pilier central de la ligne technologique de Kimi Agent, ayant participé à l'ensemble du développement des quatre générations phares : K2, K2-Thinking, K2.5 et K3. Il est également l'un des rares chercheurs dans l'industrie à avoir suivi intégralement les deux transitions paradigmatiques du secteur des agents.
Avant de rejoindre Moonshot, il était déjà parmi les premiers professionnels au pays à avoir mis en œuvre des agents.
Diplômé d'un master en informatique de l'Université Tsinghua, classé parmi les 0,2 % meilleurs étudiants pendant ses études et récipiendaire de la bourse nationale, il a ensuite travaillé comme assistant de recherche à l'Université chinoise de Hong Kong et effectué un stage au groupe voix de l'Institut de recherche asiatique de Microsoft. Après son diplôme, il a travaillé pendant près de six ans chez Microsoft, passant d'ingénieur au sein de l'institut de recherche à ingénieur senior en développement.
En début d'année 2023, a participé au développement de TaskMatrix.AI pour connecter ChatGPT à des centaines de milliers d'API ; ensuite, a co-développé la méthode Solo Performance Prompting, permettant à un seul modèle d'incarner plusieurs rôles afin de simuler une collaboration d'agents intelligents, avec des applications concrètes dans Microsoft 365 Word.
C'était l'ère du « cadre » de l'agent — toutes les capacités dépendaient d'outils externes et étaient guidées par des prompts, et il était lui-même un témoin et un constructeur de cette approche technologique.
Mais Mao Shaoguang, qui avait lui-même parcouru ce chemin, fut le premier à identifier les limites de l'ancien modèle. En juin 2025, il a écrit sur Zhihu : « Ce domaine devient de plus en plus sans intérêt, avec un sentiment d'effondrement accéléré ».
Après avoir rejoint Moonshot en février 2025, il a complètement basculé vers une approche end-to-end « modèle comme Agent ». En seulement quatre mois, il a participé à la livraison du premier produit Agent de Kimi, Kimi Researcher :
Formé entièrement par apprentissage par renforcement de bout en bout, sans aucun préconfiguré de processus, il effectue en moyenne 23 étapes d'inférence pour une tâche unique, scanne automatiquement 206 pages web et produit des rapports de recherche de dix mille caractères avec des citations conformes, atteignant 26,9 % sur le benchmark HLE, battant ainsi le niveau mondial le plus élevé à l'époque. Il est également l'un des deux auteurs désignés du récit technique officiel du produit.
Il a participé en profondeur à tout le développement des quatre générations de produits phares, de K2 à K3. L'indicateur HLE est passé de 8,6 % à 26,9 %, et cette courbe de performance presque entièrement pilotée par l'apprentissage par renforcement constitue exactement le bilan de sa nouvelle approche technologique.
De l’extension des capacités des grands modèles par des API externes à l’apprentissage intrinsèque par le modèle de l’utilisation d’outils et de l’accomplissement autonome de tâches complexes, le parcours professionnel de Mao Shaoguang au cours des dix dernières années reflète précisément l’évolution complète de l’industrie des agents, passant de la « combinaison assemblée » à la « croissance native ». Ayant personnellement participé à l’ancien paradigme et ayant ensuite tracé une nouvelle voie, ses jugements sur l’industrie sont étayés par des réalisations concrètes et solides.
Qin Ruoyu :
Qin Ruoyu est doctorant au laboratoire MADSys du département d'informatique de l'Université Tsinghua, sous la direction du professeur associé Zhang Mingxing. Ses recherches se concentrent sur les systèmes d'apprentissage automatique efficaces, notamment dans deux domaines spécifiques : le service d'inférence à grande échelle de modèles linguistiques massifs et les systèmes de rollout pour l'apprentissage par renforcement.
Mooncake, développé par Qin Ruoyu en collaboration avec l'équipe Moon Shadow, est une architecture d'inférence découplée centrée sur le KVCache. Cette architecture sépare les phases de Prefill et de Decode pour les exécuter sur des clusters indépendants, tout en intégrant les ressources CPU, mémoire et SSD inutilisées des clusters GPU en un pool de cache distribué. Ce résultat a reçu le prix Erik Riedel de la meilleure publication à la conférence FAST 2025 dans le domaine du stockage.
Mooncake est une plateforme de service de production déjà déployée ; l'abstract de l'article indique clairement en ouverture : « Mooncake is the serving platform for Kimi ». Sous charge réelle, Mooncake augmente la capacité de traitement des requêtes de Kimi de 75 % ; dans les scénarios à contexte long, la capacité de traitement des requêtes efficaces augmente de 59 % à 498 %. Ce système est actuellement déployé sur des milliers de nœuds et traite plus de 100 milliards de tokens par jour.
En 2024, Moonshot AI et le laboratoire MADSys de l'Université Tsinghua ont conjointement open-sourcé le projet Mooncake (dépôt open source : kvcache-ai/Mooncake), dont le nombre de stars sur GitHub dépasse désormais 6 000. Les données et informations pertinentes peuvent être consultées dans l'article arXiv (numéro 2407.00079), sur le site officiel du département d'informatique de Tsinghua et dans le dépôt open source du projet.
Après Mooncake, les recherches de Qin Ruoyu se sont poursuivies en profondeur dans la direction des systèmes de raisonnement. Il a publié en tant qu'auteur principal l'article Seer, sélectionné pour OSDI 2026, qui cible les goulets d'étranglement de performance dans les rollouts de l'apprentissage par renforcement, en utilisant des techniques de segmentation des rollouts, d'ordonnancement contextuel et de décodage spéculatif par groupes, permettant une augmentation maximale de 2,04 fois du débit total des rollouts et une réduction de 72 % à 94 % des latences de queue. Un autre article en tant qu'auteur principal, Prefill-as-a-Service, propose une nouvelle architecture d'inférence pour le partage inter-centres de données du KVCache.
Qin Ruoyu apparaît également sur la liste des contributeurs du projet K3. Les performances du modèle de grande taille sont soutenues par deux compétences : le développement du modèle détermine la limite de capacité du modèle, tandis que l'ingénierie système détermine la disponibilité et le coût d'exploitation du service dans des scénarios à haut débit.
La concurrence dans l'industrie des grands modèles passe progressivement d'une compétition sur les capacités d'entraînement à une compétition sur les capacités d'ingénierie de service. En tant qu'étudiant en doctorat, Qin Ruoyu parvient à produire des résultats de niveau meilleur article de conférence de premier plan dans ce domaine, principalement parce que ses recherches sont directement orientées vers des scénarios de production et que ses résultats sont intégrés dans des systèmes commerciaux réels.
Yuan Enming :
Membre clé de l'équipe Kimi de la Face Cachée de la Lune, ses recherches couvrent trois domaines : la biologie computationnelle, les systèmes de recommandation et les grands modèles, et il a participé à toutes les itérations technologiques des modèles principaux de Kimi.
Il a précédemment travaillé dans le groupe de recherche de Jianyang Zeng à l'Institut d'information interdisciplinaire de l'Université Tsinghua, en se concentrant sur l'IA pour la découverte de médicaments. Entre 2020 et 2021, ses recherches sur un cadre de réaffectation de médicaments contre la grippe ont été publiées sur le préimprimé bioRxiv et dans la revue Signal Transduction and Targeted Therapy, tandis que des résultats liés à la séparation des protéines de la capside ont été publiés dans Protein & Cell.
De 2022 à 2023, Yuan Enming a travaillé au laboratoire Noah's Ark de Huawei, en se concentrant sur la recherche en systèmes de recommandation, avec des résultats présentés dans plusieurs conférences académiques internationales de premier plan. Parmi ceux-ci, son article en tant qu'auteur principal sur la recommandation de séquences à comportements multiples a été sélectionné pour SIGIR 2022, et d'autres travaux collaboratifs ont été retenus pour CIKM 2022 et WWW 2023.
Après avoir rejoint Moonshot, Yuan Enming a participé activement au développement de plusieurs générations de modèles et de projets techniques de Kimi. Les projets publiquement vérifiables auxquels il a contribué incluent le rapport technique sur l'apprentissage par renforcement Kimi k1.5, la recherche technique MoBA, le rapport technique Kimi-VL, le rapport technique sur le grand modèle Kimi K2, le rapport technique Kimi Linear, le rapport technique sur le modèle multimodal Kimi K2.5 et le rapport technique sur le modèle phare Kimi K3.
Son domaine d'implication couvre plusieurs directions technologiques clés, telles que l'entraînement par apprentissage par renforcement, les capacités multimodales, l'architecture de modèles de base et les systèmes à long contexte, couvrant intégralement le cycle d'itération des trois générations de modèles phares de Kimi, de k1.5 à K3, ce qui en fait un membre clé de l'équipe avec une couverture technologique étendue.
Les canaux publics n'ont pas encore révélé le poste exact de Yuan Enming au sein de Moonshot, ni ses spécificités de recherche. D'après les traces de publications publiques, son parcours interdisciplinaire lui permet de participer à plusieurs directions technologiques des grands modèles, ce qui en fait un participant clé et continu dans l'itération du système technique Kimi.
Xu Weixin :
Xu Weixin est actuellement chercheur chez Moonshot AI, avec des recherches couvrant l'architecture de base des grands modèles, les mécanismes d'entraînement efficaces et l'optimisation des mécanismes d'attention.
Xu Weixin a profondément participé au développement des modèles centraux et des technologies de fond de plusieurs générations de Kimi, avec des projets publiés sous son nom couvrant l'ensemble du cycle d'itération produit de k1.5 à K3. Après le lancement de K3, Moonshot AI a officiellement révélé trois technologies clés développées en interne — l'optimiseur Muon, l'attention linéaire Kimi Linear et les résidus d'attention — et Xu Weixin est le seul contributeur vérifiable ayant son nom déployé et classé parmi les 15 premiers dans les trois articles correspondants sur ces technologies fondamentales, faisant de lui l'un des principaux développeurs soutenant la montée en puissance de l'architecture K3.
En termes de résultats concrets, il figure à la huitième position sur la liste des auteurs de l'article sur l'optimiseur Muon publié en février 2025, un optimiseur offrant une efficacité de calcul environ deux fois supérieure à celle d'AdamW ; il a également participé à la mise en œuvre open source Moonlight qui l'accompagne.
Dans le papier technique Kimi Linear publié en octobre 2025, il occupe la 15e position ; le mécanisme KDA proposé par cette architecture permet de réduire le volume du KV Cache jusqu'à 75 % et d'augmenter le débit de décodage jusqu'à 6 fois dans des scénarios de millions de tokens ;
Dans l'article « Attention Residuals » publié en mars 2026 (l'une des deux innovations majeures de l'architecture K3), il occupe la quatrième position, étant le premier contributeur principal après les trois auteurs principaux ; cette technologie a été profondément intégrée dans l'architecture du modèle de base Kimi K3.
En outre, son nom apparaît dans les listes de contributeurs des rapports techniques sur l’apprentissage par renforcement Kimi k1.5, du rapport technique Kimi-VL, des rapports techniques Kimi K2 et K2.5, ainsi que du dernier rapport technique du modèle phare Kimi K3, avec une participation couvrant plusieurs domaines de recherche clés tels que les modèles de base, le multimodal et l’apprentissage par renforcement. Il convient de préciser que son nom ne figure pas dans la liste des auteurs de l’article MoBA, et qu’aucun lien de développement publiquement vérifiable ne lie les deux.
En outre, il a participé à plusieurs recherches dans le domaine de la vision 3D, notamment la complétion de scènes 3D sémantiques OccDepth, l'enseignement actif par distillation PVD-AL et la reconstruction implicite SDF présentée à ACCV 2024, avec des résultats académiques couvrant plusieurs domaines spécialisés tels que la compression de modèles, la reconstruction 3D et la compréhension sémantique des scènes.
D'après les traces publiques de ses contributions, le parcours de recherche de Xu Weixin s'est progressivement étendu du déploiement de modèles en périphérie à la perception visuelle 3D, puis à l'innovation des architectures fondamentales des grands modèles. Il s'est longuement consacré à l'informatique efficace, avec une couverture technologique étendue, et est un participant clé et continu à l'itération de la pile technologique fondamentale de Moonshot.
Du Chenzhuang :
Du Chenzhuang est un chercheur clé de Moonshot, chargé du renforcement de l'apprentissage et de l'extension des capacités de raisonnement au sein de l'équipe.
Il a obtenu sa licence à l'Université de technologie aéronautique et spatiale de Pékin, spécialité gestion et systèmes d'information, puis a poursuivi un doctorat à l'Institut interdisciplinaire d'information de l'Université Tsinghua, considéré comme l'École militaire des talents en grands modèles.
Pendant son séjour à Tsinghua, il a étudié sous la direction du chercheur renommé en intelligence artificielle Zhao Xing et a rejoint le célèbre MARS Lab (Laboratoire de multimodalité et de raisonnement autonome), où il a commencé à se concentrer sur l'apprentissage multimodal, l'apprentissage par renforcement et les mécanismes de renforcement des grands modèles linguistiques.
Pendant ses études de doctorat, il a été l'auteur principal du développement de l'architecture révolutionnaire « ChatDB », proposant de manière innovante d'utiliser une base de données comme module de mémoire symbolique pour renforcer les grands modèles, ce qui a fait sensation dans le milieu académique et industriel de l'IA à l'époque.
Pour acquérir plus tôt une expérience pratique sur des systèmes industriels à grande échelle, il a rejoint l’Institut de recherche en intelligence artificielle HuaHai de Pékin en tant qu’stagiaire pendant ses études de doctorat, en participant activement à un projet de recherche exigeant visant à construire un système de base depuis zéro. Cela lui a permis d’acquérir une solide expérience dans les domaines de la multimodalité et de l’apprentissage par renforcement, ainsi qu’une vision fondamentale combinant système et algorithmes.
Après son diplôme, il a rejoint Moonshot AI et est apparu fréquemment dans les rapports techniques des modèles principaux. Il a participé directement à la publication majeure sur l’exploration des lois d’extension de l’apprentissage par renforcement, intitulée « Kimi k1.5: Scaling Reinforcement Learning with LLMs », et a joué un rôle de contributeur clé dans les rapports techniques des modèles phares Kimi K2 et K2.5.
Il a également participé en tant que co-auteur principal au développement du rapport technique du modèle visuel multimodal Kimi, intitulé « Kimi-VL Technical Report », en se concentrant sur l'amélioration de la perception et des capacités d'inférence multimodale approfondie du modèle face à des images complexes, des graphiques et des informations visuelles du monde réel.
La spécialisation de Du Chenzhuang réside dans l'ingénierie de formation de grands modèles linguistiques (LLM) à grande échelle, avec un accent sur l'ordonnancement des ressources, la formation stable et l'optimisation systémique extrême de modèles de mille milliards de paramètres (architecture MoE) sur des superclusters ; ainsi que sur l'apprentissage par renforcement et la fusion multimodale, en étudiant comment les modèles peuvent dépasser leurs limites intelligentes grâce à l'auto-surveillance et à l'apprentissage par renforcement lors de tâches de raisonnement long et complexe, tout en réalisant une fusion efficace en couche sous-jacente entre les informations visuelles et les modèles linguistiques.
Yanru Chen :
Yanru Chen est chercheuse principale de Moonshot, spécialisée dans le développement et la mise en œuvre de l'architecture de base des grands modèles, des technologies de texte long, de l'optimisation de la puissance de calcul et de l'ingénierie multimodale.
En tant que co-auteur de l'article « Attention Residuals », il a participé à la重构 du flux d'information dans la direction profonde des grands modèles, réussissant à résoudre les problèmes industriels majeurs d'efficacité faible lors de l'entraînement de réseaux ultra-profonds et de blocage du flux d'information.
Sur la technologie clé des longs contextes, en tant que co-auteur de MoBA (Mixture of Block Attention), il a dirigé et participé au développement des mécanismes fondamentaux les plus essentiels de Kimi, en résolvant directement le problème de la consommation excessive de puissance de calcul en pré-entraînement et en inférence pour des contextes dépassant le million de tokens, grâce à une segmentation de l'attention au niveau des blocs. Cela constitue la base fondamentale permettant à Kimi de réduire drastiquement ses coûts tout en augmentant son efficacité.
Il est également co-auteur de l'article « Muon is Scalable for LLM Training » et a profondément participé au développement du projet open source majeur Moonlight ainsi que de son optimiseur sous-jacent Muon, en utilisant l'orthogonalisation matricielle pour remettre en question AdamW traditionnel et réduire efficacement la charge de calcul lors de l'entraînement distribué de modèles de taille trillions.
Dans l'itération du modèle phare, il a profondément intégré le cycle de vie complet du développement des précédents modèles phares de Kimi (k1.5, K2, K2.5, K3), résolvant les problèmes de stabilité et d'ordonnancement des ressources sous des charges de renforcement à grande échelle et une extension à des milliers de milliards de paramètres.
En outre, lors des efforts techniques sur le modèle multimodal Kimi (Linear, VL, Audio), il a activement exploré des innovations en attention linéaire hors structure Transformer traditionnelle et a dirigé la mise en œuvre technique des rapports multimodaux visuels et audio de Kimi, résolvant efficacement les goulots d'étranglement d'efficacité lors de la fusion des flux d'informations multimodales en couche sous-jacente.
Liu Shaowei :
Liu Shaowei est un membre clé du laboratoire MADSys du laboratoire de systèmes informatiques de pointe de l'Université Tsinghua, ainsi qu'un expert de premier plan de l'équipe d'infrastructure fondamentale de Moonshot.
Lorsque vous vous émerveillez du fait que Kimi possède des milliards de paramètres tout en offrant un prix API extrêmement bas, c’est précisément grâce à l’« art extrême de la quantification » sur lequel lui et son équipe se sont concentrés sans relâche. Il consacre constamment ses efforts à l’inférence à coût extrêmement faible pour des modèles de taille trillions, à la quantification native et à la conception de topologies de calcul distribué à grande échelle.
Sur Reddit LocalLLaMA, la communauté open source AI la plus exigeante au monde, il a publié un article technique approfondi intitulé « Kimi infra team: Quantization is not a compromise, it's the next paradigm » en tant qu'expert officiel de Kimi, suscitant un énorme écho dans la communauté des passionnés internationaux. Cet article révèle en profondeur le format de quantification native INT4 extrêmement avancé à la base de Kimi K2 et K2.5.
Il est non seulement l'un des auteurs principaux du MoBA (Mixed Block Attention Mechanism), mais a également profondément participé au développement de l'architecture distribuée du projet open source phare Moonlight et de son optimiseur sous-jacent Muon, réduisant considérablement la charge de calcul lors de l'entraînement distribué de modèles de taille trillions grâce à l'orthogonalisation matricielle.
Il est également l'un des initiateurs et mainteneurs principaux du projet open source majeur KTransformers de Moonshot, ayant personnellement levé la barrière de calcul pour l'inférence hybride de modèles MoE de mille milliards sous cluster hétérogène.
Chen Guanduo :
Chen Guanduo est chercheur principal de l'équipe Infra de Moonshot AI. Il possède une capacité exceptionnelle en développement interdisciplinaire « système + algorithme », et ses recherches se concentrent fortement sur les infrastructures de grands modèles, les architectures d'attention efficaces, l'accélération du fine-tuning des grands modèles ainsi que l'optimisation du stockage et de la recherche à grande échelle.
Il a obtenu sa licence et sa maîtrise en informatique à l'Université Fudan, où il a acquis une solide base professionnelle dans les systèmes distribués et l'architecture sous-jacente. Par la suite, il a poursuivi ses études à l'Université technologique de Nanyang et à l'Université scientifique et technologique de Hong Kong, sous la direction des éminents chercheurs Yuan Binhang et Luo Siqiang, respectivement spécialisés en calcul haute performance et en infrastructure de grands modèles, accumulant ainsi une vision académique de pointe ainsi qu'une expérience de recherche et développement avancée.
Avant de rejoindre Moonshot, il a effectué une approfondissement au sein des départements centraux de grandes entreprises internet de premier plan. Il a successivement occupé des postes de stagiaire chercheur dans les équipes de développement de systèmes de base de données de ByteDance et d’infrastructure de Meituan, participant activement au développement et à l’optimisation d’architectures de systèmes distribués à grande échelle et à haute concurrence industrielle.
Pendant cette période, en tant qu'auteur principal, il a directement publié deux résultats majeurs. En ce qui concerne le stockage sous-jacent, il a développé et publié « Oasis », proposant un filtre de plage d'apprentissage à partitionnement disjoint optimal, résolvant directement le goulot d'étranglement d'index des bases de données lors de requêtes de grande échelle ;
Dans la mise en œuvre au niveau de l'application, il a publié « Gar », augmentant considérablement la précision des grands modèles à comprendre fidèlement les intentions complexes des humains et à les convertir en requêtes SQL (Text-to-SQL) grâce à une méthode de « génération et classement ».
Chen Guanduo a officiellement rejoint Moonshot AI en mars 2025. En tant que pilier de l'équipe Infra, il est non seulement l'un des auteurs principaux du modèle phare de Moonshot AI, Kimi K2 et Kimi K2.5, mais a également produit de manière intensive des percées technologiques dans des domaines tels que l'accélération du fine-tuning des grands modèles, les architectures d'attention efficaces, et même la重构 finale de l'architecture réseau.
Pour résoudre le problème de la consommation excessive de mémoire GPU lors du fine-tuning des grands modèles, Chen Guanduo a dirigé la publication de l'article « Ce-lora », qui présente une méthode de fine-tuning LoRA à haute efficacité computationnelle. Cette technologie réduit la consommation de mémoire GPU et les coûts de calcul lors du fine-tuning des paramètres des grands modèles, augmentant directement le débit d'entraînement au niveau Infra, et est qualifiée de « méthode de réduction de la mémoire GPU » pour le fine-tuning des grands modèles.
Face à la complexité calculatoire qui explose de manière quadratique avec les longs textes, il a participé au développement et à la publication de l'architecture révolutionnaire « Kimi Linear » dans la communauté open source. Il s'agit d'une architecture d'attention linéaire, à la fois expressive et efficace, qui réduit considérablement la complexité calculatoire des longs textes tout en conservant la puissante capacité de représentation du modèle. Cette innovation permet de réduire jusqu'à 75 % l'utilisation du KV Cache (cache clé-valeur) et d'atteindre un débit de décodage six fois supérieur sur des textes de longueur atteignant un million de tokens, constituant ainsi la base technique fondamentale des efforts continus de Kimi pour surmonter les défis liés aux longs textes.
He is also one of the co-authors of "Attention Residuals".
De filtres de stockage de base en passant par des algorithmes d'ajustement fin optimisés pour le calcul, jusqu'à l'architecture révolutionnaire de la prochaine génération de réseaux Transformer, la trajectoire professionnelle de Chen Guanduo s'aligne parfaitement sur la nouvelle paradigme industrielle des grands modèles, qui passe de la simple augmentation des paramètres à la recherche d'une efficacité computationnelle et d'une mise en œuvre technique optimales.
Conclusion
L'équipe de R&D de K3 est traditionnellement discrète et mystérieuse ; lors de l'analyse des documents, il nous a été difficile de déterminer précisément la répartition des rôles et le parcours complet de chaque membre. Mais à travers cette liste impressionnante, la réponse émerge déjà : pourquoi Moonlight (K3) ? Pourquoi sont-ils capables de justifier une valorisation exceptionnelle de 700 millions par personne ?
Ces jeunes, dont l'âge moyen est inférieur à 30 ans, sont des architectes système qui comprennent véritablement l'économie de la puissance de calcul. De l'ordonnancement de stockage récompensé par le meilleur article d'une conférence de premier plan à l'innovation fondamentale restructurant les mécanismes d'attention, ils ont poussé l'efficacité technique « longue, rapide et économe » à son extrême.
C'est précisément cette intégration complète, du haut niveau algorithmique jusqu'au matériel de base, qui confère à Moonshot la barrière fondamentale pour briser le sortilège de l'homogénéisation de la puissance de calcul.
Un autre détail intéressant est qu’à la fin de la liste complète, Kimi K3 est devenu un membre essentiel de l’équipe de recherche et développement. Créateurs et créations se retrouvent désormais côte à côte sur la même liste : l’ère d’or des grands modèles chinois a déjà retenti.
