Moonshot AI 開源 Kimi K3 模型,公布 401 位貢獻者

iconMetaEra
分享
AI summary icon精華摘要
Moonshot AI 於 2026 年 7 月 27 日宣佈開源其 Kimi K3 模型,列出了 401 位貢獻者。該公司目前估值為 315 億美元,背後團隊由超過 300 位 30 歲以下的專業人士組成。創始人周新宇、吳宇欣與首席技術官張玉濤領導一支包括清華大學與卡內基梅隆大學研究人員的團隊。MoBA、Mooncake 和 Muon 等創新技術為團隊贏得了 FAST 2025 最佳論文獎。此 AI + 加密貨幣新聞更新重點介紹頂尖山寨幣新聞動態。
AI-generated summary: In July 2026, Moonshot open-sourced the Kimi K3 model and publicly revealed the list of 401 contributors for the first time. The company’s latest valuation reached $31.5 billion, with a team of over 300 people, an average age under 30, and each member contributing to an average of $700 million in valuation. The core team includes three co-founders: algorithm lead Zhou Xinyu, architect Wu Yuxin, and CTO Zhang Yutao, along with other key members from top universities such as Tsinghua and CMU. The team has made multiple innovations in foundational technologies including the MoBA hybrid block attention mechanism, Mooncake decoupled inference architecture, and Muon optimizer, with related achievements honored as Best Paper at FAST 2025, the premier storage conference. This young team of geeks is known for its flat management structure, pushing engineering efficiency to the extreme with the principles of “long, fast, and lean,” becoming a significant force in China’s large model field.

文章作者、來源:雷锋网

於7月27日,月之暗面展現全部誠意,直接開源了滿血版2.8T模型Kimi K3。在技術報告的最後,他們首次公布了Kimi K3背後的實際貢獻者名單,我們細數了一下,共有401位成員,可說是月之暗面人才團隊的一次全面亮相。

從當初估值僅幾億美元的初創團隊,到如今名副其實的「國產大模型之光」,月之暗面已然成為全球牌桌上,少數能與 Claude Fable 5 和 GPT-5.6 Sol 這樣頂尖模型「掰手腕」的極客團隊。

隨著 K3 的發布,月之暗面最新估值飆升至 315 億美元,約為 2100 億元人民幣,而撐起這 2100 億估值的,是一個極度年輕的團隊。

根據公開資訊顯示,月之暗面約有 300 多人,平均年齡不到 30 歲,其中 80% 是 I 人。如果換算一下,基本人均扛起 7 億人民幣的估值。

月之暗面的組織形式極為扁平。月之暗面共有五位創始人,平均每人直接對接40–50人。內部以「無職級、無KPI、無部門牆」著稱,員工可隨時挑戰老闆。有一個細節是,在2025年初的反思會上,有員工提出激進建議,楊植麟聽完後做得比建議更激進,直接放棄K1轉做K2。

這種不拘一格同樣體現在公司的「靈魂」裡。作為搖滾愛好者的楊植麟,將會議室冠以 Rolling Stones、Nirvana、Radiohead 等傳奇樂隊之名,甚至連 Kimi 的會員套餐都以 Adagio(柔板)、Allegro(快板)等音樂術語來命名。

Midnight firmly believes that, in today's world where computing power and data are increasingly homogenized, "taste" is the core driver for building differentiated barriers. This taste is not only reflected in model refinement but also profoundly manifests in their discerning yet eager approach to talent.

月之暗面喜歡僱用CEO,非常青睞具有「創業者光環」或「賭徒基因」的人。根據公開資料,公司內部至少有50人曾創辦或加入過創業公司。而在過去一年,月之暗面招聘的新員工中,有超過100人是通過內部推薦加入的。

Today, according to the list, we conduct a comprehensive in-depth investigation and compile all publicly verifiable information regarding the K3 contributors here. The core background and hardcore capabilities of this elite geek军团 are fully revealed.

01 Kimi 技術體系頂層基石

周昕宇:

周昕宇是月之暗面的核心聯合創始人之一,同時他也是算法團隊負責人。

周昕宇與楊植麟早有交情,一個有趣的細節是,周昕宇曾是清華大學Splay樂隊的吉他手,而鼓手正是楊植麟。

在加入月之暗面之前,周昕宇曾於曠視從事算法量產及移動端模型研究。他與當時曠視的基礎科研負責人、現任階躍星辰的首席科學家張祥雨緊密合作,作為核心作者親自撰寫了輕量化網絡力作 ShuffleNet。

周昕宇的主攻方向是大模型算法量產化,擅長將最前沿的實驗室算法,高效率、低成本地轉化為大規模生產線系統。他還擅長混合架構優化,在 Reddit 社區的技術交流(AMA)中,率先拆解了 Kimi K3 KDA 混合架構結合 NoPE MLA 的對比優勢,證實該架構在預訓練和強化學習中更省算力、速度更快。

吳育昕:

Wu Yuxin 是 月 之 暗 面 的 聯 合 創 始 人 之 一。同 時,他 還 是 人 工 智 能 領 域 的 頂 尖 專 家 與 明 星 架 構 師,在 深 度 學 習、計 算 機 視 覺(CV)以 及 大 語 言 模 型(LLM)的 底 層 工 程 架 構 與 基 礎 設 施 上 擁 有 極 深 造 詣。

吳育昕與楊植麟擁有相同的教育背景,本科畢業於清華大學計算機系,隨後赴美國卡內基梅隆大學(CMU)深造。他曾在 Meta AI 研究實驗室(FAIR)擔任研究工程師,期間主導並貢獻了多項計算機視覺里程碑級技術。

在與楊植麟創立月之暗面之前,吳育昕就已經在深度學習和計算機視覺領域留下了兩個行業標準級的重磅成果:

作為 Detectron2 的主要創建者和開發者之一,該項目直接重塑了全球計算機視覺的研究生態,成為全球數以萬計視覺大模型和目標檢測項目的「通用底座」。

更具開創性的是,他在2018年與頂尖學者何愷明共同發表了關於 Group Normalization 的大作,獲得 ECCV 2018 最佳論文榮譽提名(Best Paper Honorable Mention)。

This classic breakthrough directly overcomes the critical bottleneck of traditional Batch Normalization in small-sample training. The ability to “rewrite the global rules of AI training” with just one or two lines of low-level innovation has given Wu Yuxin tremendous technical influence in the open-source community.

在月之暗面,他是那個打地基的人。他深度參與大模型架構與訓練效率的優化工作,更曾親臨全球 PyTorch 開發者大會,向全世界硬核拆解 Kimi 對全球開源基建的底層貢獻。

Ngô Dục Tân 的專業方向,完美補齊了 Kimi 撞擊下一代多模態長文本極限的最後一塊拼圖。他擅長高性能深度學習系統優化,解決的是如何讓大模型在萬億參數下跑得更穩、算得更快、內存吃得更少,這正是 Kimi 在長文本和高並發下保持絲滑體驗的技術鐵壁。

作為深度學習里程碑之作 MoCo v1 的核心作者之一,他讓 Kimi 不僅擁有行業最強的大腦(自然語言理解),更正在長出能夠深度理解現實物理世界的眼睛(多模態視覺)。

張宇韜:

張宇韜是月之暗面的聯合創始人之一,同時也是月之暗面的 CTO。他與楊植麟為清華同門師兄弟,智譜創始人唐杰是他的老師。

In 2016, Zhang Yutao co-founded “Circula Intelligence” with Yang Zhilin, and later co-founded “Moonshot” with Yang Zhilin. If Yang Zhilin is the “navigator” of Moonshot, then Zhang Yutao is the chief engineer responsible for fine-tuning the power system of the “intelligence” behemoth to its peak. Kimi’s leapfrog advancements in long-text processing, complex reasoning, and Agent task execution owe much to Zhang Yutao.

在加入月之暗面之前,他已經在知識圖譜與異構數據融合領域留下了數個「行業級」的重磅成果。

他最廣為人知的技術標籤之一,是作為技術負責人主導了科技大數據分析平台 AMiner 的研發。這個如今服務於全球千萬級學者的平台,其背後核心的異構數據融合技術就包含張宇韜在清華攻讀博士期間參與構建的底層能力。這種對「海量知識如何被機器吸收、理解並檢索」的深度洞察,直接構成了 Kimi 超長文本處理能力的技術底座。

In terms of academic contributions, he has published multiple highly cited papers at top computer science conferences such as KDD and CIKM. He is not only skilled at enabling AI to possess “logical reasoning” through knowledge graphs, but also led the development of the “Thousand Cycles Zero-Shot AI Platform” during the era of cyclic intelligence, achieving large-scale deployment of industry-scale large models in enterprise service scenarios.

張宇韜的專攻方向,精準預判了 AI 從「能對話」向「能幹活」轉變的每一個節點。他專注於推動長上下文窗口技術和動態擴展網絡架構,解決的是如何讓 AI 在海量信息中保持「清醒」。

At the latest technology summit in July 2026, he clearly outlined the three technical trajectories of industry engineering: 2023 was the Prompt era focused on “how to ask,” 2024 evolved into the Context era centered on “providing sufficient information,” and by 2026, large models officially entered a new phase of Harness engineering. Today, he is leading his team to tackle the ultimate challenge of “how to build execution environments where AI can autonomously close the loop and fix its own issues.”

許欣然:

許欣然是月之暗面(Moonshot AI)工程副總裁兼 AI 基礎設施負責人。

他擁有全棧底層開發經驗,此前在曠視負責 MegEngine(天元)深度學習框架與億級向量檢索系統的研發。目前,他主要負責月之暗面大模型訓練、推理與基礎設施的整體架構設計。

在大模型推理端,針對 Kimi 的長文本業務場景,他與團隊聯合設計了以 KV Cache 為中心的分離式推理架構 Mooncake。該成果因徹底分離了預填充(Prefill)與解碼(Decode)階段、緩解了百萬級超長上下文的顯存和 I/O 壓力,獲得了存儲頂級會議 FAST 2025 最佳論文獎。

同時,作為 MoBA(混合塊注意力)機制的核心作者之一,他透過塊級別注意力切分,在訓練和推理兩端為 Kimi 實現了大幅的降本增效。

在模型訓練端,他參與了開源項目 Moonlight 及其底層優化器 Muon 的研發,利用矩陣正交化處理替代傳統 AdamW,降低了萬億參數模型在分布式訓練中的算力成本。

憑藉這一系列在大規模長文本流量下的分布式存儲與推理實踐,他曾受邀在 GOSIM China 全球開源盛會上發表演講。他的專攻方向始終聚焦於全棧大模型架構,致力於用更少的 FLOPs 損耗和 KV Cache 佔用,支撐高智能的長文本推理。

何蔚然:

作為月之暗面推理系統負責人,他是存儲頂會 FAST 2025 最佳論文的核心作者,也是 Kimi 長文本推理架構工程落地的核心技術骨幹。從 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架構論文,其署名貫穿六代技術成果,所有工作始終圍繞同一個核心:用系統設計換效率,讓大模型真正用得起。

在加入月之暗面之前,何蔚然已在高效計算領域深耕多年。他畢業於清華大學計算機系,早年專注於晶片佈線與底層效能優化;在曠視期間,他主力攻堅自研AI晶片與低位寬神經網絡,並與後來的月之暗面聯合創始人周昕宇同期共事——周昕宇正是經典OCR文字檢測方案EAST的第一發明人。

自2023年加入月之暗面後,他將多年的系統工程經驗全部應用於萬億參數大模型的推理服務上。

他最具代表性的成果是 KVCache 分離式推理架構 Mooncake。這套系統打破了傳統推理服務的架構定式,將大模型最耗顯存的記憶緩存拆解出來集中調度,透過全局緩存複用和精細化路由,在算力規模不變的前提下,讓 Kimi 的請求承載量提升超過 75%。他在 2024 年 QCon 大會上披露,依託這套架構和持續的工程優化,Kimi 推理叢集的單位成本一年下降超過 20 倍。

在2025年2月,Mooncake相關論文榮獲FAST大會埃里克·裡德爾最佳論文獎——這是存儲系統領域的最高榮譽之一。更能體現其工程價值的是,早在論文正式獲獎前,這套架構已於Kimi生產環境的數千個節點上穩定運行,每日處理上千億token的用戶請求。

儘管 K3 技術報告未披露具體個人分工,但多項核心突破都延續著他團隊的技術脈絡:針對 KDA+MLA 混合架構下傳統前綴緩存失效的難題,團隊向 vLLM 社區貢獻了官方適配實現;面向百萬 token 長請求,集群採用緩存感知的路由調度策略,最大化緩存複用效率。最終 K3 交出的成績是推理成本僅為 Claude Fable 5 的 38%,而 KVCache 優化、前綴緩存、成本控制,恰恰都是 Mooncake 體系的核心命題。

從晶片佈線到萬億參數模型推理,何蔚然的技術路徑始終清晰:死磕系統效率,用工程設計換取更低的計算成本。如果說頂尖算法研究員為Kimi提升了能力上限,他和團隊所做的,就是將這份旗艦級能力落地,讓更多普通用戶用得起、用得穩。

02 中堅攻堅·落地級骨幹

杜羽倫:

Du Yulun 負責月之暗面的預訓練(Pretraining)與規模化(Scaling)方向。

他畢業於美國伊利諾大學香檳分校與卡內基梅隆大學的人工智能專業,隨後加入循環智能,歷任研究員與 AI Lab 負責人,為月之暗面的核心技術元老。

作為模型基座預訓練與規模化方向的核心負責人,他的技術貢獻完整貫穿了 Kimi 歷代核心旗艦基座,以及 VL、Audio 等多模態全系列的架構設計。

在底層技術突破中,他是《Attention Residuals》、《MoBA(Mixed Block Attention)》以及預訓練優化器論文《Muon is Scalable for LLM Training》的共同作者。其工作核心在於:透過塊級別注意力切分與訓練流重構,緩解超深網絡中的信號衰減問題,顯著提升萬億大模型的分散式訓練效率。

在工程開源層面,他是 MoonshotAI 官方開源項目的活躍核心貢獻者。從代碼協作記錄來看,杜羽倫與算法專家蘇劍林、推理系統負責人何蔚然之間有著高頻的協同開發與代碼審查配合,三者共同構成了 Kimi 支撐百萬級長文本和全模態高效流轉的底層技術閉環。

張宇:

張宇是月之暗面的核心架構師,專注於大語言模型的高效、可擴展及硬體友好型架構設計。作為非Transformer與線性注意力路線的開拓者,他致力於突破長文本「越長越慢、極度燒錢」的工程難題。

在學術與工程實踐上,張宇成果頗豐。他不僅是殘差連接《Attention Residuals》論文共同第一作者,更是月之暗面高效模型架構的核心研發一作。

他主導開源的 Kimi Linear 模型,首次成功將線性注意力機制應用於超長上下文任務,實現了顛覆性的效率提升。此外,他在知乎等技術社區分享的「Kimi Linear 研發心路」,至今仍被無數大模型數據工程師奉為必讀指南。

從實現 7B 模型的底層突破,到一戰協助萬億參數大模型躋身全球第一陣營,張宇在學術界與工業界之間遊刃有餘,並在頂級學術會議和開源社區中留下眾多硬核代碼。

這一系列突破源於他在核心技術上的深耕:在高效模型架構設計上,他專注於模型深度擴展過程中的通信與內存瓶頸優化;在訓練動態與效率提升方面,他通過重構底層殘差流,從根本上解決了大模型中 PreNorm 導致的梯度稀釋與隱狀態爆炸問題。

賴國堃:

賴國堃是楊植麟的清華大學與卡內基梅隆大學雙重校友。

他是 Kimi 團隊論文數量最多的研究者之一,擁有十餘篇論文,不僅是月之暗面「天才俱樂部」的代表人物之一,也是 Kimi K3 的核心貢獻者,更是在學術界擁有「定義級」成果的大神。

在加入月之暗面之前,賴國堃已經在 NLP(自然語言處理)領域留下了兩個行業標準級的重磅成果。

一個是打造了全球最大的機器閱讀理解數據集之一「RACE 數據集」,RACE 數據集直接用中國學生英語考試題訓練 AI,成為了全球機器閱讀理解的標尺。

更令人驚嘆的是,他在本科時期撰寫的關於推薦算法的論文《Explicit factor models for explainable recommendation》,在十年後的2024年仍獲得了SIGIR時間檢驗獎,這是資訊檢索領域的最高榮譽之一,專門頒發給十年前發表、經得起時間考驗且對行業產生持久影響的論文。

在本科階段就具備「定義未來十年技術路線」能力的人,在月之暗面並不是孤例。

Lai Guokun's area of expertise aligns perfectly with Kimi's core capabilities, such as his proficiency in "machine reading comprehension," which addresses how to enable AI to understand long documents and answer questions—this is precisely the technological foundation of Kimi's long-text capabilities.

Pre-trained large models were one of his research focuses during his time at CMU, in addition to neural architecture search, studying how to enable AI to automatically design better network structures, and interpretable recommendation systems, allowing AI to not only recommend content but also explain to users why a particular item is recommended.

郭海清:

郭海清(Haiqing Guo)是月之暗面 Kimi 團隊的早期核心研發成員,屬於團隊元老級人物,全程參與 Kimi 多代核心項目的研發迭代。

Publicly verifiable participating projects include the Kimi k1.5 Technical Report, Kimi K2 Technical Report, Attention Residual (AttnRes) Core Architecture Paper, and Kimi K3 Technical Report. Among them, AttnRes is one of the two core architectural innovations of Kimi K3.

從署名軌跡來看,他覆蓋了 Kimi 從 k1.5 到 K3 三代旗艦版本的完整迭代週期,參與範圍貫穿多代產品的核心研發環節,是 Kimi 技術團隊的持續核心參與者。目前公開渠道暫未披露其具體崗位與細分研發分工。

陳廣宇:

陳廣宇可能是月之暗面最年輕的研究員,2009 年出生,17 歲,曾讓埃隆·馬斯克(Elon Musk)在 X 上公開驚嘆「Impressive」的少年。

當月之暗面推出震撼世界的 2.8 萬億參數旗艦 Kimi K3 時,他已與技術大牛蘇劍林等人並列,成為 Kimi K3 核心架構奠基之作《Attention Residuals》的共同第一作者。

他參與的注意力殘差(Attention Residuals)機制,直接對深度學習領域沿用了十年的標準殘差連接進行了革新,透過「可學習的深度注意力」,讓模型能夠聰明地「回頭看」,這一底層重構將模型的擴展效率提升了1.25倍,使中國公司在萬億規模的頂級算力競爭中,能以更低的成本跑得更快。他加入月之暗面的故事極為神奇。一年前,他甚至不知道Transformer是什麼,只因在一次黑客松中提出了「人類第三隻機械輔助手」的構想,而被矽谷初創公司發掘。7週後,他被Kimi團隊徹底看中,並破格納入公司核心研究組。入職第一週,他就打破所有常規,親自重構並贏得Kimi內部48小時極限黑客馬拉松總冠軍。

杜昂昂:

在 Kimi 的技術報告中,杜昂昂的名字總是在最前面。他是月之暗面多模態體系的核心骨幹之一,也是 Kimi 技術報告中少有的五代全勤研究者。他曾兩度獲得團隊署名後的第一順位,推測他在 Kimi K3 中的核心貢獻在視覺領域。

在加入月之暗面之前,杜昂昂就已經在計算機視覺領域打下了兩項分量十足的根基。

一個是對水下顯微視覺方向的深耕。本碩七年就讀於中國海洋大學水下視覺實驗室,專攻難度極高的浮遊生物顯微圖像分類——要在成像模糊、樣本稀缺、物種差異極細微的顯微鏡畫面裡,讓 AI 精準識別海洋中最小的生命。

在2020年,他以第一作者身份在 Global OCEANS 發表了相關研究,透過二階特徵建模破解了細粒度分類的難題,這是實驗室十年來該研究方向中,唯一由碩士生擔任第一作者的成果。

更具行業影響力的是他在曠視科技時期的產出。他參與的多人姿態估計研究被計算機視覺頂會 ECCV 2020 收錄,論文累計引用超 300 次,成為人體姿態估計領域的重要參考。這篇工作的合作者名單裡,既有孫劍、張祥雨等視覺領域領軍人物,也有後來的月之暗面聯合創始人周昕宇。

加入 Kimi 後,他專注於視覺編碼器設計、多模態對齊與視覺智能體技術,尤其擅長高分辨率圖像理解、長時序視頻解析與多模態強化學習,這正是 Kimi 原生多模態能力的核心技術底座。除此之外,他的能力還向下延伸至大模型訓練基建——從優化器穩定性到智能體數據合成,形成了從底層視覺算法到模型訓練、再到上層智能體落地的全棧能力。

在2025年,他以第一作者身份發布了開源多模態模型 Kimi-VL,自研的 MoonViT 視覺編碼器原生支援超高解析度輸入,並搭配 128K 長上下文能力,使 Kimi 首次具備了通讀長影片、長文檔的多模態長文本理解能力,奠定了 Kimi 全系列多模態能力的技術基礎。

在 K2 階段,他深度參與 MuonClip 優化器的研發,配合 QK-Clip 機制攻克大模型訓練抖動的行業痛點,支撐 15.5 萬億 Token 超大規模訓練實現「零損失尖峰」,大幅降低訓練的算力成本與風險;至 K3 階段,他主導的智能體數據合成流水線,讓模型可自主生成高質量訓練數據,為 K3 在編程、智能體等硬核任務上躋身全球第一梯隊提供關鍵的數據支撐。

For Kimi, his contributions span the entire evolution path of multimodal capabilities.

瞿博文:

瞿博文(Bowen Qu / Brian Qu)隸屬於模型後訓練團隊,本科畢業於華中科技大學電子信息與通信學院,碩士畢業於北京大學電子學院。他的研究主攻多模態大模型相關方向,具體覆蓋多模態強化學習、視覺語言模型、AI 智能體以及 AIGC 內容質量評估。

加入月之暗面後,瞿博文的核心工作圍繞 Kimi 系列模型的多模態能力建設展開,深度參與 Kimi-K2.5 項目,並參與原生多模態強化學習方向的研發。Kimi-K2.5 是月之暗面推出的原生多模態智能體模型,總參數規模 1T,激活參數 32B。

Qu Bo Wen 負責的原生多模態強化學習體系,跳出了傳統多模態模型先完成視覺監督微調、再開展強化學習的常規路徑,提出從零視覺監督微調的純文本推理模型出發,直接通過視覺強化學習獲取視覺推理能力的訓練方案,避免低質量視覺數據對模型原生語言推理能力造成干擾。

瞿博文的研究始於 AIGC 內容質量評估方向,相關成果先後發表於 ICME 2024、CVPRW 2024 等國際會議。其中發表於 ICME 2024 的論文,針對當時 AI 生成圖像評價體系僅關注畫面美觀度與清晰度、忽略生成內容與用戶指令匹配度的問題,提出將文本提示詞納入生成圖像質量評價體系的方案,構建了同時覆蓋視覺質量與指令遵循度的評價標準,提升了 AI 生成內容評價的全面性與人類感知的對齊程度。

Qu Bo Wen 也出現在 Kimi 系列多模態版本的貢獻者名單中。作為年輕研究者,Qu Bo Wen 的研究路徑從評價體系搭建延伸至模型能力建設,再落地到高階智能體能力研發,成果緊密貼合產業實際需求,直接服務於生產級模型的迭代升級。

鹿恩哲:

在 Kimi K3 超過 400 人的貢獻者名單中,鹿恩哲並非署名位置最靠前的,但其出手異常精準。每一項成果都精準命中大模型落地的核心痛點,是 Kimi 高效算力體系的關鍵搭建者。

鹿恩哲的研究方向可用三個字精準概括:長、快、省,核心目標就是讓大模型以更低的成本、更快的速度處理更長的文本。對 Kimi 而言,他負責的是從訓練到推理的全鏈路效率升級。

在2025年2月,他以第一作者身份發布了MoBA混合塊注意力機制,將MoE的專家選擇思路遷移至注意力層,使模型在處理請求時僅調取最相關的上下文塊進行計算。在95%稀疏度下,其效果與全注意力相當,實現了百萬token推理提速6.5倍、千萬token提速16倍,直接奠定了Kimi超長上下文能力的底層架構。

發布當天,該論文與 DeepSeek 的 NSA 論文同期亮相,成為當年國內大模型圈最受關注的技術撞車事件;更能體現其工程價值的是,在被 NeurIPS 2025 收錄為 Spotlight 論文之前,這套方案已經在 Kimi 生產環境中穩定承載了近一年的長上下文用戶請求。

此外,從 MoBA 到 Kimi Linear 的 KDA 注意力機制,他全程專注於架構設計以極致優化硬體推理效率;在訓練端,他參與的 Muon 優化器分散式實現達成內存佔用最優與通信開銷高效,實質壓縮了大模型訓練的算力成本。加上 AttnRes 以及 K1.5、K2、Kimi-VL 等多代技術報告,他的論文完整覆蓋了高效大模型的全鏈路技術。

在團隊內部,他與 MoBA 論文的通訊作者之一邱傑仲是固定搭檔,一個衝鋒落地,一個把控方向,配合默契。

汪彧之:

Wang Yu Zhi 是 月之暗面(Moonshot AI)的一名研究員,也是 Kimi 系列技術報告中出鏡率最高的署名者之一。

從 2025 年 1 月的 k1.5 到 2026 年 7 月的 Kimi K3,他的名字出現在這家公司幾乎每一份技術文件上,涵蓋視覺、音頻、注意力架構、訓練優化器、旗艦模型乃至前沿 AI 風險治理框架。

他畢業於西安電子科技大學本科,並取得清華大學電子工程系博士學位,加入曠視研究院後擔任研究工程師;2024年加入月之暗面擔任研究員至今。

在加入月之暗面之前,他的研究集中在計算攝影與底層視覺。代表性成果包括:以第一作者身份於 ECCV 2020 發表手機端 RAW 圖像降噪論文,該方向至今仍是移動影像的標桿工作之一;作為曠視團隊成員獲得 NTIRE 2019 真實圖像去噪挑戰賽 raw-RGB 賽道全球冠軍;以共同作者身份參與 OCR 領域經典工作 EAST(CVPR 2017,引用超過 2500 次)。

在月之暗面期間,他參與署名的技術文件共 10 份,包括:k1.5、K2、K3、Kimi-VL、Kimi-Audio、MoBA、Muon、Kimi Linear、Attention Residuals 四篇架構與效率論文,以及前沿 AI 風險管理框架。

值得注意的是,公司全部四篇架構與效率論文他均在作者之列,這種覆蓋廣度在約 400 人的貢獻者名單中並不多見。他在 K3 中的具體職責暫無公開信息。

毛紹光:

毛紹光是 Kimi Agent 技術線的核心骨幹,全程參與 K2、K2-Thinking、K2.5、K3 四代旗艦研發,也是業內少有的完整經歷 Agent 行業兩次範式轉換的研究者。

在加入月之暗面之前,他已是國內最早一批落地 Agent 的從業者。

清華大學計算機碩士畢業,在校期間排名前0.2%,獲國家獎學金,曾先後於香港中文大學擔任研究助理,並在微軟亞洲研究院語音組實習。畢業後他在微軟任職近六年,從研究院工程師晉升為資深研發工程師。

於2023年初參與研發 TaskMatrix.AI,為 ChatGPT 接入上百萬個 API 能力;隨後共同提出 Solo Performance Prompting 方法,讓單一模型分飾多個角色以模擬多智能體協作,相關技術已落地至 Microsoft 365 Word。

那是 Agent 的「框架時代」——所有能力都依賴外部工具拼接、依賴 Prompt 引導,而他正是這套技術路線的親歷者與建設者。

但親手趟過這條路的毛紹光,最先看清了舊範式的瓶頸。2025年6月,他在知乎寫下一段行業自白:「這個方向越來越沒意思了,有點加速衰亡的感覺」。

於2025年2月加入月之暗面後,他徹底轉向「模型即Agent」的端到端路線。僅四個月就參與交付了Kimi首款Agent產品Kimi Researcher:

不依賴任何流程預設,完全透過端到端強化學習訓練而成,單任務平均完成 23 步推理,自主掃描 206 個網頁,可產出帶規範引用的萬字調研報告,在 HLE 基準上達到 26.9%,刷新當時全球最高水平。他也是該產品官方技術自述的兩位署名作者之一。

此後,他全程深度參與了從 K2 到 K3 的四代旗艦研發。HLE 指標從 8.6% 一路攀升至 26.9%,這條幾乎完全由強化學習驅動的性能曲線,正是他新技術路線的成績單。

從為大模型外接 API 擴展能力,到讓模型內生學會調用工具、自主完成複雜任務,毛紹光近十年的職業軌跡,恰好勾勒出 Agent 行業從「拼裝組合」走向「原生生長」的完整弧光。親手參與過舊範式,又親手走出新路線,他對行業的判斷,有著最紮實的落地成果做支撐。

秦若愚(Ruoyu Qin):

Qin Ruoyu is a Ph.D. candidate in the MADSys Lab at the Department of Computer Science, Tsinghua University, supervised by Associate Professor Zhang Mingxing. His research focuses on efficient machine learning systems, specifically covering large-scale distributed large language model inference services and reinforcement learning rollout systems.

Qin Ruoyu 與月之暗面團隊合作研發的 Mooncake,是一套以 KVCache 為中心的解耦推理架構。這套架構將 Prefill 與 Decode 階段拆分至獨立叢集運行,同時把 GPU 叢集中閒置的 CPU、內存與 SSD 資源整合為分散式快取池。該成果獲得了儲存領域頂會 FAST 2025 的 Erik Riedel 最佳論文獎。

Mooncake 是已投入實際應用的生產級服務平台,論文摘要開篇即明確標註「Mooncake is the serving platform for Kimi」。在真實業務負載下,Mooncake 可使 Kimi 的請求處理量提升 75%;在長上下文場景中,有效請求處理能力提升 59% 至 498%。目前該系統已部署於數千個節點上,每日處理的 token 總量超過 1000 億。

2024 年,月之暗面與清華 MADSys 實驗室聯合開源 Mooncake 項目(開源倉庫為 kvcache-ai/Mooncake),截至目前項目 GitHub Star 數已超過 6000。相關數據與信息可參考 arXiv 論文(編號 2407.00079)、清華計算機系官網公告及項目開源倉庫。

在 Mooncake 之後,秦若愚的研究持續圍繞推理系統方向深入。他以第一作者身份完成的 Seer 論文入選 OSDI 2026,這項工作針對強化學習中的 rollout 性能瓶頸,通過 rollout 切分、上下文感知調度與分組投機解碼技術,實現端到端 rollout 吞吐最高提升 2.04 倍,長尾延遲降低 72% 至 94%。另一篇一作論文 Prefill-as-a-Service,則進一步提出了 KVCache 跨數據中心共享的下一代推理架構設計思路。

Qin Ruoyu 也出現在 K3 項目的貢獻者名單中。大模型的產品表現由兩方面能力共同支撐:模型研發決定模型的能力上限,系統工程則決定高並發場景下服務的可用性與運行成本。

當前大模型行業的競爭,正從訓練能力的比拼逐步延伸至服務工程能力的較量。作為在讀博士生,秦若愚能在該領域產出頂會最佳論文級別的成果,核心在於其研究直接面向生產場景,成果落地於真實業務系統。

袁恩銘:

月之暗面 Kimi 團隊核心研發成員,研究軌跡橫跨計算生物學、推薦系統與大模型三大領域,全程參與 Kimi 多代核心模型的技術迭代。

早期,他曾於清華大學交叉信息研究院曾堅陽課題組從事 AI 製藥方向的研究。2020 至 2021 年間,他參與的流感藥物重定位框架研究先後發布於 bioRxiv 預印本與期刊《Signal Transduction and Targeted Therapy》,另有核衣殼蛋白相分離相關成果發表於《Protein & Cell》。

2022 至 2023 年,袁恩銘於華為諾亞方舟實驗室任職,專注於推薦系統方向的研究,成果涵蓋多個國際頂級學術會議。其中,他以第一作者完成的多行為序列推薦相關論文入選 SIGIR 2022,另有合作成果分別入選 CIKM 2022 與 WWW 2023。

加入月之暗面後,袁恩銘深度參與 Kimi 多代核心模型與技術項目研發,公開可核實的署名項目包括 Kimi k1.5 強化學習技術報告、MoBA 技術研究、Kimi-VL 技術報告、Kimi K2 大模型技術報告、Kimi Linear 技術報告、Kimi K2.5 多模態模型技術報告與 Kimi K3 旗艦大模型技術報告。

His scope of involvement covers multiple core technical areas including reinforcement learning training, multimodal capabilities, foundational model architecture, and long-context systems, fully spanning Kimi's three generations of flagship model iterations from K1.5 to K3, making him one of the core R&D team members with the broadest technical coverage.

目前公開渠道尚未披露袁恩銘在月之暗面的具體職位與細分研發分工。從公開署名軌跡來看,其跨領域的研究背景支撐了他在大模型多技術方向的參與能力,是 Kimi 技術體系迭代過程中的重要持續參與者。

許偉欣:

Hui Wai Hing is currently a researcher at Moonshot AI, with research interests covering large model foundational architecture, efficient training mechanisms, and Attention mechanism optimization.

許偉欣深度參與 Kimi 多代核心模型與底層技術研發,公開署名項目覆蓋從 k1.5 到 K3 的完整產品迭代週期。月之暗面官方在 K3 發布後公開披露了三大核心自研技術——Muon 系優化器、Kimi Linear 線性注意力、Attention Residuals 注意力殘差,許偉欣是目前可核實的、唯一在三篇對應核心技術論文中署名且順位均在前 15 位的貢獻者,是支撐 K3 架構性能升級的核心研發人員之一。

在具體成果方面,於2025年2月發布的 Muon 優化器論文中,他位列作者名單第 8 位,該優化器的計算效率約為 AdamW 的兩倍,其後續配套開源的 Moonlight 訓練實現亦有其參與;

在2025年10月發布的Kimi Linear技術論文中,他位列第15名,該架構提出的KDA機制可將KV Cache體積最高降低75%,在百萬token場景下解碼吞吐量最高提升6倍;

在2026年3月發布的 Attention Residuals 論文(K3 兩大核心架構創新之一)中,他位列第 4 位,是三位共同一作之後的首位核心貢獻者,相關技術已深度集成進 Kimi K3 基礎模型架構。

此外,他的署名還出現在 Kimi k1.5 強化學習技術報告、Kimi-VL 技術報告、Kimi K2 與 K2.5 技術報告,以及最新的 Kimi K3 旗艦模型技術報告貢獻者名單中,參與範圍涵蓋基礎模型、多模態、強化學習等多個核心研發方向。需明確的是,MoBA 論文作者列表中無其署名,二者不存在公開可查的研發關聯。

此外,他還參與了 OccDepth 三維語義場景補全、PVD-AL 主動學習蒸餾、ACCV 2024 隱式 SDF 重建等多項三維視覺方向的研究,學術成果覆蓋模型壓縮、3D 重建、語義場景理解等多個細分領域。

From the publicly signed trajectory, Xu Weixin’s research path has gradually expanded from edge model deployment and 3D visual perception to innovations in large model underlying architecture, with long-term dedication to efficient computing and broad technical coverage, making him a core continuous contributor to the iterative development of Moonshot’s underlying technology stack.

杜晨壯:

Du Chenzhuang is a core researcher at Midnight, and a key pillar of the team responsible for enhancing reinforcement learning and expanding reasoning capabilities.

他本科畢業於北京航空航天大學信息管理與信息系統專業,隨後進入大模型人才的黃埔軍校——清華大學交叉信息研究院讀博。

在清華期間,他師從人工智能領域知名學者趙行,並加入了聲名顯赫的 MARS Lab(多模態與自主推理實驗室),開始聚焦多模態機器學習、強化學習以及大語言模型強化機制。

在攻讀博士期間,他作為核心作者研發了轟動一時的《ChatDB》架構,開創性地提出「以資料庫作為符號性記憶模組來增強大模型」,在當時的AI學術界與工業界一舉刷屏。

為了更早地積累工業級大系統的實戰經驗,他還在讀博期間加入了北京海華人工智能研究院擔任實習生,深度參與了從零開始搭建底層系統的硬核研究項目。這讓他在多模態與強化學習領域積累了不少經驗,更具備了系統加算法的底層視野。

他畢業後加入月之暗面,頻繁出現在核心模型的技術報告中。他直接參與了探索強化學習擴展律的重磅論文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,同時在 Kimi K2 和 K2.5 等旗艦系列模型的技術報告中也都扮演了核心貢獻者的角色。

He also deeply contributed as a core co-author to the development of Kimi's multimodal vision large model, the "Kimi-VL Technical Report," focusing on enhancing the large model's perception and multimodal deep reasoning capabilities for complex images, charts, and real-world visual information.

Du Chenzhuang's primary focus is on large-scale large language model (LLM) training engineering, specializing in resource scheduling, stable training, and extreme system optimization of trillion-parameter models (MoE architecture) on superclusters; as well as reinforcement learning and multimodal fusion, researching how models can achieve breakthroughs in intelligent capabilities through self-supervision and reinforcement learning on complex long-reasoning tasks, and realize efficient underlying fusion of visual information with language models.

陳艷如:

Yanru Chen 是 月 之 暗 面 的 核 心 研 究 員, 專 注 於 大 模 型 底 層 架 構、 長 文 本 技 術、 算 力 優 化 與 多 模 態 工 程 的 研 發 與 落 地。

作為《Attention Residuals》論文的共同作者,他參與重構了大模型深度方向的信息流動方式,成功攻克了超深網絡訓練效率低下和信息流阻斷的行業痛點。

在長文本核心技術上,他作為 MoBA(混合塊注意力)的共同作者,主導並參與了 Kimi 最核心的底層機制研發,透過塊級別的注意力切分,直接解決了百萬級超長上下文在預訓練和推理端算力消耗過大的問題,成為 Kimi 極限降本增效的核心底座。

同時,他還是《Muon is Scalable for LLM Training》論文的共同作者,深度參與了重磅開源項目 Moonlight 及其底層 Muon 優化器的研發,通過矩陣正交化處理挑戰了傳統的 AdamW,有效地壓縮了萬億大模型在分布式訓練中的算力開銷。

In the flagship model iteration, he deeply integrated the entire R&D lifecycle of Kimi's previous flagship models (K1.5, K2, K2.5, K3), resolving stability and resource scheduling challenges under large-scale reinforcement learning and trillion-parameter scaling.

此外,在 Kimi 多模態線(Linear、VL、Audio)的技術攻堅中,他積極探索非傳統 Transformer 結構的線性注意力創新,並主導推動了 Kimi 視覺與音頻多模態技術報告的工程落地,高效解決了多模態信息流在底層融合時的效率瓶頸。

劉少偉:

劉少偉是清華大學頂級計算機系統實驗室 MADSys 實驗室的核心成員,同時也是月之暗面核心基礎設施(Infra)團隊的領軍專家。

當你感嘆 Kimi 擁有萬億參數、API 價格卻極低,背後正是他與團隊死磕的「極致量化藝術」。他常年深耕萬億級大模型的極致低成本推理、原生量化與大規模分佈式計算拓撲設計。

於全球最硬核的 AI 開源社區 Reddit LocalLLaMA 上,他曾以 Kimi 官方專家的身份,發表了轟動海外極客圈的技術拆解長文《Kimi infra team: Quantization is not a compromise, it's the next paradigm》。這篇長文深度揭秘了 Kimi K2 與 K2.5 底層極其硬核的 Native INT4 原生量化格式。

他不僅是 MoBA(混合塊注意力機制)的核心共同作者,更深度參與了重磅開源項目 Moonlight 及其底層 Muon 優化器的分佈式架構研發,通過矩陣正交化處理極大地壓縮了萬億大模型在分佈式訓練中的算力開銷。

他還是月之暗面重磅開源項目 KTransformers 的核心發起人和代碼維護者之一,親手打通了異構集群下萬億 MoE 模型混合推理的算力屏障。

陳冠多:

Chen Guanduo 是月之暗面 Infra 團隊的核心研究員。他具備極強的「系統+算法」跨界研發能力,研究領域高度聚焦於大模型基礎設施(Infra)、高效注意力機制架構(Efficient Attention Architecture)、大模型微調加速,以及大規模存儲與檢索優化。

他本科與碩士均畢業於復旦大學計算機系,在分佈式系統與底層架構領域打下了堅實的專業基礎。隨後,他前往南洋理工大學與香港科技大學進行深造,分別師從高性能計算與大模型基礎設施領域的知名學者 Yuan Binhang 和 Luo Siqiang,積累了前沿的學術視野與研發經驗。

在正式加入月之暗面之前,他曾在頂尖互聯網大廠的底層核心部門進行深度沉澱。他曾先後在字節跳動數據庫系統研發團隊以及美團基礎設施團隊擔任研究實習生,深度參與了工業級高並發、大規模分布式系統的研發與架構優化。

期間,他作為核心作者直接推出了兩項重磅成果。在底層存儲上,他研發並發表了《Oasis》,提出了一種最優不相交分割學習範圍濾波器,直接解決了底層資料庫在大規模範圍查詢時的索引瓶頸;

在應用層落地中,他發表了《Gar》,透過一種「生成和排序」的方法,大幅提升了大模型精準理解人類複雜意圖並轉化為 SQL 數據庫查詢語句(Text-to-SQL)的準確率。

陳冠多於2025年3月正式加入月之暗面。作為Infra團隊的中堅力量,他不僅是月之暗面旗艦大模型Kimi K2和Kimi K2.5的核心共同作者,還在大模型微調加速、高效注意力架構、甚至是最後網絡架構重構等方向,密集輸出了一項技術突破。

為了解決大模型微調過度耗用顯存的問題,陳冠多主導發表了《Ce-lora》論文,提出了一種計算高效的 LoRA 微調方法。這項技術透過降低大模型參數微調時的顯存佔用與計算開銷,直接提升 Infra 層的訓練吞吐量,堪稱大模型微調的「顯存瘦身術」。

為應對長文本計算複雜度呈平方級爆炸的問題,他參與研發並發表了轟動開源社區的《Kimi Linear》架構。這是一種富有表現力且高效的線性注意力架構,在保持模型強大表徵能力的同時,大幅降低長文本計算的複雜度,成功將 KV Cache(鍵值緩存)佔用最高減少 75%,並在百萬文本長度下實現 6 倍的解碼吞吐量,成為 Kimi 持續深耕長文本技術壁壘的硬核底座。

He is also one of the co-authors of Attention Residuals.

From the lowest-level storage filters and computationally efficient fine-tuning algorithms to revolutionary next-generation Transformer network architectures, Chen Guanduo’s career trajectory perfectly aligns with the industry paradigm shift from “merely scaling parameters” to “pursuing extreme computational efficiency and engineering practicality” in large models.

結語

K3 的研發團隊一向低調神秘,在梳理資料的過程中,我們也難以一一釐清所有成員的具體分工與完整履歷。但透過這份沉甸甸的名單,答案已然浮出水面:為什麼是月之暗面?為什麼他們能撐起人均 7 億的超級估值?

這群平均年齡不到 30 歲的年輕人,是真正懂算力經濟學的系統架構師。從斬獲頂會最佳論文的存儲調度,到重構注意力機制的底層創新,他們將「長、快、省」的工程效率做到了極致。

正是這種從上層算法直到底層硬件的全棧打通,賦予了月之暗面打破「算力同質化」魔咒的核心壁壘。

另一個有趣的細節是,在全員名單的結尾,Kimi K3 也成為整個研發團隊的重要成員。創造者與被創造者開始在同一張名單上並肩而立,屬於中國大模型的「黃金時代」,已然轟鳴而至。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露