Resumen generado por IA: En julio de 2026, Moon Shadow lanzó el modelo Kimi K3 como código abierto y reveló por primera vez la lista de 401 contribuidores. La valoración más reciente de la empresa alcanza los 31.500 millones de dólares, con un equipo de más de 300 personas, cuya edad promedio es inferior a 30 años, lo que equivale a unos 700 millones de dólares de valor por persona. El equipo principal incluye a los tres cofundadores: Zhou Xinyu, responsable de algoritmos; Wu Yuxin, arquitecto; y Zhang Yutao, CTO, junto con otros miembros clave provenientes de universidades de élite como Tsinghua y CMU. El equipo ha logrado múltiples innovaciones en tecnologías fundamentales como el mecanismo de atención híbrida MoBA, la arquitectura de inferencia desacoplada Mooncake y el optimizador Muon, obteniendo reconocimientos como el mejor artículo en la conferencia de almacenamiento FAST 2025. Este joven equipo de entusiastas de la tecnología se destaca por su gestión plana y por llevar la eficiencia de ingeniería "largo, rápido y económico" al máximo nivel, convirtiéndose en una fuerza importante en el campo de los modelos grandes en China.Autor y fuente del artículo: Leiphone
El 27 de julio, Moonshot mostró toda su buena voluntad y lanzó completamente el modelo Kimi K3 de 2.8T en código abierto. Al final del informe técnico, revelaron por primera vez la lista de contribuyentes reales detrás de Kimi K3; contamos 401 miembros, lo que representa un lanzamiento completo del equipo de talento de Moonshot.
Desde un equipo inicial con una valoración de solo unos cientos de millones de dólares, hasta convertirse en el verdadero "orgullo de los grandes modelos nacionales", Moonshot ha emergido como uno de los pocos equipos de entusiastas en la mesa global capaces de competir con modelos de élite como Claude Fable 5 y GPT-5.6 Sol.
Con el lanzamiento de K3, la última valoración de Moon Shadow se disparó hasta 31.500 millones de dólares, aproximadamente 210.000 millones de yuanes chinos, y este valor de 210.000 millones es respaldado por un equipo extremadamente joven.
Según información pública, Moonshot tiene aproximadamente más de 300 personas, con una edad promedio inferior a 30 años, de las cuales el 80% son I. Si se calcula, esto equivale a aproximadamente 700 millones de yuanes chinos de valoración por persona.
La estructura organizativa de Moonshot es extremadamente plana. Moonshot tiene cinco fundadores, cada uno de los cuales se comunica directamente con entre 40 y 50 personas. Internamente, se caracteriza por "sin niveles jerárquicos, sin KPI y sin barreras departamentales"; los empleados pueden desafiar a sus jefes en cualquier momento. Un detalle importante es que, durante una reunión de reflexión a principios de 2025, un empleado presentó una sugerencia radical; tras escucharla, Yang Zhilin actuó de forma aún más radical, abandonando directamente K1 para pasar a K2.
Esta misma diversidad se refleja en el "alma" de la empresa. Como fanático del rock, Yang Zhilin bautizó las salas de reunión con nombres de leyendas del rock como Rolling Stones, Nirvana y Radiohead, e incluso los planes de suscripción de Kimi llevan nombres de términos musicales como Adagio y Allegro.
Luna Dark cree que, en la actualidad, donde la capacidad de cómputo y los datos se vuelven cada vez más homogéneos, el "gusto" es el impulsor fundamental para construir barreras diferenciadoras. Este gusto se manifiesta no solo en el pulido del modelo, sino también profundamente en su exigencia y anhelo por el talento.
Luna Obscura disfruta contratar CEOs y tiene una fuerte preferencia por personas con "aura de emprendedor" o "gen de apostador". Según datos públicos, al menos 50 personas dentro de la empresa han fundado o se unido a startups. En el último año, más de 100 de los nuevos empleados contratados por Luna Obscura ingresaron a través de recomendaciones internas.
Hoy, según la lista, realizamos una investigación exhaustiva y reunimos toda la información pública y confiable relacionada con los contribuidores de K3. Se exhiben por completo el trasfondo y la capacidad técnica de este equipo de expertos de élite.
01 Kimi: base fundamental del sistema técnico
Zhou Xinyu:
Zhou Xinyu es uno de los cofundadores principales de Moonshot y también es el responsable del equipo de algoritmos.
Zhou Xinyu y Yang Zhilin se conocían desde antes; un detalle interesante es que Zhou Xinyu fue guitarrista de la banda Splay de la Universidad Tsinghua, y el baterista era precisamente Yang Zhilin.
Antes de unirse a Moonshot, Zhou Xinyu trabajó en Megvii en la producción de algoritmos y la investigación de modelos móviles. Colaboró estrechamente con Zhang Xiangyu, responsable de la investigación básica en Megvii en ese momento y actual científico jefe de Jieyue Xingchen, como autor principal y redactor directo de la obra de red ligera ShuffleNet.
La dirección principal de Zhou Xinyu es la producción masiva de algoritmos de grandes modelos, y se especializa en transformar de manera eficiente y de bajo costo los algoritmos más avanzados del laboratorio en sistemas de línea de producción a gran escala. También destaca en la optimización de arquitecturas híbridas; en una sesión de intercambio técnico (AMA) en la comunidad de Reddit, fue el primero en desglosar las ventajas comparativas de la arquitectura híbrida Kimi K3 KDA combinada con NoPE MLA, demostrando que esta arquitectura es más eficiente en términos de cálculo y más rápida tanto en preentrenamiento como en aprendizaje por refuerzo.
Wu Yuxin:
Wu Yuxin es uno de los cofundadores de Moonshot. Además, es un experto líder y arquitecto estrella en el campo de la inteligencia artificial, con un profundo conocimiento en la infraestructura y arquitectura subyacente del aprendizaje profundo, la visión por computadora (CV) y los modelos de lenguaje grandes (LLM).
Wu Yuxin y Yang Zhilin comparten el mismo trasfondo educativo: se graduaron en la facultad de informática de la Universidad Tsinghua y luego continuaron sus estudios en la Universidad Carnegie Mellon (CMU) en Estados Unidos. Trabajó como ingeniero de investigación en el laboratorio de investigación de Meta AI (FAIR), donde lideró y contribuyó a varias tecnologías fundamentales en visión por computadora.
Antes de fundar Moonshot con Yang Zhilin, Wu Yuxin ya había logrado dos resultados de nivel estándar de la industria en el campo del aprendizaje profundo y la visión por computadora:
Uno de los creadores y desarrolladores principales de Detectron2, este proyecto redefinió directamente el ecosistema de posgrado en visión por computadora a nivel mundial, convirtiéndose en la "base universal" para miles de modelos visuales y proyectos de detección de objetos en todo el mundo.
Más innovador aún, en 2018 publicó junto con el destacado académico Kaiming He una obra fundamental sobre Group Normalization, que recibió una mención honorífica al mejor artículo en ECCV 2018.
Este artículo clásico rompió directamente el cuello de botella mortal de la normalización por lotes en el entrenamiento con muestras pequeñas. La capacidad de "reescribir las reglas globales de entrenamiento de IA" con solo unas pocas líneas de innovación subyacente otorga a Wu Yuxin una gran influencia técnica en el mundo de código abierto.
En la cara oculta de la luna, él fue quien sentó las bases. Participó profundamente en la optimización de la arquitectura de modelos grandes y la eficiencia de entrenamiento, e incluso asistió personalmente a la conferencia global de desarrolladores de PyTorch, desglosando frente al mundo las contribuciones fundamentales de Kimi a la infraestructura de código abierto global.
La especialización de Wu Yuxin completa perfectamente el último rompecabezas para que Kimi alcance los límites de la próxima generación de textos largos multimodales. Es experto en la optimización de sistemas de aprendizaje profundo de alto rendimiento, resolviendo cómo hacer que los modelos grandes operen de manera más estable, calculen más rápido y consuman menos memoria con billones de parámetros, lo que constituye la muralla técnica que permite a Kimi mantener una experiencia fluida bajo textos largos y alta concurrencia.
Como uno de los autores principales de MoCo v1, una obra fundamental en el aprendizaje profundo, él ha permitido que Kimi no solo posea el cerebro más poderoso de la industria (comprensión del lenguaje natural), sino que también esté desarrollando ojos capaces de comprender profundamente el mundo físico real (visión multimodal).
Zhang Yutao:
Zhang Yutao es uno de los cofundadores de Moonshot AI y también su CTO. Él y Yang Zhilin son compañeros de la Universidad Tsinghua, y Tang Jie, fundador de Zhipu, es su profesor.
En 2016, Zhang Yutao y Yang Zhilin fundaron conjuntamente "CirculAI". Posteriormente, él y Yang Zhilin fundaron "Luna Obscura". Si Yang Zhilin es el "navegante" de Luna Obscura, entonces Zhang Yutao es el ingeniero jefe encargado de ajustar al máximo el sistema de propulsión del gigante "Inteligencia". Kimi logró una evolución explosiva en textos largos, razonamiento complejo y ejecución de tareas de Agentes, gracias en gran medida a Zhang Yutao.
Antes de unirse a Moonshot, ya había dejado varios logros de "nivel industrial" en el campo de los grafos de conocimiento y la fusión de datos heterogéneos.
Uno de sus etiquetas técnicas más conocidas es haber liderado como responsable técnico el desarrollo de la plataforma de análisis de big data académico AMiner. La tecnología central de fusión de datos heterogéneos detrás de esta plataforma, que ahora sirve a millones de académicos a nivel mundial, incluye capacidades fundamentales que Zhang Yutao participó en construir durante su doctorado en Tsinghua. Esta profunda comprensión de "cómo la máquina absorbe, entiende y recupera grandes volúmenes de conocimiento" constituye directamente la base técnica de la capacidad de Kimi para procesar textos extremadamente largos.
En contribuciones académicas, ha publicado múltiples artículos altamente citados en conferencias de computación de primer nivel como KDD y CIKM. No solo se destaca por hacer que la IA adquiera un “sentido lógico” mediante grafos de conocimiento, sino que también lideró el desarrollo de la “plataforma de IA de cero muestras con mil ciclos” durante la era de la inteligencia cíclica, logrando la implementación a gran escala de modelos de gran tamaño en escenarios de servicios empresariales.
La especialización de Zhang Yutao permitió predecir con precisión cada hito en la transición de la IA de "capaz de conversar" a "capaz de trabajar". Se centra en impulsar la tecnología de ventanas de contexto largo y la arquitectura de red de expansión dinámica, abordando cómo mantener a la IA "despierta" en medio de una gran cantidad de información.
En la última cumbre tecnológica de julio de 2026, él analizó con precisión las tres líneas tecnológicas de la ingeniería industrial: en 2023 fue la era del Prompt, centrada en "cómo hacer preguntas"; en 2024 evolucionó hacia la era del Contexto, enfocada en "proporcionar suficiente información"; y en 2026, los grandes modelos ingresaron oficialmente a una nueva fase de ingeniería Harness. Actualmente, está liderando a su equipo para resolver el enfrentamiento final del Agente: "cómo construir un entorno de ejecución que permita que la IA se corrija automáticamente en caso de errores".
Xu Xinran:
Xu Xiran es vicepresidenta de ingeniería y responsable de infraestructura de IA en Moonshot AI.
Tiene experiencia en desarrollo de capas completas y anteriormente trabajó en MegEngine (Tianyuan) y sistemas de búsqueda de vectores de miles de millones en Megvii. Actualmente, se encarga del diseño integral de la arquitectura para el entrenamiento, inferencia e infraestructura del modelo grande de Moonshot.
En la inferencia de modelos grandes, para el escenario de texto largo de Kimi, él y su equipo diseñaron conjuntamente la arquitectura de inferencia separada Mooncake, centrada en el KV Cache. Este logro, que separa completamente las fases de prellenado (Prefill) y decodificación (Decode), aliviando la presión de memoria y I/O en contextos superiores al millón de tokens, recibió el Premio al Mejor Artículo de la conferencia de almacenamiento de primer nivel FAST 2025.
Al mismo tiempo, como uno de los autores principales del mecanismo MoBA (Mixed Block Attention), logró una reducción significativa de costos y un aumento de eficiencia en el entrenamiento y la inferencia de Kimi mediante la división de atención a nivel de bloques.
En el lado del entrenamiento del modelo, participó en el desarrollo del proyecto de código abierto Moonlight y su optimizador subyacente Muon, reemplazando el AdamW tradicional con una técnica de ortogonalización matricial para reducir el costo de cómputo en el entrenamiento distribuido de modelos con billones de parámetros.
Gracias a esta serie de prácticas de almacenamiento distribuido e inferencia en flujos de texto largo a gran escala, fue invitado a pronunciar una charla en la conferencia global de código abierto GOSIM China. Su área de especialización se centra siempre en la arquitectura de modelos grandes de pila completa, dedicándose a respaldar la inferencia de texto largo de alta inteligencia con menos pérdida de FLOPs y menor uso de KV Cache.
He Weiran:
Como responsable del sistema de razonamiento de Moonshot, es el autor principal del artículo premiado como el mejor en FAST 2025 y el pilar técnico clave en la implementación práctica de la arquitectura de razonamiento de largos textos de Kimi. Desde Kimi k1.5, Kimi-VL, K2 hasta Kimi Linear, Kimi-Audio, y luego las arquitecturas clave MoBA, Muon, AttnRes, su nombre aparece en todas las seis generaciones de logros tecnológicos, y todo su trabajo gira en torno a un mismo núcleo: intercambiar diseño de sistemas por eficiencia para hacer que los modelos grandes sean realmente accesibles.
Antes de unirse a Moonshot, He Weiran ya había profundizado durante muchos años en el campo del cálculo eficiente. Se graduó en el Departamento de Informática de la Universidad Tsinghua y, al principio de su carrera, se enfocó en la colocación de chips y la optimización del rendimiento a nivel inferior; durante su etapa en Megvii, lideró el desarrollo de chips de IA propios y redes neuronales de baja precisión, trabajando al mismo tiempo que Zhou Xinyu, cofundador posterior de Moonshot, quien es precisamente el primer inventor de la solución clásica de detección de texto OCR EAST.
Después de unirse a Moonshot en 2023, aplicó toda su experiencia en ingeniería de sistemas al servicio de inferencia de modelos de gran escala con billones de parámetros.
Su logro más representativo es la arquitectura de inferencia separada KVCache, Mooncake. Este sistema rompe con los modelos tradicionales de servicios de inferencia, extrayendo y centralizando la memoria caché más intensiva en memoria gráfica de los modelos grandes, y mediante la reutilización global de caché y enrutamiento refinado, aumenta en más del 75% la capacidad de carga de solicitudes de Kimi sin incrementar la capacidad de cómputo. En la conferencia QCon de 2024, reveló que, gracias a esta arquitectura y a continuas optimizaciones de ingeniería, el costo unitario del clúster de inferencia de Kimi disminuyó más de 20 veces en un año.
En febrero de 2025, el artículo sobre Mooncake ganó el Premio Eric Riedl a la Mejor Papel de la conferencia FAST, uno de los premios más prestigiosos en el campo de los sistemas de almacenamiento. Lo que mejor demuestra su valor de ingeniería es que, antes incluso de que el artículo recibiera oficialmente el premio, esta arquitectura ya estaba funcionando de forma estable en miles de nodos del entorno de producción de Kimi, procesando miles de millones de tokens de solicitudes de usuarios cada día.
Aunque el informe técnico de K3 no revela asignaciones individuales específicas, varias innovaciones clave continúan la línea tecnológica de su equipo: para resolver el problema de la invalidez del caché de prefijos tradicional en la arquitectura híbrida KDA+MLA, el equipo contribuyó con una implementación oficial adaptada a la comunidad vLLM; para solicitudes largas de millones de tokens, el clúster emplea una estrategia de enrutamiento y programación consciente del caché para maximizar la eficiencia de reutilización del caché. El resultado final de K3 es un costo de inferencia solo del 38% del de Claude Fable 5, y la optimización de KVCache, el caché de prefijos y el control de costos son precisamente los temas centrales del sistema Mooncake.
Desde el diseño de circuitos integrados hasta la inferencia de modelos de billones de parámetros, la trayectoria técnica de He Weiran ha sido siempre clara: perseguir sin descanso la eficiencia del sistema, intercambiando diseño de ingeniería por costos de cómputo más bajos. Si los investigadores de algoritmos de élite elevaron el límite de capacidad de Kimi, él y su equipo se encargaron de materializar esta capacidad de primera línea, haciendo que sea accesible y estable para un mayor número de usuarios comunes.
02 Medio profesional, pilar práctico
Du Yulun:
Du Yulun se encarga de la preentrenamiento y la escalabilidad en Moonshot.
Se graduó en la Universidad de Illinois en Urbana-Champaign y en la Universidad Carnegie Mellon, especializándose en inteligencia artificial. Posteriormente se unió a CirculAI, donde desempeñó los puestos de investigador y director del AI Lab, siendo uno de los pioneros tecnológicos de Moonshot.
Como responsable principal de la preentrenación y la escalabilidad del modelo base, sus contribuciones técnicas abarcan completamente la arquitectura de todas las generaciones de modelos base insignia de Kimi, así como de la serie completa de multimodalidad, incluyendo VL, Audio, etc.
En avances tecnológicos subyacentes, es coautor de los artículos "Attention Residuals", "MoBA (Mixed Block Attention)" y el optimizador de preentrenamiento "Muon is Scalable for LLM Training". Su trabajo se centra en aliviar el problema de atenuación de señales en redes ultra profundas mediante la segmentación de atención a nivel de bloque y la reestructuración del flujo de entrenamiento, mejorando significativamente la eficiencia del entrenamiento distribuido de modelos masivos de billones de parámetros.
En el nivel de código abierto de ingeniería, es un contribuidor activo y clave en los proyectos de código abierto oficiales de MoonshotAI. Según los registros de colaboración de código, Du Yulun trabaja en estrecha colaboración y revisión de código con los expertos en algoritmos Su Jianlin y el responsable del sistema de inferencia He Weiran, formando juntos el cierre técnico subyacente que sustenta a Kimi en el procesamiento eficiente de textos largos de millones de tokens y el flujo multimodal.
Zhang Yu:
Zhang Yu es el arquitecto principal de Moonshot, especializado en el diseño de arquitecturas eficientes, escalables y amigables con el hardware para modelos de lenguaje grandes. Como pionero en rutas no Transformer y atención lineal, se dedica a superar el maldición engineering de que los textos largos se vuelven cada vez más lentos y extremadamente costosos.
En el ámbito académico y la práctica de ingeniería, Zhang Yu ha logrado numerosos éxitos. No solo es coautor principal del artículo "Attention Residuals" sobre conexiones residuales, sino también el autor principal del desarrollo de la arquitectura de modelo eficiente de Moonlight.
El modelo Kimi Linear, que él lideró como código abierto, aplicó por primera vez con éxito el mecanismo de atención lineal en tareas de contexto extremadamente largo, logrando un salto eficiente revolucionario. Además, su publicación en comunidades técnicas como Zhihu, titulada “La trayectoria de desarrollo de Kimi Linear”, sigue siendo considerada una guía obligatoria por innumerables ingenieros de datos de modelos grandes.
Desde romper la barrera inferior del modelo de 7B hasta ayudar en una batalla clave para que modelos de parámetros trillones ingresen al primer grupo mundial, Zhang Yu se desplaza con facilidad entre el mundo académico y el industrial, dejando numerosos códigos técnicos en conferencias académicas de primer nivel y comunidades de código abierto.
Esta serie de avances se deriva de su profundo enfoque en la tecnología central: en el diseño de arquitecturas de modelos eficientes, se centró en optimizar los cuellos de botella de comunicación y memoria durante la expansión de la profundidad del modelo; en la mejora de la dinámica y eficiencia del entrenamiento, reestructuró el flujo residual subyacente, resolviendo fundamentalmente los problemas de dilución del gradiente y explosión del estado oculto causados por PreNorm en modelos grandes.
Lai Guokun:
Lai Guokun es un exalumno dual de Tsinghua y Carnegie Mellon de Yang Zhilin.
Es uno de los investigadores con más artículos del equipo Kimi, con más de diez publicaciones; no solo es una de las figuras representativas del "Club de Genios" de Moonshot, sino también un contribuyente clave de Kimi K3, y un referente en el ámbito académico con logros de "definición".
Antes de unirse a Moonshot, Lai Guokun ya había dejado dos logros de nivel estándar de la industria en el campo del procesamiento del lenguaje natural (NLP).
Uno de ellos creó uno de los conjuntos de datos de comprensión de lectura por máquina más grandes del mundo, el conjunto de datos RACE, que entrenó la IA directamente con preguntas de exámenes de inglés para estudiantes chinos, convirtiéndose en la referencia global para la comprensión de lectura por máquina.
Lo más sorprendente es que su artículo de licenciatura sobre algoritmos de recomendación, titulado "Explicit factor models for explainable recommendation", recibió en 2024, diez años después, el Premio SIGIR Test of Time, uno de los honores más altos en el campo de la recuperación de información, otorgado exclusivamente a artículos publicados hace diez años que han resistido la prueba del tiempo y generado un impacto duradero en la industria.
Esta persona, que en la etapa de licenciatura ya posee la capacidad de “definir la línea tecnológica de los próximos diez años”, no es un caso aislado en Moonlight.
La dirección especializada de Lai Guokun se alinea muy bien con las capacidades centrales de Kimi, como su habilidad en "comprensión de lectura por máquina", que aborda cómo hacer que la IA entienda documentos largos y responda preguntas, y que constituye la base tecnológica central de la capacidad de texto largo de Kimi.
Uno de los focos de su investigación durante su tiempo en CMU fueron los modelos grandes preentrenados, además de especializarse en búsqueda de arquitecturas neuronales, estudiando cómo permitir que la IA diseñe automáticamente estructuras de red mejores, y en sistemas de recomendación explicables, para que la IA no solo recomiende contenido, sino que también explique al usuario por qué se recomienda eso.
Guo Haiqing:
Haiqing Guo fue uno de los primeros miembros clave del equipo Kimi de Moonshot, considerado un miembro fundacional del equipo, y participó en todo el desarrollo e iteración de los proyectos centrales de múltiples generaciones de Kimi.
Los proyectos verificables públicamente incluyen el informe técnico de Kimi k1.5, el informe técnico de Kimi K2, el artículo sobre la arquitectura central AttnRes y el informe técnico de Kimi K3. AttnRes es una de las dos innovaciones arquitectónicas centrales de Kimi K3.
Según la trayectoria de firma, cubrió todo el ciclo de iteración de Kimi desde la generación k1.5 hasta K3, participando en los núcleos del desarrollo de múltiples generaciones de productos y siendo un participante clave continuo en el equipo técnico de Kimi. Actualmente, los canales públicos no han revelado su puesto específico ni sus divisiones detalladas de desarrollo.
Chen Guangyu:
Chen Guangyu es probablemente el investigador más joven de Moon Shadow, nacido en 2009, con 17 años, un adolescente que hizo que Elon Musk exclamara públicamente en X: "Impressive".
Cuando Moonshot lanzó su icónico Kimi K3 con 2.8 billones de parámetros, ya figuraba junto a expertos técnicos como Su Jianlin como coautor principal del trabajo fundacional de la arquitectura central de Kimi K3, titulado "Attention Residuals".
Su participación en el mecanismo de Attention Residuals revolucionó directamente la conexión residual estándar que ha prevalecido durante diez años en el campo del aprendizaje profundo, utilizando una "atención profunda aprendible" que permite al modelo "mirar hacia atrás" de manera inteligente. Esta reestructuración fundamental aumentó la eficiencia de escalado del modelo en un 1.25 veces, permitiendo a las empresas chinas avanzar más rápido en la batalla de capacidad de cómputo de trillones con costos más bajos. Su historia de unirse a Moonshot es casi mágica. Hace un año, ni siquiera sabía qué era un Transformer; fue descubierto por una startup de Silicon Valley tras proponer en un hackathon la idea de "una tercera mano mecánica auxiliar para los humanos". Siete semanas después, fue completamente adoptado por el equipo de Kimi y admitido sin restricciones en su grupo central de investigación. Durante su primera semana de trabajo, rompió todas las convenciones y ganó el campeonato absoluto del maratón interno de hackathon de 48 horas de Kimi.
Du Angang:
En el informe técnico de Kimi, el nombre de Du Angang aparece siempre en primer lugar. Es uno de los pilares centrales del sistema multimodal de Moonshot, y uno de los pocos investigadores que han asistido a las cinco generaciones completas en el informe técnico de Kimi. Ha ocupado el primer lugar en la lista de autores del equipo en dos ocasiones, lo que sugiere que su contribución clave en Kimi K3 se encuentra en el ámbito visual.
Antes de unirse a Moonshot, Du Angang ya había establecido dos cimientos sólidos en el campo de la visión por computadora.
Una especialización en visión microscópica submarina. Durante siete años, realizó sus estudios de licenciatura y maestría en el Laboratorio de Visión Submarina de la Universidad de Ciencia y Tecnología Marítima de China, enfocándose en la clasificación de imágenes microscópicas de plancton, una tarea de extrema dificultad: identificar con precisión, mediante IA, las formas de vida más pequeñas del océano en imágenes microscópicas con borrosidad, escasez de muestras y diferencias extremadamente sutiles entre especies.
En 2020, fue el primer autor de un estudio publicado en Global OCEANS, que resolvió el problema de la clasificación de granularidad fina mediante modelado de características de segundo orden, siendo el único resultado en esta línea de investigación durante diez años en el laboratorio con un estudiante de maestría como primer autor.
Lo que tiene mayor impacto en la industria son sus logros durante su tiempo en Megvii. Su investigación sobre estimación de postura multi-persona fue aceptada en ECCV 2020, una conferencia de vanguardia en visión por computadora, y el artículo ha acumulado más de 300 citas, convirtiéndose en una referencia importante en el campo de la estimación de postura humana. Entre los coautores de este trabajo figuran figuras líderes en visión por computadora, como Sun Jian y Zhang Xiangyu, así como Zhou Xinyu, cofundador de Moonshot AI.
Después de unirse a Kimi, se ha especializado en el diseño de codificadores visuales, alineación multimodal y tecnología de agentes visuales, destacándose especialmente en la comprensión de imágenes de alta resolución, el análisis de videos de larga secuencia y el aprendizaje por refuerzo multimodal, que constituyen la base técnica central de las capacidades multimodales nativas de Kimi. Además, sus habilidades se extienden hacia la infraestructura de entrenamiento de modelos grandes —desde la estabilidad de los optimizadores hasta la síntesis de datos para agentes—, formando una capacidad integral que abarca desde algoritmos visuales de bajo nivel, hasta el entrenamiento de modelos y la implementación de agentes en la capa superior.
En 2025, publicó como primer autor el modelo multimodal de código abierto Kimi-VL; su codificador visual MoonViT de desarrollo propio admite entradas de ultraalta resolución de forma nativa, y combinado con la capacidad de contexto largo de 128K, permitió que Kimi adquiriera por primera vez la comprensión multimodal de textos largos, capaz de leer videos largos y documentos extensos, sentando las bases tecnológicas para la capacidad multimodal completa de Kimi.
En la fase K2, participó profundamente en el desarrollo del optimizador MuonClip, colaborando con el mecanismo QK-Clip para resolver el problema industrial de la inestabilidad en el entrenamiento de modelos grandes, logrando un entrenamiento a escala de 15,5 billones de tokens con "picos de pérdida cero" y reduciendo significativamente el costo y el riesgo computacional del entrenamiento; en la fase K3, lideró la tubería de síntesis de datos para agentes inteligentes, permitiendo que el modelo genere automáticamente datos de entrenamiento de alta calidad, proporcionando el soporte clave de datos que permitió a K3 posicionarse entre los primeros niveles globales en tareas exigentes como programación y agentes inteligentes.
For Kimi, his contributions span the entire evolution path of multimodal capabilities.
Qu Bo wen:
Bowen Qu (Brian Qu) forma parte del equipo de postentrenamiento de modelos. Se graduó en la Escuela de Electrónica, Información y Telecomunicaciones de la Universidad de Ciencia y Tecnología de Huazhong y obtuvo su maestría en la Escuela de Electrónica de la Universidad de Pekín. Su investigación se centra en modelos multimodales, abarcando específicamente el aprendizaje por refuerzo multimodal, modelos visuales y lingüísticos, agentes de IA y evaluación de la calidad del contenido generado por IA.
Después de unirse a Moonshot, Qu BoWen se centró principalmente en el desarrollo de las capacidades multimodales de la serie Kimi, participó profundamente en el proyecto Kimi-K2.5 y colaboró en la investigación de aprendizaje por refuerzo multimodal nativo. Kimi-K2.5 es un modelo de agente multimodal nativo lanzado por Moonshot, con un total de 1T parámetros y 32B parámetros activados.
El sistema de aprendizaje por refuerzo multimodal nativo dirigido por Qu Bowen salta la ruta tradicional de los modelos multimodales, que primero completan el ajuste fino supervisado visual y luego inician el aprendizaje por refuerzo. En su lugar, propone un enfoque que parte de un modelo de razonamiento puramente textual sin ajuste fino supervisado visual, y adquiere directamente la capacidad de razonamiento visual mediante el aprendizaje por refuerzo visual, evitando así la interferencia de datos visuales de baja calidad en la capacidad original de razonamiento lingüístico del modelo.
La investigación de Qu Bowen comenzó en la evaluación de la calidad del contenido AIGC, con resultados publicados en conferencias internacionales como ICME 2024 y CVPRW 2024. El artículo publicado en ICME 2024 abordó el problema de que los sistemas de evaluación de imágenes generadas por IA en ese momento solo se centraban en la estética y la claridad visual, ignorando la coincidencia entre el contenido generado y las instrucciones del usuario. Propuso integrar los prompts de texto en el sistema de evaluación de calidad de imágenes generadas, estableciendo un estándar que cubre tanto la calidad visual como la adherencia a las instrucciones, mejorando así la comprehensividad de la evaluación del contenido generado por IA y su alineación con la percepción humana.
Qu Bo Wen también aparece en la lista de contribuyentes de las versiones multimodales de Kimi. Como investigador joven, la trayectoria de investigación de Qu Bo Wen se ha extendido desde la construcción de sistemas de evaluación hasta el desarrollo de capacidades del modelo, y finalmente se ha concretado en la investigación de capacidades avanzadas de agentes inteligentes, con resultados estrechamente alineados a las necesidades prácticas de la industria y que sirven directamente a la iteración y actualización de modelos de producción.
Lu Enzhe:
En la lista de más de 400 contribuidores de Kimi K3, Lu Enzhe no aparece entre los primeros en la lista de nombres, pero sus acciones son excepcionalmente precisas. Cada uno de sus logros ha impactado directamente los puntos críticos de la implementación de modelos grandes, siendo un pilar clave en la construcción del sistema de capacidad de cómputo eficiente de Kimi.
La dirección de investigación de Lu Enzhe se puede resumir precisamente en tres palabras: largo, rápido, eficiente. Su objetivo principal es permitir que los modelos grandes procesen textos más largos con menor costo y mayor velocidad. Para Kimi, su responsabilidad consiste en mejorar la eficiencia en toda la cadena, desde el entrenamiento hasta la inferencia.
En febrero de 2025, publicó como primer autor el mecanismo de atención híbrida de bloques MoBA, transfiriendo la idea de selección de expertos de MoE a la capa de atención, permitiendo que el modelo solo utilice los bloques de contexto más relevantes para el cálculo al procesar solicitudes. Con una esparsidad del 95%, su rendimiento es equivalente al de la atención completa, logrando una aceleración de 6.5 veces en la inferencia de millones de tokens y 16 veces en la de decenas de millones de tokens, sentando así las bases fundamentales de la capacidad de contexto ultra largo de Kimi.
El día de su publicación, este artículo coincidió con el artículo de DeepSeek sobre la NSA, convirtiéndose en el evento de choque tecnológico más destacado del año en el círculo de modelos grandes nacionales; lo que mejor demuestra su valor de ingeniería es que, antes de ser aceptado como artículo Spotlight en NeurIPS 2025, esta solución ya había estado funcionando de forma estable en el entorno de producción de Kimi durante casi un año, atendiendo solicitudes de usuarios con largos contextos.
Además, desde la atención KDA de MoBA hasta Kimi Linear, participó en el diseño de arquitecturas dedicándose completamente a la eficiencia de la inferencia en hardware; en el lado del entrenamiento, su implementación distribuida del optimizador Muon logró un uso óptimo de memoria y una comunicación eficiente, reduciendo concretamente el costo de cómputo para el entrenamiento de modelos grandes. Sumando los informes técnicos de AttnRes, K1.5, K2, Kimi-VL y otras generaciones, su trabajo abarca integralmente toda la cadena de tecnologías para modelos grandes eficientes.
Dentro del equipo, él es compañero fijo de Qiu Jiezhong, uno de los autores de correspondencia del artículo MoBA; uno se encarga de la ejecución, mientras que el otro guía la dirección, y trabajan con gran química.
Wang Yuzhi:
Wang Yuzhi es un investigador de Moonshot AI y uno de los autores más frecuentes en los informes técnicos de la serie Kimi.
Desde K1.5 en enero de 2025 hasta Kimi K3 en julio de 2026, su nombre aparece en casi cada documento técnico de esta empresa, abarcando visión, audio, arquitecturas de atención, optimizadores de entrenamiento, modelos insignia y marcos de gobernanza de riesgos de IA de vanguardia.
Es licenciado por la Universidad de Ciencia y Tecnología de Xi'an y doctor en el Departamento de Ingeniería Electrónica de la Universidad Tsinghua; tras unirse al Instituto Megvii, trabajó como ingeniero de investigación; en 2024 se unió a Moonshot AI como investigador y sigue en ese cargo hasta la actualidad.
Antes de unirse a Moonshot, su investigación se centró en la fotografía computacional y la visión subyacente. Sus logros representativos incluyen: ser el primer autor de un artículo sobre reducción de ruido en imágenes RAW en dispositivos móviles publicado en ECCV 2020, una línea de trabajo que sigue siendo uno de los referentes en imagen móvil; como miembro del equipo Megvii, ganar el primer lugar global en la pista raw-RGB del desafío NTIRE 2019 de eliminación de ruido en imágenes reales; y participar como coautor en el trabajo clásico del campo de OCR, EAST (CVPR 2017, más de 2,500 citas).
Durante la fase de la cara oculta de la luna, participó en la firma de diez documentos técnicos, incluyendo: k1.5, K2, K3, Kimi-VL, Kimi-Audio, MoBA, Muon, Kimi Linear, y cuatro artículos sobre arquitectura y eficiencia de Attention Residuals, así como un marco avanzado de gestión de riesgos de IA.
Es importante destacar que aparece como autor en las cuatro publicaciones de la empresa sobre arquitectura y eficiencia, una cobertura amplia que no es común en una lista de aproximadamente cuatrocientos contribuyentes. No hay información pública disponible sobre sus responsabilidades específicas en K3.
Mao Shaoguang:
Mao Shaoguang es un pilar fundamental de la línea técnica de Kimi Agent, participó en todo el proceso de desarrollo de las cuatro generaciones de productos estrella: K2, K2-Thinking, K2.5 y K3, y es uno de los pocos investigadores en la industria que ha vivido completamente los dos cambios de paradigma en el sector de Agentes.
Antes de unirse a Moonshot, ya era uno de los primeros profesionales en implementar Agentes en el país.
Graduado con maestría en informática de la Universidad Tsinghua, clasificado entre los primeros el 0.2% durante su estadía universitaria y galardonado con la beca nacional. Trabajó como asistente de investigación en la Universidad China de Hong Kong y realizó prácticas en el grupo de voz del Instituto de Investigación de Microsoft Asia. Después de graduarse, trabajó en Microsoft durante casi seis años, ascendiendo de ingeniero de investigación a ingeniero de desarrollo sénior.
En 2023, participó en el desarrollo de TaskMatrix.AI, integrando cientos de miles de API en ChatGPT; posteriormente, propuso conjuntamente el método Solo Performance Prompting, que permite a un solo modelo interpretar múltiples roles para simular la colaboración de múltiples agentes inteligentes, con tecnología implementada en Microsoft 365 Word.
Esa es la «era de los marcos» del agente: todas las capacidades dependen de herramientas externas y son guiadas por prompts, y él es un testigo y constructor directo de esta línea tecnológica.
Pero Mao Shaoguang, quien había recorrido personalmente este camino, fue el primero en ver los límites del antiguo modelo. En junio de 2025, escribió en Zhihu una confesión de la industria: "Este rumbo se está volviendo cada vez menos interesante, tiene un sentido de declive acelerado".
Después de unirse a Moonshot en febrero de 2025, se volcó completamente hacia la línea end-to-end de "modelo como Agent". En solo cuatro meses, participó en el lanzamiento del primer producto Agent de Kimi: Kimi Researcher:
Entrenado completamente mediante aprendizaje por refuerzo de extremo a extremo, sin ningún preset de proceso, realiza un promedio de 23 pasos de razonamiento por tarea única, escanea automáticamente 206 páginas web y genera informes de investigación de diez mil caracteres con citas normativas, alcanzando un 26,9 % en la métrica HLE, superando el nivel más alto mundial en ese momento. También es uno de los dos autores firmantes del relato técnico oficial del producto.
Después, participó profundamente en el desarrollo de las cuatro generaciones de productos insignia, desde K2 hasta K3. El indicador HLE aumentó de 8.6% a 26.9%, y esta curva de rendimiento impulsada casi en su totalidad por aprendizaje por refuerzo es el informe de resultados de su nueva línea tecnológica.
Desde extender las capacidades de los modelos grandes mediante APIs externas hasta permitir que los modelos aprendan internamente a utilizar herramientas y completar tareas complejas de forma autónoma, la trayectoria profesional de Mao Shaoguang durante los últimos diez años refleja exactamente la evolución completa de la industria de los Agentes, desde la “ensamblaje y combinación” hacia el “crecimiento nativo”. Al haber participado directamente en el antiguo paradigma y haber liderado activamente el nuevo camino, sus juicios sobre la industria están respaldados por resultados concretos y sólidos.
Qin Ruoyu:
Qin Ruoyu es un estudiante de doctorado en el laboratorio MADSys del Departamento de Informática de la Universidad Tsinghua, bajo la supervisión del profesor asociado Zhang Mingxing. Su investigación se centra en sistemas de aprendizaje automático eficientes, abarcando dos áreas específicas: servicios de inferencia de modelos de lenguaje grandes a gran escala y sistemas de rollout de aprendizaje por refuerzo.
Mooncake, desarrollado por Qin Ruoyu en colaboración con el equipo de Moon Shadow, es una arquitectura de inferencia desacoplada centrada en KVCache. Esta arquitectura separa las fases de Prefill y Decode para ejecutarse en clústeres independientes, mientras integra los recursos de CPU, memoria y SSD inactivos en los clústeres de GPU en un pool de caché distribuido. Este logro recibió el Premio Erik Riedel al Mejor Artículo en FAST 2025, la conferencia líder en el campo del almacenamiento.
Mooncake es una plataforma de servicio de producción ya implementada; el resumen del artículo indica claramente en su inicio: "Mooncake es la plataforma de servicio para Kimi". Bajo cargas de trabajo reales, Mooncake aumenta la capacidad de procesamiento de solicitudes de Kimi en un 75%; en escenarios de contexto largo, la capacidad efectiva de procesamiento de solicitudes aumenta entre un 59% y un 498%. Actualmente, este sistema ya se ha desplegado en miles de nodos y procesa más de 100 mil millones de tokens diariamente.
En 2024, Moon Shadow聯合清華大學MADSys實驗室開源了Mooncake proyecto (el repositorio de código abierto es kvcache-ai/Mooncake); hasta la fecha, el número de estrellas en GitHub del proyecto ha superado los 6000. Los datos e información relacionados se pueden consultar en el artículo de arXiv (número 2407.00079), el anuncio en el sitio web del Departamento de Informática de Tsinghua y el repositorio de código abierto del proyecto.
Tras Mooncake, la investigación de Qin Ruoyu continuó profundizando en la dirección de sistemas de razonamiento. El artículo Seer, del cual es primer autor, fue seleccionado para OSDI 2026; este trabajo aborda el cuello de botella de rendimiento en el rollout del aprendizaje por refuerzo mediante técnicas de división de rollout, programación consciente del contexto y decodificación especulativa por grupos, logrando un aumento máximo del 2.04 veces en el rendimiento total de rollout y una reducción del 72% al 94% en la latencia de cola larga. Otro artículo como primer autor, Prefill-as-a-Service, propone adicionalmente una nueva arquitectura de inferencia que permite el intercambio de KVCache entre centros de datos.
Qin Ruoyu también aparece en la lista de contribuyentes del proyecto K3. El rendimiento del modelo grande es respaldado por dos capacidades: el desarrollo del modelo determina el límite de capacidad del modelo, mientras que la ingeniería de sistemas determina la disponibilidad y el costo de operación del servicio en escenarios de alta concurrencia.
La competencia en la industria de los modelos grandes actualmente está pasando de una batalla por capacidades de entrenamiento a una competencia por capacidades de ingeniería de servicios. Como estudiante de doctorado, Qin Ruoyu ha logrado resultados de nivel mejor artículo de conferencia de alto nivel en este campo, principalmente porque su investigación se enfoca directamente en escenarios de producción y sus resultados se implementan en sistemas de negocios reales.
Yuan Enming:
Miembros clave del equipo de investigación de Moonshot, con trayectorias de investigación que abarcan biología computacional, sistemas de recomendación y modelos grandes, participaron en todo el proceso de iteración técnica de los modelos principales de Kimi.
Anteriormente, trabajó en el grupo de investigación de Zhenyang Jian en el Instituto de Información Interdisciplinaria de la Universidad Tsinghua, enfocándose en la investigación de IA para la farmacéutica. Entre 2020 y 2021, su investigación sobre un marco de reutilización de fármacos contra la gripe se publicó primero en el preimpreso bioRxiv y luego en la revista Signal Transduction and Targeted Therapy; además, sus resultados relacionados con la separación de la proteína de la cápside nuclear se publicaron en Protein & Cell.
De 2022 a 2023, Yuan Enming trabajó en el Laboratorio Ark de Huawei, enfocándose en la investigación de sistemas de recomendación, con resultados publicados en múltiples conferencias académicas internacionales de primer nivel. Entre ellos, el artículo que escribió como primer autor sobre recomendación de secuencias de múltiples comportamientos fue seleccionado para SIGIR 2022, y otros trabajos colaborativos fueron seleccionados para CIKM 2022 y WWW 2023.
Después de unirse a Moonshot, Yuan Enming participó profundamente en el desarrollo de múltiples generaciones de modelos y proyectos técnicos de Kimi. Los proyectos con nombre público y verificable incluyen el informe técnico de aprendizaje por refuerzo de Kimi k1.5, la investigación técnica de MoBA, el informe técnico de Kimi-VL, el informe técnico del gran modelo Kimi K2, el informe técnico de Kimi Linear, el informe técnico del modelo multimodal Kimi K2.5 y el informe técnico del modelo insignia Kimi K3.
Su ámbito de participación abarca múltiples direcciones tecnológicas clave, como el entrenamiento de aprendizaje por refuerzo, capacidades multimodales, arquitectura de modelos base y sistemas de contexto largo, cubriendo completamente el ciclo de iteración de las tres generaciones de modelos insignia de Kimi, desde k1.5 hasta K3, siendo uno de los miembros del equipo con el mayor alcance técnico.
Actualmente, los canales públicos no han revelado el puesto específico de Yuan Enming en Moonshot ni sus divisiones detalladas de investigación. Según las huellas de autoría públicas, su trasfondo de investigación interdisciplinario respalda su capacidad para participar en múltiples direcciones tecnológicas de modelos grandes, siendo un participante clave y continuo en el proceso de iteración del sistema técnico de Kimi.
Xu Weixin:
Xu Weixin es investigador actual de Moonshot AI, con líneas de investigación que abarcan la infraestructura básica de modelos grandes, mecanismos de entrenamiento eficientes y optimización del mecanismo Attention.
Xu Weixin participó profundamente en el desarrollo de los modelos centrales y la tecnología subyacente de múltiples generaciones de Kimi, con proyectos con su nombre público que abarcan todo el ciclo de iteración del producto desde k1.5 hasta K3. Tras el lanzamiento de K3, la oficialidad de Moonshot reveló públicamente tres tecnologías clave desarrolladas internamente: el optimizador Muon, la atención lineal Kimi Linear y los residuos de atención Attention Residuals. Xu Weixin es el único contribuyente verificable que aparece firmado en los tres artículos correspondientes a estas tecnologías clave, con su posición en todos ellos dentro de los primeros 15 lugares, siendo uno de los desarrolladores clave que respaldan la mejora de rendimiento de la arquitectura K3.
En cuanto a logros concretos, en el artículo sobre el optimizador Muon publicado en febrero de 2025, figura como octavo autor; este optimizador tiene una eficiencia de cálculo aproximadamente el doble que AdamW, y también participó en la implementación de entrenamiento Moonlight, lanzada posteriormente como código abierto;
En el artículo técnico Kimi Linear publicado en octubre de 2025, ocupó el puesto 15; el mecanismo KDA propuesto por esta arquitectura puede reducir el volumen del KV Cache hasta en un 75% y aumentar hasta seis veces el rendimiento de decodificación en escenarios de un millón de tokens;
En el artículo "Attention Residuals" publicado en marzo de 2026 (uno de los dos principales innovaciones arquitectónicas de K3), ocupó el cuarto lugar, siendo el primer contribuyente clave tras los tres autores principales; la tecnología relacionada ya se ha integrado profundamente en la arquitectura del modelo base Kimi K3.
Además, su nombre aparece en la lista de contribuyentes de los informes técnicos de Kimi k1.5 de aprendizaje por refuerzo, Kimi-VL, Kimi K2 y K2.5, así como en el último informe técnico del modelo insignia Kimi K3, con una participación que abarca múltiples direcciones clave de investigación, como modelos básicos, multimodalidad y aprendizaje por refuerzo. Es importante aclarar que su nombre no aparece en la lista de autores del artículo MoBA, y no existe ninguna relación de desarrollo pública y verificable entre ambos.
Además, participó en múltiples investigaciones en el ámbito de la visión tridimensional, como OccDepth para la completitud semántica de escenas 3D, PVD-AL para la distilación de aprendizaje activo y la reconstrucción implícita de SDF en ACCV 2024, con logros académicos que abarcan varios subcampos, incluyendo compresión de modelos, reconstrucción 3D y comprensión de escenas semánticas.
Según las trayectorias de publicación firmadas, la línea de investigación de Xu Weixin se ha extendido gradualmente desde la implementación de modelos en el extremo y la percepción visual tridimensional hasta la innovación en la arquitectura subyacente de grandes modelos, con un enfoque prolongado en cálculo eficiente y una amplia cobertura tecnológica, siendo un participante clave y continuo en la iteración de la pila tecnológica subyacente de Moonshot.
Du Chenzhuang:
Du Chenzhuang es un investigador clave de Moonshot, encargado del aprendizaje por refuerzo y la expansión de las capacidades de razonamiento dentro del equipo.
Se graduó en la Universidad de Aeronáutica y Astronáutica de Pekín con una licenciatura en Gestión e Información de Sistemas, y luego ingresó al "Huangpu Military Academy" de talentos en modelos grandes: el Instituto de Investigación Interdisciplinaria de Información de la Universidad de Tsinghua para realizar su doctorado.
Durante su tiempo en Tsinghua, estudió bajo el reconocido experto en inteligencia artificial Zhao Xing y se unió al prestigioso MARS Lab (Laboratorio de Multimodalidad y Razonamiento Autónomo), enfocándose en el aprendizaje multimodal, el aprendizaje por refuerzo y los mecanismos de refuerzo de modelos de lenguaje grandes.
Durante sus estudios de doctorado, como autor principal desarrolló la arquitectura revolucionaria «ChatDB», proponiendo innovadoramente «utilizar bases de datos como módulos de memoria simbólica para potenciar modelos grandes», lo que generó un gran impacto en la comunidad académica e industrial de la IA en ese momento.
Para acumular antes experiencia práctica con sistemas industriales a gran escala, durante su doctorado se unió como becario al Instituto de Inteligencia Artificial Haihua de Pekín, participando profundamente en un proyecto de investigación riguroso que consistía en construir desde cero un sistema subyacente. Esto le permitió adquirir una sólida experiencia en los campos de la multimodalidad y el aprendizaje por refuerzo, así como una visión integral de sistema y algoritmo.
Después de graduarse, se unió a Moonshot AI y apareció frecuentemente en los informes técnicos de los modelos principales. Participó directamente en el influyente artículo “Kimi k1.5: Scaling Reinforcement Learning with LLMs”, que explora las leyes de escalado del aprendizaje por refuerzo, y también desempeñó un papel clave como contribuyente principal en los informes técnicos de los modelos insignia Kimi K2 y K2.5.
También participó profundamente como coautor principal en el desarrollo del modelo visual multimodal Kimi, informe técnico de Kimi-VL, centrándose en mejorar la percepción y la capacidad de razonamiento multimodal profundo del modelo frente a imágenes complejas, gráficos e información visual del mundo real.
El enfoque principal de Du Chenzhuang es la ingeniería de entrenamiento de grandes modelos de lenguaje (LLM) a gran escala, centrándose en la programación de recursos, el entrenamiento estable y la optimización extrema del sistema para modelos de trillones de parámetros (arquitectura MoE) en superclusters; así como en el aprendizaje por refuerzo y la fusión multimodal, investigando cómo los modelos pueden superar los límites de inteligencia en tareas de razonamiento largo y complejo mediante auto-supervisión y aprendizaje por refuerzo, y lograr una fusión eficiente a nivel básico entre información visual y modelos de lenguaje.
Yanru Chen:
Yanru Chen es investigadora principal de Moonshot AI, enfocada en el desarrollo e implementación de arquitecturas de modelos grandes, tecnologías de texto largo, optimización de capacidad de cómputo e ingeniería multimodal.
Como coautor del artículo "Attention Residuals", participó en la reestructuración del flujo de información en la dirección profunda de los modelos grandes, logrando superar los problemas industriales clave de baja eficiencia en el entrenamiento de redes ultra profundas y la interrupción del flujo de información.
En la tecnología clave de textos largos, como coautor de MoBA (Mixed Block Attention), lideró y participó en el desarrollo de los mecanismos fundamentales más importantes de Kimi, resolviendo directamente el excesivo consumo de poder computacional en el entrenamiento y la inferencia de contextos extremadamente largos de millones de tokens mediante la segmentación de atención a nivel de bloques, convirtiéndose en la base fundamental para la reducción extrema de costos y el aumento de eficiencia de Kimi.
Al mismo tiempo, es coautor del artículo "Muon is Scalable for LLM Training" y participó profundamente en el desarrollo del importante proyecto de código abierto Moonlight y su optimizador subyacente Muon, desafiando el AdamW tradicional mediante la ortogonalización matricial y reduciendo eficazmente el consumo de recursos de cómputo en el entrenamiento distribuido de modelos de billones de parámetros.
Durante la iteración del modelo insignia, integró profundamente el ciclo de vida completo de desarrollo de los anteriores modelos insignia de Kimi (k1.5, K2, K2.5, K3), resolviendo los desafíos de estabilidad y asignación de recursos bajo el aprendizaje por refuerzo a gran escala y la expansión a billones de parámetros.
Además, en el desarrollo técnico de los módulos multimodales de Kimi (Linear, VL, Audio), exploró activamente innovaciones en atención lineal fuera de las estructuras Transformer tradicionales y lideró la implementación práctica del informe técnico multimodal visual y de audio de Kimi, resolviendo eficientemente los cuellos de botella de eficiencia en la fusión subyacente de flujos de información multimodal.
Liu Shaowei:
Liu Shaowei es miembro clave del laboratorio MADSys del Laboratorio de Sistemas Computacionales de la Universidad Tsinghua y también es el experto líder del equipo de infraestructura (Infra) de Moonshot.
Cuando te maravillas de que Kimi posee trillones de parámetros y un precio de API extremadamente bajo, detrás está el "arte cuantitativo extremo" al que él y su equipo han dedicado esfuerzos incansables. Él ha profundizado durante años en la inferencia de modelos de trillones de parámetros con costos extremadamente bajos, la cuantificación nativa y el diseño de topologías de cómputo distribuido a gran escala.
En la comunidad de código abierto de IA más exigente del mundo, Reddit LocalLLaMA, publicó un extenso artículo técnico que causó sensación en la comunidad de entusiastas internacionales titulado «Kimi infra team: Quantization is not a compromise, it's the next paradigm», en su calidad de experto oficial de Kimi. Este artículo revela en profundidad el extremadamente avanzado formato nativo de cuantización Native INT4 subyacente a Kimi K2 y K2.5.
No solo es coautor principal del MoBA (Mixed Block Attention Mechanism), sino que también participó profundamente en el desarrollo de la arquitectura distribuida del importante proyecto de código abierto Moonlight y su optimizador subyacente Muon, reduciendo enormemente el consumo de poder de cómputo en el entrenamiento distribuido de modelos de trillones de parámetros mediante la ortogonalización matricial.
También es uno de los fundadores y mantenedores de código clave del importante proyecto de código abierto KTransformers de Moonshot, quien eliminó personalmente la barrera de capacidad de cómputo para la inferencia híbrida de modelos MoE de billones en clusters heterogéneos.
Chen Guanduo:
Chen Guanduo es investigador principal del equipo de Infra de Moonshot AI. Posee una extraordinaria capacidad de investigación interdisciplinaria en "sistema + algoritmo", y sus áreas de investigación se centran altamente en la infraestructura de modelos grandes, arquitecturas de mecanismos de atención eficientes, aceleración del ajuste fino de modelos grandes y optimización de almacenamiento y recuperación a gran escala.
Obtuvo su licenciatura y maestría en el Departamento de Informática de la Universidad Fudan, donde sentó una sólida base profesional en sistemas distribuidos y arquitectura de bajo nivel. Posteriormente, se especializó en la Universidad Tecnológica de Nanyang y la Universidad Científica y Tecnológica de Hong Kong, estudiando bajo los reconocidos académicos Yuan Binhang y Luo Siqiang en los campos de computación de alto rendimiento e infraestructura para modelos de gran escala, acumulando una visión académica y experiencia de investigación de vanguardia.
Antes de unirse oficialmente a Moonshot, realizó una profunda especialización en los departamentos centrales de empresas de internet de primer nivel. Trabajó como becario de investigación en los equipos de desarrollo del sistema de bases de datos de ByteDance y en el equipo de infraestructura de Meituan, participando activamente en el desarrollo y la optimización arquitectónica de sistemas distribuidos a gran escala y de alta concurrencia a nivel industrial.
Durante este período, como autor principal, lanzó directamente dos resultados significativos. En el almacenamiento subyacente, desarrolló y publicó "Oasis", proponiendo un filtro de rango de aprendizaje de particiones disjuntas óptimas que resolvió directamente el cuello de botella de índices en bases de datos bajo consultas de rango a gran escala;
En la implementación a nivel de aplicación, publicó "Gar", que mejora significativamente la precisión de los grandes modelos para comprender con precisión las intenciones complejas humanas y convertirlas en consultas de base de datos SQL (Text-to-SQL) mediante un método de "generación y ordenación".
Chen Guanduo se unió oficialmente a Moonshot en marzo de 2025. Como pilar del equipo de Infra, no solo es coautor principal del modelo insignia de Moonshot, Kimi K2 y Kimi K2.5, sino que también ha logrado una serie de avances técnicos en áreas como la aceleración del ajuste fino de modelos grandes, arquitecturas de atención eficientes e incluso la reestructuración final de la arquitectura de red.
Para resolver el problema de que el ajuste fino de modelos grandes consume demasiada memoria GPU, Chen Guanduo lideró la publicación del artículo "Ce-lora", que presenta un método de ajuste fino LoRA de alta eficiencia computacional. Esta tecnología reduce directamente el consumo de memoria GPU y la carga computacional durante el ajuste fino de parámetros de modelos grandes, aumentando significativamente el rendimiento de entrenamiento en la capa de infraestructura, y puede considerarse como una "reducción de peso de memoria" para el ajuste fino de modelos grandes.
Para abordar el problema de la complejidad computacional que crece de forma cuadrática con textos largos, participó en el desarrollo y publicó la arquitectura "Kimi Linear", que generó un gran impacto en la comunidad de código abierto. Se trata de una arquitectura de atención lineal, expresiva y eficiente, que reduce drásticamente la complejidad computacional de textos largos mientras mantiene la potente capacidad de representación del modelo. Logró reducir hasta un 75 % el uso de KV Cache (memoria caché de claves y valores) y alcanzó un rendimiento de decodificación seis veces mayor en textos de un millón de tokens, constituyendo la base técnica fundamental que sustenta el profundo compromiso de Kimi con la superación de las barreras tecnológicas en textos largos.
He is also one of the co-authors of "Attention Residuals".
Desde los filtros de almacenamiento de nivel más bajo hasta algoritmos de ajuste fino eficientes en cálculo y arquitecturas de red Transformer de próxima generación revolucionarias, la trayectoria profesional de Chen Guanduo se alinea perfectamente con el paradigma industrial actual, en el que los modelos grandes evolucionan de una simple "búsqueda de parámetros" hacia una búsqueda de eficiencia computacional extrema y implementación técnica.
Cierre
El equipo de desarrollo de K3 ha sido tradicionalmente reservado y misterioso; durante el proceso de revisión de la información, resultó difícil determinar con precisión la distribución de funciones y el historial completo de todos los miembros. Pero a través de esta lista abrumadora, la respuesta ya emerge: ¿por qué Moonlight Dark Side? ¿Cómo lograron respaldar una valoración récord de 700 millones por persona?
Este grupo de jóvenes, con una edad promedio inferior a 30 años, son arquitectos de sistemas que realmente comprenden la economía de la potencia de cálculo. Desde la programación de almacenamiento que ganó el mejor artículo en conferencias de élite hasta innovaciones fundamentales en la reestructuración del mecanismo de atención, han llevado la eficiencia de ingeniería de "largo, rápido y económico" al extremo.
Es precisamente esta integración completa, desde los algoritmos de nivel superior hasta el hardware de nivel inferior, lo que otorga a Moonshot la barrera central para romper el hechizo de la homogeneización de la capacidad de cómputo.
Otro detalle interesante es que, al final de la lista completa, Kimi K3 también se convirtió en un miembro clave de todo el equipo de investigación y desarrollo. Creadores y creados ahora se alinean lado a lado en la misma lista; la era dorada de los grandes modelos chinos ya ha llegado con fuerza.
