El modelo de IA Kimi K3 de un baterista de 34 años ocupa el cuarto lugar a nivel mundial, generando reacción en el mercado

iconMetaEra
Compartir
AI summary iconResumen
Kimi K3 de Moonshot AI, lanzado el 16 de julio de 2026, se ubicó en el puesto 4º a nivel mundial con una puntuación de 57.1 en el Intelligence Index v4.1. El modelo de 2.8 billones de parámetros admite 1 millón de tokens y visuales nativos. Su fundador, Yang Zhilin, un baterista de 34 años, busca impulsar la presencia global de Moonshot en inteligencia artificial. El precio de Kimi K3 es el triple del de su predecesor, desviándose de la estrategia china de IA de bajo costo. Su lanzamiento coincidió con una caída del 1.4% en el Nasdaq, demostrando el impacto del modelo en el sentimiento del mercado. El análisis on-chain revela un creciente interés en activos impulsados por IA, mientras que el índice de miedo y codicia refleja emociones mixtas entre los inversores.
El verdadero punto de interés no es la puntuación del modelo, sino la estrategia que Yang Zhilin ha apostado: pesos abiertos + largo contexto + clúster de agentes, un camino completamente distinto al de OpenAI.

Autor del artículo, fuente: 0x9999in1, ME News



TL;DR

  • El 16 de julio de 2026, Moonshot lanzó Kimi K3, con 2.8 billones de parámetros y 1 millón de tokens de contexto; Artificial Analysis le otorgó una puntuación general de 57.1, ubicándolo en el puesto 4 a nivel mundial, superando a Claude Opus 4.8.
  • El fundador, Yang ZhiLin, tiene 34 años, es licenciado por Tsinghua y doctor por CMU, y es el primer autor de Transformer-XL y XLNet, perteneciendo al pequeño grupo de personas que convierten sus propios artículos académicos en productos.
  • Moonshot completó una nueva ronda de financiación de aproximadamente 2 mil millones de dólares en mayo de 2026, con una valoración que superó los 20 mil millones de dólares, multiplicando su valor aproximadamente cuatro veces en tres meses.
  • El día del lanzamiento de K3, Nasdaq cayó más del 1.4%, y NVIDIA también se debilitó simultáneamente: el lanzamiento de una empresa emergente china impulsó por primera vez de manera tangible el ánimo del mercado accionario estadounidense.
  • Pero K3 ya no es "extremadamente barato": $3/$15 por millón de tokens, aproximadamente el triple del K2.6 anterior, marcando un punto de inflexión en la era de "IA china a precio de repollo".
  • La tasa de ilusiones de K3 fue evaluada independientemente en un 51 %, la salida es redundante y los pesos abiertos se posponen hasta el 27 de julio; la historia no es perfecta.
  • El verdadero punto de interés no es la puntuación del modelo, sino la estrategia que Yang Zhilin ha apostado: pesos abiertos + largo contexto + clúster de agentes, un camino completamente distinto al de OpenAI.

Un baterista, ¿por qué podría crear el cuarto modelo más grande del mundo?

Primero, la conclusión. Yang Zhilin no tuvo suerte.

Es uno de los pocos en lograr el ciclo cerrado de teoría a producto.

Transformer-XL, XLNet, dos artículos, primer autor. Estos no son artículos comunes. Son una de las bases para el procesamiento de secuencias largas en todos los modelos grandes de hoy.

Muchos escriben tesis. Pocos convierten las tesis en empresas. Y aquellos que logran llevar sus empresas a los primeros cuatro lugares a nivel mundial, se pueden contar con los dedos de una mano en todo el mundo.

Nacido en 1992, de Shantou, Guangdong. Licenciado en Ingeniería Informática en la Universidad Tsinghua, tocaba la batería y componía canciones para la banda de rock universitaria Splay mientras escribía código. Obtuvo su doctorado en la Universidad Carnegie Mellon en cuatro años. Ha trabajado en Google Brain y Meta AI, y figura entre sus colaboradores Bengio y LeCun.

Co-fundó su primera empresa de IA a los 24 años. En marzo de 2023, fundó Moonshot AI.

Este currículum es una muestra escasa incluso en Silicon Valley. En China, es prácticamente el único de su tipo.

¿Por qué enfatizar esto?

En el camino de los grandes modelos, "he leído todos los artículos relacionados" y "estos artículos los escribí yo" son dos formas completamente distintas de energía potencial. La primera es una curva de aprendizaje; la segunda, una intuición de primer movimiento. Yang Zhilin pertenece a la segunda.

Transformer-XL aborda el problema de "no poder recordar secuencias demasiado largas". XLNet supera el paradigma de preentrenamiento de BERT. En la extensión de estos dos avances se encuentra la etiqueta de producto más distintiva de Kimi hoy: contexto largo.

Desde los primeros 200.000 caracteres del asistente inteligente Kimi, hasta los 2 millones posteriores, y ahora en K3 se ofrecen directamente 1M de tokens (aproximadamente 1 millón de tokens).

This is not a marketing topic. It is a natural extension of his academic career.

¿En qué es fuerte Kimi K3 y en qué es débil?

Primero, veamos los datos duros.

Kimi K3 se lanzó el 16 de julio de 2026. 2.8 billones de parámetros totales, arquitectura MoE dispersa, con 16 expertos activados por token de un total de 896. Ventana de contexto de 1.048.576 tokens. Soporte nativo para visión.

Puntuación del Intelligence Index v4.1 de la tercera parte independiente Artificial Analysis: 57.1,排名第4 a nivel mundial.

Los tres primeros son Claude Fable 5 (59.9), GPT-5.6 Sol (58.9) y Kimi K3, seguidos de cerca por Claude Opus 4.8 (55.7). Más abajo, Grok 4.5 tiene 53.8, GLM-5.2 tiene 51.1 y DeepSeek V4 tiene 44.3.

Esta es la primera vez que un modelo chino entra realmente en el primer grupo mundial.

Revise los ítems específicos: GPQA Diamond: 93.5%. Terminal-Bench 2.1: 88.3%, casi empatado con el 88.8% de GPT-5.6 Sol. BrowseComp: 91.2%. En el Frontend Code Arena de Arena.ai, K3 obtuvo el primer lugar, superando a Claude Fable 5. También fue el primero en AutomationBench-AA, con un 53%.

En la puntuación independiente GDPval-AA v2, que mide el "conocimiento del trabajo de valor económico real", el Elo de K3 aumentó directamente de 1190 en la generación anterior K2.6 a 1668, superando a Claude Opus 4.8 con 1600, GLM-5.2 con 1514 y GPT-5.5 con 1494.

El salto es de 478 Elo. Bastante brusco.

¿Dónde está la debilidad?

Tasa de alucinaciones alta. Artificial Analysis midió una tasa de alucinaciones del 51% para K3, más alta que la generación anterior. La precisión mejoró, pero también aumentó la "probabilidad de decir tonterías".

Demasiado extenso. K3 generó 130 millones de tokens en la evaluación completa de AA, mientras que el promedio de la industria es de 63 millones. ¡Doble! Simon Willison probó una tarea simple de "dibujar un ganso" en SVG, gastando aproximadamente 0.25 dólares.

Los pesos abiertos se retrasan. El día del lanzamiento no hay checkpoint, ni licencia, ni model card, ni informe técnico. Moonshot promete liberarlos antes del 27 de julio, es decir, seis días después de la redacción de este artículo. Antes de eso, K3 solo está disponible a través de API y App, siendo esencialmente un "modelo alojado".

No hay puntuación de SWE-bench Pro/Verified. Los conjuntos de evaluación elegidos por Moonshot, como DeepSWE y FrontierSWE, aún no pueden ser replicados por terceros.

Entonces, K3 es un modelo "realmente bueno, pero aún no perfecto". Esto merece quedar claro y no debe ser exagerado.

Señal aún más importante: La IA en China ya no es "barata como la col"

Esto es lo más ignorado, pero posiblemente lo más importante de K3.

Precio de la API de K3: $3 por millón de tokens de entrada, $15 por millón de tokens de salida, $0.30 para entrada en caché.

¿Cuánto era la generación anterior de Kimi K2.6? $0.95 / $4.00.

Aumentó aproximadamente tres veces.

¿Qué significa este precio? Está básicamente alineado con el nivel de Claude Sonnet. Es decir, Moonshot ha renunciado activamente a la carta más distintiva de los grandes modelos chinos de los últimos años: el precio extremadamente bajo.

Why?

Debido a los 2.8 billones de parámetros, el modo de pensamiento profundo siempre activo y el contexto de 1M, los costos no se pueden reducir. Además, la posición de K3 ya no es "un asistente económico para ti", sino "una base de nivel agente que compite directamente con Claude Opus y GPT-5.6".

Es interesante que, incluso con un aumento de tres veces el precio, el costo por tarea de K3 según Artificial Analysis sigue siendo de aproximadamente $0.94, alrededor de la mitad de Claude Opus 4.8 ($1.80) y casi igual al $1.04 de GPT-5.6 Sol.

Mitad de precio, misma categoría.

Esta fue la razón por la que el mercado accionario de EE.UU. se agitó el 17 de julio.

Ese día, Nasdaq cayó más del 1.4%. NVIDIA también fue vendida. El lanzamiento de una empresa emergente china afectó realmente el ánimo del mercado accionario estadounidense.

Esto era inimaginable hace dos años. Hace dos años, el canal de transmisión de los modelos chinos hacia el mercado de valores estadounidense casi no existía.

Ahora existe. Porque la narrativa cambió.

La narrativa ha pasado de "Estados Unidos crea lo前沿, China sigue" a "China también crea lo前沿, además tiene más peso y es la mitad de barata". Esta narrativa ejerce una presión directa, a largo plazo y estructural sobre la capacidad de fijación de precios de laboratorios前沿 cerrados como Anthropic y OpenAI.

Detrás de una valoración de 20 mil millones de dólares: una apuesta que se cuadruplicó en tres meses

El ritmo de financiación también cuenta la misma historia.

A finales de 2024, la valoración de Moonshot era de aproximadamente 3.3 mil millones de dólares. Para mayo de 2026, se cerró una nueva ronda de financiación de aproximadamente 2.0 mil millones de dólares, con una valoración superior a 20.0 mil millones de dólares.

Cuadruplicar en tres meses.

Yang Zhilin dijo en el Foro Zhongguancun en marzo de 2026: "En los próximos años, un número creciente de trabajos de investigación serán dirigidos por IA". En la GTC de 2026, también reveló tres rutas tecnológicas: eficiencia de tokens, contexto largo y escalado de clústeres de agentes.

Solo puedes entender la apuesta de Moonshot si comprendes estas tres cosas.

Eficiencia del token, que se refiere a los dos nuevos mecanismos de K3: Kimi Delta Attention y Attention Residuals, que supuestamente aceleran la velocidad de decodificación hasta 6.3 veces.

Contexto largo, que abarca un recorrido desde 200.000 caracteres hasta 1 millón de tokens.

Agent cluster, correspondiente a K3, definido explícitamente como "modelo de razonamiento agente": diseñado para tareas de larga cadena, navegación en repositorios de código y llamadas a herramientas, no para chatear.

Estas tres rutas son la apuesta de Yang Zhilin sobre la "próxima forma de IA".

Él apuesta que: un solo modelo grande no es el fin, sino un clúster de agentes con generación dinámica y programación colaborativa.

Whether this judgment is correct will be answered within two years.

La ciencia abierta es el verdadero foso de protección de la IA en China

Aquí se debe mencionar un contexto más amplio.

Durante este período, se ha difundido ampliamente en la comunidad una observación de un investigador de IA en el extranjero, que dice esencialmente: los laboratorios chinos pueden producir continuamente modelos como GLM-5.2 y Kimi K3 no porque tengan más capacidad de cómputo, sino por su apertura — no solo la apertura de los pesos, sino también de todo el ecosistema.

Hay una observación muy dolorosa: gran parte del trabajo de entrenamiento de modelos en los laboratorios más destacados de China lo realizan pasantes. Además, estos estudiantes de licenciatura y posgrado comprenden profundamente los detalles del entrenamiento y están cien veces más dispuestos a compartir su conocimiento que sus homólogos estadounidenses.

Por el contrario, los laboratorios de vanguardia en Estados Unidos casi no contratan pasantes. Los estudiantes de doctorado de Stanford y Berkeley deben esforzarse al máximo para obtener una oportunidad de calcular modelos de "tamaño adecuado". La mayoría de los secretos están bloqueados por un pequeño grupo de investigadores privilegiados.

No es una competencia entre Estados Unidos y China. Es una lucha entre la ciencia abierta y la ciencia cerrada.

La existencia de Kimi K3 es, por sí misma, el mejor comentario de este argumento.

Un empresario baterista de 34 años, que usó su propio artículo como base, lideró a un grupo de jóvenes aún estudiando o recién graduados para crear el cuarto modelo más grande del mundo.

Esto probablemente no ocurra dentro de OpenAI. No es que las personas no puedan, es que el mecanismo no lo permite.

Por supuesto, que K3 posponga la apertura de los pesos hasta el 27 de julio es también una señal: los partidarios de la apertura también dudan, también calculan, y también son empujados hacia atrás por la comercialización. Este movimiento merece atención, pero no invalida la dirección general.

DeepSeek V4 sigue abierto bajo la licencia MIT. GLM-5.2 también lo está. El bloque chino de pesos abiertos no se ha disuelto.

How far can a drummer go?

Volvamos a la persona de Yang Zhilin.

Un emprendedor tecnológico con origen como baterista de rock, casi un extranjero en el círculo de IA de China. No encaja en el estereotipo típico del "genio científico de Tsinghua" ni en el perfil clásico del "elite regresado de Silicon Valley".

No hace muchos comentarios públicos, pero son de alta densidad. En su discurso en GTC 2026, presentó con gran claridad la hoja de ruta tecnológica: reestructurar el optimizador, reestructurar el mecanismo de atención, reestructurar las conexiones residuales. Esto no es lenguaje de relaciones públicas, es un juicio técnico.

También reconoció las debilidades de Moonshot. En su propio blog de lanzamiento, K3 fue muy sincero: aún hay una brecha en la UX en comparación con Claude Fable 5 y GPT-5.6 Sol; es sensible al historial de pensamiento conservado; y es "demasiado proactivo" con tareas ambiguas.

Un CEO sincero, un investigador que incorpora su tesis en el producto, un equipo joven unido por la red de Tsinghua, y una ruta técnica clara. Este es el fundamento de Moonshot hoy.

No es perfecto. Cometerá errores. Su camino de comercialización aún no se ha consolidado completamente: ¿puede mantener el crecimiento con un aumento del 300% en precios? ¿Puede reducirse el costo de cómputo con hasta 1M de contexto? ¿Cuándo se implementará realmente el formato de Agent? Todas estas son incógnitas.

Pero es real. No es una empresa de PowerPoint, no es una burbuja de valoración, no se basa en una炒作 temporal.

Conclusión: El temblor de Nasdaq es solo el comienzo

El 17 de julio de 2026, Nasdaq cayó un 1.4%.

Algunos dirán que una caída del 1.4% no es nada, ya que el mercado siempre está fluctuando.

Pero lo que debes observar es la cadena de causalidad: una startup china lanza un modelo que el mismo día es evaluado seriamente por Reuters, CNBC y evaluadores independientes como Simon Willison, que provoca una venta simultánea de NVIDIA y hace que Artificial Analysis lo clasifique directamente entre los 4 mejores del mundo.

Esto nunca ha sucedido antes.

Significa una cosa: el poder de fijación de precios y la voz de la IA están comenzando a desplazarse silenciosamente desde la Bahía de San Francisco. No se desplazan por completo, sino que están empezando a hacerlo.

Yang Zhilin no es el único impulsor. El equipo de DeepSeek lo es, Zhipu lo es, Alibaba Tongyi lo es. Pero él es sin duda el símbolo más afilado y típico de esta ronda: un joven de 34 años que entiende teoría, producto, apertura y comercialización, y que además ha tocado la batería.

Habrá una próxima generación del modelo. K4, K5 siempre llegarán. La puntuación siempre será igualada y luego superada.

Lo que realmente permanece es si esta ruta abierta puede mantenerse.

Si se mantiene, AI no será la IA de tres empresas.

Si no podemos mantenerlo, solo estaremos pasando de un antiguo cierre a uno nuevo.

En cuanto a Yang Zhilin en persona: probablemente no le importen demasiado estas grandes narrativas. A los 34 años, con una valoración de la empresa de 20 mil millones de dólares y un modelo entre los cuatro mejores del mundo, rodeado de jóvenes con quienes puede dialogar, ya tiene suficiente posición para seguir tocando la batería, siguiendo escribiendo artículos y continuando siendo uno de los pocos que convierten sus papers en productos.

¿Cuándo fue la segunda vez que el Nasdaq tembló?

Probablemente no tendrás que esperar mucho.

Referencias

  1. Reuters, "China's Moonshot presenta el modelo de IA abierto más grande del mundo, acercándose a sus rivales estadounidenses", 2026-07-17
  2. CNBC, "China's Moonshot AI lanza Kimi K3 que compite con OpenAI y Anthropic", 2026-07-17
  3. Los Rankings de IA, "Kimi K3: Benchmark, precios y reseña — el modelo frontera de 2,8T de Moonshot", 2026-07
  4. El Decoder, "El modelo abierto de Kimi, K3, se acerca a GPT-5.6 Sol y Fable 5, mientras señala el fin de la IA china superbarata", 2026-07
  5. Análisis artificial, "Ficha del modelo Kimi K3 e Índice de Inteligencia v4.1", 2026-07
  6. Wall Street View, "Yang Zhilin, fundador de Kimi: El desarrollo futuro de la IA entrará en la era liderada por la IA, con una valoración de la empresa de 18.000 millones de dólares", 2026-03-25
  7. Era de la inteligencia cognitiva, "Discurso de Yang Zhilin en GTC 2026: Primera divulgación completa de la hoja de ruta tecnológica del modelo Kimi", 2026-03-18
  8. Atlas de IA de China, "Perfil de YANG Zhilin (杨植麟)"
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.