Organizado y compilado por Deep潮 TechFlow

Invitados: Jordan y Max, analistas de SemiAnalysis
Presentador: Jordan (Diálogo interno de SemiAnalysis)
Fuente del podcast: SemiAnalysis
Título original: [Episodio de emergencia] ¡Ha llegado el Kimi K3 de Moonshot! China tiene un modelo frontera
Fecha de transmisión: 2026-07-18
Resumen de puntos clave
Moonshot (La cara oculta de la luna) lanza Kimi K3, superando a Google y Meta en múltiples benchmarks integrados, convirtiéndose en el tercer mejor modelo del mundo, detrás de Fable de Anthropic y Soul 5.6 de OpenAI. Los analistas de SemiAnalysis, Jordan y Max, desglosaron en un programa de emergencia el significado de este lanzamiento: un modelo de 2.8T parámetros ofrece servicios al mismo precio que Sonnet (3/15 por millón de tokens); si su escala es comparable a la de los modelos cerrados más avanzados, entonces los márgenes de beneficio del 10/50 de Anthropic podrían ser de nivel mindboggling.
Un juicio más agudo proviene de Jordan: la brecha frontal se está reduciendo, y él atribuye esto a las restricciones del gobierno estadounidense sobre Anthropic/OpenAI para lanzar sus modelos más potentes, lo que ha creado artificialmente una ventana de oportunidad para los que siguen. El código abierto realmente no ha logrado alcanzarlos. Mientras tanto, el código abierto occidental está completamente en blanco: ningún modelo de código abierto de una empresa estadounidense puede igualar al quinto mejor de China. La competencia de modelos está convirtiéndose en una competencia de harness (uso de herramientas) y geopolítica.
Resumen de opiniones destacadas
Sobre la posición de Kimi K3
- If you look at the overall ranking of all major benchmarks, today there is a very clear top three: Fable, Soul 5.6, and Kimi K3. They consistently rank above everyone else, including DeepSeek, as well as Google, Meta, and xAI.
- Google debería sentirse particularmente avergonzada. En noviembre y diciembre de 2025, todos todavía creían que los tres gigantes de la IA eran Google, Anthropic y OpenAI. Hoy, al hablar con algunos "anticuados", todavía piensan así, pero claramente ya no es así.
- Podría ser el segundo mejor modelo del mundo, porque cada vez que intento hacer algo serio con Fable, me lo rechazan y me devuelven a Opus. Aunque no estoy seguro de si es mejor que Opus, al menos no me lo rechazan.
Sobre el margen de beneficio de los modelos de vanguardia
- If Kimi is unlikely to be selling K3 at 3/15 at a loss, then Fable, with similar scale, charging 10/50, should completely alleviate concerns that AI labs are unprofitable businesses. Selling tokens at API pricing may even be more profitable than SaaS.
- El precio aumentó más de tres veces de K2.7 a K3, de 0.95/4 a 3/15. Pero no creo que tengan mucho margen para aumentar más los precios, ya que muchas tareas pueden realizarse con GLM o MiniMax M3.
Sobre el gobierno de Estados Unidos y la brecha
- Creo que esta brecha se ha reducido squarely gracias a las restricciones del gobierno estadounidense sobre Anthropic, lo que nos impide acceder a los modelos más potentes de estas empresas. Ellos se están esforzando artificialmente por alcanzarnos.
- Solo podemos acceder a ella si se permite la inteligencia前沿. Esto representa una oportunidad para los jugadores que ocupan los puestos cuarto, quinto, sexto y séptimo.
Sobre el vacío de código abierto occidental
- Me sorprende que, dado lo ineficiente que aún es todo el mercado, no tengamos ni una sola empresa estadounidense que al menos pueda igualar a la quinta mejor de China.
- Incluso si el gobierno no prohíbe los modelos de código abierto chinos, las grandes empresas estadounidenses comunes no están dispuestas a alimentar sus datos propietarios a modelos de código abierto chinos. Incluso si cargas los pesos en un centro de datos aislado, aunque el PCC no vea tus datos, los ejecutivos no lo aceptarán.
Sobre Harness
- Pruebo Kimi K3 y por primera vez examino seriamente Open Code, Hermes y Pi. Harness sigue siendo completamente parte del producto.
- Algo tan simple como si se puede instalar en un servidor SSH remoto o si los atajos de teclado son fáciles de usar me hace elegir este modelo en lugar de otro: los detalles de estos harness realmente influyen en dónde envío mis tokens, es decir, dónde asigno mi presupuesto.
Sobre "aún es demasiado pronto"
- La semana pasada fui a ICML, y la semana anterior a AI Engineer. Es una conferencia de IA en nombre, y más del 80% de la gente nunca ha oído hablar de SemiAnalysis. Dices que trabajas en la industria de la IA, pero ni siquiera has leído SemiAnalysis? Todavía somos demasiado tempranos.
¿Es Kimi K3 el tercer mejor modelo del mundo?
Jordan: Comentario rápido, ¿es Kimi K3 ahora el tercer mejor modelo del mundo?
Max: La respuesta es claramente "sí". A todos les gusta criticar los benchmark, y efectivamente tienen problemas, pero si miras el ranking combinado de todos los principales benchmark, siempre apuntan en la dirección correcta. Hoy hay un top tres muy claro: Fable, Soul 5.6 y Kimi K3, que constantemente superan a todos los demás, incluidos jugadores open source como DeepSeek, y también están claramente por encima de Google, Meta y xAI. Este es un logro extraordinario para el equipo de Moonshot.
Google debería sentirse particularmente avergonzado. En noviembre y diciembre de 2025, todos todavía creían que los tres gigantes de la IA eran Google, Anthropic y OpenAI. Hoy, al hablar con algunos "anticuados", todavía piensan así, pero claramente ya no es así.
En general, aún siento que es inferior a Fable y Soul 5.6. Es un poco gracioso que también lo mencionen explícitamente en su blog de lanzamiento del modelo. Tal vez sea la humildad tradicional china, o quizás no quieren atraer la atención de las autoridades estadounidenses, dado que el lanzamiento de Fable 5.6 también tuvo ciertos retrasos. Pero de cualquier manera, es muy impresionante.
Jordan: En la sección de limitaciones del blog escribieron: "Aunque K3 en general es un modelo altamente competitivo, aún existe una brecha notable en la experiencia de usuario en comparación con Fable 5 y GPT 5.6". Mi experiencia personal de uso es que realmente es bueno, pero es muy lento, y eso es molesto. Me hizo sentir por primera vez la motivación para probar harness de código abierto. Francamente, siento que he aprendido más sobre harness que sobre el modelo, porque todos estos modelos son lo suficientemente buenos como para completar el trabajo básico que estoy haciendo actualmente, y me resulta difícil encontrar tareas complejas que no pueda realizar.
Este podría ser para mí el segundo mejor modelo del mundo, ya que cada vez que uso Fable para algo serio, me rechazan y me devuelven a Opus. Aunque no estoy seguro de si es mejor que Opus, al menos no ser rechazado hace que sea menos molesto. Sin embargo, al usar una clave de API con pago por uso, nunca me rechazan; solo encuentro límites cuando uso la consola web o la investigación profunda. Claramente no tienen suficientes GPU para satisfacer la demanda generada por este modelo. Anteriormente, este problema se resolvía con una estrategia de código abierto, liberando los pesos para que otros los sirvieran. Pero esta vez aún no han liberado los pesos; dicen que lo harán en 10 días.
¿Por qué se retrasó 10 días la apertura del peso?
Jordan: ¿Cuál crees que es la estrategia de este retraso?
Max: Aclaro que todo esto es pura especulación mía. Una razón importante podría ser que necesitan dar suficiente tiempo a los equipos de motores de inferencia como vLLM y SGLang para asegurar que puedan servir este modelo con alto rendimiento. Si lanzaran los pesos hoy, todos estarían sirviéndolo pero solo lograrían 20 tokens/segundo, lo cual sería muy malo para su captura de marca. Ahora tienen una excelente oportunidad de obtener una gran cantidad de PR y adopción; si se lanzara y fuera inmediatamente limitado por el rendimiento, esto debilitaría el impulso.
Otra posibilidad es que estén negociando acuerdos de licencia con proveedores de servicios de inferencia como Together AI, Fireworks, Nebius y Groq para que utilicen chips más recientes como el GB300 para atender la capacidad incremental. Estas dos vías son probablemente las principales razones del retraso de 10 días.
Beneficios exorbitantes de los modelos de vanguardia
Jordan: Hagamos un análisis de la arquitectura del modelo. Tiene 2.8T parámetros, lo que no cabe en el B200; necesitas un B300, GB300 o AMD MI355X para poder servirlo en un solo servidor HGX de 8 tarjetas. Por supuesto, puedes implementar pipeline parallelism entre nodos, pero eso afectará significativamente el rendimiento. Por lo tanto, solo quienes posean los chips más recientes podrán servir este modelo.
Volviendo al tema de Google que mencionaste antes, este modelo ya alcanza competitividad de vanguardia con 2.8T parámetros, lo que nos da alguna pista sobre el tamaño de los modelos de vanguardia cerrados. Si ellos están comparando esto con modelos de 10T parámetros, sería aún más vergonzoso. Debemos asumir que está en la misma escala que Soul y Fable.
Max: Sí, tienes razón. Sigo creyendo en la capacidad y agudeza del equipo de investigación de Anthropic. Si alguien en Twitter dice que los modelos cerrados actuales tienen 10T parámetros o algo así, y eso fuera cierto, amigo, ya deberías hacer las maletas, la acción de NVIDIA caería un 50% mañana y todo habría terminado.
Estoy bastante seguro de que Kimi K3 no es mucho más pequeño que los modelos propietarios líderes actuales, e incluso podría ser ligeramente más grande. Si esto es cierto, refuerza aún más un punto que hemos destacado constantemente en SemiAnalysis: los márgenes de beneficio de estos laboratorios propietarios son absolutamente increíbles. Si Kimi probablemente no está vendiendo K3 a precios de 3/15 con pérdidas, igual que Sonnet; y Fable tiene un tamaño similar pero cobra 10/50, entonces debería disiparse por completo la preocupación de que los laboratorios de IA no generan ganancias. Vender tokens según los precios de la API podría ser incluso más rentable que el SaaS, hoy en día.
Jordan: Sin costos de empleados, solo GPU. ¿Cómo se compara con los precios anteriores? Dijiste 3/15, pero la versión anterior de Moonshot tenía un precio directo de 0.95/4, por lo que el precio aumentó más de tres veces de K2.7 a K3. ¿Cuánto margen de aumento tienen aún?
Max: No creo que les quede mucho espacio para subir. Incluso en el nivel de 3/15, mucha gente lo considerará demasiado caro. Sus tareas se pueden cubrir con GLM o MiniMax M3. Aquí hay una bifurcación interesante: quienes, como SemiAnalysis, no les importa gastar tokens de Dylan, seguirán usando Fable para casi todo; mientras que los extremadamente sensibles a los costos, como Tesla o Uber, que solo usan $200 en tokens por semana, optarán por la capa de precios de GLM. Entonces, ¿quiénes realmente cambiarán a Kimi K3? Probablemente sea un grupo de personas filosóficamente comprometidas con el código abierto y que quieren apoyar nuevos modelos. ¿Las grandes empresas adoptarán realmente este modelo? No me sorprendería que la respuesta sea no.
Nueva arquitectura y próximos pasos
Jordan: Esta es una arquitectura completamente nueva. 2.8T parámetros, con delta attention de Kimi, residuals potenciales y latent estable; básicamente es una versión ampliada del modelo anterior, aproximadamente el doble de tamaño. Anteriormente, con K2.5, vimos que Cursor lo usaba como composer, basado en continued pre-training y MRL, y luego lanzaron checkpoints como 2.5, 2.6, 2.6.7, etc. Este es un nuevo modelo base, pero ya es bastante completo y no presenta los bordes rugosos comunes en los modelos originales. ¿Qué sigue? ¿Cuándo saldrá el 3.1? ¿Cambiará el precio? ¿Habrá un composer basado en K3?
Max: No debería haber ningún composer basado en K3; el equipo de Cursor ya decidió entrenar su propio modelo desde cero. En cuanto a K3.1, K3.2, etc., es probable que en los próximos uno o dos meses se lancen dos o tres actualizaciones, continuando con el post-training. Supongo que los precios se mantendrán sin cambios, ya que en los próximos dos o tres meses no podrán operar en hardware nuevo y no hay mejora en el throughput que justifique una reducción de precios. Quizás un ingeniero de kernel realmente excelente pueda reducir los costos al nivel de DeepSeek V4, pero dudo que un modelo de 3T parámetros pueda lograrlo. Los precios actuales de GLM y MiniMax probablemente ya sean el límite para modelos de 1T a 1.5T parámetros.
¿Puede el código abierto alcanzar al código cerrado?
Max: La pregunta más interesante es si la brecha entre open source y closed source seguirá reduciéndose y si el código abierto puede alcanzar realmente la paridad con los niveles más avanzados. Si esto ocurre, tendrá un impacto enorme en toda nuestra industria. ¿Qué piensas?
Jordan: Mi opinión es que la brecha ahora se ha reducido, y la razón se debe directamente a las restricciones del gobierno estadounidense sobre Anthropic, lo que nos impide acceder a los modelos más potentes de estas empresas. Han sido alcanzados artificialmente.
Podemos ver la comparación entre Mythos y Fable. No puedo usar Mythos, y para Fable tengo que pedir con mucho esfuerzo para usarlo ocasionalmente. 5.6 Soul, según nuestro juicio interno, no es el modelo más grande entrenado por OpenAI, y no es tan grande como 4.5. Ellos tienen uno más grande. Como resultado, solo podemos acceder a él cuando la inteligencia de vanguardia esté permitida por el gobierno.
Para los jugadores en las posiciones cuatro, cinco, seis y siete, esto en realidad representa una oportunidad para liberarse completamente dentro de ciertos límites y comenzar a captar cuota de usuarios, pero nunca alcanzar la verdadera frontera. Creo que la frontera podría dar un gran paso adelante a finales de este verano, o podría haber un ligero cambio en la dirección política. También es posible que comencemos a encontrar modalidades más allá del código, permitiéndoles explorar realmente esos ámbitos.
Por cierto, la publicación de Inkling de Thinking Machines me parece muy interesante, la entrada de audio nativa es una señal del futuro.
Max: En Occidente, realmente, realmente, realmente falta un modelo de código abierto que no sea malo. El mercado aún es tan ineficiente que nos sorprende que ninguna empresa estadounidense haya logrado siquiera igualar al quinto mejor modelo chino. Por un lado, la prohibición total por parte del gobierno estadounidense de los modelos de código abierto chinos podría ser solo cuestión de tiempo. Por otro lado, incluso si no se prohíben, las grandes empresas estadounidenses comunes no quieren alimentar sus datos propietarios a modelos de código abierto chinos. Incluso si cargas los pesos en un centro de datos con aislamiento físico, donde el CCP no puede ver tus datos, los ejecutivos no lo aceptarán. Muchas empresas se preocupan por el presupuesto de tokens y solo están dispuestas a ejecutar modelos occidentales o no chinos. Inkling es el mejor OSS occidental que podemos obtener en este momento, pero aún está muy lejos de la vanguardia del código abierto, lo cual me sorprende.
Jordan: Antes era Neotron, ahora es Inkling. Creo que la estrategia de Inkling tiene dos oportunidades: primero, deben ser mejores que la mayoría de los proyectos de código abierto chinos para poder participar. Segundo, también deben superar a los modelos secundarios y terciarios de los laboratorios de vanguardia, y ser mejores que Sonnet, porque puedes obtener inteligencia cercana a la vanguardia usando Bedrock o Foundry, y ahorrar dinero con modelos secundarios cerrados. Nunca he entendido bien el enfoque occidental de "ayudar a las personas a ahorrar dinero". Impulsar los modelos hacia ecosistemas como Fireworks, Together o Base10 es ciertamente algo positivo, pero la mayor parte del mercado está en el nivel gubernamental.
Creado para los aceleradores nacionales chinos
Jordan: Otra cosa digna de mención es que en el blog de K3 se menciona que en la fase SFT se realizó cuantificación, utilizando originalmente MXFP4 y MXFP8 para pesos y activaciones; la afirmación oficial es "compatibilidad amplia con hardware". ¿Crees que Moonshot se preocupa por algún otro hardware?
Max: Tengo una lista de 11 aceleradores chinos; deberías suscribirte al modelo de aceleradores de SemiAnalysis para saber más. Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads, todos estos chips aparecen en los artículos y también en el código. Ejecutar modelos de vanguardia en aceleradores nacionales ya es una prioridad nacional en China. Si en finales de 2025 todavía decimos que Google es un laboratorio de vanguardia, entonces ahora también debemos llamar a Moonshot laboratorio de vanguardia.
Jordan: Por cierto, mi padre está de viaje de negocios en China y dice que todos los hoteles están llenos porque Xi Jinping va a pronunciar un discurso en esa región sobre cómo la IA es la prioridad número uno de China. Muchas de las cosas que dijiste son correctas.
Harness es el producto en sí
Jordan: La mayor lección que he aprendido al usar estos modelos es que, en primer lugar, cada vez es más difícil distinguir entre usar un modelo de vanguardia absoluta con el modo max thinking y usar un esfuerzo medio. En tareas cotidianas, realmente no encuentro ninguna tarea que estos modelos no puedan manejar. Mi comportamiento por defecto es activar siempre el modo más potente y difícil, porque no me importa el presupuesto de Dylan.
Pero hay un nivel en el que Harness es parte integral del producto. Evaluar a Kimi K3 me hizo examinar por primera vez seriamente Open Code, Hermes y Pi. Harness sigue siendo completamente parte del producto. Algunos detalles simples me hacen elegir este modelo sobre otro: ¿puede instalarse en un servidor SSH remoto? ¿Son intuitivas las teclas de acceso rápido? ¿Puedo editar comandos anteriores? Estos pequeños detalles dentro de Harness realmente influyen en dónde envío mis tokens, es decir, en dónde asigno mi presupuesto.
Max: Mucha gente habla de presupuestos de tokens, pero según tu descripción del flujo de trabajo, incluso para tareas que GLM podría manejar, prefiero redirigirlas a Fable usando max intelligence, porque el ROI aún vale la pena. Los benchmarks indican que muchas tareas pueden migrarse a GLM, pero aún así prefieres quedarte con los modelos de Anthropic o OpenAI.
Jordan: Básicamente, sí. Pero uso muchos bots de Slack y no sé qué modelos se ejecutan detrás. Por ejemplo, la integración de Slack de Perplexity: si comienza a redirigir a K3, a GLM o a Sonnet, en realidad no me importa. Hasta que no revisé el uso, no supe qué porcentaje correspondía a los modelos de OpenAI, porque fue una decisión tomada por ellos mismos. Esa parte de justificación la decide Harness.
Max: Esto es precisamente una oportunidad para el pricing basado en resultados. Si un laboratorio implementa pricing basado en resultados, podría obtener un margen bruto superior al 95%, porque las tareas por las que estás dispuesto a pagar un precio fijo hoy en realidad se pueden resolver con una mínima cantidad.
Jordan: En segundo lugar, no creo que estos laboratorios ya se hayan quedado sin ideas. Pueden seguir entrenando modelos asombrosos para competir en el lado de la codificación del RSI, pero no liberarlos para nosotros, manteniendo su "clase inferior permanente". Pueden seguir con la destilación, dándonos un poco de muestra, mientras continúan explorando otros usos, como generación de video, audio a audio, investigación profunda, que son bastante distintos de la codificación. La robótica y los modelos del mundo son un camino sencillo; ¿y si Anthropic cambia su objetivo del trabajo intelectual al trabajo físico? No creo que sea cierto que no puedan construir un negocio sostenible con un buen ROI utilizando la tecnología más avanzada del mundo.
Aún estamos demasiado temprano
Max: Incluso sin hablar de esto, uso estos modelos diariamente en una cantidad enorme; mis amigos que son ingenieros de software los usan diez veces menos y gastan diez veces menos. Una persona que usa Fable utiliza tantos modelos como alguien que usa Sonnet, pero la persona que usa Fable gasta diez veces más dinero, con un margen bruto del 90%, sosteniendo la mayor parte del negocio. Una vez que esas personas comiencen a usar modelos más grandes y con mayor frecuencia, la demanda solo aumentará, y los modelos ni siquiera necesitan volverse mejores. Luego, aún tengo que hablar con mis vecinos que no se dedican a la tecnología; entre ellos, ciertamente soy del 0,1% o incluso del 0,01%, y podría haber un espacio de crecimiento de hasta 1000 veces. Volviendo a la "curva del índice de la oca de oro" de Masa-san (Masayoshi Son).
Jordan: Lo que ella dice de que "aún es demasiado pronto" es completamente correcto, y por eso creo que Kimi K3 no ralentizará el crecimiento neto de ARR de Anthropic y OpenAI. Incluso si una parte de las personas que hoy usan Fable y 5.6 cambian inamoviblemente a Kimi K3, esos usuarios serán completamente superados por aquellos que aún no han probado seriamente esta tecnología. Esas personas descubren diariamente nuevos casos de uso con alto ROI y seguirán usando por defecto 5.6 Soul o Fable 5 para desbloquear estos nuevos escenarios. No verás una desaceleración en la tasa de crecimiento del ARR.
Max: Piensa en cuántas personas aún no se han suscrito a este podcast ni siguen a SemiAnalysis. La semana pasada estuve en ICML, y la semana anterior en la conferencia AI Engineer, que es una conferencia de IA en toda regla, y más del 80% de la gente nunca ha oído hablar de SemiAnalysis. Dices que trabajas en la industria de la IA, pero ni siquiera has leído SemiAnalysis? Todavía somos demasiado tempranos.
Jordan: Esto es como un chequeo de tu ego, Max, relájate.
