El lanzamiento de Kimi K3 desencadena un 'freno de emergencia' mientras la demanda supera las expectativas

iconMetaEra
Compartir
AI summary iconResumen
Un aumento en la demanda del Kimi K3 de Moonshot AI provocó un "disyuntor" en menos de 48 horas, obligando al equipo a suspender los registros de nuevos usuarios. El modelo de 2,8 billones de parámetros utiliza un mecanismo de atención lineal híbrida KDA, reduciendo la caché KV en un 75% y mejorando el rendimiento seis veces en una longitud de contexto de 1 millón. Kimi K3 obtuvo 57 de 60 en evaluaciones globales de IA, ubicándose en tercer lugar detrás de Claude Fable 5 y GPT-5.6. El lanzamiento desencadenó una caída de $111 mil millones en la capitalización de mercado de NVIDIA y elevó la valoración de Moonshot a $31,5 mil millones en seis meses. Las altcoins a vigilar podrían beneficiarse a medida que el índice de miedo y codicia reacciona a los cambios del mercado impulsados por la IA.
La versión K3 de Moonshot, conocida como Kimi K3, suspendió la suscripción de nuevos usuarios dentro de las 48 horas posteriores a su lanzamiento debido a una demanda de usuarios que superó con creces las estimaciones, lo que obligó a implementar un "corte de capacidad". El modelo K3 cuenta con un tamaño total de 2.8 billones de parámetros y utiliza el mecanismo de atención lineal híbrida KDA, reduciendo la complejidad computacional de las capas de atención de orden cuadrático a lineal, disminuyendo hasta un 75% el caché KV y aumentando seis veces el rendimiento de decodificación con una longitud de contexto de 1 millón. Esta arquitectura se considera una implementación práctica de la "Ley Tao" en el campo de la IA, logrando un salto de rendimiento mediante innovaciones arquitectónicas a nivel de sistema. En evaluaciones globales de modelos de IA, K3 obtuvo una puntuación general de 57 puntos, ocupando el tercer lugar, detrás de Claude Fable 5 y GPT-5.6. En el mercado financiero, el día del lanzamiento de K3, la capitalización de mercado de NVIDIA se redujo en aproximadamente 111.100 millones de dólares, mientras que la valoración de Moonshot aumentó de 4.300 millones a 31.500 millones de dólares en solo seis meses.

Autor y fuente del artículo: 36氪

Kimi también tiene su propia "Ley Tao".

K3 está en auge, pero Kimi debe detenerse temporalmente.

En la noche del 19 de julio, el equipo de Moonshot Kimi publicó un anuncio indicando que, debido a que la demanda de usuarios superó ampliamente las estimaciones en las primeras 48 horas tras el lanzamiento de Kimi K3, y ante la escasez de recursos de cómputo, se ha suspendido la apertura de nuevas suscripciones a Kimi, priorizando los recursos limitados para garantizar el servicio a los usuarios suscritos actuales.

El sistema de membresía se dividió en derechos principales de Kimi y derechos de Code para asignar recursos con precisión. Según la respuesta oficial posterior, Kimi no ajustó el sistema de membresía, sino que reequilibró la experiencia del usuario bajo capacidad de cómputo limitada.

K3 se activó por el corte de capacidad, por lo que solo podemos rechazar a nuevos clientes y centrarnos en servir a los usuarios existentes.

La "Ley Tao" de Kimi

Actualmente, todos los fabricantes de modelos están esforzándose por aumentar su base de usuarios, atrayendo nuevos clientes mediante estrategias de alta relación calidad-precio como servicios gratuitos y reducciones de precios. En comparación, la estrategia inversa de Kimi parece ligeramente “verdine”.

Pero cuanto más potente sea el modelo, más larga sea la contexto y más frecuente sea la llamada del usuario, mayor será el consumo de capacidad de inferencia. En la situación en que "la cantidad de solicitudes K3 se acerca al límite de capacidad del clúster de cálculo actual", Kimi también enfrenta el mismo problema que "DouBao": cuantos más usuarios finales haya, menos clara es la contribución a los ingresos, pero las GPU ya no aguantan.

Como el primer modelo MoE de la serie Moonshot con 3 billones de parámetros, K3 tiene un tamaño total de 2.8 billones de parámetros. Según la comprensión convencional, un modelo de esta escala consume poder de cómputo de forma exponencial con cada salida. Sin embargo, gracias a su arquitectura central única, logra el efecto de la "Ley Tao" propuesta por Huawei en el ámbito de los chips.

Esta arquitectura también se considera un supermotor que implementa tres tecnologías clave: atención híbrida lineal KDA (Kimi Delta Attention), residuos de atención (Attention Residuals) y MoE de alta esparsidad, llevando al máximo la eficiencia con la que cada unidad de poder de cómputo se convierte en rendimiento del modelo.

Durante mucho tiempo, la industria de los chips ha dependido de la ley de Moore para mejorar el rendimiento reduciendo el tamaño de los transistores. Pero cuando los procesos avanzados se acercan a los límites físicos y los costos aumentan drásticamente, el modelo de crecimiento basado únicamente en la acumulación de hardware también entra en una meseta.

La "Ley Tao" propuesta por Huawei este año rompe con la tradicional idea de "reducción espacial" y se inclina hacia la "reducción temporal": mediante plegado lógico, apilamiento tridimensional y optimización de la arquitectura de extremo a extremo, reduce la latencia de transmisión de señales y minimiza la搬运 redundante de datos, logrando un salto en eficiencia energética en procesos maduros que compite con los procesos avanzados.

Su metodología fundamental es: lograr un salto de rendimiento mediante innovaciones arquitectónicas a nivel de sistema bajo restricciones de hardware o costos.

En mi opinión, el mecanismo de atención lineal mixta KDA adoptado por K3 es una práctica de la "Ley Tao" en el campo de la IA.

Hay que tener en cuenta que la arquitectura Transformer consume la mayor parte de la potencia de cálculo en el mecanismo de atención. La atención estándar crece de forma cuadrática con la longitud de la secuencia; en tareas de contexto de millones de tokens, la mayor parte de la potencia de cálculo se consume en mantener la matriz de atención para secuencias largas. El mecanismo KDA reduce la complejidad computacional de la mayoría de las capas de atención de cuadrática a lineal.

Según el informe técnico publicado previamente por Moonshot, al utilizar una proporción mixta de KDA y MLA en modelos experimentales, el uso máximo de caché KV se redujo hasta en un 75%, y el rendimiento de decodificación con una longitud de contexto de 1 millón aumentó hasta seis veces. Combinado con la técnica de residuos de atención y MoE de alta esparsidad, la eficiencia de entrenamiento aumentó aproximadamente un 25%, con un costo adicional inferior al 2%.

Esto es una reestructuración de la “eficiencia de producción del modelo”. Si la línea principal de Transformer en Silicon Valley es como un automóvil de combustión que confía en la potencia bruta para lograr resultados sorprendentes, KDA se asemeja más a un motor híbrido que persigue una eficiencia térmica extrema.

El informe de SemiAnalysis indica que KDA aumenta la velocidad de inferencia en un 300%, manteniendo al mismo tiempo un rendimiento cercano al de Transformer en el procesamiento de contextos largos. Esto significa que, con la misma inversión en capacidad de cómputo, K3 puede generar más inteligencia efectiva.

Los comentarios de prueba de la comunidad de desarrolladores muestran que K3 destaca en tareas de agentes de larga duración y generación de código, y posee la capacidad de competir con los principales modelos internacionales.

En esencia, K3 sigue la Ley de Escalado, pero dirige el corte hacia el desperdicio algorítmico ineficiente. Mientras las empresas de IA de Silicon Valley siguen acumulando chips y aumentando la potencia de cálculo, Kimi logra un equilibrio entre rendimiento y eficiencia bajo condiciones de potencia de cálculo limitada, reestructurando la cadena algorítmica y eliminando redundancias computacionales, recorriendo así un camino que maximiza la inteligencia producida por vatio.

Esto sorprendió a los observadores e inversores de Wall Street, quienes, al igual que con DeepSeek, vuelven a cuestionar si las miles de millones de dólares invertidas en IA en Silicon Valley generarán retornos equivalentes y si la ventaja líder de Estados Unidos en IA se ha debilitado.

Al mismo tiempo, los usuarios empresariales y los desarrolladores también han comenzado a prestar atención al costo del uso de IA. Algunos desarrolladores ya están utilizando el servicio de "enrutamiento de modelos" (Model Routing), que selecciona automáticamente el modelo de IA más económico y eficiente según la tarea, incluyendo por supuesto modelos chinos como Kimi.

Yang Zhilin salta alto

Mirando hacia atrás, la saturación de la capacidad de cómputo de Kimi fue un efecto secundario del éxito técnico: el aumento de la eficiencia del modelo redujo el costo por uso, pero estimuló un aumento masivo en la demanda total.

Cabe destacar que el 11 de julio, Tang Jie, fundador de Zhipu, anunció el "Plan Touch High", afirmando directamente: "No alcanzar la cima es un fracaso", y señaló claramente que durante los próximos dos años no buscará la monetización a corto plazo de aplicaciones, sino que concentrará recursos en abordar las cuatro direcciones clave de la AGI, con planes de recaudar fondos y destinar recursos de miles de millones para superar la tecnología de interpretabilidad mecánica.

Si se dice que el "salto" de Zhipu es su última batalla tras la cotización, es porque espera reforzar la narrativa de ser "la primera empresa pública de modelos grandes del mundo" y aliviar la ansiedad real mediante el impulso hacia los límites tecnológicos.

También veo el "salto" de Kimi en tres dimensiones en la decisión de Yang Zhilin:

En primer lugar, maximizar la capacidad de cómputo, pasando de una mentalidad basada en tráfico a una centrada en valor. La información pública muestra que el negocio de API de Kimi ya ha superado el 70%, lo cual difiere considerablemente del anterior modelo de suscripción orientado al consumidor final. Mantener a los usuarios existentes y rechazar a los nuevos clientes en realidad desvía la capacidad limitada hacia escenarios de alto valor, evitando que el tráfico genérico del consumidor final compita con las cuotas de negocio B2B, que ya son el pilar de ingresos.

El costo también es evidente. Por ejemplo, la implementación del estándar "priorizar a los usuarios existentes" no es transparente; si no se maneja adecuadamente, qué solicitudes se responden con prioridad y cuáles se degradan puede diluir la confianza de los usuarios.

A largo plazo, para lograr la transición de una estrella tecnológica a una empresa de IA líder y madura, Kimi debe fortalecer infraestructuras como piscinas de capacidad de cómputo elástica, mecanismos de respuesta por niveles y capacidades de programación dinámica.

En segundo lugar, se trata de una prueba de presión en la fijación de precios: Kimi está sometiendo a prueba la transición de un modelo de buffet económico a una estructura de valor diferenciado. La mención en el anuncio sobre "separar los derechos principales de Kimi de los derechos de Code" es tanto un ajuste temporal ante la escasez de capacidad de cómputo como posiblemente el inicio de una reestructuración de su sistema de precios.

Anteriormente, independientemente de si los usuarios escribían código, buscaban información o charlaban, pagaban la misma tarifa y consumían la misma capacidad de cómputo. Cuando aumentó la proporción de usuarios de código que consumen alta capacidad de cómputo, este modelo inevitablemente provocó un desajuste estructural.

Kimi aprovecha esta oportunidad para desglosar los beneficios de membresía y reajustar los precios según el escenario de uso: los usuarios ligeros disfrutan de servicios básicos, mientras que los usuarios intensivos pagan una prima por capacidades de alto valor.

Esto es un intento de competir por el poder de fijación de precios de los productos del modelo mediante la segmentación de usuarios por valor. Actualmente, la tarifa de K3 alcanza los 2.3 dólares por millón de tokens, lo cual, aunque inferior al de los modelos líderes en el extranjero, ha establecido un nuevo récord para los modelos nacionales.

Quizás Kimi también desea dejar atrás el modelo económico barato y transmitir una percepción: los modelos de alto rendimiento tienen capacidad de fijación de precios. A continuación, la competencia entre modelos grandes también pasará de "competir por parámetros" a "competir por infraestructura" y "competir por costos y precios".

Este paso es más difícil que alcanzar la cima de la lista, y más cercano a la esencia del negocio.

Tercero, elevación del estatus: Kimi pasa de ser una variable geopolítica a convertirse en un punto de referencia de precios.

Tras el lanzamiento de K3, generó rápidamente atención global. En el último Índice de Inteligencia publicado por la institución independiente de evaluación de modelos de IA, Artificial Analysis, obtuvo una puntuación general de 57 puntos, ocupando el tercer lugar a nivel mundial, detrás de Claude Fable 5 (60 puntos) y GPT-5.6 Sol (59 puntos), y por encima de Claude Opus 4.8 (56 puntos).

Este logro también rompió de paso el consenso de la industria de que el código abierto lleva media generación de retraso respecto al código cerrado.

Al mismo tiempo, la influencia de K3 ha trascendido el ámbito técnico. Las instituciones estadounidenses de inversión tecnológica lo consideran un "punto de inflexión" en el desarrollo de la IA, creyendo que los modelos de código abierto de alta calidad están acelerando la difusión de capacidades; el profesor de ciencias de la computación de la Universidad de California, Berkeley, afirma que K3 ha reducido la brecha entre los modelos de código abierto chinos y los modelos avanzados estadounidenses a solo 2 o 3 meses.

La reacción del mercado de capitales fue igualmente fuerte: el primer día de negociación de K3, NVIDIA perdió aproximadamente 111.100 millones de dólares en capitalización de mercado en un solo día; los estrategas de JPMorgan llamaron directamente a esto "DeepSeek 2.0" en su informe.

This acceleration is what changes the pricing logic.

Además, el ARR (ingreso anualizado) de Moonshot ha alcanzado casi 300 millones de dólares hasta junio, con un crecimiento externo del 400% y un aumento de ingresos tras un alza del 60% en los precios; la combinación de estos tres datos indica que el modelo de "código abierto + eficiencia" de Kimi puede escalarse para generar ingresos.

Además, se ha revelado que Moon Shadow está buscando cotizarse en Hong Kong en tan solo seis meses, con una valoración que ha aumentado de 4.300 millones de dólares a 31.500 millones de dólares en seis meses, más de siete veces.

Esto es una validación del mercado de capitales hacia una ruta no convencional fuera de Silicon Valley. Al apostar por el SOTA con un modelo económico viable, también demuestran que Kimi posee una lógica de valoración independiente, ya no necesitando compararse con OpenAI o Anthropic para demostrar su valor.

Lado oscuro de la luna Fuente de la imagen: recursos en línea

Pero K3 aún tiene un largo camino por recorrer antes de alcanzar a AGI. Por ejemplo, en las pruebas de rendimiento, aunque K3 solo está 3 puntos por debajo de Fable 5, la diferencia real sigue siendo significativa.

Además, Kimi reconoció en el informe técnico dos defectos en la implementación: primero, K3 conservó el historial completo de pensamiento durante el entrenamiento; si el llamador no transmite correctamente el proceso de razonamiento anterior o cambia de otro modelo a K3 durante la sesión, la calidad de la salida disminuirá notablemente;

En segundo lugar, K3 tiende a ser "demasiado proactivo" cuando las tareas son ambiguas, prefiriendo tomar decisiones por el usuario. Este comportamiento "autónomo" puede desencadenar errores en cadena en procesos de ingeniería que requieren ejecución precisa.

También hay un problema fácil de pasar por alto pero extremadamente importante: las alucinaciones. Artificial Analysis destacó específicamente en la evaluación que la tasa de alucinaciones de K3 aumentó en comparación con la generación anterior K2.6.

En cierto sentido, el brillo y las preocupaciones ocultas de K3 son un reflejo del desequilibrio general en la oferta y la demanda de capacidad de cómputo, así como un dolor colectivo de la industria china de IA bajo la presión de cuellos de botella en capacidad de cómputo, comercialización no cerrada y expectativas excesivas de los usuarios.

Cada sobrecarga y cada “corte automático” de estos proveedores de IA son obstáculos que China debe superar en su búsqueda de alcanzar nuevos niveles en IA. Es seguro que ha comenzado un nuevo ciclo de competencia, en el que los modelos grandes pasarán de competir por capacidad a competir por poder de cómputo.

Quien pueda establecer una ventaja en infraestructura como algoritmos y capacidad de cómputo será quien finalmente triunfe y defina los estándares de supervivencia para las próximas generaciones de empresas de IA.

Referencias:

Ranking de letras, "K3 lanzado durante 48 horas"

Seda, "Todo por culpa de Kimi"

Este artículo proviene del canal de WeChat "Tang Chen Tong Xue", autor: Tang Chen, publicado con permiso de 36氪.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.