В течение 48 часов после запуска K3 от Moonshot AI новая регистрация пользователей была приостановлена из-за того, что запросы пользователей значительно превысили ожидаемые показатели, что вынудило провести «аварийное отключение» вычислительных ресурсов. Общий объем параметров K3 достиг 2,8 триллиона, он использует гибридный линейный механизм внимания KDA, снижающий вычислительную сложность слоев внимания с квадратичной до линейной, что позволяет сократить KV-кэш до 75% и увеличить пропускную способность декодирования в 6 раз при длине контекста в 1 миллион. Эта архитектура рассматривается как реализация «закона Тао» в области ИИ, обеспечивающая скачок производительности за счет системных архитектурных инноваций. K3 набрал 57 баллов по общей оценке в глобальных тестах моделей ИИ и занял третье место, уступив только Claude Fable 5 и GPT-5.6. На финансовых рынках в день запуска K3 капитализация NVIDIA сократилась примерно на 111,1 млрд долларов США, а оценка Moonshot AI за полгода выросла с 4,3 млрд до 31,5 млрд долларов США.Автор статьи, источник: 36氪
У Кими тоже есть свой «закон Тао».
K3 набирает популярность, но Kimi вынужден приостановить работу.
В полночь 19 июля команда Kimi от компании Moon Shadow опубликовала объявление: из-за того, что запросы пользователей в течение первых 48 часов после запуска Kimi K3 значительно превысили прогнозируемые показатели, и в связи с нехваткой вычислительных ресурсов, регистрация новых пользователей для Kimi временно приостановлена; ограниченные вычислительные ресурсы будут приоритетно направлены на обеспечение существующих подписчиков.
Система участников была разделена на основные права Kimi и права Code для точного распределения ресурсов. Согласно последующему официальному ответу, Kimi не вносил изменений в систему участников, а лишь перераспределил опыт пользователей в условиях ограниченных вычислительных мощностей.
K3 достигла предела по мощности, и мы вынуждены временно отказаться от новых клиентов, сосредоточившись на обслуживании существующих пользователей.
«Закон Тао» от Kimi
В настоящее время все крупные производители моделей активно увеличивают количество пользователей, привлекая новых клиентов с помощью бесплатных услуг и снижения цен. В сравнении с этим действия Kimi выглядят немного «вульгарно».
Чем мощнее модель, чем длиннее контекст и чем чаще пользователи обращаются к ней, тем выше потребление вычислительных ресурсов для вывода. В ситуации, когда объем запросов K3 приближается к предельной нагрузке существующего кластера вычислительных ресурсов, Kimi сталкивается с той же проблемой, что и «DouBao»: чем больше конечных пользователей, тем менее заметен вклад в доход, но GPU не выдерживают нагрузки.
Как первая модель MoE с параметрами в 3 триллиона от Moonshot, K3 имеет общее количество параметров 2,8 триллиона. Согласно обычному пониманию, для такой модели вычислительные ресурсы расходуются экспоненциально при каждом выводе. Однако благодаря уникальной архитектуре ядра она достигает эффекта, описанного Huawei в области чипов как «закон Тао».
Эта архитектура также рассматривается как супердвигатель, реализующий три ключевые технологии: гибридное линейное внимание KDA (Kimi Delta Attention), остаточное внимание (Attention Residuals) и высокоразреженное MoE, что позволяет максимально эффективно превращать каждую единицу вычислительной мощности в производительность модели.
Долгое время полупроводниковая отрасль полагалась на закон Мура, повышая производительность за счет уменьшения размеров транзисторов. Однако, когда передовые технологические процессы приблизились к физическим пределам, а затраты резко выросли, модель роста, основанная исключительно на наращивании аппаратных компонентов, достигла тупика.
Компания Huawei в этом году предложила «закон Тао», отказавшись от традиционного подхода «уменьшения пространства» и перейдя к «уменьшению времени»: за счет логического складывания, трехмерного стекирования и оптимизации архитектуры всей цепочки удалось сократить задержку передачи сигналов и уменьшить избыточную передачу данных, обеспечив на зрелых технологических узлах повышение энергоэффективности, сопоставимое с передовыми узлами.
Его основная методология заключается в достижении роста производительности за счет инноваций в архитектуре системы при ограничениях по оборудованию или затратам.
На мой взгляд, гибридная линейная механизм внимания KDA, используемый K3, является реализацией «закона Тао» в области ИИ.
Следует отметить, что архитектура Transformer наиболее требовательна к вычислительным ресурсам при использовании механизма внимания. Стандартное внимание растет квадратично с длиной последовательности, и в задачах с контекстом в миллионы токенов большая часть вычислительных ресурсов расходуется на поддержание матрицы внимания для длинных последовательностей. Механизм KDA снижает вычислительную сложность большинства слоев внимания с квадратичной до линейной.
Согласно техническому отчету, опубликованному Moonshot ранее, при использовании гибридного соотношения KDA и MLA на экспериментальной модели максимальное сокращение占用 KV-кэша составило 75%, а пропускная способность декодирования при длине контекста в 1 миллион увеличилась в 6 раз. В сочетании с технологиями остаточного внимания и высокоразреженного MoE эффективность обучения повысилась примерно на 25%, а дополнительные затраты составили менее 2%.
Это переосмысление «производительности модели». Если доминирующий в Силиконовой долине подход на основе Transformer — это бензиновый двигатель, полагающийся на мощность, то KDA скорее напоминает гибридный двигатель, стремящийся к максимальной тепловой эффективности.
Отчет SemiAnalysis указывает, что KDA повышает скорость вывода на 300%, сохраняя при этом производительность, близкую к Transformer, при обработке длинных контекстов. Это означает, что при одинаковых затратах вычислительных ресурсов K3 может генерировать больше эффективного интеллекта.
Фидбэк от сообщества разработчиков показал, что K3 отлично справляется с длинными задачами агентов и генерацией кода, обладая потенциалом конкурировать с ведущими международными моделями.
В основе K3 по-прежнему лежит Закон масштабирования, но он направляет удар на устранение неэффективных алгоритмических потерь. Пока компании из Кремниевой долины продолжают накапливать чипы и наращивать вычислительные мощности, Kimi достиг баланса между производительностью и эффективностью за счет перестройки алгоритмических цепочек и устранения избыточных вычислений, проложив путь к максимизации «интеллектуального выхода на ватт».
Это удивило наблюдателей и инвесторов с Уолл-стрит, которые, как и в случае с DeepSeek, вновь задаются вопросом, окупятся ли миллиарды долларов инвестиций в ИИ из Кремниевой долины и не ослабляется ли преимущество США в области ИИ.
В то же время корпоративные пользователи и разработчики也开始关注 стоимость использования ИИ. Некоторые разработчики уже используют сервис «маршрутизации моделей» (Model Routing), автоматически выбирая для различных задач наиболее дешевую и эффективную ИИ-модель, включая китайские модели, такие как Kimi.
Ян Чжилин подпрыгивает
Возвращаясь к этому, превышение вычислительных мощностей Kimi стало побочным эффектом технического успеха: повышение эффективности модели снизило стоимость одного использования, что, в свою очередь, стимулировало резкий рост общего спроса.
Стоит отметить, что 11 июля основатель Zhipu Tang Jie объявил о программе «Touch High», прямо заявив: «Не достигнуть вершины — значит провал», и четко обозначил, что в ближайшие два года не будет стремиться к краткосрочной монетизации приложений, а сосредоточит ресурсы на решении четырех ключевых направлений AGI, а также планирует привлечь средства для вложения десятков миллиардов ресурсов в преодоление технологии механической объяснимости.
Если говорить об этом, то «прыжок» Цзипу — это последняя попытка после выхода на биржу. Она надеется укрепить историю о том, что является «первой в мире компанией по крупным моделям», стремясь достичь вершины технологий, и снять реальную тревогу.
Также в решениях Ян Чжилина я вижу, как Kimi демонстрирует «подъем» по трем измерениям:
Во-первых, сосредоточьтесь на вычислительной мощности, перейдите от мышления, ориентированного на трафик, к мышлению, ориентированному на ценность. Согласно открытым данным, доля бизнеса API Kimi уже превысила 70%, что значительно отличается от прежней модели подписки для конечных пользователей. Сохранение существующих пользователей и отказ от новых клиентов на самом деле означает перераспределение ограниченных вычислительных ресурсов в пользу высокодоходных сценариев, чтобы предотвратить переполнение трафиком для конечных пользователей, которое может вытеснить долю B2B-бизнеса, уже являющегося основным источником дохода.
Эта цена очевидна. Например, критерии выполнения приоритизации существующих пользователей не прозрачны: какие запросы получают приоритет, а какие понижаются в приоритете, — при неправильном управлении это подрывает доверие пользователей.
В долгосрочной перспективе, чтобы пройти путь от технологической звезды к зрелой ведущей компании в области ИИ, Kimi должна укрепить инфраструктуру, включая гибкий пулы вычислительных ресурсов, иерархическую систему ответов и динамическое управление.
Во-вторых, происходит повышение цен: Kimi проходит тестирование на давление от дешевого шведского стола к ценовой сегментации. Упоминание в объявлении о «разделении основных прав Kimi и прав на Code» является как краткосрочным регулированием в ответ на нехватку вычислительных мощностей, так и возможным началом перестройки его ценовой системы.
Раньше пользователи платили одинаковую стоимость и потребляли одинаковые вычислительные ресурсы, независимо от того, писали ли они код, искали информацию или просто общались. Когда доля пользователей, потребляющих высокие вычислительные ресурсы для кода, увеличивается, такая модель неизбежно приводит к структурному несоответствию.
Kimi использует эту возможность для разделения преимуществ для участников и переоценки в соответствии с сценариями использования: легкие пользователи получают базовые услуги, а интенсивные пользователи платят премию за высокую ценность функций.
Это попытка завоевать право на ценообразование модели через сегментацию пользователей по ценности. Текущая ставка K3 составляет 2,3 доллара США за миллион токенов — ниже, чем у ведущих зарубежных моделей, но это новый рекорд для отечественных моделей.
Возможно, Kimi также хочет отказаться от дешевой модели и сформировать восприятие: высокопроизводительные модели обладают ценовой гибкостью. Далее конкуренция среди крупных моделей перейдет от «сравнения параметров» к «сравнению инфраструктуры» и «сравнению ценовой стратегии».
Этот шаг сложнее, чем подняться на вершину рейтинга, и ближе к сущности бизнеса.
В-третьих, повышение статуса: Kimi переходит от геополитической переменной к опорной точке ценообразования.
После выпуска K3 он быстро привлек внимание по всему миру. В последнем «Индексе интеллекта (Intelligence Index)», опубликованном независимой оценочной организацией искусственного интеллекта Artificial Analysis, его совокупный балл составил 57 баллов, заняв третье место в мире, уступая только Claude Fable 5 (60 баллов) и GPT-5.6 Sol (59 баллов), и опережая Claude Opus 4.8 (56 баллов).
Этот результат также случайно разрушил отраслевое мнение о том, что открытый исходный код отстает от закрытого на полупоколение.
В то же время влияние K3 вышло за пределы технического сообщества. Американская технологическая инвестиционная компания рассматривает его как «переломный момент» в развитии ИИ, считая, что качественные открытые модели ускоряют распространение возможностей; профессор компьютерных наук Калифорнийского университета в Беркли утверждает, что K3 сократил разрыв между китайскими открытыми моделями и передовыми американскими моделями до 2–3 месяцев.
Реакция рынка капитала была столь же резкой: в первый день торгов K3 рыночная капитализация NVIDIA сократилась на 111,1 млрд долларов США за один день; стратеги JPMorgan в отчете прямо назвали это «DeepSeek 2.0».
Это ускорение — то, что меняет логику ценообразования.
Кроме того, годовой доход (ARR) Moonshot к июню приблизился к 300 миллионам долларов США, темпы роста за рубежом составили 400%, а после повышения цен на 60% доходы увеличились — эти три показателя в совокупности свидетельствуют о том, что модель «открытый исходный код + эффективность» Kimi может быть масштабирована для монетизации.
Помимо этого, стало известно, что Lunar Shadow ищет возможность листинга в Гонконге в течение шести месяцев, при этом его оценка за полгода выросла с 4,3 млрд долларов до 31,5 млрд долларов, увеличившись более чем в семь раз.
Это — признание рынком капитала альтернативного пути, не являющегося основным в Силиконовой долине. Когда они делают ставку на SOTA с рабочей моделью единичной экономики, это также означает, что Kimi обладает собственной логикой оценки и больше не нуждается в сравнении с OpenAI или Anthropic, чтобы доказать свою ценность.

Темная сторона Луны, источник изображения: сетевые материалы
Но K3 все еще очень далеко от AGI. Например, по бенчмаркам, хотя K3 всего на 3 балла уступает Fable 5, на самом деле разница значительна.
Кроме того, Kimi в техническом отчете признал два дефекта на уровне развертывания: во-первых, K3 сохраняет полную историю мышления (thinking history) во время обучения; если вызывающая сторона не передает правильно предыдущий процесс рассуждения или переключается с другой модели на K3 в ходе сессии, качество вывода значительно снижается;
Во-вторых, K3 при нечетких задачах проявляет «чрезмерную инициативу» и склонен принимать решения за пользователя. Такая «самовольность» в инженерных процессах, требующих точного выполнения, легко вызывает цепные ошибки.
Еще одна легко упускаемая, но чрезвычайно важная проблема: галлюцинации. Artificial Analysis особо отметила, что уровень галлюцинаций у K3 повысился по сравнению с предыдущей версией K2.6.
В определенной степени яркость и скрытые риски K3 отражают дисбаланс спроса и предложения на вычислительные мощности во всей отрасли, а также коллективную боль китайской индустрии ИИ, столкнувшейся с давлением из-за нехватки вычислительных мощностей, незавершенной коммерциализации и завышенных ожиданий пользователей.
Каждая перегрузка и каждый «сбой» этих китайских компаний в области ИИ — это препятствие, которое необходимо преодолеть для достижения новых высот в китайском ИИ. Можно с уверенностью сказать, что начался новый цикл конкуренции: крупные модели перейдут от соревнования в способностях к соревнованию в вычислительной мощности.
Только те, кто сможет создать преимущество в алгоритмах, вычислительных ресурсах и других инфраструктурных компонентах, смогут победить в итоге и определить стандарты выживания для следующего поколения AI-компаний.
Справочные материалы:
Буквенный рейтинг, «K3 выпущен 48 часов»
Шелк, Виноват Kimi
Эта статья опубликована в официальном аккаунте WeChat «Тан Чэнь», автор: Тан Чэнь, опубликовано с разрешения 36氪.
