Місячна темна сторона Kimi K3 призупинила підписку нових користувачів протягом 48 годин після запуску через значно перевищення запитів, що призвело до «розплавлення» обчислювальних ресурсів. Загальний розмір параметрів K3 становить 2,8 трильйона, він використовує гібридний лінійний уваговий механізм KDA, що знижує обчислювальну складність шарів уваги з квадратичної до лінійної, зменшує KV-кеш до 75% і збільшує пропускну здатність декодування в 6 разів при довжині контексту 1 мільйон. Ця архітектура вважається практичним застосуванням «закону Тао» в галузі ШІ, що забезпечує стрибок у продуктивності завдяки системним архітектурним інноваціям. K3 отримав загальний бал 57 у глобальних оцінках моделей ШІ, посівши третє місце після Claude Fable 5 та GPT-5.6. На фінансових ринках у день запуску K3 капіталізація NVIDIA зменшилася приблизно на 111,1 мільярда доларів США, а оцінка Місячної темної сторони за шість місяців зросла з 4,3 до 31,5 мільярда доларів США.Автор статті, джерело: 36氪
У Кімі також є власний «закон Тао».
K3 набуває популярності, а Kimi змушений натиснути паузу.
Ніч з 19 на 20 липня команда Moonshot Kimi опублікувала повідомлення, що через значне перевищення запитів користувачів протягом 48 годин після запуску Kimi K3 та через дефіцит обчислювальних ресурсів, відкриття підписки для нових користувачів призупинено, а обмежені обчислювальні ресурси пріоритетно надаються існуючим підписникам.
Система членства була розділена на основні права Kimi та права Code для точного розподілу ресурсів. З пізнішого офіційного відповіді видно, що Kimi не змінювала систему членства, а лише перерозподілила досвід користувача в межах обмежених обчислювальних потужностей.
K3 вибухнув від завантаження обчислювальної потужності, що спричинило «розплавлення» — ми змушені відмовити новим користувачам і зосередитися на обслуговуванні існуючих.
«Закон Тао» від Kimi
Зараз усі виробники моделей намагаються максимально збільшити кількість користувачів, привертаючи нових користувачів за допомогою безкоштовних пропозицій, знижок та інших переваг у співвідношенні ціна/якість. Навпаки, дії Kimi здаються трохи «вєрсальськими».
Але чим сильніші моделі, чим довші контексти та чим частіше користувачі викликають їх, тим більше ресурсів витрачається на інференс. У ситуації, коли «обсяг запитів K3 наближається до межі навантаження існуючого кластера обчислювальних ресурсів», Kimi зіткнувся з тією ж проблемою, що й «DouBao»: чим більше кінцевих користувачів, тим менший внесок у доходи, але GPU не витримують.
Як перша модель MoE з параметрами на рівні 3 трильйонів від Moonshot, K3 має загальну кількість параметрів 2,8 трильйона. За звичайним розумінням, така модель витрачає обчислювальні ресурси експоненційно при кожному виводі. Але завдяки її унікальній архітектурі досягається ефект, запропонований Huawei у сфері чіпів — «закон Тао».
Цю архітектуру також вважають супердвигуном, який реалізує три ключові технології: змішану лінійну увагу KDA (Kimi Delta Attention), залишки уваги (Attention Residuals) та високу розрідженість MoE, що максимально підвищує ефективність перетворення кожного одиниці обчислювальних ресурсів у продуктивність моделі.
Протягом тривалого часу напівпровідникова галузь залежала від закону Мура, підвищуючи продуктивність шляхом зменшення розмірів транзисторів. Але коли передові технологічні процеси наблизилися до фізичних меж, а витрати стрімко зросли, модель простого наростання апаратного забезпечення досягла точки стагнації.
Хуавей цього року запропонувала «закон Тао», вийшовши за межі традиційного підходу «мініатюризації простору» і звернувшись до «мініатюризації часу»: шляхом логічного згортання, тривимірного стекування та оптимізації архітектури повного ланцюга, скорочується затримка передачі сигналів та зменшується надлишкова передача даних, що дозволяє досягти підвищення енергоефективності, що дорівнює ефективності передових технологій, на зрілих технологічних процесах.
Його основна методологія полягає в досягненні стрибка в продуктивності за рахунок інновацій у системній архітектурі при обмеженнях апаратного забезпечення або витрат.
На мою думку, гібридна лінійна увага KDA, використовувана K3, є практичним застосуванням «закону Тао» у галузі ШІ.
Варто знати, що архітектура Transformer найбільш витратна щодо обчислювальних ресурсів через механізм уваги. Стандартна увага зростає квадратично з довжиною послідовності, і в завданнях із мільйонами контексту більшість обчислювальних ресурсів витрачається на підтримку матриць уваги довгих послідовностей. Механізм KDA зменшує обчислювальну складність більшості шарів уваги з квадратичної до лінійної.
Згідно з технічним звітом, опублікованим раніше «Місячною темрявою», при використанні змішаного співвідношення KDA та MLA на експериментальній моделі максимальне зменшення зайнятості KV-кешу становить 75%, а пропускна здатність декодування при довжині контексту 1 мільйон збільшилася в 6 разів. У поєднанні з технологіями залишкової уваги та високої розрідженості MoE ефективність навчання збільшилася приблизно на 25%, а додаткові витрати становлять менше 2%.
Це переосмислення «продуктивності моделі». Якщо домінуючий у Сіліконовій долині підхід Transformer — це бензиновий автомобіль, що досягає чудес за рахунок потужності, то KDA схожий на гібридний двигун, що прагне до максимальної теплової ефективності.
Звіт SemiAnalysis вказує, що KDA збільшує швидкість виведення на 300%, одночасно зберігаючи продуктивність, близьку до Transformer, при обробці довгих контекстів. Це означає, що за однакових вкладів у обчислювальну потужність K3 може генерувати більше ефективного інтелекту.
Реальні відгуки спільноти розробників показують, що K3 відзначається високою продуктивністю у довгих процесах завдань агента та генерації коду, маючи потенціал конкурувати з лідерами світового рівня.
На фундаментальному рівні K3 все ще дотримується закону масштабування, але спрямовує ніж на грубі алгоритмічні втрати. Поки компанії зі Стенфордської долини продовжують накопичувати чіпи та збільшувати обчислювальну потужність, Kimi досяг балансу між продуктивністю та ефективністю за обмежених обчислювальних ресурсів завдяки перебудові алгоритмічних ланцюжків та скороченню надлишкових обчислень, вибравши шлях, що максимізує «розумну вихідну продуктивність на ват».
Це здивувало спостерігачів та інвесторів з Уолл-стріт, які, як і раніше, ставлять під сумнів, чи окупляться мільярди доларів США, вкладені в Штатах у штучний інтелект, і чи була зменшена перевага США в галузі ШІ.
Тим часом корпоративні користувачі та розробники також почали звертати увагу на витрати на використання ШІ. Деякі розробники вже використовують сервіс «маршрутизації моделей» (Model Routing), щоб автоматично вибирати найбільш ефективну та найдешевшу модель ШІ залежно від завдання, до яких, звичайно, належать китайські моделі, включаючи Kimi.
Ян Чжилінь стрибнув високо
Поглянувши назад, збій потужності Kimi став побічним ефектом технічного успіху: підвищення ефективності моделі знизило вартість одноразового використання, що, навпаки, спричинило стрімке зростання загального попиту.
Варто зазначити, що 11 липня засновник Zhipu Tang Jie оголосив про «План Touch High», прямо сказавши: «Не досягти вершини — це невдача», і чітко заявив, що протягом наступних двох років вони не будуть прагнути до короткострокового монетизування застосунків, а зосередять ресурси на розвитку чотирьох ключових напрямків AGI, а також планують залучити кошти для інвестування мільярдів одиниць ресурсів у розробку технологій механічної пояснюваності.
Якщо говорити про те, що «підйом» Zhipu — це останній шанс після лістингу, він сподівається закріпити історію про «першу у світі компанію з великими моделями» шляхом досягнення вершин технологій та зменшення реальних занепокоєнь.
Також у рішеннях Яна Чжилінь я бачу, як Kimi досягає «підйому» на трьох вимірах:
По-перше, зосередьтесь на потужностях обчислення, перейшовши від мислення, спрямованого на трафік, до мислення, спрямованого на цінність. Згідно з відкритою інформацією, частка бізнесу API Kimi вже перевищила 70%, що значно відрізняється від попередньої моделі підписки для кінцевих користувачів. Збереження існуючих користувачів та відмова від нових — це насправді перерозподіл обмежених обчислювальних ресурсів на високодоходні сценарії, щоб уникнути витіснення B2B-бізнесу, який вже є основним джерелом доходу, масовим C2B-трафіком.
Ціна також очевидна. Наприклад, критерії виконання «пріоритетного забезпечення існуючих користувачів» не прозорі: хто саме отримує пріоритетну обробку, а хто — знижений рівень обробки. Якщо обробка буде неправильною, це призведе до зниження довіри користувачів.
На довгострокову перспективу, щоб Kimi здійснив перехід від технологічної зірки до зрілої лідируючої компанії в галузі ШІ, він повинен міцно закласти інфраструктуру, включаючи гнучкі пули обчислювальних ресурсів, механізми різних рівнів відповіді та динамічні здатності планування.
Друге — підйом цін: Kimi проходить тест на навантаження від дешевого буфету до відокремлення цінності. Згадка у повідомленні про «розподіл основних прав Kimi та прав на Code» є не лише короткостроковим перерозподілом обчислювальних ресурсів у відповідь на нестачу потужностей, але й може свідчити про початок перебудови її цінової системи.
Раніше користувачі, незалежно від того, чи писали код, шукали інформацію чи просто спілкувалися, сплачували однакову вартість і споживали однакові обчислювальні ресурси. Коли частка користувачів, що вимагають великих обчислювальних потужностей, зростає, така модель необхідно призводить до структурної диспропорції.
Kimi скористалася цією нагодою, щоб розділити переваги для учасників і перез цінувати їх згідно зі сценаріями використання: легкі користувачі отримують базові послуги, а інтенсивні користувачі платять премію за високодоходні функції.
Це спроба вплинути на ціноутворення моделей шляхом сегментації користувачів за цінністю. Наразі тарифи K3 досягли 2,3 долара за мільйон токенів — хоча й нижчі, ніж у світових лідерів, це новий рекорд для китайських моделей.
Можливо, Kimi також хоче попрощатися з дешевою моделлю та передати зовнішнє сприйняття: високопродуктивні моделі мають здатність до ціноутворення. Далі конкуренція серед великих моделей перейде від «боротьби за параметри» до «боротьби за інфраструктуру» та «боротьби за вартість та ціноутворення».
Цей крок складніший за підйом на вершину рейтингу і ближчий до суті бізнесу.
Третє, підйом на вершину: Kimi здійснює стрибок від геополітичної змінної до цінового якоря.
Після випуску K3 швидко привернув увагу по всьому світу. У найновішому «Індексі інтелекту» (Intelligence Index), опублікованому незалежною оціночною організацією штучного інтелекту Artificial Analysis, його загальний бал становить 57 балів, що посідає третє місце у світі, поступаючись лише Claude Fable 5 (60 балів) і GPT-5.6 Sol (59 балів), і обігнавши Claude Opus 4.8 (56 балів).
Цей результат також зламав галузеву уяву про те, що відкрите програмне забезпечення відстає від закритого на півпокоління.
Одночасно вплив K3 вийшов за межі технічної спільноти. Американська технологічна інвестиційна фірма вважає його «переломним моментом» у розвитку ШІ, вважаючи, що високоякісні відкриті моделі прискорюють поширення здатностей; професор комп’ютерних наук Каліфорнійського університету в Берклі стверджує, що K3 скоротив розрив між китайськими відкритими моделями та передовими американськими моделями до 2–3 місяців.
Реакція ринків капіталу була не менш різкою: у перший день торгівлі K3 ринкова капіталізація NVIDIA зменшилася приблизно на 111,1 мільярда доларів США; стратеги JPMorgan у звіті прямо назвали це «DeepSeek 2.0».
Це прискорення — те, що змінює логіку ціноутворення.
Крім того, річний дохід (ARR) Moonshot до червня наблизився до 300 мільйонів доларів США, темпи зростання за кордоном склали 400%, а після підвищення цін на 60% дохід збільшився — ці три показники разом свідчать про те, що модель «відкритого коду та ефективності» Kimi може бути масштабована для отримання прибутку.
Додатково, згідно з інформацією, Moonshot шукає можливість провести ініціалізацію публічного пропозиції в Гонконзі протягом найкоротшого терміну — шість місяців, при цьому оцінка компанії за шість місяців зросла з 4,3 млрд доларів США до 31,5 млрд доларів США, що більше ніж у 7 разів.
Це підтвердження ринковими капіталами альтернативного шляху, що не належить до основної硅谷-спрямованості. Коли вони роблять ставки на SOTA з працездатною моделлю одиничної економіки, це також свідчить про те, що Kimi має власну логіку оцінки і більше не потребує порівняння з OpenAI чи Anthropic, щоб довести свою вартість.

Темна сторона Місяця. Фото: інтернет-джерела
Але K3 ще дуже далеко від AGI. Наприклад, у тестах, хоча K3 лише на 3 бали нижче за Fable 5, це все ще значна різниця.
Крім того, Kimi у технічному звіті також визнав два дефекти на рівні розгортання: по-перше, K3 під час навчання зберігав повну історію міркувань (thinking history); якщо клієнт не передає правильно попередній процес міркувань або переключається з іншої моделі на K3 у сесії, якість виводу значно погіршується;
Друге: коли завдання нечітке, K3 «занадто активно» діє, надаючи перевагу прийняттю рішень замість користувача. Таке «самовоління» у інженерних процесах, що вимагають точного виконання, легко викликає ланцюгові помилки.
Ще одна легко знехтувана, але надзвичайно важлива проблема: галюцинації. Artificial Analysis особливо зазначив, що рівень галюцинацій K3 збільшився порівняно з попередньою версією K2.6.
У певному сенсі яскравість та приховані ризики K3 є відображенням загального дисбалансу між попитом і пропозицією обчислювальних потужностей у галузі, а також колективним болем китайської індустрії ШІ, що стикається з тиском через дефіцит обчислювальних потужностей, незавершену комерціалізацію та надмірні очікування користувачів.
Кожне перевантаження цих китайських компаній з штучним інтелектом, кожен «запобіжник», — це перешкода, яку потрібно подолати для досягнення нових висот китайського ШІ. Можна бути впевненими: розпочався новий цикл конкуренції, де великі моделі перейдуть від змагання за здібності до змагання за обчислювальну потужність.
Тільки ті, хто зможе створити перевагу в алгоритмах, обчислювальних ресурсах та інших інфраструктурних елементах, зможуть виграти в кінцевому підсумку та визначити стандарти виживання для наступного покоління компаній з ІІ.
Джерела:
Літерний рейтинг, «K3 за 48 годин»
Шовк, «Всім винен Kimi»
Цей матеріал надійшов із офіційного аккаунту WeChat «Тан Чень», автор: Тан Чень, опубліковано за дозволом 36氪.
