Kimi K3 занимает третье место в мире по рейтингу ИИ-моделей и конкурирует с Anthropic и OpenAI

iconTechFlow
Поделиться
AI summary iconСводка
Kimi K3 от Moonshot занимает третье место в мире после Fable от Anthropic и Soul 5.6 от OpenAI. С 2,8 триллиона параметров и стоимостью 3/15 за миллион токенов он соответствует ценовой политике Sonnet. Данные в блокчейне демонстрируют активное внедрение, а индекс страха и жадности отражает растущую уверенность рынка. Аналитики отмечают, что производительность Kimi K3 может увеличить прибыль лабораторий ИИ по сравнению с моделями SaaS. Экспортные ограничения США могут сокращать разрыв между китайскими и американскими моделями.

Организация и компиляция: Shenchao TechFlow

Гости: Джордан и Макс, аналитики SemiAnalysis

Ведущий: Джордан (внутренний диалог SemiAnalysis)

Источник подкаста: SemiAnalysis

Оригинальное название: [Экстренный выпуск] Moonshot's Kimi K3 уже здесь! Китай получил передовую модель

Дата выхода: 18 июля 2026 года

Ключевые моменты

Moonshot (Лунная тень) выпустила Kimi K3, которая превзошла Google и Meta по нескольким комплексным тестам и стала третьей по качеству моделью в мире, уступая только Fable от Anthropic и Soul 5.6 от OpenAI. Два аналитика SemiAnalysis, Джордан и Макс, в экстренном выпуске разобрали значение этого выпуска: модель с 2,8 трлн параметров предлагает услуги по той же цене, что и Sonnet (3/15 за миллион токенов); если её масштаб сопоставим с передовыми закрытыми моделями, то прибыльность Anthropic в размере 10/50 может быть невероятно высокой.

Более резкую оценку дал Джордан: разрыв на передовой сокращается, и он связывает это с ограничениями, наложенными правительством США на Anthropic/OpenAI по выпуску самых мощных моделей, что искусственно создало окно возможностей для последователей. Открытые источники действительно не догнали. В то же время западные открытые источники находятся в полном вакууме — ни одна американская компания не имеет открытой модели, способной догнать пятую по силе китайскую. Конкуренция моделей превращается в конкуренцию за инструменты и геополитику.

Краткое изложение интересных мнений

О позиционировании Kimi K3

  • Если вы посмотрите на общий рейтинг всех основных benchmark, сегодня четко выделяются три лидера: Fable, Soul 5.6 и Kimi K3. Они постоянно опережают всех остальных, включая DeepSeek, а также Google, Meta и xAI.
  • Google должно чувствовать себя крайне смущенно. Еще в ноябре и декабре 2025 года все считали, что тремя крупнейшими игроками в ИИ являются Google, Anthropic и OpenAI. Сегодня с некоторыми «старомодными» людьми я разговариваю — они до сих пор так думают, но, очевидно, это уже не так.
  • Это, возможно, вторая по качеству модель в мире, потому что каждый раз, когда я пытаюсь что-то серьезное сделать с Fable, мне отказывают и перенаправляют на Opus. Хотя я не уверен, что она лучше Opus, зато хотя бы не отказывают.

О прибыльности передовых моделей

  • Если Kimi с большой вероятностью не продает K3 по цене 3/15 в убыток, а Fable, имеющая сопоставимый масштаб, взимает 10/50, это должно полностью рассеять опасения, что лаборатории ИИ — это неприбыльный бизнес. Продажа токенов по цене API может быть даже прибыльнее, чем SaaS.
  • Цена выросла более чем в три раза с K2.7 до K3 — с 0,95/4 до 3/15. Но я не думаю, что у них осталось много пространства для повышения цен, поскольку многие задачи можно решить с помощью GLM или MiniMax M3.

О правительстве США и разрыве

  • Я считаю, что это сокращение разрыва объясняется исключительно ограничениями, наложенными правительством США на Anthropic, из-за чего мы не можем получить самые мощные модели этих компаний. Они искусственно догнали нас.
  • Мы можем получить доступ к передовым технологиям только в том случае, если они разрешены. Это на самом деле представляет собой возможность для игроков, занявших четвертое, пятое, шестое и седьмое места.

О западных открытых вакуумах

  • Меня шокирует, что на этом еще настолько неэффективном рынке у нас нет ни одной американской компании, которая хотя бы смогла бы догнать пятую по уровню китайскую.
  • Даже если правительство не запретит китайские открытые модели, обычные крупные американские компании не захотят кормить свои проприетарные данные китайскими открытыми моделями. Даже если вы загрузите веса в изолированном центре обработки данных, когда CCP не видит ваши данные, руководство не согласится.

О Harness

  • Тестирование Kimi K3 заставило меня впервые серьезно задуматься об Open Code, Hermes и Pi. Harness по-прежнему является частью продукта.
  • Простые вещи могут заставить меня выбрать эту модель, а не ту: можно ли установить её на удалённом SSH-сервере? Удобны ли горячие клавиши? Эти детали в среде фактически влияют на то, куда я отправляю токены, то есть куда я направляю бюджет.

О том, что еще слишком рано

  • На прошлой неделе я был на ICML, а неделей раньше — на конференции AI Engineer. Это официальная конференция по ИИ, и более 80% людей никогда не слышали о SemiAnalysis. Вы утверждаете, что работаете в сфере ИИ, но даже не читали SemiAnalysis? Мы еще слишком рано.

Является ли Kimi K3 третьей лучшей моделью в мире?

Джордан: Быстрый комментарий — является ли Kimi K3 сейчас третьей лучшей моделью в мире?

Макс: Ответ однозначно «да». Все любят критиковать бенчмарки, и действительно, у них есть проблемы, но если посмотреть на общий рейтинг всех основных бенчмарков, их направление всегда правильное. Сегодня четко выделяются три лидера: Fable, Soul 5.6 и Kimi K3, которые постоянно превосходят всех остальных, включая таких участников с открытым исходным кодом, как DeepSeek, а также явно опережают Google, Meta и xAI. Это невероятное достижение для команды Moonshot.

Google должен чувствовать себя крайне смущенно. Еще в ноябре и декабре 2025 года все считали, что тремя крупнейшими игроками в ИИ являются Google, Anthropic и OpenAI. Сегодня, общаясь с некоторыми «старомодными» людьми, они все еще так думают, но, очевидно, это уже не так.

В целом, я все еще считаю, что он уступает Fable и Soul 5.6. Забавно, что они сами явно об этом написали в своем блоге о выпуске модели. Возможно, это старомодный китайский скромность, возможно, они не хотят привлекать внимание американских властей, учитывая, что выпуск Fable 5.6 также сопровождался некоторой задержкой. Но в любом случае, это очень впечатляет.

Джордан: В разделе «Ограничения» их блога написано: «Несмотря на то, что K3 в целом является высоко конкурентоспособной моделью, между ней и Fable 5 и GPT 5.6 всё ещё существует явный разрыв в пользовательском опыте». Мой личный опыт использования показывает, что она действительно хороша, но очень медленная — это раздражает. Это заставило меня впервые почувствовать желание попробовать open source harness. Честно говоря, я узнал больше о harness, чем о модели, потому что все эти модели достаточно хороши, чтобы справляться с базовыми задачами, которые я сейчас выполняю, и мне сложно найти сложные задачи, которые они не могут выполнить.

Это, возможно, вторая лучшая модель в мире для меня, потому что каждый раз, когда я использую Fable для серьезных задач, меня отклоняют и перенаправляют на Opus. Хотя я не уверен, лучше ли он Opus, сам факт, что меня не отклоняют, уже менее раздражает. Однако при использовании ключа API по тарифу «оплата за использование» меня не отклоняют — лимиты срабатывают только при использовании веб-консоли или глубоких исследований. Очевидно, у них недостаточно GPU для удовлетворения спроса на эту модель. Раньше эту проблему решали с помощью открытой стратегии — выпускали веса, чтобы другие их обслуживали. Но на этот раз веса еще не выпущены, и они говорят, что выпустят их через 10 дней.

Почему отложили открытие веса на 10 дней?

Джордан: Как ты думаешь, в чем заключается эта стратегия задержки?

Макс: Ясно скажу, это всё мои чистые предположения. Одной из основных причин может быть то, что им нужно дать командам движков вывода, таким как vLLM и SGLang, достаточно времени, чтобы обеспечить высокопроизводительное обслуживание этой модели. Если сегодня просто выпустить веса, все начнут их обслуживать, но будут получать всего 20 токенов/сек, это плохо скажется на их репутации. Сейчас у них отличная возможность получить огромный пиар и широкое принятие; если же запуск будет подорван производительностью, это только ослабит импульс.

Другая возможность заключается в том, что они ведут переговоры с поставщиками сервисов вывода, такими как Together AI, Fireworks, Nebius и Groq, о лицензионном сотрудничестве, чтобы использовать последние чипы, такие как GB300, для обслуживания дополнительной емкости. Вероятно, именно эти два фактора стали основной причиной задержки на 10 дней.

Прибыль от передовых моделей

Джордан: Давайте поговорим об архитектуре модели. Она имеет 2,8 трлн параметров и не помещается в B200; для запуска этой модели на одном сервере HGX с 8 GPU вам понадобятся B300, GB300 или AMD MI355X. Конечно, можно использовать пайплайн-параллелизм между узлами, но это сильно снизит производительность. Поэтому только обладатели самых современных чипов могут запускать эту модель.

Возвращаясь к вашему предыдущему упоминанию Google, эта модель достигла конкурентоспособности на переднем крае при 2,8 трлн параметров, что действительно даёт нам некоторое представление о масштабе закрытых передовых моделей. Если они сравнивают её с моделью в 10 трлн параметров, то это ещё более позорно. Мы должны предположить, что она находится на том же уровне, что и Soul и Fable.

Max: Да, ты прав. Я по-прежнему верю в способности и проницательность команды Anthropic. Если кто-то в Twitter говорит, что текущие закрытые модели имеют 10 трлн параметров, и это правда, тогда друг, тебе пора собирать чемоданы — акции NVIDIA завтра упадут на 50%, и всё закончится.

Я довольно уверен, что Kimi K3 не намного меньше текущих ведущих закрытых моделей, а возможно, даже немного больше. Если это правда, это еще раз подтверждает нашу постоянную точку зрения в SemiAnalysis: прибыльность этих закрытых лабораторий действительно поразительна. Если Kimi, как и Sonnet, вряд ли продает K3 по цене 3/15 в убыток, а Fable примерно такого же размера, но взимает 10/50, то это должно окончательно рассеять все опасения по поводу нерентабельности AI-лабораторий. Продажа токенов по цене API, по состоянию на сегодня, может быть даже прибыльнее, чем SaaS.

Джордан: Нет затрат на персонал, только GPU. А как это соотносится с предыдущей ценой? Вы упомянули 3/15, но предыдущая версия Moonshot имела прямую цену 0,95/4, поэтому цена выросла более чем в три раза с K2,7 до K3. Сколько ещё у них есть потенциала для повышения цен?

Макс: Я не думаю, что у них осталось много места для роста. Даже на уровне 3/15 многие сочтут это слишком дорого. Их задачи вполне решаются с помощью GLM или MiniMax M3. Здесь возникает интересное расхождение: те, как SemiAnalysis, кто не боится тратить токены Dylan, будут продолжать использовать Fable для почти всех задач; а крайне чувствительные к затратам, такие как Tesla, Uber, тратящие всего $200 в неделю на токены, перейдут на уровень цен GLM. Кто же на самом деле перейдет на Kimi K3? Возможно, это будет группа людей, философски преданных open source и желающих поддержать новые модели. Будут ли крупные корпорации действительно использовать эту модель? Я не удивлюсь, если ответ будет отрицательным.

Новая архитектура и следующие шаги

Джордан: Это совершенно новая архитектура. 2,8 трлн параметров, с delta attention Kimi, potential residuals и stable latent — по сути, увеличенная версия предыдущей модели, примерно в два раза больше. Ранее, в K2.5, мы видели, что Cursor использовал его в качестве composer на основе continued pre-training и MRL, после чего появились чекпоинты 2.5, 2.6, 2.6.7 и т.д. Это новая базовая модель, но она уже достаточно завершена и не имеет грубых границ, характерных для исходных моделей. Что дальше? Когда выйдет 3.1? Изменится ли цена? Появится ли composer на основе K3?

Max: Композитор на основе K3, скорее всего, не появится — команда Cursor уже решила обучать свою модель с нуля. Что касается K3.1, K3.2, то, вероятно, в ближайшие один-два месяца выйдет два-три обновления, продолжающих пост-обучение. Цены, думаю, останутся неизменными, поскольку в ближайшие два-три месяца они не смогут работать на новом оборудовании и не получат повышения пропускной способности для снижения цен. Возможно, очень талантливые инженеры ядер смогут снизить стоимость до уровня DeepSeek V4, но я сомневаюсь, что модель с 3 трлн параметров сможет этого достичь. Текущие цены GLM и MiniMax, возможно, уже являются пределом того, что могут обслуживать модели с 1–1,5 трлн параметров.

Откроется ли открытый исходный код для обгона закрытого?

Max: Более интересный вопрос — будет ли разрыв между открытым и закрытым исходным кодом продолжать сокращаться, и сможет ли открытый исходный код действительно достичь паритета с передовым уровнем. Если это произойдет, это окажет огромное влияние на всю нашу отрасль. Как вы считаете?

Джордан: Мое мнение заключается в том, что разрыв сейчас сократился, и это squarely связано с тем, что правительство США ограничило Anthropic, из-за чего мы не можем получить самые мощные модели этих компаний. Их искусственно догнали.

Мы можем видеть сравнение Mythos и Fable. Mythos я не могу использовать, Fable мне приходится умолять, чтобы иногда получить доступ. 5.6 Soul, по нашему внутреннему мнению, не является самой большой моделью, обученной OpenAI, она меньше, чем 4.5. У них есть большая модель. В результате мы можем получить доступ к ней только в том случае, если передовые технологии будут разрешены правительством.

Это на самом деле возможность для игроков, занимающих четвертое, пятое, шестое и седьмое места, — расширить свои возможности в пределах определенного лимита и начать завоевывать долю пользователей, но никогда не дотянуться до настоящей границы. Я считаю, что граница может значительно сместиться к концу этого лета, или же политический курс может немного измениться. Также возможно, что мы начнем находить модальности, выходящие за рамки кодирования, и позволим им по-настоящему исследовать эти области.

Кстати, выпуск Inkling от Thinking Machines — оригинальный аудиовход мне кажется очень интересным и сигналом будущего.

Max: Что касается Inkling, на Западе действительно крайне-крайне-крайне не хватает хорошей открытой модели. Рынок все еще настолько неэффективен, что у нас нет ни одной американской компании, способной хотя бы догнать пятую по качеству китайскую — это меня шокирует. С одной стороны, полный запрет американским правительством китайских открытых моделей — вопрос времени. С другой стороны, даже если запрета не будет, обычные крупные американские компании не хотят предоставлять свои проприетарные данные китайским открытым моделям. Даже если вы загружаете веса в изолированный центр обработки данных, где CCP не видит ваши данные, руководство все равно не одобрит это. Многие компании заботятся о бюджете на токены и готовы запускать только западные или некитайские модели. Inkling — это лучшая западная OSS-модель, которую мы сейчас можем получить, но она все еще далеко от передового края открытых источников — это меня шокирует.

Джордан: Раньше было Neotron, теперь Inkling. Я считаю, у Inkling есть два шанса: во-первых, они должны быть лучше большинства китайских открытых решений, чтобы войти в игру. Во-вторых, им нужно превзойти вторичные и третичные модели передовых лабораторий, превзойти Sonnet, потому что вы можете получить почти передовые возможности с помощью Bedrock или Foundry, используя закрытые вторичные модели и экономя деньги. Я всегда плохо понимал, как западные открытые решения «помогают экономить деньги». Конечно, продвижение моделей в экосистемы Fireworks, Together, Base10 — это хорошо, но основной рынок находится на правительственном уровне.

Создано для китайских локальных ускорителей

Джордан: Еще один важный момент — в блоге K3 упоминается, что на этапе SFT проводилось квантование, причем для весов и активаций изначально использовались MXFP4 и MXFP8, причем официальная формулировка — «широкая совместимость с оборудованием». Как вы думаете, Moonshot еще что-то учитывает в плане оборудования?

Max: У меня есть список из 11 китайских ускорителей, вам стоит подписаться на модель ускорителей SemiAnalysis, чтобы узнать больше. Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads — все эти чипы упоминаются в статьях и встречаются в коде. Запуск передовых моделей на отечественных ускорителях уже является национальным приоритетом Китая. Если мы в конце 2025 года еще будем называть Google передовой лабораторией, то теперь также нужно называть Moonshot передовой лабораторией.

Джордан: Кстати, мой отец сейчас в командировке в Китае, он говорит, что все отели забронированы, потому что Си Цзиньпин скоро выступит в этом регионе с речью о том, что ИИ — это первый приоритет Китая. Многое из того, что ты сказал, верно.

Harness — это сам продукт

Джордан: Самый большой вывод, который я сделал, используя эти модели, заключается в следующем: во-первых, все труднее различать разницу между использованием абсолютно передовых моделей в режиме max thinking и использованием средних усилий. В повседневных задачах я действительно не могу найти ничего, что эти модели не смогли бы сделать. Мое поведение по умолчанию — включать самый мощный и сложный режим, потому что мне не важен бюджет Дайлана.

Но есть один аспект: Harness сам по себе является частью продукта. Тестирование Kimi K3 заставило меня впервые серьезно рассмотреть Open Code, Hermes и Pi. Harness полностью остается частью продукта. Некоторые простые детали заставляют меня выбрать эту модель, а не другую: можно ли установить ее на удаленный SSH-сервер? Удобны ли горячие клавиши? Можно ли редактировать предыдущие команды? Эти мелкие детали в Harness фактически влияют на то, куда я отправляю токены, то есть куда направляю бюджет.

Max: Многие говорят о токен-бюджете, но из вашего описания рабочего процесса видно, что даже для задач, которые GLM может выполнить, вы всё равно предпочитаете направлять их в Fable с использованием Max Intelligence, потому что ROI оправдывает эту цену. Бенчмарки говорят, что многие задачи можно перевести на GLM, но вы всё равно предпочитаете оставаться на моделях Anthropic или OpenAI.

Джордан: В основном да. Но я использую множество Slack-ботов и не знаю, какие модели запущены за кулисами. Например, интеграция Slack от Perplexity — если она начинает перенаправлять запросы на K3, на GLM, на Sonnet, мне это на самом деле безразлично. Только когда я посмотрел на объем использования, я понял, какую долю занимают модели OpenAI, потому что это решение принимает сама система. Эта часть обоснования — это решение, принимаемое системой.

Макс: Это как раз точка входа для ценообразования на основе результата. Если какая-либо лаборатория использует ценообразование на основе результата, она может получить валовую прибыль выше 95%, потому что задачи, за которые вы готовы платить по стабильной цене, сегодня можно выполнить за копейки.

Джордан: Второй момент: я не считаю, что эти лаборатории исчерпали все идеи. Они могут продолжать обучать потрясающие модели для решения задач на кодовой стороне, но не выпускать их нам, сохраняя свою «постоянную нижнюю классовую структуру». Они могут продолжать дистилляцию, давая нам немного на пробу, одновременно исследуя другие направления, такие как генерация видео, аудио в аудио, глубокие исследования — всё это не слишком похоже на программирование. Робототехника и модели мира — это простое направление. А что, если Anthropic изменит свою цель с интеллектуального труда на физический? Я не верю, что они не могут построить устойчивый бизнес с хорошей рентабельностью, используя самые передовые технологии в мире.

Нам еще слишком рано

Макс: Даже не говоря об этом, я использую эти модели очень часто каждый день — мои друзья-программисты используют их в десять раз реже и тратят в десять раз меньше. Человек, использующий Fable, использует его столько же, сколько человек, использующий Sonnet, но тот, кто использует Fable, тратит в десять раз больше денег, с прибылью в 90%, что обеспечивает основную часть бизнеса. Как только эти люди начнут использовать более крупные модели и чаще, спрос только вырастет — модели даже не должны становиться лучше. Затем мне еще приходится общаться с соседями, которые не разбираются в технологиях — среди них я, вероятно, являюсь 0,1% или даже 0,01%, и потенциал роста может составлять в тысячу раз. Вернемся к «кривой индекса золотой утки» Маса-сана (Масаёси Сон).

Джордан: То, что она сказала о «слишком рано», абсолютно верно, и именно поэтому я считаю, что Kimi K3 не замедлит чистый прирост ARR Anthropic и OpenAI. Даже если часть пользователей, сегодня использующих Fable и 5.6, необратимо перейдут на Kimi K3, эти пользователи будут полностью затмеваться теми, кто еще не начал серьезно пробовать эту технологию. Эти люди ежедневно открывают новые высокорентабельные варианты использования и по-прежнему будут по умолчанию использовать 5.6 Soul или Fable 5 для раскрытия этих новых сценариев. Вы не увидите замедления темпов роста ARR.

Max: Подумай, сколько людей еще не подписаны на этот подкаст и не следят за SemiAnalysis. На прошлой неделе я был на ICML, а неделей ранее — на конференции AI Engineer, это формально AI-конференция, и более 80% людей никогда не слышали о SemiAnalysis. Ты утверждаешь, что работаешь в сфере ИИ, но даже не читал SemiAnalysis? Мы еще слишком рано.

Джордан: Это своего рода проверка твоего эго, Макс, успокойся.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.