Автор: Stratechery
Перевод: Shenchao TechFlow
DeepChaо обзор: Kimi K3 вторгается на рынок когнитивных моделей — почему Уолл-стрит и Силиконовая долина реагируют чрезмерно? В этой статье разбирается, как после эпохи ChatGPT переход в эпоху агентов превратил токены из товаров в саму суть интеллекта — а в этой войне, где ключевую роль играет предельная стоимость, китайские открытые модели, хотя и кажутся бесплатными, на самом деле имеют высокие затраты на обслуживание. Паника в передовых лабораториях вызвана тем, что они еще не адаптировались к новым правилам игры, где доминирующим фактором становится не стоимость обучения, а масштаб вывода.
Я когда-то рассказывал историю о своём первом дне на курсе STRT-431 в школе бизнеса Келлогга — обязательном курсе для всех новых студентов MBA. Перелистывая учебные материалы и кейсы, я с разочарованием обнаружил, что в расписании нет ни одной технологической компании. Я побежал к профессору и спросил, почему так получилось. Ответ был следующим: цель этого курса — не изучать конкретную отрасль, а выявить универсальные принципы, применимые к любой компании и в любой отрасли.
Как я часто говорил, я был крайне недоволен этим ответом: на мой взгляд, суть технологий, особенно нулевые предельные издержки программного обеспечения и его распространения (и нулевые транзакционные издержки), принципиально отличаются. Подстановка нуля в формулу часто всё переворачивает. Но я быстро понял, что именно это и есть моя возможность. Ключевое понимание теории агрегации заключается в том, что нулевые предельные издержки приводят к цепочке создания стоимости, совершенно отличной от того, что люди когда-либо ожидали от интернета — в мире, где контроль над спросом важнее распределения предложения, вы увидите централизацию и масштабирование.
Однако интересно то, что древние универсальные принципы вновь выходят на первый план. Это особенно ярко проявилось на прошлых выходных, когда на X разгорелась острая дискуссия вокруг Kimi K3. Kimi K3 — это еще одна открытая модель, запущенная в Китае, чьи возможности приближаются к передовым уровням. Коротко: предельные издержки вернулись важным образом — как с точки зрения краткосрочного влияния бесплатных передовых моделей, так и с точки зрения долгосрочной структуры отрасли.
COGS и расходы на исследования и разработки
Одним из самых распространенных заблуждений относительно открытых весовых моделей является то, что они дешевле — или даже бесплатны. В конце концов, вы можете напрямую загрузить веса и избежать затрат времени, денег и усилий, необходимых для создания собственной модели. Это, конечно, верно, но здесь «бесплатно» означает сумму, которую вы тратите на исследования и разработки (R&D). Исследования и разработки — это фиксированные расходы, не зависящие от вашего дохода. Если вы потратили 1 миллион долларов на исследования и разработки, то независимо от того, получили ли вы доход в 100 тысяч или 1 миллиард долларов, вы все равно потратили 1 миллион долларов на исследования и разработки (это, конечно, влияет на вашу прибыльность).
Связано с доходом COGS — стоимость проданных товаров — и для ИИ это реальная величина, чего не было в программной индустрии долгое время. Конкретно, выполнение вывода на моделях — будь то Kimi или Fable — требует затрат, и ИИ-провайдеры тратят на вывод деньги, которые, по крайней мере, в большинстве бизнес-моделей, напрямую связаны с доходом. Воспользуемся приведённым выше примером: для получения дохода в 100 миллионов долларов может потребоваться COGS в 1000 раз больше, чем для дохода в 100 тысяч долларов. Конкретно, если стоимость токена для получения 1 доллара дохода составляет 50 центов, то доход в 100 миллионов долларов будет иметь COGS в 50 миллионов долларов, а доход в 100 тысяч долларов — только 50 тысяч долларов COGS.
Ключевой момент в отношении открытых весовых моделей заключается в том, что они не являются бесплатными услугами. Стоимость Kimi K3 составляет 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов. Это дешевле, чем у Sol — 5 долларов за миллион входных токенов и 30 долларов за миллион выходных токенов, но это может быть не правильный критерий оценки.
Токены и смарт-контракты
Генеральный директор NVIDIA Хуань Ренсюнь описал то, что NVIDIA строит, как «фабрику токенов», и с точки зрения NVIDIA это утверждение вполне обосновано. GPU NVIDIA не ориентированы на конкретные модели: они генерируют токены и делают это самым быстрым и эффективным способом. Это привело к появлению таких метрик, как количество токенов в секунду, время до первого токена, количество токенов на ватт, стоимость токена, и Хуань Ренсюнь считает, что эти метрики станут основой для принятия решений.
Эта модель имела смысл в первую эпоху ИИ — эпоху ChatGPT, когда токены напрямую доставлялись конечным пользователям. Однако вторая эпоха ИИ — эпоха рассуждений — нарушает этот подход к измерению. Рассуждения означают взрывной рост токенов цепочки рассуждений, и разные модели требуют различного количества токенов рассуждений для получения правильного ответа. Например,据报道, Kimi использует значительно больше токенов, чем Sol, что сводит на нет его ценовое преимущество. Агенты вводят аналогичную динамику: некоторые модели более эффективны с точки зрения количества токенов, необходимых для выполнения рабочих процессов агента.
Это означает, что токены не являются товарами. Основной признак товара — его взаимозаменяемость: один галлон нефти равен другому галлону нефти, одна тонна меди равна другой тонне меди, один бушель пшеницы равен другому бушелю пшеницы. Но токен одной модели отличается от токена другой модели. Взаимозаменяемым является то, что построено на основе токенов — то есть интеллект. Другими словами, если Kimi и Sol сгенерировали правильный ответ, то сам ответ взаимозаменяем. Разница в количестве токенов, необходимых для генерации правильного ответа, приводит к различиям в COGS.
Интеллектуальные COGS являются функцией нескольких различных факторов:
Занимаемое пространство модели: веса и состояние выполнения определяют, сколько дорогой памяти и ускорителей требуется для размещения каждой копии сервиса.
Inference efficiency: Architecture choices (e.g., Mixture of Experts models) reduce computational cost per generated token
Эффективность памяти: выбор архитектуры может снизить потребность в KV-кеше, позволяя обрабатывать больше одновременных запросов и повышая использование GPU
Efficiency: Batch processing, scheduling, prefix caching, and other inference optimizations maximize utilization and share work between requests
Token efficiency: the fewer tokens required to reach the correct answer, the lower the reasoning cost
Это важно, потому что мы быстро приближаемся к состоянию, при котором интеллект становится товаром для многих экономически полезных задач. Например, любой может создать базовое CRUD-приложение, используя модели от нескольких поставщиков. На товарном рынке путь к прибыли не лежит через установление более высоких цен — вы можете (или вскоре сможете) создать абсолютно одинаковое приложение с использованием нескольких моделей — а через обладание более выгодной структурой затрат.
Понимание товарных рынков
Здесь стоит разобрать механизм, поскольку, как я отмечал несколько месяцев назад в статье «Устойчивость Amazon», динамика товарных рынков не является普遍ной для специалистов в области технологий:
На товарных рынках все платят одну и ту же цену, потому что все продают одно и то же. Эта цена определяется спросом и предложением.
Спрос на товар является функцией ценовой эластичности: чем дешевле товар, тем выше спрос, и наоборот.
Предложение товара является функцией предельных издержек производства товара.
Важно понимать, что разные поставщики имеют разную предельную стоимость производства товаров. На практике это означает, что поставщик с наихудшей структурой затрат продает товары по своей предельной стоимости (если он еще способен производить). Прибыль всех остальных зависит от того, насколько лучше их структура затрат по сравнению с предельным поставщиком.
Например:
Поставщик A может производить 10 единиц товара по стоимости 10 долларов за единицу
Поставщик B может производить 10 единиц товара по стоимости 15 долларов за единицу.
Поставщик C может производить 10 единиц товара по стоимости 20 долларов за единицу.
Предположим, что ценовая эластичность обеспечивает спрос на 25 единиц товара при цене 20 долларов. Это означает:
Поставщик A продаст 10 единиц по 20 долларов, зарабатывая 10 долларов за единицу
Поставщик B продаст 10 единиц по 20 долларов, зарабатывая 5 долларов за единицу
Поставщик C продаст 5 единиц по 20 долларов США, получив 0 долларов США за единицу
Это не совсем точно: причина дефицита, которую несет поставщик C, заключается в том, что поставщики A и B могут немного снизить свои цены, что, конечно, влияет на спрос (эластичный), но это иллюстрирует проблему. У поставщика A хороший бизнес, у поставщика B неплохой бизнес, а поставщик C обанкротится.
Риск банкротства — это место, где фиксированные расходы вновь выходят на первый план: поставщик C несет как фиксированные расходы (например, возможные затраты на НИОКР), так и долг, взятый для финансирования оборудования, необходимого для производства товаров. Он не может учитывать эти расходы при ценообразовании — помните, цена равновесия на рынке близка к предельным затратам единицы с наивысшей стоимостью, удовлетворяющей спросу — но эти расходы могут абсолютно вытеснить поставщика с рынка. Если поставщик обанкротится, цены вырастут, пока другой поставщик не решит войти на рынок (или другой поставщик не расширится).
Smart Market
Давайте вернёмся к модели. Сейчас все вышеуказанные анализы не применимы, поскольку спрос на передовые модели превышает предложение, а предложение ограничено нехваткой вычислительных мощностей. Эта нехватка вычислительных мощностей означает не только, что поставщики вычислительных мощностей, такие как NVIDIA, могут получать очень высокую маржу, но и что клиенты NVIDIA, например SpaceXAI, могут перепродавать эти вычислительные мощности компаниям, таким как Anthropic, с высокой маржой. В то же время Anthropic может платить надбавку, поскольку они могут продавать токены с ещё более высокой надбавкой.
Однако дело не только в избыточном спросе, который обеспечивает Anthropic огромную прибыльность: Anthropic и OpenAI, вероятно, обладают самыми низкими затратами на единицу передового качества интеллекта благодаря возможностям моделей, масштабу сервиса и эффективности токенов. Они опережают конкурентов на несколько месяцев в предоставлении моделей определенного уровня способностей, одновременно применяя лучшие модели для оптимизации этих затрат.
Стоит также отметить, что рынок еще не рассматривает интеллект как товар: спрос сосредоточен исключительно на Anthropic и OpenAI, а спрос на менее качественные модели значительно ниже (поэтому SpaceXAI и Meta продают свои мощности Anthropic). Один из способов понять движущую силу оптимизации затрат — это рассматривать его как функцию работы, которая определяется уровнем интеллекта, позволяя покупателям интеллекта создать рынок, где интеллект становится товаром. Однако в долгосрочной перспективе любой, кто находится на переднем крае, будет обладать наибольшей способностью доминировать на не передовых рынках, которые представляют собой просто передовой край минус n месяцев — то есть те месяцы, в течение которых производители передовых моделей постоянно оптимизировали свои затраты на услуги.
Всё это говорит о том, что общая реакция на Kimi и китайские модели, на мой взгляд, чрезмерна, по крайней мере с экономической точки зрения. Сейчас существует ценовой коридор, являющийся следствием нехватки вычислительных мощностей. Я сильно сомневаюсь, что китайские модели предоставляют услуги дешевле на основе предельных затрат — они просто кажутся дешевле, потому что предложение от Anthropic и OpenAI настолько ограничено, что они взимают цены намного выше, чем если бы было достаточное предложение для удовлетворения спроса на интеллект.
Паника в лаборатории передового направления
Тогда почему производители моделей кажутся такими обеспокоенными китайскими моделями?
Во-первых, я считаю, что передовая лаборатория привязана к миру, в котором затраты на обучение доминируют в их финансовой модели. Пока обучение потребляет больше GPU, чем вывод, критически важно максимизировать доход от вывода, чтобы финансировать следующий цикл обучения, что означает установление очень высоких цен на вывод.
Однако, глядя в будущее, я ожидаю, что рост рынка выводов будет намного быстрее, чем рост затрат на обучение (что предполагает, что затраты на обучение продолжат стремительно расти), что означает, что они действительно могут компенсировать это за счет масштаба. Восемь месяцев назад было неясно, станет ли это реальностью, но разблокировка парадигмы агентов настолько велика, что передовые лаборатории должны быть более уверены в том, что они не только смогут выжить по более низкой цене, но и процветать (как только у них будет достаточно вычислительных мощностей).
Во-вторых, интеллект на самом деле не является идеальным товаром, частично потому, что применение интеллекта делает его более умным. Конкретно говоря, любой, кто запускает выводы, также собирает данные, которые используются для улучшения следующей итерации модели. С одной стороны, это еще одна причина, по которой передовые лаборатории снижают цены и увеличивают объем использования при увеличении вычислительных мощностей. С другой стороны, именно поэтому такие компании, как Microsoft, все больше увлекаются помощью компаниям в запуске собственных моделей. Если китайские модели являются жизнеспособной альтернативой, это становится еще более осуществимым.
В-третьих, передовые лаборатории могут не только выделиться среди китайских моделей, но и отличаться друг от друга, продолжая интегрироваться вверх в пользовательский опыт. Claude Code и Codex оказались удивительно востребованными. Какой бы инструмент вы ни начали использовать, скорее всего, именно его вы будете продолжать использовать, особенно для нетехнических пользователей. В долгосрочной перспективе эта необходимость движения вверх действительно означает, что передовые модели представляют прямую угрозу для поставщиков программного обеспечения, включая Microsoft. С другой стороны, насколько сильно компании, владеющие пользовательским опытом, смогут получить конкурентоспособные модели, настолько же они смогут противостоять вторжению передовых лабораторий.
Наконец, идеологическая позиция Anthropic особенно важна. Это компания, которая считает, что только она может быть доверена с ИИ, и существование открытых альтернатив с весами разрушает это предположение.
Мотивы Китая
Kimi — не единственная новая китайская модель. Bloomberg сообщает:
Акции Alibaba Group Holding Ltd. выросли на 5,4% в понедельник после того, как компания представила предварительную версию своей ключевой модели Qwen3.8 Max, назвав ее второй по мощности после Fable 5 от Anthropic. Это воскресное объявление последовало вскоре после выхода от стартапа Moonshot AI мощного нового продукта, который потряс рынок и вызвал опасения в США по поводу того, что Китай сокращает разрыв с такими мировыми лидерами, как Anthropic и OpenAI. Qwen3.8 Max имеет 2,4 триллиона параметров и вместе с Kimi K3 от Moonshot AI входит в категорию тяжеловесов. K3, обладающий 2,8 триллионами параметров, может конкурировать с лучшими продуктами, и Alibaba также поставила перед собой аналогичные высокие ожидания.
Разработчики теперь могут получить доступ к Qwen3.8 Max через платформу кодирования Alibaba (включая Qoder). Alibaba планирует вскоре открыть веса модели, расширив доступ за пределы предварительной версии. Интерес к этим китайским искусственным интеллектуальным системам и моделям настолько высок, что Yuechu вынужден приостановить прием новых подписок в воскресенье вечером из-за подавляющего спроса.
Акции Alibaba Group Holding Ltd. в понедельник поднялись до 5,4% выше, после того как компания представила предварительную версию своей ключевой модели Qwen3.8 Max, заявив, что она уступает только Fable 5 от Anthropic PBC. Это воскресное объявление последовало вскоре после выхода мощного нового продукта от Moonshot AI, который потряс рынок и вызвал опасения в США по поводу того, как Китай догоняет таких глобальных лидеров, как Anthropic и OpenAI. Qwen3.8 Max имеет 2,4 триллиона параметров и вместе с Kimi K3 от Moonshot входит в топ-класс. K3 имеет 2,8 триллиона параметров и сопоставим с лучшими продуктами; Alibaba также поставила перед собой такие же высокие ожидания.
Разработчики теперь могут получить доступ к Qwen3.8 Max через платформу кодирования Alibaba, включая Qoder. Alibaba планирует вскоре открыть веса модели, расширив доступ за пределы предварительной версии. Спрос на эти китайские искусственные интеллектуальные системы и модели настолько высок, что Moonshot была вынуждена приостановить прием новых подписок в воскресенье вечером из-за подавляющего спроса.
Стоит отметить, что веса Qwen3.8 Max также будут открыты. Alibaba прекратила публикацию весов своих ведущих моделей в начале этого года, но, похоже, изменила это решение; я подозреваю, что этот поворот связан с выступлением Си Цзиньпина по вопросам ИИ на прошлой неделе, в котором было усилено подчеркивание подхода с открытыми весами:
Мы должны придерживаться принципа открытости и взаимной выгоды, способствуя развитию за счет инноваций. Искусственный интеллект, выступая новым двигателем мирового экономического роста и ускорителем перехода к новым источникам роста, переходит из цифрового мира в физический. Мы должны воспользоваться этой уникальной исторической возможностью, поощряя открытость, сотрудничество и обмен. Мы должны содействовать технологическим инновациям в области искусственного интеллекта, развитию отрасли и его применению в реальных сценариях. Мы должны скоординированно продвигать модернизацию и трансформацию традиционных отраслей, развитие новых отраслей и перспективное планирование будущих отраслей, чтобы все сферы деятельности могли извлечь выгоду из искусственного интеллекта.
Китайская стратегия очевидна: коммерциализируйте свои дополнительные товары. Обратите внимание, что Си Цзиньпин прямо связал открытость с ИИ, «переходящим из цифрового мира в физический»; физический мир — это мир, которым руководит Китай, и лидерство Китая в таких областях, как робототехника, получит значительную выгоду от широко доступных моделей ИИ.
Точно так же Китай не хочет, чтобы США получили асимметричное преимущество в области ИИ; было бы еще лучше, если бы Китай мог ослабить передовые лаборатории США и одновременно усилить любых и всех потенциальных противников США, а также извлечь выгоду из инноваций, связанных с открытой экосистемой.
Проблема дистилляции
Также не стоит ожидать, что Китай предпримет какие-либо меры против атак на дистилляцию передовых лабораторий. Я считаю ошибочным приписывать все успехи китайских лабораторий исключительно дистилляции, но также ошибочно игнорировать, что дистилляция предоставила китайским лабораториям огромное преимущество. Это преимущество действительно проявилось за последний год, поскольку послеобучение с подкреплением стало все более важным для производительности моделей. Китайским лабораториям не нужно создавать среды для обучения с подкреплением с нуля — они могут просто использовать модели передовых лабораторий в качестве учителей, чтобы достичь быстрого улучшения при значительно более низких затратах (это не единственная причина более низкой стоимости разработки моделей в Китае, но одна из ключевых).
Интересно, что одним из самых важных применений китайских моделей на Западе является именно дистилляция. Например, только что выпустившая модель с открытыми весами Thinking Machines полагается на китайские модели для решения проблемы холодного старта в обучении с подкреплением. Дин Майер и Константин Бюлер опубликовали отличную статью в X, объясняющую, что дистилляция означает, что западные модели с открытыми весами фундаментально уступают китайским:
Дистилляция не объясняет всего преимущества Китая в области открытых моделей. Китайские лаборатории обладают мировым уровнем исследователей, большим объемом вычислительных ресурсов, мощными предварительно обученными моделями, совместной разработкой программного и аппаратного обеспечения, а также быстро растущими возможностями после обучения. Однако дистилляция сокращает дорогостоящий последний разрыв между мощными базовыми системами и системами, приближающимися к переднему краю. Даже если дистилляция составляет небольшую долю в общей способности китайских моделей, она играет значительную роль в их относительном преимуществе над американскими открытыми моделями.
Новые механизмы принуждения сделают масштабное дистиллирование для китайских компаний более сложным, медленным и дорогостоящим. Однако принуждение не может устранить дистиллирование, поддерживаемое государственными субъектами. Таким образом, каждое передовое достижение на Западе становится для китайских лабораторий еще одним учителем. Западным разработчикам необходимо самостоятельно воспроизвести эти возможности или ждать, пока не научатся на китайских моделях. Этот разрыв предоставляет китайским лабораториям повторяющееся структурное преимущество по сравнению с западными компаниями.
Это стоит повторить: поскольку производители моделей с открытыми весами в США должны соблюдать условия обслуживания передовых лабораторий, они (1) уступают китайским аналогам, (2) в конечном итоге получают дистилляты, которые лишь косвенно проходят через китайские лаборатории. Разве не лучше, если западные производители моделей с открытыми весами могли бы напрямую получать доступ к источнику?
В связи с этим возникает еще более интересный вопрос: почему это вообще плохо? Разве крупные языковые модели не являются просто дистилляцией всего знания, доступного в открытых интернет-ресурсах, собранного и дистиллированного передовыми лабораториями в модели, которые сейчас сами подвергаются дистилляции? Кто здесь пострадал?
На самом деле, этот парадокс и есть решение. Я верю, что открытые весовые модели способствуют инновациям (и, исходя из вышеизложенного, я считаю, что передовые лаборатории не пострадают), но зависимость от Китая — это проблема. США должны принять закон, (1) четко определяющий сбор данных для обучения моделей как добросовестное использование, и (2) запрещающий американским компаниям условия обслуживания, запрещающие дистилляцию. Запретить дистилляцию — то есть фактически запросы API — практически невозможно; США должны выбрать другой путь, предпочтя новую политику авторского права, которая защищает лаборатории и одновременно обеспечивает, чтобы знания, которые они приобретают, стимулировали дальнейшие инновации других.
Поводы для беспокойства
Вся статья стремится снизить чрезмерную реакцию на Kimi K3 и китайские модели с открытым весом; однако есть веская причина для беспокойства — кибербезопасность. Рассмотрите эту историю от The Stack:
Hugging Face сообщила, что её производственная инфраструктура была взломана «автономной» системой AI-агентов в начале прошлой недели. Первоначально команда безопасности платформы столкнулась с трудностями в реагировании на инцидент (IR) из-за неуказанных американских моделей LLM, «которые не могли различить реагирующих на инцидент и злоумышленников», — сказали они. В результате защитники Hugging Face переключились на использование открытой модели GLM 5.2 от китайской лаборатории Z.ai, запустив её на собственной инфраструктуре для анализа более 17 000 журналов или следов, оставленных злоумышленниками.
Для Hugging Face, штаб-квартира которой расположена в Нью-Йорке, это заметное публичное признание — компания позволяет пользователям сотрудничать над моделями, наборами данных и приложениями и достигла в этом лету вехи в 100 миллионов долларов ARR. В отчете о инциденте компания рекомендует защитникам «заранее подготовить мощную модель, способную работать на вашей собственной инфраструктуре [наш курсив], чтобы избежать блокировки барьеров и предотвратить утечку данных и учетных данных злоумышленников за пределы вашей среды».
Трудно переоценить, насколько ошибочной была реакция администрации Трампа на выпуск Fable компанией Anthropic, особенно поскольку она усугубила худшие тенденции Anthropic — предположение, что только они могут быть доверены для использования мощного ИИ. В мире, где существует только один ИИ, сохранение самых мощных возможностей кибербезопасности для правительства США и надежных союзников могло бы иметь смысл; однако это не мир, в котором мы живем.
Уже существуют и будут существовать модели, полностью способные атаковать существующую инфраструктуру в киберпространстве, и эти модели уже широко доступны. Лучшая защита — на самом деле единственная жизнеспособная защита — заключается в том, чтобы обеспечить защитникам доступ к лучшим моделям. Сейчас, из-за указа правительства Трампа, защитникам фактически запрещено использовать Fable или Sol для кибербезопасности; это означает, что лучшей альтернативой является использование моделей из страны, которая в течение многих лет пыталась ослабить наши киберзащиты. Это безумие!
Более разумный подход — четко сформулировать: во-первых, смягчить ограничения Fable и Sol в области кибербезопасности, во-вторых, обеспечить равные условия конкуренции для американских производителей моделей с открытым весом и китайских. Да, передовые лаборатории будут шуметь, но правительство должно осознавать, что подчинение их истерик привело к тому, что американские компании теперь зависят от Китая в области защиты. Пусть передовые лаборатории побеждают за счет лучшего выполнения своей работы; не позволяйте им определять безопасность или защиту и не позволяйте им убирать лестницу коллективного человеческого знания. Китай и так достаточно трудно конкурирует; позволить им взять на себя флаг открытости и инноваций — это полный отказ от нашего главного преимущества.
