MiniMax опубликовала первый полугодовой отчет после выхода на рынок акций Гонконга: выручка выросла на 283,1% до уровня, превышающего весь годовой доход 2025 года в 1,5 раза, валовая прибыль увеличилась на 464,8%. В августе ARR превысил 800 миллионов долларов США, доля B2B-доходов составила 80%, а объем потребления токенов в июле достиг 20-кратного уровня января. Основатель Янь Цзюньцзе предложил технологическую стратегию «минимизация затрат на вывод, максимизация интеллекта», с помощью собственной архитектуры MSA снизив стоимость вычислений на токен для длинных текстов в миллион слов до примерно 1/20 по сравнению с традиционным механизмом полного внимания, обеспечив баланс между интеллектом и стоимостью при ограниченных вычислительных ресурсах и создав новый путь для участия китайских крупных моделей в глобальной конкуренции.Автор статьи, источник: Zhixidong
26 августа Китайская ведущая компания в области крупных языковых моделей ИИ MiniMax (Xiyu Technology) опубликовала свой первый полугодовой отчет после выхода на рынок акций Гонконга.
Финансовый отчет показывает, что выручка MiniMax выросла на 283,1% в годовом исчислении, а полугодовая выручка уже достигла 1,5-кратного уровня всей выручки за 2025 год; валовая прибыль выросла на 464,8%.

На отчетной конференции основатель, председатель совета директоров, генеральный директор и технический директор MiniMax Янь Цзюньцзе сообщил, что в августе ARR MiniMax превысил 800 миллионов долларов США, доля B2B-доходов достигла 80%, а объем потребления токенов в июле составил 20 раз больше, чем в январе.
Помимо данных, меня заинтересовала фраза Янь Цзюньцзе, сказанная им на отчетной встрече вчера вечером: «Только минимизировав удельную стоимость интеллекта, можно максимизировать его уровень».
Стоит отметить, что за последние два года крупные модели следовали в основном двум путям: либо увеличивали параметры в соответствии с законом масштабирования, чтобы повысить интеллект, но это сопровождалось высокой стоимостью; либо снижали эффективность для доступности, но уровень интеллекта всегда оставался несколько ниже.
Отрасль, похоже, считает это взаимоисключающим.
Почему MiniMax выбрал путь, противоречащий отраслевой логике? Сможет ли этот путь привести к успеху?
Ум и стоимость — почему это трудно совместить?
Закон масштабирования определял повествование в области ИИ за последние несколько лет: чем больше параметров, тем выше интеллект.
Следуя закону масштабирования, параметры текущих моделей уже достигли уровня 2–3 трлн, и их интеллект значительно вырос, вызывая всеобщее восклицание о скором наступлении AGI.
За процветанием скрывается и опасность: когда модель достигает уровня триллионов параметров, стоимость вывода начинает становиться заметной.
Генеральный директор NVIDIA Хуан Ренсюнь заявил на конференции GTC 2026 года: «Эпоха, когда расходы на обучение были основным драйвером затрат, закончилась. Инференс — это текущая рабочая нагрузка, и она быстро расширяется».
Рост стоимости вычислений и рост нагрузки на агенты приводят к тому, что ИИ переходит от однократных вопросов и ответов к многоэтапному автономному выполнению. За одним запросом пользователя может стоять десятки甚至 сотни вызовов модели, что приводит к экспоненциальному росту счетов за вычислительные ресурсы во всей отрасли.
В результате отрасль постепенно разделилась на две стороны:
С одной стороны — небольшие модели с высокой скоростью и низкой стоимостью, но умеренной интеллектуальной производительностью.
Гугл — яркий пример этого подхода. В июле–августе 2026 года Google сразу выпустил три легковесные модели: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber.

3.5 Flash-Lite — это самый быстрый и наименее затратный модель в серии 3.5, разработанный для задач с высокой пропускной способностью и небольших задач в крупных системах AI-агентов. Использование токенов вывода в Gemini 3.6 Flash сократилось на 17% по сравнению с предыдущим поколением.
Но цена также очевидна. Google до сих пор не выпустил флагманскую модель Gemini 3.5 Pro, которая должна была быть представлена на конференции I/O в мае и до сих пор не появилась.
С другой стороны — крупные модели с высоким интеллектом, но дорогими затратами на развертывание и растущими издержками.
Китайские производители крупных языковых моделей активно движутся по этому пути. В июле 2026 года Moonshot AI выпустила Kimi K3 с объемом параметров около 2,8 триллионов, что делает ее самой крупной открытой моделью в мире на данный момент.
Алибаба сразу же выпустила Qwen3.8 Max с объемом параметров около 2,4 триллиона; Вэньсин от Baidu также достиг 2,4 триллиона параметров; DeepSeek V4-Pro имеет объем параметров 1,6 триллиона.
Повышение интеллекта за счет масштаба параметров заметно невооруженным глазом. Kimi K3 превзошел Claude Fable 5 и GPT-5.6 Sol по нескольким рейтингам агентов. Qwen3.8 Max описывается как «одна из моделей с наибольшим количеством параметров и наивысшей производительностью среди открытых моделей».
Но и стоимость также выросла.
Цены на API Kimi K3: ввод без кэширования увеличился с 6,5 юаня за миллион токенов до 20 юаней, вывод — с 27 юаней до 100 юаней, что составляет рост на 208% и 270% соответственно. Официальная рекомендация — развертывание суперузла с использованием 64 и более ускорителей.
Всего через два дня после запуска Moonshot announced приостановку подписки новых конечных пользователей и направила всю вычислительную мощность на обеспечение существующих пользователей.
Чем более передовые технологии искусственного интеллекта, тем больше параметров модели, тем дороже их вызов, тем выше барьеры для развертывания, тем больше дефицит вычислительных мощностей… Это кажется неразрешимым замкнутым кругом.
MiniMax, не делает выбора
В ответ на сложный выбор между стоимостью и интеллектом, MiniMax выбрал: я хочу всё.
Янь Цзюньцзе в целом четко изложил всю логику MiniMax на совещании по финансовым результатам:
Вычислительные ресурсы ограничены для каждой компании. Мы стремимся к достижению «Интеллект для всех» через принцип «Снизить стоимость вывода, максимизировать интеллект». Это наша постоянная технологическая стратегия и первоначальная миссия стартапа.
«Минимизируйте стоимость вывода, максимизируйте интеллект» означает «минимизировать стоимость вывода, максимизировать интеллект». MiniMax объединяет снижение затрат и повышение интеллекта в одну и ту же повествовательную рамку.
Почему эти два события можно упомянуть вместе? Потому что MiniMax по-другому понимает «рассуждение»:
Во-первых, рассуждение является средством производства для создания следующего поколения интеллекта.
Раньше считалось, что вывод — это «использование модели», а обучение — «создание модели». Однако сейчас ключевые этапы, такие как синтез данных, Rollout в обучении с подкреплением, оценка и верификация модели, взаимодействие агентов со средой, по сути, выполняют нагрузку вывода.
Доля пост-тренировочных этапов в общем объеме вычислительных мощностей для обучения все возрастает. Инференс уже не является задачей, возникающей только после завершения обучения, а представляет собой постоянные затраты в течение всего процесса обучения.
Таким образом, эффективность вывода определяет не только ценовой диапазон API, но и то, насколько далеко можно обучить следующее поколение моделей.
Во-вторых, оптимизация стоимости выводов является необходимым условием для интеллектуальной итерации.
Вычислительная мощность имеет физические пределы, в то время как масштаб моделей продолжает расти. Если стоимость вывода не снизится, то с каждым шагом вперед стоимость будет все сильнее сдерживать рост интеллекта.
В пределах ограниченного бюджета на вычислительные мощности, способность превратить каждый доллар в эффективный интеллектуальный результат определяет, насколько далеко сможет продвинуться итерация модели.
В-третьих, стремление к наивысшему уровню интеллекта при минимальных затратах на интеллектуальные ресурсы — это две стороны одной цели.
Раньше отрасль рассматривала «приоритет интеллекта» и «приоритет стоимости» как два разных подхода. Но если стоимость вывода не снижается, никакой высокий интеллект не сможет быть реализован.
Проще говоря, подход MiniMax заключается в том, чтобы рассматривать оптимизацию затрат и улучшение интеллекта как одно и то же. С первого дня разработки модели эффективность вывода становится ключевым показателем и учитывается на всех этапах разработки.
По словам Янь Цзюньjie: «MiniMax не стремится к компромиссу между интеллектом и стоимостью. Достижение более высокого уровня интеллекта — это цель, а постоянная оптимизация затрат и эффективности вывода для повышения соотношения цены и качества — это средство».
Стоимость вычислений снизилась в 20 раз: MiniMax превратила «снижение затрат и повышение интеллекта» в технологический цикл
MiniMax всегда придерживалась этой первоначальной идеи, создав надежную техническую основу.
Самое главное — это их собственная архитектура MSA (разреженное внимание). Проще говоря, она снижает вычислительную стоимость на один токен для текстов длиной в миллионы слов до примерно 1/20 от стоимости традиционной полной механизмы внимания, то есть M3 при контексте в 1M имеет вычислительную нагрузку на токен всего 1/20 от предыдущего поколения.

Ключ к этому прорыву заключается в том, что общее количество параметров определяет верхний предел знаний модели, но активное количество параметров определяет стоимость вывода на один токен. Эти два параметра можно декомбинировать: увеличение масштаба параметров не обязательно приводит к пропорциональному росту стоимости вывода.
Таким образом, M3 может повысить уровень интеллекта без изменения цены, а M3 Pro способен достигать объема параметров около 3 трлн, одновременно продвигая обучение с подкреплением и обучение длинным задачам.
На инфраструктурном уровне MiniMax достигает ETTR (пропорция эффективного времени обучения) 97% и является одной из первых независимых компаний в Китае, создавших масштабируемую и долгосрочно стабильную систему вычислительных мощностей для крупных моделей.
Сеть вычислительных мощностей построена за счет сочетания собственных кластеров, облачных провайдеров и сотрудничества с TokenFactory. Текущие и планируемые вычислительные мощности уже способны поддерживать непрерывную итерацию текстовых и видео-моделей объемом до 3 ТБ.
Заключение: При отсутствии преимуществ в вычислительной мощности, на чем основаны отечественные модели для догоняния?
Когда речь заходит о различиях между крупными моделями Китая и США, аппаратное обеспечение всегда остается неотъемлемой темой.
Раньше все считали, что тот, у кого более передовые технологии производства чипов и более высокая вычислительная мощность, сможет создать лучшую модель. Согласно этой логике, китайский ИИ, похоже, будет всегда отставать от американского ИИ на несколько месяцев до полугода.
Разве нельзя поступить иначе?
MiniMax предлагает новый путь: Minimize the Inference Cost, Maximize the Intelligence.
Снижение стоимости единицы вычислений также повышает потолок интеллекта. Поскольку сегодняшние пост-обучение, синтетические данные и обучение с подкреплением по сути выполняют нагрузки на вывод. Чем выше эффективность вывода, тем больше экспериментов можно провести при той же вычислительной мощности, и тем выше потолок интеллекта.
Тот, кто сможет производить более высокий интеллект с меньшими затратами, сможет продвинуться дальше в рамках ограниченных вычислительных ресурсов и позволить более высокому интеллекту проникнуть в более широкую сферу жизни.
Это, возможно, самый перспективный путь для китайских крупных моделей, участвующих в глобальной конкуренции. И MiniMax уже начала проверять это.
