MiniMax опублікувала перший піврічний звіт після лістингу на гонконгській біржі: дохід збільшився на 283,1% до 1,5 разів річного рівня 2025 року, прибуток зростився на 464,8%. У серпні ARR перевищив 800 мільйонів доларів США, частка B2B-доходів становить 80%, а в липні споживання токенів досягло 20-кратного рівня січня. Засновник Янь Цзюньцзе запропонував технічний напрямок «мінімізація витрат на висновок, максимізація інтелекту» — за допомогою власної архітектури MSA вартість обчислення токенів для довгих текстів у мільйони слів була знижена до приблизно 1/20 від традиційного механізму повної уваги, що дозволяє поєднати інтелект та економію ресурсів при обмежених обчислювальних потужностях і надає новий шлях для китайських великих моделей у глобальній конкуренції.Автор статті, джерело: Zhixidong
26 серпня китайська лідерська компанія у сфері великих моделей ШІ MiniMax (Xiyu Technology) опублікувала свій перший піврічний звіт після входу на гонконгську біржу.
Фінансовий звіт показує, що дохід MiniMax збільшився на 283,1% у порівнянні з попереднім періодом, а його піврічний дохід вже досяг 1,5 разів річного доходу 2025 року; валова прибутковість зросла на 464,8%.

На зустрічі з інвесторами засновник, голова ради директорів, генеральний директор та технічний директор MiniMax Янь Цзяньцзе повідомив, що у серпні ARR MiniMax перевищив 800 мільйонів доларів США, частка доходів від B2B досягла 80%, а кількість спожитих токенів у липні була в 20 разів більшою, ніж у січні.
Крім даних, мене зацікавило твердження Янь Цзюньцзе, яке він сказав на виступі щодо результатів минулої ночі: «Тільки мінімізувавши вартість інтелекту на одиницю, можна максимізувати рівень інтелекту».
Варто зазначити, що за останні два роки великі моделі дотримувалися майже двох шляхів: або накопичували параметри за законом масштабування, щоб збільшити інтелект, за ціну високих витрат; або знижували ефективність для доступності, але рівень інтелекту завжди залишався трохи нижчим.
Галузь наразі вважає це неможливим — не можна мати і те, і інше.
Чому MiniMax вибрав шлях, що суперечить індустріальній інтуїції? Чи зможе цей шлях виявитися успішним?
Інтелект та витрати: чому важко досягнути обох?
Закон масштабування керував нарративом штучного інтелекту за останні кілька років: чим більше параметрів, тим вищий інтелект.
Дотримуючись закону масштабування, параметри моделей зараз досягли рівня 2–3 Т, і інтелект моделей також значно зростав, викликаючи загальне захоплення на тему наближення AGI.
За процвітанням це правило закладає бомбу: коли модель досягає рівня трильйонів параметрів, витрати на виведення стають помітними.
Генеральний директор NVIDIA Хуань Ренсюнь заявив на конференції GTC 2026 року: «Час, коли витрати на навчання були основним драйвером витрат, минув. Висновок — це тепер основне завдання, і він швидко розширюється».
Зростання витрат на обчислення разом із зростанням навантаження на агенти робить штучний інтелект з одного запиту-відповіді перехідним до багатокрокового автономного виконання. За однією користувацькою заявкою може приховуватися десятки або навіть сотні викликів моделей, що призводить до експоненційного зростання рахунків за обчислювальні ресурси у всій галузі.
В результаті галузь поступово розділилася на дві групи:
З одного боку — невеликі моделі з високою швидкістю та низькою вартістю, але з середнім рівнем інтелектуальних здібностей.
Гугл є типовим представником цього шляху. У липні–серпні 2026 року Google одночасно запустила три легкі моделі: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та Gemini 3.5 Flash Cyber.

3.5 Flash-Lite — це найшвидша та найдешевша модель серії 3.5, розроблена для завантажень з високою пропускною здатністю та невеликих завдань у великих системах AI-агентів. Використання токенів виводу Gemini 3.6 Flash зменшилося на 17% порівняно з попереднім поколінням.
Але ціна це очевидна. Google до сих пір не випустив флагманську модель Gemini 3.5 Pro, яка мала бути представлена на конференції I/O у травні, але досі не з’явилася.
З іншого боку — великі моделі з високим рівнем інтелекту, але з високою вартістю розгортання та зростаючими витратами.
Китайські розробники великих моделей активно рухаються цим шляхом. У липні 2026 року Moonshot AI випустила Kimi K3 з параметрами обсягом приблизно 2,8 трильйона, що робить її найбільшою на сьогодні відкритою моделлю у світі.
Alibaba негайно випустила Qwen3.8 Max з обсягом параметрів близько 2,4 трильйона; Baidu Wenxin 5.0 також досягла 2,4 трильйона параметрів; DeepSeek V4-Pro має обсяг параметрів 1,6 трильйона.
Збільшення розміру параметрів призводить до очевидного зростання інтелекту. Kimi K3 перевершив Claude Fable 5 і GPT-5.6 Sol за кількома рейтингами агентів. Qwen3.8 Max описують як «один із найбільших за розміром параметрів та найпотужніших відкритих моделей».
Але витрати також зросли.
Ціни на API Kimi K3 зросли: вхідні дані без кешування з 6,5 юаня за мільйон токенів до 20 юанів, вихідні дані — з 27 юанів до 100 юанів, що становить зростання на 208% і 270% відповідно. Офіційна рекомендація — використовувати не менше 64 прискорювачів для розгортання супервузла.
Лише через два дні після запуску Moonshot оголосила про призупинення підписки нових користувачів C-рихунку, щоб усі обчислювальні потужності були спрямовані на забезпечення існуючих користувачів.
Чим передовіше штучний інтелект, тим більші параметри моделі, тим дорожче її виклик, тим вищі бар’єри для розгортання, тим більше дефіцит обчислювальних потужностей… Це здається нерозв’язним парадоксом.
MiniMax, не робить вибору
Щодо складної дилеми між витратами та розумним вибором, вибір MiniMax: я хочу все.
Янь Цзюньцзе на зустрічі з інвесторами чітко пояснив всю логіку MiniMax:
Обчислювальна потужність обмежена для кожної компанії. Ми прагнемо до досягнення «Інтелект для кожного» за допомогою принципу «Мінімізувати витрати на висновування, максимізувати інтелект». Це наша постійна технологічна стратегія та початкова мета підприємництва.
«Мінімізувати витрати на висновування, максимізувати інтелект» — це означає «мінімізувати витрати на висновування, максимізувати інтелект». MiniMax поєднує зниження витрат і підвищення інтелекту в одній історії.
Чому ці дві речі можна поєднувати? Тому що MiniMax має інше розуміння «міркування»:
По-перше, міркування є засобом виробництва наступного покоління інтелекту.
Раніше вважалося, що висновки — це «використання моделі», а навчання — це «створення моделі». Але зараз такі ключові етапи, як синтез даних, Rollout у підсиленому навчанні, оцінка та верифікація моделей, взаємодія агентів з середовищем, суттєво базуються на навантаженні висновків.
Післятренувальний етап все більше відсотків становить у загальній обчислювальній потужності тренування. Висновок — це не завдання, яке з’являється після завершення тренування, а витрати, що супроводжують весь процес тренування.
Отже, ефективність виведення визначає не лише простір ціноутворення API, а й те, на якому рівні можна навчити наступне покоління моделей.
Друге, оптимізація витрат на виведення є необхідною умовою для інтелектуальної ітерації.
Моцність має фізичні межі, тоді як розмір моделей безперервно зростає. Якщо витрати на виведення не знизяться, з часом вони будуть все більше перетягувати на собі розвиток інтелекту.
У межах обмеженого бюджету на обчислювальну потужність, чи зможете ви перетворити кожен долар на ефективний інтелектуальний вихід, вирішує, наскільки далеко зможе просунутися ітерація моделі.
Третє: використовуйте найнижчі розумні витрати, щоб досягти найвищого рівня розуму — ці дві речі є двома сторонами однієї мети.
Раніше індустрія розглядала «інтелект-першочерговість» та «вартісно-першочерговість» як дві різні стратегії. Але якщо витрати на висновки не можна знизити, навіть найвищий інтелект не зможе бути реалізований.
Просто кажучи, підхід MiniMax полягає в тому, щоб розглядати оптимізацію витрат і розумове удосконалення як одне й те саме. З першого дня розробки моделі ефективність виведення вважається ключовим показником і враховується протягом усього циклу розробки.
За словами Янь Цзюньцзе: «MiniMax не прагне робити вибір між інтелектом і витратами. Досягнення вищого рівня інтелекту є метою, а постійна оптимізація витрат та ефективності висновків — засобом для досягнення більшої цінності».
Витрати на обчислення зменшено в 20 разів: MiniMax створила технологічний цикл «зниження витрат та підвищення інтелекту»
MiniMax завжди дотримувалася цієї початкової ідеї, створивши технічну основу.
Найважливішим є його власна архітектура MSA (розріджена увага). Просто кажучи, вона знизила вартість обчислення на один токен для текстів довжиною в мільйони слів до приблизно 1/20 від традиційної повної механіки уваги, тобто M3 при контексті 1M має лише 1/20 обчислювальних витрат на токен порівняно з попереднім поколінням.

Ключ до цього прориву полягає в тому, що загальна кількість параметрів визначає верхню межу знань моделі, але активовані параметри визначають вартість виведення для одного токена. Ці два показники можна роз’єднати: збільшення розміру параметрів не обов’язково призводить до пропорційного зростання вартості виведення.
Отже, M3 може підвищити рівень інтелекту без зміни ціни, а M3 Pro може досягти рівня приблизно 3 трлн параметрів, одночасно просуваючи навчання з підсиленням та тренування довгострокових завдань.
На інфраструктурному рівні MiniMax досягає ETTR (відсоток ефективного часу навчання) 97% і є однією з перших незалежних компаній у Китаї, яка створила масштабовану та довгостроково стабільну систему обчислювальних ресурсів для великих моделей.
Мережа обчислювальних потужностей створена за допомогою комбінації самостійних кластерів, хмарних провайдерів та TokenFactory. Поточна та планова обчислювальна потужність уже може підтримувати постійну ітерацію текстових та відеомоделей розміром до 3 ТБ.
Заключення: Як вітчизняні моделі наздоганяють, якщо не мають переваги в обчислювальній потужності?
Коли йдеться про різницю між великими моделями Китаю та США, обладнання завжди є неподільною частиною обговорення.
Раніше всі вважали, що той, хто має більш передові технології виробництва чіпів та більшу обчислювальну потужність, зможе створити кращу модель. За цією логікою, китайський ШІ, здається, завжди буде відставати від американського ШІ на кілька місяців до півроку.
Чи не можна зробити нічого іншого?
MiniMax пропонує новий шлях: мінімізувати витрати на висновування, максимізувати інтелект.
Зниження вартості на одиницю обчислень також піднімає межу інтелекту. Бо сьогоднішні пост-навчання, синтетичні дані та підсилювальне навчання суттєво базуються на навантаженні висновку. Чим вища ефективність висновку, тим більше експериментів можна провести при тій самій обчислювальній потужності, і тим вищою є межа інтелекту.
Хто зможе отримувати більш високий інтелект з меншими витратами, той зможе розширити межі в межах обмежених обчислювальних ресурсів і дозволити більш високому інтелекту потрапити в більш широке життя.
Це, можливо, найбільш перспективний шлях для китайських великих моделей у глобальній конкуренції. І MiniMax вже почав це перевіряти.
