Китайські AI-моделі стикаються з високими витратами незважаючи на високий рівень використання

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Китайські AI-моделі залишаються популярними, незважаючи на зростання витрат на експлуатацію, при цьому використання токенів триває вже дев’ять тижнів поспіль. Однак високі витрати та нестабільна робота погіршують їхню ефективність порівняно з GPT Codex. Вітчизняні моделі, такі як GLM-5.2 і Kimi, стикаються з обмеженнями квот та зниженням продуктивності у пікові години, тоді як Zhipu AI повідомила про збитки в розмірі 3 млрд юанів до 2025 року. Дані про інфляцію підкреслюють тиск на компанії, оскільки Китай відстає у розвитку обчислювальної інфраструктури — лише 449 центрів обробки даних порівняно з 5 427 у США. Індекс страху та жадоби для розробників AI свідчить про зростаючу стурбованість щодо довгострокової стійкості.
Хоча китайські великі мовні моделі штучного інтелекту мають лідерство у кількості запитів на дев’ять тижнів перед США, їх реальні витрати у високонавантажених сценаріях програмування значно перевищують пакети GPT Codex. ZhiPu зазнала збитків понад 3 мільярди юанів у 2025 році, а пакети Kimi та інших обмежені за обсягом та підлягають обмеженню під час пікових навантажень. Основна причина — недостатність інфраструктури обчислювальних ресурсів у Китаї (449 центрів обробки даних проти 5427 у США), що не дозволяє запровадити високоефективні пакети, подібні до Codex. Зараз розробникам потрібно зважувати на три виміри: продуктивність, ціну та стабільність. Китайські моделі лише в окремих показниках продуктивності наближаються до світових лідерів, а загалом стикаються з проблемою популярності без реального попиту.

Автор статті, джерело: FunTalk

За останній місяць сіліконова долина AI випустила кілька великих новин: GPT-5.6, fable5 та Grok-4.5.

На деякий час розробники та програмісти в країні захопилися, і різні обговорення та оцінки передових моделей, таких як GPT-5.6, поступово з’являлися.

Хоча цього місяця з’явився новий вітчизняний моделі, як Kimi-K3, загалом вітчизняні великі моделі залишаються у стані «хвалять, але не використовують» серед перших розробників.

За останніми даними, щодо використання: згідно з даними від 22 по 28 червня, тижневий обсяг використання китайських моделей становив 20,39 трильйона токенів, а американських — 4,25 трильйона, причому перші вже дев’ять тижнів поспіль лідирують.

Проте на тлі цього відзначається слабкий фінансовий результат шести китайських «AI-драконів» у сфері доходів: згідно з публічними фінансовими звітами, дохід Zhipu за 2025 рік становив 724 мільйони юанів, а збитки досягли 3 мільярдів юанів та більше; MiniMax — 79 мільйонів доларів США (приблизно 570 мільйонів юанів); інші чотири компанії, зокрема Moonshot, ще не оприлюднили повні річні доходи.

Навіть провідні компанії залишаються на рівні доходів у кілька сотень мільйонів юанів.

Навпаки, Anthropic, лідер серед компаній у сфері ШІ, досягла ARR приблизно в 60–70 мільярдів доларів США, основними драйверами якої є B2B API та сценарії AI-кодування.

Це викликає гостре питання:

Чому китайські моделі, які позиціонуються як «дешеві» та «з високою інтенсивністю використання», досі користуються схваленням, але не отримують широкого поширення, і все ще не можуть ефективно конкурувати з найкращими зарубіжними моделями у високодоходних сценаріях, таких як AI Coding?

Останнім часом, після глибокого обговорення цього питання з кількома провідними розробниками, я виявив дуже неочікуваний факт:

Вітчизняні великі моделі, у певному сенсі, дуже «дорогі».

Саме через таку «вищу» ціну деякі вітчизняні моделі, що досягли прориву у продуктивності, не можуть повністю продемонструвати свої сильні сторони.

01 Ілюзія «низької ціни»

Коли йдеться про китайські великі моделі, багато хто думає про такі представники, як DeepSeek і Kimi, і одним із найбільш тісно пов’язаних з ними ярликів є низька ціна, дешевизна;

Якщо дивитися лише на ціну за токен, вітчизняні моделі мають значну перевагу порівняно з такими лідерами, як GPT-5.6 та Fable 5. Наприклад, GLM-5.2 коштує 1,4/4,4 долари за мільйон токенів на вхід/вихід, а DeepSeek-V4-Pro — 0,435/0,87 долара; GPT-5.6 Sol — 5/30 доларів, Claude Fable 5 — 10/50 доларів.

Насправді це враження «низької ціни» — тривала помилка зовнішніх осіб.

Зокрема в умовах інтенсивного програмування ціна за одиницю вітчизняних великих моделей не лише не є перевагою, але й у кілька разів вища, ніж у GPT та Claude з пакетними тарифами.

Лі Гуан (псевдонім) — науковий працівник у галузі ШІ, який через вимоги роботи щодня витрачає десятки мільярдів токенів у сценаріях AI Coding. При такому рівні споживання використання китайських великих моделей, наприклад GLM-5.2, призводить до надзвичайно високих витрат.

Рахунок токенів, опублікований Лі Гуаном

У день розмови спожито майже 4 мільярди токенів Лі Гуаном. Якщо припустити, що він використовував GLM-5.2, витрати становлять приблизно: (86,39 мільйона звичайних вхідних даних × 1,4 долара + 3,38 мільярда кешованих вхідних даних × 0,26 долара + 19,06 мільйона вихідних даних та висновків × 4,4 долари) ≈ 1084 долари. За курсом 1 долар = 7,2 юаня, це становить приблизно 7800 юанів.

А причина, чому Лі Гуан так вільно витрачає токени, полягає в тому, що він оформив пакет GPT CodeX,

Тут просто пояснюємо, як саме працює пакет CodeX: коротко кажучи, це пакет, розроблений для сценаріїв програмування; строго кажучи, він не є справді безлімітним, а замість цього включає Codex у підписку ChatGPT: Plus — 20 доларів на місяць, Pro — від 100 доларів на місяць, ліміт приблизно у 5 або 20 разів більший, ніж у Plus; після вичерпання ліміту можна купити Credits для продовження використання.

Так само, Claude Code від Anthropic має схожі тарифи: Claude Pro — 20 доларів США на місяць, Max 5x і Max 20x — відповідно 100 і 200 доларів США на місяць; веб-версія Claude та Claude Code ділять ліміти — 5 годин і на тиждень, після вичерпання ліміту можна продовжити використання за цінами API.

За таких умов величезна вартість токенів зводиться нанівець.

Для розробників у Китаї щоденне споживання десятків або сотень мільярдів токенів у інтенсивних сценаріях AI-кодування — це звична практика.

Мало Люй також є запеклим розробником AI-кодування: на Codex він витрачає 300 юанів на тиждень, і це навіть без компенсації від компанії.

Але навіть така вартість значно дешевша порівняно з китайськими моделями, бо за ті самі 300 юанів неможливо купити стільки ж токенів, скільки дає GLM 5.2.

Рахунок токенів Сяо Ліу

З точки зору розробників у Китаї, пакет GPT Codex — це найдешевший токен, який можна купити зараз, він у кілька разів дешевший, ніж Zhipu або Kimi. Це може здатися протилежним логіці, але справа в тому, що китайські моделі повністю поступаються їм у співвідношенні ціна/якість у сценаріях інтенсивного кодування.

Варто зазначити: Codex не є безлімітним тарифом у справжньому сенсі; якщо розраховувати за найвищим тарифом у 200 доларів США, тижневий ліміт становить приблизно 2 мільярди.

Однак через те, що деякі розробники використовують моделі через «проміжні вузли» та інші методи, реальна вартість деяких моделей значно нижча, ніж за офіційними каналами, що призводить до того, що іноді можна купити більше токенів за нижчу ціну — саме тому виникає ситуація, коли за 300 доларів можна купити 12 мільярдів токенів.

Насправді, китайські моделі не запускали подібних пакетів, але якщо розглянути їх детальніше, такі пакети мають значні обмеження щодо лімітів порівняно з Codex.

02 Болі українського ціноутворення

Поточний стан ціноутворення китайських великих моделей можна описати одним реченням:

Ти думав, що потрапив на шведський стіл, але виявилось, що продавець все одно рахує за вагу.

Наприклад, щодо пакетів, у Китаї Kimi та GLM-5.2: Kimi Code доступні у чотирьох тарифах — 49, 99, 199 та 699 юанів, ліміти оновлюються щотижня; у GLM Coding Plan Lite, Pro, Max — приблизно 80, 400, 1600 запитів кожні 5 годин, щотижня — приблизно 400, 2000, 8000 запитів, а під час пікового навантаження GLM-5.2 споживання ліміту збільшується втричі.

Наприклад, з qoder від Alibaba: за словами одного зі мого друга, який працює з B2B-клієнтами (псевдонім Амі), «qoder колись був найкращим AI IDE в Китаї, але його нова цінова політика знищила його переваги».

Щодо пакетів: Qoder CN для окремих користувачів Pro та Pro+ коштують 59 та 169 юанів на місяць і включають 2000 та 6000 кредитів відповідно; версії Teams та VPC коштують 99 та 199 юанів на місце на місяць, обидві включають 3000 кредитів, причому версія VPC доступна від 50 місць.

Після того як вони об’єднали Lingma та налаштували ціни, з того, що мені відомо, щонайменше двадцять-тридцять компаній відмовилися від продовження підписки, — пізніше пояснив Амі.

За тестами Ami, пакет Qoder Enterprise Edition 199 використовується повністю за 3 дні за його способом використання; якщо використовувати його як важкий розробник, він, швидше за все, закінчиться за один день.

Так само щодо пакетів, GLM-5.2 викликає у внутрішніх користувачів змішані почуття.

За словами розробника Сяо Вей: «Пакети GLM-5.2 майже не існують; навіть якщо вони є, у пікові години все одно встановлюється обмеження трафіку, і ще й спостерігається підступність щодо користувачів.»

За матеріалами 36Kr: пакети GLM-5.2 раніше було важче купити, ніж квитки на концерт — вони оновлювалися щодня о 10:00, і успіх залежав від швидкості реакції.

У січні 2026 року Zhipu оголосило, що через дефіцит обчислювальних потужностей щоденний обсяг продажу було зменшено до 20% від початкового рівня: щодня о 10:00 випускається невелика кількість квот, які розкуповуються за кілька хвилин.

В кінцевому підсумку, скупість китайських моделей щодо пакетів і цін по суті є наслідком недостатньої обчислювальної потужності.

Згідно з даними Китайського інституту інформаційних телекомунікацій та Міністерства промисловості та інформатизації Китаю за 2025 рік, у Китаї наразі існує 449 центрів обробки даних, а в США — 5427. Щодо загальної обчислювальної потужності, у Китаї вона становить 1053 EFLOPS, а в США — 2400.

Але ключовим моментом є те, що у тих 2 400 EFLOPS у США частка високопродуктивних GPU дуже висока; у китайських обчислювальних потужностях велика кількість — це китайські чіпи, такі як Huawei Ascend та Cambricon, які мають поколінну різницю в продуктивності окремої карти порівняно з H100.

Щоб відповісти на зростаючий попит на обчислювальну потужність, з березня 2026 року Zhipu, Alibaba Cloud, Tencent Cloud та Baidu одночасно підвищили ціни на токени, збільшивши їх на 5–460%.

Просто кажучи, «низькі ціни» та «цінова війна» для китайських моделей вже минулими.

Не тому, що китайські моделі не хочуть робити буфет, а тому, що ми все порахували: за поточних витрат на обчислювальну потужність і втрат, пакет на місяць означає фіксовану щомісячну плату, яка виходить на те, що користувач не розіб’є систему. Але з урахуванням того, як китайські розробники і програмісти використовують десятки або навіть сотні мільярдів токенів щодня, така бізнес-модель швидко перетне лінію собівартості.

А програми для програмістів від OpenAI та Anthropic продаються корпоративним клієнтам з високим рівнем доходу — такі величезні клієнти, як Cursor та GitHub Copilot, можуть принести Anthropic до 1,4 мільярда доларів доходу на рік.

За підтримки високої обчислювальної потужності ця бізнес-модель суттєво полягає у обміні «фіксованої щомісячної плати» на «довгострокову утриманість клієнтів»: якість клієнтів висока, ARPU відносно високий, а витрати розподілені рівномірно.

Натомість, у країні, хоча є такі гіганти хмарних технологій, як Alibaba, проблема полягає в тому, що скоригований EBITA-маржинальний показник Alibaba Cloud за фінансовий рік 2026 становить лише 7,5%. Хоча група хмарних технологій має швидкий ріст доходів, її прибуток не є значним.

Крім того, традиційні хмарні провайдери наважуються продавати «хмарні сервери без обмежень», тому що користувачі не використовують їх на 100% протягом 24 годин. Один ECS може мати реальну завантаженість CPU лише 10%, тому хмарний провайдер може продавати одну фізичну машину десяти користувачам.

Але висновки великих моделей інші: кожен токен вимагає реального витрачання обчислювальних потужностей GPU. Якщо користувачі безперервно генерують контент протягом 24 годин, витрати хмарного провайдера на HBM-пам’ять, ядра GPU та електроенергію є жорсткими — немає жодного простору для перевищення навантаження.

03 Золотий трикутник моделі

Крім факторів ціни, причиною вибору Codex та Claude Code українськими розробниками є їхній потужний програмний інструментарій.

Однак щодо продуктивності китайські моделі не є такими, як про них існують певні стереотипи.

Після спілкування з кількома розробниками, автор виявив загальну думку: китайські великі моделі, зокрема останні моделі, такі як GLM-5.2, вже можуть виконувати деякі допоміжні та другорядні завдання, наприклад, тестування та виправлення помилок.

Але щодо більш складних, тривалих асинхронних завдань, сучасні китайські моделі все ще мають значну різницю в порівнянні з лідерами, такими як GPT та Claude.

Розробник Чжан, у березні цього року використовував китайську модель для програмування, порівнюючи GLM, Qwen і GPT для однієї й тієї ж задачі; лише GPT успішно завершив її та відповідав вимогам сторінки — це був проект з порівнянням багаторівневого, багатостовпцевого вмісту та генерацією результатів.

Інший розробник Сяо Вей зазначила, що за її досвідом продуктивність Kimi 2.7 і DouBao 2.1 Pro також задовільна, але в цілому вони на рівень слабші (належать до другого ешелону), проте все ж перевершують Claude Sonnet 4.6.

На даний момент у розробницькій спільноті загальна згода полягає в тому, що GLM-5.2 — це перша китайська модель, яка досягла рівня Opus.

Він доступний і займає місце під час виконання реальних, складних, довготривалих асинхронних завдань.

Хоча з багатьох аспектів, наприклад, світових знань, він все ще значно відрізняється від справжньої моделі Opus, це не заважає йому стати новим рівнем для китайських моделей.

Але реальність така: це лише на початку розвитку, і кілька «відмінників» були знищені іншими факторами, що не пов’язані з продуктивністю.

Зокрема, такі фактори, як низька ефективність кешування та збереження обмежень у пікові години, роблять реальний досвід розробників поганим.

Це вводить ще один аспект порівняння моделей на даний момент: стабільність.

У досвіді розробників і програмістів на передовій вибір моделі вже не є просто порівнянням продуктивності, а —

Золотий трикутник: продуктивність — ціна — стабільність.

У цих трьох вимірах вітчизняні моделі змогли отримати лише частину показників першого виміру.

Недавно китайська компанія Kimi випустила свій останній флагманський моделі K3: це відкритий флагманський моделі з 2,8 трильйона параметрів, нативною мультимодальністю та контекстом у 1 000 000 токенів, спрямований на довготривале програмування, роботу зі знаннями та глибоке міркування.

У багатьох тестах її інтелектуальний індекс на Artificial Analysis становить 57 балів і посідає третє місце у світі; з 1679 балами вона посідає перше місце в рейтингу передньої програмної інженерії Arena, і навіть існують чутки, що її продуктивність вже порівнянна з Claude Fable 5.

Однак за яскравими оцінками та рейтингами розробники найбільше хвилює одне слово: співвідношення ціни та якості.

Після запуску K3 багато розробників зазначили, що Kimi залишається дуже дорогим, не має співвідношення ціна/якість порівняно з Codex, і обсягів недостатньо. Лише з точки зору цін на API, K3 не можна назвати «дешевим»: вартість за мільйон токенів для кешування/вводу/виводу становить 2/20/100 юанів; GPT-5.6 Sol — 0,5/5/30 доларів США; хоча K3 дешевший за Sol, він значно дорожчий за GPT-5.6 Luna — 0,1/1/6 доларів США.

Під час використання K3 розробники зазначили, що виникали перерви в підключенні API, навіть цілий ранок.

На даний момент китайські розробники не відмовляються платити за локальні моделі — просто зараз через дефіцит обчислювальних ресурсів і високі витрати вони не можуть дозволити собі пакети на кшталт Codex, які мають високу співвідношення ціни та якості, і змушені обирати пакети, які зовні схожі на «шведський стіл», але насправді мають обмеження (наприклад, Coding Plan від Zhipu).

Нестабільна якість досвіду та невизначена співвідношення ціни та якості пакетів призводять до того, що користувачі важко залишаються після використання. Це, по суті, раціональний вибір користувачів на тлі високих витрат на базову потужність обчислень у поточний період.

Це не означає, що ми хочемо підсилювати впевненість інших та зменшувати власну, а лише звертаємо увагу на ризик.

Наразі китайські моделі, прагнучи наздогнати GPT та Claude, дуже акцентують увагу на продуктивності, але шлях від розробки до застосування китайських великих моделей вимагає подолання не лише цієї однієї гори.

Нам потрібно чекати, поки вітчизняна база обчислювальних потужностей не буде масово вироблятися і не створить синергію в технологіях, цінах та стабільності — тоді наш продукт зможе виправдати очікування користувачів.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.