Zhipu запускає модель GLM-5.3-Flash на 100 000 вітчизняних чіпах, конкуруючи з NVIDIA

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Zhipu AI запустила модель GLM-5.3-Flash, яку вже розгорнуто на кластері більше ніж 100 000 вітчизняних чипів. Модель, раніше відома як Ox Alpha, досягає ефективності та вартості токенів NVIDIA GPU, отримавши 57 балів за Індексом штучного інтелекту AA. Вона пропонує нижчі ціни, ніж лідери ринку, і є першою нативною багатомодальною моделлю серії GLM-5. Дані ланцюга свідчать про зростаючий інтерес до інфраструктури ШІ, при цьому аналіз ланцюга підкреслює зсув у бік ефективних за вартістю вітчизняних рішень.
ZhiPu запускає нову модель GLM-5.3-Flash, яка раніше була безкоштовно доступна на тестовій платформі під ім’ям Ox Alpha і за 5 днів обробила понад 50 трильйонів токенів. Для інференсу моделі використовується більше 100 000 китайських чіпів, і ефективність апаратного забезпечення та вартість одного токена вже порівнянні з GPU від NVIDIA. За продуктивністю модель набирає 57 балів у загальному індексі AA, що відповідає рівню Claude Opus 4.8. Ціна становить 0,8 юаня за мільйон токенів на вхід і 2,8 юаня за мільйон токенів на вихід — значно нижче, ніж у конкурентів. Архітектура моделі використовує гібридний підхід з розрідженою та лінійною увагою і є першою нативною багатомодальною моделлю серії GLM-5. На тлі загального підвищення цін на китайські AI-моделі ZhiPu застосовує стратегію низьких цін для захоплення ринку.

Автор статті, джерело: LatePost

26 серпня Zhipu офіційно підтвердила: анонімна модель Ox Alpha (у китайській спільноті відома як «Нюйлай»), яка викликала широкий інтерес у спільноті розробників, є її останньою випущеною моделлю GLM-5.3-Flash. Назва моделі надихнута недавно вийшовим китайським фільмом «Нюйлай».

Ця модель була безкоштовно відкрита для тестування в анонімному режимі на OpenRouter та OpenCode до офіційного запуску, за 5 днів загальний обсяг токенів перевищив 50 трильйонів, побивши рекорди зростання трафіку на обох платформах, а зараз її використання перевищує вдвічі показники DeepSeek. Але справжньою причиною інтересу ринку став деталь, який пізніше розкрила Zhipu: весь цей трафік оброблявся виключно китайськими чіпами.

Чжіпін у своїх офіційних технічних документах зазначив, що для сервісу висновку цієї моделі використовується кластер понад 100 000 китайських чіпів, «ефективність апаратного забезпечення та вартість на один токен досягли рівня, подібного до популярних GPU від NVIDIA».

Дослідницький інститут напівпровідників SemiAnalysis відразу опублікував коментар у X: «Весь трафік обробляється китайськими чіпами, ефективність апаратного забезпечення та вартість на один токен вже порівнянні з GPU від NVIDIA. Після оголошення Jalapeño (внутрішній інференс-чіп OpenAI) вчора, CUDA-захисний рівень знову піддається випробуванню.»

100 000 китайських карт: від тестування до виробництва — Zhipu описала деталі розгортання цієї кластерної системи китайських чіпів у технічній документації.

Основним обмеженням однієї чіп-плати є обсяг та пропускна здатність пам’яті, особливо складно підтримувати довжину контексту до 1 мільйона токенів. Для цього Zhipu створила спеціалізований інжиніринговий рушій на основі SGLang, використовуючи квантування W8A8, змішане квантування кешу INT8/FP8/BF16, а також тензорне паралелізування всередині вузла, а також впровадила виробничу архітектуру Encode–Prefill–Decode (EPD) з розділенням: модуль кодування мультимодальних даних, попереднє заповнення prompt та декодування по токену були розділені на окремі робочі пули.

ZhiPu повідомляє, що продуктивність енд-ту-енд сервісу зросла втричі порівняно з початковою базовою лінією на тому самому обладнанні.

За інформацією LatePost, постачальниками цих чіпів можуть бути Huawei, Moore Threads та Hygon. Офіційно представники ZhiPu не коментували це, а в технічній документації не вказано конкретні моделі чіпів.

SemiAnalysis у коментарі особливо зазначив, що раніше існувала думка, що лише найкращі передові лабораторії мають обчислювальну потужність у розмірі 100 трильйонів токенів на день, «а тут 100 трильйонів токенів на день безкоштовного трафіку працюють виключно на китайських чіпах».

Сама модель: у порівнянні з DeepSeek, ціна становить 1/40 від ціни Claude Opus 4.8. Розмір параметрів GLM-5.3-Flash — 320 млрд загальних параметрів, 18 млрд активованих параметрів, що становить приблизно 40% від розміру параметрів попередньої флагманської моделі GLM-5.3 і майже дорівнює DeepSeek V4 Flash.

Щодо продуктивності, офіційні тести від Zhipu показують, що GLM-5.3-Flash набрав 57 балів за Artificial Analysis Intelligence Index (AA-індекс), що вище, ніж у попереднього флагманського моделі GLM-5.2, дорівнює показнику Claude Opus 4.8 від Anthropic і перевищує 53 бали офіційної версії флагманської моделі DeepSeek V4 Pro.

Щодо ціноутворення: введення 1 мільйона токенів GLM-5.3-Flash коштує 0,8 юаня, виведення — 2,8 юаня, ціна за спрацьовування кешу — 0,23 юаня, що становить десяту частину від ціни GLM-5.3. У перші два тижні після запуску діє знижка 50%.

ZhiPu зазначає, що ціна GLM-5.3-Flash становить 1/10 від ціни GLM-5.3, а в межах обмеженої знижки — 1/20 від ціни GLM-5.3, що в 40 разів менше, ніж Claude Opus 4.8.

Порівняно зі зміненою ціною DeepSeek V4 Flash (вхід 1,5 юаня, вихід 4,5 юаня), GLM-5.3-Flash у більшості звичайних сценаріїв використання дешевший.

Інновація в архітектурі: кількість параметрів і шарів майже зменшена наполовину. GLM-5.3-Flash використовує архітектуру, відмінну від GLM-5.3, що є ключовою причиною його здатності досягати вищої продуктивності за нижчою вартістю.

Порівняно з GLM-4.5, загальна кількість параметрів GLM-5.3-Flash подібна (355 млрд проти 320 млрд), але кількість активованих параметрів зменшилася з 32 млрд до 18 млрд, а кількість шарів скоротилася з 92 до 45 — майже вдвічі.

ZhiPu повідомляє, що GLM-5.3-Flash — це перша відкрита передова модель, що використовує гібридну архітектуру розрідженої та лінійної уваги. Порівняно з GLM-5.3, обчислення уваги та розмір KV-кешу зменшилися відповідно в 3,01 і 4,44 рази.

Крім того, ця модель є першою нативною багатомодальною моделлю серії GLM-5, яка підтримує введення зображень і відео, а також першою новою моделлю з багатомодальними можливостями, запущеною після того, як Zhipu зосередилася на стратегії кодування.

Випуск GLM-5.3-Flash відбувся після серії загальних підвищень цін на ринку китайських AI-моделей.

Ціна виводу Kimi K3 досягає 100 юанів за мільйон токенів, що більше ніж у три рази від попередньої моделі K2.6; після підвищення цін у першій половині року ціна виводу ZhiPu також досягла 28 юанів; DeepSeek V4 Pro збільшив ціну з 6 до 13,5 юанів, а в пікові години — до 27 юанів; ціна виводу DeepSeek V4 Flash зросла з 2 до 4,5 юанів, а в пікові години — до 9 юанів.

Прямим наслідком підвищення цін є витік попиту. «Ваньдянь ЛайХоу» зазначає, що після підвищення ціни на DeepSeek V4 Flash кількість запитів на платформі OpenCode зменшилася наполовину, і цей попит став новим простором для зростання китайських виробників моделей.

Стратегія ціноутворення GLM-5.3-Flash спрямована саме на цей розрив.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.