Дев’ять головних моделей ШІ запущено за один місяць, що свідчить про початок ери «одноразовості»

iconMetaEra
Поділитися
AI summary iconКороткий зміст
У липні 2026 року на ринок вийшли дев’ять ключових моделей ШІ, зокрема Tencent Hunyuan Hy3, Kimi K3 та Qwen3.8-Max. Швидкі випуски свідчать про посилення конкуренції та швидший інноваційний розвиток. Kimi K3 посів перше місце у лідерах frontend Code Arena, тоді як Hy3 використовував менше активних параметрів. Ціни та продуктивність коду тепер мають таке ж значення, як і сира потужність. Трейдери стежать за тим, як ці зміни впливають на індекс страху та жадоби та провідні альткоїни.
Термін придатності «найпотужнішої моделі» скорочується.

Автор статті, джерело: Дінцзяо

За місяць було одночасно запущено дев’ять флагманських моделей, що не є поширеним явищем у галузі великих моделей.

З початку місяця, коли Tencent Huanyuan Hy3 випустив офіційну версію та відкрив код, до кінця місяця, коли Anthropic випустила Claude Opus 5, по черзі з’являлися такі моделі, як Kimi K3, Qwen3.8-Max (попередня версія) та Grok 4.5. Липень став рідкісним піком випусків за останній рік.

Різні виробники вибирають різні моменти для запуску. Деякі виробники випускають продукти після оновлення конкурентів, інші — навколо Всесвітнього конгресу штучного інтелекту, а також є виробники, які реагують на ринкову конкуренцію шляхом корекції цін.

Але липень відрізняється не лише кількістю запусків моделей, а й двома важливими змінами, які вони відображають.

По-перше, розрив у здатностях між моделями скорочується. Останній загальний індекс інтелекту від Artificial Analysis показує, що різниця між лідерськими моделями значно зменшилася. Зі швидкими ітераціями версій позиція «найпотужнішої моделі» стає все складнішою для тривалого утримання, і компанії починають шукати переваги у різних завданнях, а не прагнути до абсолютного лідерства в одному вимірі.

Друге, відкриті моделі входять до першої ліги. Серед нових моделей, випущених у липні, Tencent Hunyuan Hy3, Kimi K3 та інші обрали відкриті ваги (відкриті параметри моделі, що дозволяють розробникам завантажувати та розгортати їх самостійно). Зокрема, Kimi K3 посідає перше місце у рейтингу фронтенд-програмування Code Arena, обійшовши GPT-5.6 Sol та Claude Fable 5. Протягом останніх двох років відкриті моделі сприймалися переважно як підслідники закритих моделей, але ця хвиля конкуренції показує, що відкриті моделі вже почали безпосередньо конкурувати з закритими моделями у певних розробницьких сценаріях.

Тоже, які зміни та що означає цей місяць інтенсивних випусків?

01. Більше не тільки порівнюється, хто розумніший

Протягом останніх кількох років індустрія великих моделей здебільшого змагалася за загальні здібності — хто мав ширший кругозір і хто давав більш точні відповіді. Але зараз виміри конкуренції змінилися.

На цьому етапі навички програмування стали найбільш очевидним напрямком боротьби.

OpenAI продовжує підсилювати програмування та складні міркування, а також постійно розширює екосистему Codex, сподіваючись зв’язати розробників за допомогою інструментів. Anthropic робить ставку на розуміння коду та аудит безпеки, допомагаючи розробникам вирішувати складні інженерні завдання у великих проектах. Grok 4.5 зосереджується на швидкості та низькій вартості та інтегрований з інструментом AI-програмування Cursor, охоплюючи повсякденні сценарії розробки.

Дослідник великих моделей Яо Юйхань сказав «Дінцзяо One», що всі компанії активно інвестують у програмування, і розрив швидко скорочується — наприклад, здатність Kimi K3 до написання коду значно покращилася і наближається до рівня лідерів серед закритих моделей.

Джерело зображення / pexels

Агенти — це ще один напрямок, за який борються всі компанії. GPT-5.6 Sol у поєднанні з Codex досліджує автоматизоване програмування, Opus 5 зосереджується на виконанні довготривалих завдань, Kimi K3 демонструє здатність до безперервного виконання складних завдань, а Tencent Hunyuan Hy3 намагається поєднати екосистему WeChat для дослідження застосувань агентів.

Але агенти на практиці все ще не дозріли. Незалежний розробник Бейчен зазначив, що поточні слабкі місця деяких продуктів інтелектуальних агентів полягають не в здатності використовувати інструменти, а в здатності планувати завдання. Наприклад, режим Ultra Codex запускає багато підагентів, які одночасно читають один і той самий файл і виконують подібний аналіз, що призводить до збільшення споживання токенів, але реальна ефективність роботи не зростає. За його думкою, підвищення здатностей інтелектуальних агентів не може залежати лише від збільшення кількості підагентів — ключовим є здатність визначати, які завдання варто аналізувати, а які кроки можна опустити.

Думка Яо Юханя схожа. Він вважає, що агенти — це найбільш перспективний напрямок наразі, але вони ще не досягли справжньої зрілості. За його думкою, у вертикальних галузях, таких як охорона здоров’я та фінанси, у агентів залишається великий потенціал; ключовим фактором, що визначить розрив на наступному етапі, буде не лише здатність моделей, а й те, наскільки зручними є агенти у конкретних сценаріях і чи готові клієнти за них платити.

Китайські моделі шукають прориви шляхом покращення різних здібностей. Kimi K3 зосередився на підсиленні довгого контексту, фронтенд-програмування та здібностей до дизайну продуктів, зайнявши провідні позиції в кількох тестах з програмування та наблизившись за здібностями до закритих флагманських моделей за кордоном.

Конкуренція між розміром параметрів та ефективністю висновку також стала іншою основною лінією.

У липні було випущено кілька моделей з параметрами в трильйони і навіть десятки трильйонів, але розмір параметрів більше не можна просто зводити до рівня здібностей. З розвитком архітектури MoE моделі можуть мати більшу параметричну ємність, одночасно активуючи лише невелику її частину для виведення, що знижує реальні обчислювальні витрати.

Галузь сформувала два напрямки: перший — продовжувати розширення масштабів, використовуючи більші параметри для отримання більшої потужності; другий — зосередитися на ефективності, досягаючи результатів, близьких до флагманських моделей, за допомогою менших активованих параметрів.

Ціна також стала найбільш прямим фактором у конкуренції моделей у липні.

Зарубіжні виробники більше схиляються до диференційованої стратегії ціноутворення. OpenAI вирішила додатково сегментувати ринок, розділивши GPT-5.6 на різні версії, щоб користувачі могли вибирати модель відповідно до складності завдання; Anthropic продовжує підтримувати стратегію високопродуктивних флагманських моделей, охоплюючи високодоходні розробки та корпоративні сценарії за допомогою серії Opus; Grok 4.5, навпаки, застосовує стратегію низьких цін — його вихідна ціна становить лише чверть від ціни серії Opus, а також приваблює розробників завдяки інтеграції з Cursor.

Вітчизняні виробники зосереджуються на перевагах у витратах. За останні шість місяців кілька вітчизняних компаній, що розробляють моделі, постійно знижували ціни на API, намагаючись знизити бар’єри для входу за допомогою низьких витрат і розширити кількість розробників та корпоративних користувачів.

Одним реченням: у липні конкуренція між великими моделями розширилася зі звичайного порівняння окремих здібностей на кілька вимірів — код, агенти, ефективність параметрів і ціна.

02. Хто перевищив очікування, а хто отримав поділених відгуків?

З урахуванням змін порівняно з попередніми версіями, результатів у рейтингах та відгуків розробників, рівень моделей, випущених у липні, можна умовно поділити на три категорії.

Спочатку розглянемо ті, що перевершили очікування: Kimi K3, Grok 4.5, Hunyuan Hy3.

Найбільш уваги привертає Kimi K3. Ця модель використовує архітектуру MoE, загальний обсяг параметрів якої досягає трильйонів, з акцентом на підсилення довгих контекстів, фронтенд-програмування та дизайну продуктів. У день випуску Kimi K3 зайняв перше місце в рейтингу фронтенд-програмування Code Arena з результатом 1679 балів, піднявшись на 17 позицій порівняно з 18-м місцем попередньої версії Kimi K2.6. Через тиждень у загальному рейтингу Arena Kimi K3 вперше потрапив у топ-10 світу.

Але Kimi K3 також має чіткі межі здібностей. У тесті на надійність знань Artificial Analysis коефіцієнт галюцинацій зрос з 39% у Kimi K2.6 до 51%, а швидкість виведення становить приблизно 33 токени/с, що значно нижче, ніж у подібних моделей.

Практичний досвід розробників також підтверджує цю «односторонність». Бейчен вважає, що Kimi K3 справді значно покращився порівняно з попередньою версією, і його переваги зосереджені в основному на фронтенд-розробці, дизайні інтерфейсу та продуктовій експресії. Наприклад, у завданнях щодо оптимізації UI веб-сайту або дизайну інтерфейсу додатків, Kimi K3 дає кращі результати, але під час роботи зі складними інженерними завданнями його продуктивність нестабільна.

Джерело зображення / pexels

Також увагу привертає Grok 4.5. Після запуску 9 липня він потрапив у топ-показників інтелектуального індексу Artificial Analysis та відзначився в тестах виклику інструментів, ставши вибором із високою співвідношенням ціни та якості для багатьох розробників.

Північний міст відчуває те саме і вважає, що найбільша перевага Grok 4.5 — це швидкість: на той самий запит можна витратити лише три-п’ять хвилин, тоді як GPT-5.6 іноді вимагає двадцяти хвилин або навіть півгодини. Крім того, через нижчу ціну він ідеально підходить для ситуацій, коли потрібні швидкі розробки. Яо Юхан вважає, що програмні здібності Grok 4.5 були спеціально оптимізовані, і разом із Cursor вони забезпечують чудовий досвід. На тлі цього SpaceX раніше оголосила про придбання материнської компанії Cursor — Anysphere, і угоду очікують на завершення у третьому кварталі; також вважається, що співпраця xAI з Cursor допомогла оптимізувати досвід програмування Grok 4.5.

Hunyuan Hy3 означає прорив у напрямку ефективності. Ця модель має загальну кількість параметрів 295 млрд, з яких активовано лише 21 млрд, і при розмірі менше ніж одна п’ята параметрів флагманської моделі досягає результатів, близьких до більш масштабних конкурентів на кількох відкритих тестах. Однак у SWE-Bench Pro розрив між результатом Hunyuan Hy3 — 57,9 бала та Claude Opus — 69,2 бала є помітним, що свідчить про те, що здатність до складного виправлення коду ще потрібно покращувати.

Яо Юйхан вважає, що Хуньюань Hy3 має прогрес порівняно з попередніми моделями Tencent, а також відкрите джерело та компактний розмір роблять його хорошим вибором серед моделей середнього розміру.

Знову розглянемо ті, що стабільно залишаються в першій групі, але з обмеженими сюрпризами: GPT-5.6 Sol і Claude Opus 5.

GPT-5.6 Sol і Claude Opus 5 зберігають позиції в першій групі, але не принесли значних змін. GPT-5.6 Sol підвищив здатності до складного міркування та програмування агентів, досягнувши 88,8% у тесті Terminal-Bench 2.1 (бенчмарк для оцінки здатності моделей виконувати реальні завдання в середовищі командного рядка), а в режимі Ultra цей показник збільшився до 91,9%. Claude Opus 5 зберігає перевагу у складних завданнях, зосереджуючись на надійності моделі в сценаріях, пов’язаних із складним інженерним проектуванням, розумінням коду та аналізом безпеки. Перевагою Opus 5 є продуктивність, близька до Fable 5, при ціні лише половину від неї.

Обидві моделі залишаються в першій лінії, але не принесли значних проривів.

Північний місто зазначив, що GPT-5.6 вже може задовольнити більшість його повсякденних розробницьких потреб, але при зіткненні з особливо складними проблемами він використовує Opus 5. Однак більш високі здібності означають і більш високі витрати. Для нього Opus 5 виступає як «експерт», яким звертаються для вирішення ключових питань.

Останнім є клас із різноманітними відгуками, який ще потребує підтвердження: Gemini 3.6 Flash та попередня версія Qwen3.8-Max.

Найбільш типовим є Gemini 3.6 Flash. Він отримав 50 балів у рейтингу Artificial Analysis, що дорівнює попередній версії 3.5 Flash. Розробницька спільнота в цілому вважає, що ця версія не має значних покращень порівняно з попередньою і поступається за продуктивністю конкурентам того ж періоду. Однак деякі вважають, що як легковажна модель, якість виводу Gemini 3.6 Flash в цілому задовільна.

За думкою незалежного розробника Капдіма, Gemini 3.6 Flash добре підходить для повсякденного використання: хоча його програмні здібності не видаються видатними, його багатомодальне розуміння залишається досить сильним. Він підтримує введення файлів будь-якого формату, а стиль і досвід повсякденного чату кращі, ніж у багатьох конкурентів.

Після запуску попередньої версії Qwen3.8-Max у липні, ефективність моделі була нестабільною, а ринкова відповідь відрізнялася. Найбільшим враженням Бейчена була глибина міркувань попередньої версії Qwen3.8-Max, але іноді вона заглиблювалася у довготривалі міркування, «наче сама себе заплутала», але нарешті не надавала ефективного рішення. Капдім вважає, що попередня версія Qwen3.8-Max не відповідає очікуванням: під час тестування за допомогою власного набору оцінок з фронтенд-естетики він виявив значну різницю між реальними можливостями та оголошеними. Як продукт, який ще перебуває на стадії налаштування, кінцевий результат потрібно буде перевірити після запуску офіційної версії.

У липні не з’явився жоден модель, яка б поступалася у всіх вимірах; різні моделі почали розподіляти обов’язки навколо конкретних сценаріїв.

Наприклад, Північний міст вибирає інструменти залежно від завдання: GPT-5.6 відповідає за щоденну розробку, Grok 4.5 — для швидкого виконання вимог, Kimi K3 — для продукту та фронтенд-сценаріїв, а Claude Opus 5 — для вирішення складних проблем. Підхід Капдіма інший: він використовує моделі Claude Fable 5 або Opus 5 для планування, а потім виконує їх за допомогою GPT-5.6 Sol.

03. Випуск стає все швидшим, суперечки між відкритим та закритим кодом посилюються

За цією серією інтенсивних запусків стоять кілька питань, які варто проаналізувати: чому ітерації моделей стають все швидшими, чому вони зосереджуються саме на липні та чому відкрите програмне забезпечення впливає на існуючі бізнес-моделі.

Спочатку підхід до ітерації моделей змінюється. Раніше підвищення здатностей великих моделей здійснювалося переважно шляхом переосвіти більш масштабних моделей, що вимагало довгих циклів і високих витрат. Але з поширенням технологій підсиленого навчання та пост-навчання (оптимізація продуктивності моделі після завершення базового навчання за допомогою тонкої настройки, підсиленого навчання тощо) оновлення моделей все частіше засноване на оптимізації після навчання.

Яо Юйхан сказав «Дінцзяо One», що за останні два роки швидкість випуску моделей значно зросла, і важливою причиною цього є те, що галузь освоїла більш досконалі методи після навчання. Зараз багато покращень моделей не вимагають перенавчання, а здійснюються шляхом подальшої оптимізації вже існуючих базових моделей за допомогою підсиленого навчання, самоітерації та інших методів.

Це означає, що цикл конкуренції між моделями скорочується. Раніше лідируюча модель могла зберігати перевагу протягом кількох місяців; зараз вік переваги, забезпечений оновленням версії, може тривати лише кілька тижнів. Якщо темп випуску не встигає, модель швидко буде витіснена новою версією. Для виробників випуск моделі — це не просто демонстрація технологій; саме час випуску стає частиною конкуренції.

Джерело зображення / pexels

Крім того, липень — це період накладання кількох ключових подій. Для китайських виробників Всесвітній конгрес штучного інтелекту (WAIC) проходить у липні, і компанії зосереджують публікацію моделей та демонстрацію технологічних досягнень саме в цей період. Для зарубіжних виробників багато провідних компаній також обирають цей етап для оновлення моделей, щоб зайняти провідну позицію в екосистемі розробників та комерційній конкуренції.

Крім того, правила конкуренції в галузі змінюються. Сила моделі більше не є єдиною метою — конкуренція розширилася на те, як моделі використовуються та як вони перетворюються на дохід.

Тому в липні знову посилився спір між відкритим та закритим кодом. Довгий час між відкритими та закритими моделями існувала різниця в можливостях. Але з появою деяких відкритих моделей у першій лізі виникло більш реальне питання: чи не буде зменшено доходи від викликів API та підписок у компаніях, що розробляють моделі, якщо високопродуктивні моделі можна отримати безкоштовно?

Ті, хто підтримує відкрите джерело, вважають, що відкриті ваги знижують технічні бар’єри і дозволяють більшій кількості компаній та розробників брати участь у інноваціях в галузі ШІ. Відкрите джерело означає, що постачальники технологій добровільно відмовляються від частини своїх інтересів, сприяючи розвитку екосистеми; тоді як прихильники закритого джерела стурбовані тим, що їхні користувачі можуть бути відведені до моделей з відкритим джерелом. Компанії, такі як Anthropic, вважають, що зі зростанням здатностей моделей відкриття ваг може призвести до ризиків безпеки і вимагати більш суворої регуляції.

За цією суперечкою стоять інтереси різних компаній. Для інфраструктурних компаній, таких як NVIDIA, відкритість моделей означає більше потреб у розгортанні та більший ринок обчислювальних потужностей. Для компаній, що розробляють моделі, таких як OpenAI та Anthropic, закрита модель дозволяє зберігати дохід від викликів API та підписок. Однак слід врахувати й інший бік: відкритість справді збільшує попит на розгортання, але зі зростанням ефективності параметрів обчислювальні витрати на одиницю завдання можуть зменшуватися, і зростання ринку обчислювальних потужностей не обов’язково буде збігатися з рівнем відкритості моделей. Для українських компаній відкриття вагів — це не лише вибір технічної стратегії, а й спроба отримати доступ до екосистеми розробників, хмарних сервісів та подальшої комерціалізації.

Після липня конкуренція серед великих моделей продовжиться. Розробницька спільнота загалом очікує, що нові моделі, такі як DeepSeek V4, Fable 5.1 та GPT-6, будуть випущені в серпні.

Розрив у здатностях моделей зменшується, і просто випуск більш потужної моделі все складніше забезпечує тривалий перевагу. Далі варто стежити за кількома конкретними показниками: до якого рівня DeepSeek V4 у випускній версії зможе підняти межу здатностей відкритих моделей, чи продовжать падати ціни на API, чи з’являться стабільні платні сценарії для агентів, і чи зможуть відкриті моделі потрапити до більшої кількості корпоративних приватних розгортань. Відповіді на ці питання скажуть більше про те, що насправді змінилося в цьому циклі боротьби, ніж місця в рейтингах.

*Зображення обкладинки надано Pexels.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.