Kimi K3 посідає третє місце серед найкращих штучних інтелектів у світі, стає конкурентом Anthropic та OpenAI

iconTechFlow
Поділитися
AI summary iconКороткий зміст
Kimi K3 від Moonshot посідає третє місце у світі, поступаючись Fable від Anthropic та Soul 5.6 від OpenAI. З 2,8 трильйона параметрів та вартістю 3/15 за мільйон токенів, він відповідає ціновій політиці Sonnet. Дані у блокчейні свідчать про сильне впровадження, а індекс страху та жадоби відображає зростання ринкової впевненості. Аналітики зазначають, що продуктивність Kimi K3 може збільшити прибуток лабораторій штучного інтелекту порівняно з моделями SaaS. Обмеження на експорт із США можуть скорочувати розрив між китайськими та американськими моделями.

Організація та компіляція: Shenchao TechFlow

Гості: Джордан і Макс, аналітики SemiAnalysis

Ведучий: Jordan (внутрішній діалог SemiAnalysis)

Джерело подкасту: SemiAnalysis

Оригінальний заголовок: [Екстрений епізод] Moonshot's Kimi K3 прибув! У Китаї з’явилася передова модель

Дата виходу: 18 липня 2026 року

Ключові моменти

Moonshot (Місячна темна сторона) випустив Kimi K3, який перевершив Google та Meta за кількома комплексними тестами, ставши третьою найкращою моделлю у світі, поступаючись лише Fable від Anthropic та Soul 5.6 від OpenAI. Два аналітики SemiAnalysis, Jordan і Max, у екстреному випуску розібрали значення цього випуску: модель з 2,8 трлн параметрів надає послуги за тією ж ціною, що й Sonnet (3/15 за мільйон токенів), і якщо її розмір порівнянний з передовими закритими моделями, то прибутковість Anthropic у розмірі 10/50 може бути неймовірною.

Більш гострий аналіз від Джордана: розрив на передовій скорочується, і він пояснює це обмеженнями уряду США щодо публікації найпотужніших моделей Anthropic/OpenAI, що штучно створило вікно можливостей для відсталих. Відкрите програмне забезпечення справді не наздогнало. Між тим, на західному відкритому просторі повна порожнеча — жодна американська компанія не має відкритої моделі, яка могла б порівнятися з п’ятою найкращою китайською. Конкуренція моделей перетворюється на боротьбу за інструменти та геополітику.

Короткі висновки

Щодо позиціонування Kimi K3

  • Якщо ви подивитеся на загальний рейтинг усіх основних benchmark, сьогодні чітко видно топ-три: Fable, Soul 5.6 і Kimi K3. Вони постійно вище за всіх інших, включаючи DeepSeek, а також Google, Meta і xAI.
  • Google повинен відчувати велике сором. Ще в листопаді та грудні 2025 року всі вважали, що трійця штучного інтелекту — це Google, Anthropic та OpenAI. Сьогодні з деякими «старомодними» людьми я розмовляв — вони ще так думають, але зрозуміло, що це вже не так.
  • Це може бути друга найкраща модель у світі, бо кожного разу, коли я намагаюся щось серйозне зробити з Fable, мені відмовляють і перенаправляють до Opus. Хоча я не впевнений, чи вона краща за Opus, але принаймні мені не відмовляють.

Щодо прибутковості передових моделей

  • Якщо Kimi найімовірніше не продає K3 по ціні 3/15 у збиток, тоді Fable, який має схожий масштаб, але отримує 10/50, повинен повністю розсіяти сумніви щодо того, що лабораторії з ІШ — це неприбутковий бізнес. Продаж токенів за цінами API може бути прибутковішим, ніж SaaS.
  • Ціна зросла більше ніж утричі з K2.7 до K3 — з 0,95/4 до 3/15. Але я не вважаю, що у них залишилося багато простору для підвищення цін, оскільки багато завдань можна вирішити за допомогою GLM або MiniMax M3.

Про уряд США та розрив

  • Я вважаю, що ця різниця зменшилася саме через обмеження, накладені урядом США на Anthropic, через які ми не отримуємо справді найпотужніші моделі цих компаній. Вони штучно наздогнали.
  • Ми можемо отримати доступ до нього лише тоді, коли передові інтелектуальні системи дозволять це. Це насправді є можливістю для гравців, які зайняли місця з четвертого по сьоме.

Про западний відкритий вакуум

  • Мене вражає, що весь ринок все ще настільки неефективний, що ми не маємо жодної американської компанії, яка хоча б змогла наздогнати п’яту найкращу китайську.
  • Навіть якщо уряд не заборонить китайські відкриті моделі, звичайні великі американські компанії не хочуть подавати власні дані китайським відкритим моделям. Навіть якщо ви завантажуєте ваги в ізольованому центрі обробки даних, де CCP не бачить ваших даних, керівництво не погодиться.

Про Harness

  • Тестування Kimi K3 дозволило мені вперше серйозно розглянути Open Code, Hermes і Pi. Harness повністю залишається частиною продукту.
  • Декілька простих речей можуть змусити мене вибрати цю модель замість іншої: чи можна її встановити на віддаленому сервері SSH? Чи зручні горячі клавіші? Ці деталі в harness-і справді впливають на те, куди я надсилаю токени, тобто куди я розподіляю свій бюджет.

Щодо "ще занадто рано"

  • На тиждень до цього я був на ICML, а на тиждень до того — на конференції AI Engineer. Це звичайна AI-конференція, де понад 80% людей ніколи не чули про SemiAnalysis. Ти кажеш, що працюєш у галузі ШІ, але навіть не читав SemiAnalysis? Ми ще дуже рано.

Чи є Kimi K3 третьою найкращою моделлю у світі?

Джордан: Швидкий коментар, чи є Kimi K3 зараз третьою найкращою моделлю у світі?

Макс: Відповідь однозначна — «так». Усі люблять скаржитися на бенчмарки, і справді, вони мають недоліки, але якщо подивитися на загальний рейтинг усіх основних бенчмарків, їхні висновки завжди правильні. Сьогодні чітко видно трійку лідерів: Fable, Soul 5.6 і Kimi K3, які постійно вище за всіх інших, включаючи таких гравців з відкритим кодом, як DeepSeek, і значно вище за Google, Meta та xAI. Це надзвичайно видатне досягнення для команди Moonshot.

Google повинен відчувати величезний сором. Ще в листопаді та грудні 2025 року всі вважали, що три великі гравці в ІШ — це Google, Anthropic та OpenAI. Сьогодні з деякими "старомодними" людьми я розмовляв — вони досі так думають, але зрозуміло, що це вже не так.

Загалом я все ще вважаю, що він поступається Fable та Soul 5.6. Дещо смішно, що вони самі чітко це зазначили у своєму блозі про запуск моделі. Можливо, це старомодна китайська скромність, а може, вони не хочуть привертати увагу американського уряду, враховуючи, що запуск Fable 5.6 теж трохи затримався. Але будь-яким чином, це дуже вражливо.

Джордан: В розділі обмежень у їхньому блозі написано: «Хоча K3 в цілому є дуже конкурентоспроможною моделлю, між нею та Fable 5 і GPT 5.6 існує помітна різниця щодо досвіду користувача». Мій особистий досвід використання показує, що вона дійсно гарна, але дуже повільна — це дратує. Це спонукало мене вперше спробувати open source harness. Щиро кажучи, я вважаю, що навчився більшого про harness, ніж про модель, бо всі ці моделі достатньо добре впоруються з моїми поточними базовими завданнями, і мені важко знайти складні завдання, які вони не можуть виконати.

Це, можливо, друга найкраща модель для мене, бо кожного разу, коли я використовую Fable для серйозних завдань, мені відмовляють і перенаправляють на Opus. Хоча я не впевнений, чи вона краща за Opus, але саме те, що мене не відмовляють, робить це менш дратівливим. Однак при використанні ключа API за використанням мене ніколи не відмовляють — ліміти стикаються лише при використанні веб-консолі або глибоких досліджень. Очевидно, що у них недостатньо GPU, щоб задовольнити попит на цю модель. Раніше цю проблему вирішували за допомогою стратегії відкритого коду — вони публікували ваги, щоб інші могли їх обслуговувати. Але на цей раз ваги ще не опубліковані, і вони кажуть, що випустять їх через 10 днів.

Чому відкладено відкриття ваг на 10 днів?

Джордан: Як ти вважаєш, в чому полягає ця стратегія затримки?

Макс: Ясно, що це всі мої чисті припущення. Однією з великих причин може бути те, що їм потрібно дати достатньо часу командам інференс-енджинів, таким як vLLM і SGLang, щоб забезпечити високопродуктивне сервісування цієї моделі. Якщо сьогодні випустити ваги, і всі почнуть сервісувати, але отримають лише 20 токенів/сек, це дуже погано вплине на їхній бренд. Зараз у них є чудова можливість отримати величезний PR і широке впровадження; якщо випуск буде збитий продуктивністю, це лише ослабить імпульс.

Іншою можливістю є переговори з провайдерами інференс-сервісів, такими як Together AI, Fireworks, Nebius, Groq, щодо ліцензійної співпраці, щоб вони використовували найновіші чіпи, такі як GB300, для обслуговування збільшених обсягів. Ці два пункти, ймовірно, є основними причинами затримки на 10 днів.

Прибутковість передових моделей

Джордан: Поговоримо про архітектуру моделі. Вона має 2,8 трлн параметрів і не вміщується в B200; вам знадобиться B300, GB300 або AMD MI355X, щоб запускати її на одній 8-карточній серверній платформі HGX. Звичайно, ви можете використовувати пайплайн-паралелізм між вузлами, але це серйозно вплине на продуктивність. Тож цю модель може запускати лише той, хто має найновіші чіпи.

Повертаючись до вашої попередньої згадки про Google, ця модель досягла передового рівня конкурентоспроможності з 2,8 трлн параметрів, що дає нам деякі підказки щодо розміру закритих передових моделей. Якщо вони використовують моделі з 10 трлн параметрів, щоб порівнювати з цією, то це ще гірше. Ми повинні припустити, що вона має той самий рівень, що й Soul та Fable.

Макс: Так, ти прав. Я все ще вірю в здатність і проникливість команди Anthropic. Якщо хтось у Twitter каже, що поточні закриті моделі мають 10 Т параметрів, і це правда, то брате, треба збирати речі — ціни на акції NVIDIA впали б на 50% вже завтра, і все б закінчилося.

Я досить впевнений, що Kimi K3 не значно менший за поточні лідуючі закриті моделі, а можливо, навіть трохи більший. Якщо це правда, це додатково підтверджує одну з наших основних ідей у SemiAnalysis: прибутковість цих закритих лабораторій дійсно неймовірна. Якщо Kimi, ймовірно, не продає K3 за ціною 3/15 з збитками — так само, як Sonnet — а Fable має схожий розмір, але стягує 10/50, то це повинно повністю розсіяти будь-які сумніви щодо неприбутковості AI-лабораторій. Продаж токенів за цінами API, на сьогоднішній день, може бути навіть прибутковішим, ніж SaaS.

Джордан: Немає витрат на персонал, тільки GPU. Як це порівнюється з попередніми цінами? Ви згадали 3/15, але попередня версія Moonshot мала прямий ціновий показник 0,95/4, тому ціна зросла більше ніж у 3 рази з K2,7 до K3. Скільки ще простору для підвищення цін у них є?

Макс: Я не думаю, що у них залишилося багато простору для зростання. Навіть на рівні 3/15 багато хто вважатиме це надто дорого. Їхні завдання можна вирішити за допомогою GLM або MiniMax M3. Ось цікавий розкол: такі, як ми, SemiAnalysis, які не турбуються про витрату токенів Dylan, продовжуватимуть використовувати Fable для майже всього; а надто чутливі до витрат, наприклад Tesla, Uber, які витрачають лише $200 на токени на тиждень, оберуть рівень ціноутворення GLM. Тоді хто саме перейде на Kimi K3? Можливо, це буде група людей, які філософськи схильні до open source і хочуть підтримувати нові моделі. Чи справді великі компанії приймуть цю модель? Я не здивуюся, якщо відповідь буде негативною.

Нова архітектура та наступні кроки

Джордан: Це нова архітектура. 2,8 Т параметрів, з delta attention від Kimi, potential residuals, stable latent — майже подвоєна версія попередніх моделей. Раніше, у K2.5 ми бачили, що Cursor використовував його як composer на основі continued pre-training і MRL, а потім з’явилися чекпоінти 2.5, 2.6, 2.6.7 тощо. Це нова базова модель, але вона вже досить завершена і не має грубих країв, характерних для початкових моделей. Що далі? Коли з’явиться 3.1? Зміниться ціна? Чи з’явиться composer на основі K3?

Макс: Композитор на основі K3, швидше за все, не з’явиться — люди з Cursor вирішили навчати свою модель з нуля. Щодо K3.1, K3.2, очікується, що протягом наступних одного-двох місяців буде випущено два-три оновлення, які продовжать пост-навчання. Ціни, гадаю, залишаться незмінними, оскільки протягом наступних двох-трьох місяців вони не зможуть працювати на новому обладнанні, і не буде зростання пропускної здатності, щоб знизити ціни. Можливо, дуже досвідчені інженери ядер зможуть знизити витрати до рівня DeepSeek V4, але я сумніваюся, що модель з 3 трлн параметрів зможе досягти такого рівня. Поточні ціни GLM і MiniMax, ймовірно, вже є межею того, що може обслуговувати модель з 1–1,5 трлн параметрів.

Чи наздожене відкрите кодове забезпечення закрите?

Макс: Більш цікаве питання — чи буде розрив між відкритим та закритим кодом продовжувати зменшуватися, і чи зможе відкритий код реально досягти паритету з передовим рівнем. Якщо це відбудеться, це матиме величезний вплив на весь наш індустрію. Як ви думаєте?

Джордан: Моя думка полягає в тому, що розрив зараз зменшився, і це squarely відбулося через обмеження уряду США щодо Anthropic, через які ми не можемо отримати справді найпотужніші моделі цих компаній. Їх штучно наздогнали.

Ми можемо побачити порівняння Mythos і Fable. Mythos я не можу використовувати, Fable я можу використовувати лише іноді, після багатьох прохань. 5.6 Soul — за нашою внутрішньою оцінкою, це не найбільша модель, натренована OpenAI, вона менша, ніж 4.5. У них є більша модель. В результаті ми можемо отримати доступ до неї лише тоді, коли уряд дозволить доступ до передових інтелектуальних систем.

Це насправді можливість для гравців на місцях з четвертого по сьоме — відкрити все, що можливо в межах певного ліміту, і почати боротьбу за частку користувачів, але ніколи не досягнути справжнього frontier. Я вважаю, що frontier може зробити великий крок вперед наприкінці цього літа, а може, і змінитися політичний курс. Можливо, ми почнемо знаходити модальності, які виходять за межі кодування, і дозволимо їм справді досліджувати ці сфери.

Згадаю про випуск Inkling від Thinking Machines — власний аудіовхід мені здається дуже цікавим і є сигналом майбутнього.

Max: Щодо Inkling, на Заході дійсно дуже-дуже-дуже не вистачає хоча б якісної відкритої моделі. Ринок все ще настільки неефективний, що ми не маємо жодної американської компанії, яка хоча б змогла наздогнати п’яту за якістю китайську — це мене шокує. З одного боку, повна заборона американським урядом китайських відкритих моделей — це лише питання часу. З іншого боку, навіть якщо їх не заборонять, звичайні великі американські компанії не бажають надавати власні дані китайським відкритим моделям. Навіть якщо ви завантажуєте ваги в ізольованому центрі обробки даних, де CCP не бачить ваших даних, керівництво все одно не погодиться. Багато компаній стежать за бюджетом на токени і готові запускати лише західні або некитайські моделі. Inkling — це найкраща західна відкрита модель, яку ми зараз можемо отримати, але вона все ще дуже далеко від переднього краю відкритих розробок — це мене шокує.

Джордан: Раніше це було Neotron, зараз — Inkling. Я вважаю, що у Inkling є дві можливості: по-перше, вони повинні бути кращими, ніж більшість китайських відкритих рішень, щоб взяти участь. По-друге, вони повинні бути кращими, ніж другорядні та третинні моделі передових лабораторій, ніж Sonnet, бо ви можете отримати майже передовий рівень інтелекту за допомогою Bedrock або Foundry, витрачаючи менше грошей на закриті другорядні моделі. Я завжди важко розумів, чому западні відкриті моделі «допомагають людям економити». Напевно, продвиження моделей у екосистеми Fireworks, Together, Base10 — це добре, але основний ринок — це урядовий сектор.

Створено для китайських прискорювачів

Джордан: Ще одна річ, про яку варто згадати: у блозі K3 зазначено, що на етапі SFT використовувалася квантизація, а для ваг і активацій використовувалися MXFP4 та MXFP8; офіційно це описується як «широку сумісність з апаратним забезпеченням». Як ви думаєте, Moonshot ще що цікавить щодо іншого апаратного забезпечення?

Макс: У мене є список з 11 китайських прискорювачів, варто підписатися на модель прискорювачів SemiAnalysis, щоб дізнатися більше. Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads — різні чіпи згадуються в статтях і зустрічаються в коді. Запуск передових моделей на китайських прискорювачах — це національний пріоритет Китаю. Якщо ми до кінця 2025 року ще будемо називати Google передовою лабораторією, то зараз так само слід називати передовою лабораторією Moonshot.

Джордан: На sidelines: мій батько зараз у командуванні в Китаї, він сказав, що всі готелі заповнені, бо Сі Цзіньпін збирається виступити з промовою про те, що ШІ — це найвищий пріоритет Китаю. Багато з того, що ти сказав, — правда.

Harness — це сам продукт

Джордан: Найважливіший висновок, який я зробив, працюючи з цими моделями, полягає в тому, що все складніше розрізняти між використанням абсолютно передових моделей у режимі max thinking і використанням середніх зусиль. У повсякденних завданнях я справді не можу знайти нічого, чого ці моделі не зможуть зробити. Моя стандартна поведінка — включати найбільший і найскладніший режим, бо мені байдуже бюджет Дайланa.

Але є один аспект: harness сам є частиною продукту. Перевірка Kimi K3 змусила мене вперше серйозно розглянути Open Code, Hermes і Pi. Harness повністю залишається частиною продукту. Деякі прості деталі можуть змусити мене вибрати цю модель, а не іншу: чи можна встановити її на віддаленому сервері SSH? Чи зручні гарячі клавіші? Чи можна редагувати попередні команди? Ці дрібні деталі в harness насправді впливають на те, куди я надсилаю токени, тобто куди я розподіляю бюджет.

Макс: Багато людей говорять про бюджет токенів, але згідно з вашим описом робочого процесу, навіть для завдань, які GLM може виконати, я все ще віддаю перевагу маршрутизації до Fable з використанням max intelligence, оскільки ROI вартий цієї ціни. Бенчмарки говорять, що багато завдань можна перенести на GLM, але ви все ще віддаєте перевагу моделям Anthropic або OpenAI.

Джордан: Майже так. Але я використовую багато Slack-ботів і не знаю, які моделі працюють за кулисами. Наприклад, інтеграція Perplexity з Slack — якщо вона почне маршрутизувати до K3, до GLM, до Sonnet, мені це насправді не важливо. Раніше, коли я дивився на використання, я зрозумів, яку частину займають моделі OpenAI, бо це рішення приймає сама система. Ця частина обґрунтування — це рішення, що приймає harness.

Макс: Це саме та точка входу для ціноутворення на основі результату. Якщо лабораторія застосовує ціноутворення на основі результату, вона може отримувати прибутковість понад 95%, бо завдання, які ви готові оплачувати за стабільною ціною, сьогодні можна виконати за копійки.

Джордан: Другий пункт — я не вважаю, що ці лабораторії вичерпали всі ідеї. Вони можуть продовжувати навчати захопливі моделі для роботи з кодом, але не випускати їх нам, зберігаючи свій «постійний нижній клас». Вони можуть продовжувати дистиляцію, даючи нам трохи на смак, одночасно досліджуючи інші застосування, наприклад генерацію відео, аудіо до аудіо, глибокі дослідження — все це не схоже на кодування. Робототехніка та світові моделі — це простий напрямок. А що, якщо Anthropic змінить свою мету з інтелектуальної праці на фізичну? Я не вірю, що вони не можуть використати найкращі технології світу для створення сталого бізнесу з хорошим ROI.

Нам ще дуже рано

Макс: Навіть не розглядаючи це, я використовую ці моделі дуже часто щодня — мої друзі-програмісти використовують їх у десять разів менше і витрачають у десять разів менше. Людина, яка використовує Fable, використовує її так само часто, як та, хто використовує Sonnet, але та, хто використовує Fable, витрачає у десять разів більше грошей — 90% маржі, що підтримує основну частину бізнесу. Коли ці люди почнуть використовувати більші моделі та робитимуть це частіше, попит лише зросте — моделі навіть не повинні ставати кращими. Потім мені ще доведеться розмовляти з сусідами, які не займаються технологіями — серед них я, мабуть, є 0,1% або навіть 0,01%, і можливо, існує простір для зростання у 1000 разів. Повертаючись до «кривої золотої гуски» Маса-сан (Масаєші Сон).

Джордан: Вона абсолютно права, що «ще дуже рано», і саме тому я вважаю, що Kimi K3 не зупинить зростання чистого доданого ARR Anthropic і OpenAI. Навіть якщо частина людей, які зараз використовують Fable і 5.6, необернено перейдуть на Kimi K3, ці користувачі будуть повністю загублені серед тих, хто ще не розпочав серйозно використовувати цю технологію. Ці люди щодня відкривають нові випадки застосування з високим ROI і продовжуватимуть використовувати 5.6 Soul або Fable 5 для розблокування цих нових сценаріїв. Ви не побачите зниження темпів зростання ARR.

Макс: Подумай, скільки людей ще не підписалися на цей подкаст і не підписалися на SemiAnalysis. На тиждень до цього я був на ICML, а на тиждень до того — на конференції AI Engineer, це звичайна AI-конференція, і більше 80% людей ніколи не чули про SemiAnalysis. Ти кажеш, що працюєш у сфері ШІ, але навіть не читав SemiAnalysis? Ми ще занадто рано.

Джордан: Це тобі его-чек, Макс, охолонь.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.