Уряд США провів для найновішої китайської моделі ШІ тест на хакерське втручання. Виявилось, що Moonshot AI’s Kimi K3 значно поступається найкращим американським моделям.
Центр зі стандартів та інновацій у сфері ШІ (CAISI), агентство США, провів тести з британським партнером. Результати з’явилися лише через один день після того, як Вашингтон звинуватив Moonshot у створенні Kimi K3 за допомогою вкрадених американських технологій.
Kimi K3 не відповідає американським кібернетичним стандартам
Відомство торгівлі оприлюднило результати в четвер. Воно зазначило, що Kimi K3 поступається за показниками найкращим американським моделям, посилаючись на спільний тест з британськими експертами.
Moonshot запустив Kimi K3 16 липня. Попит був настільки високим, що довелося зупинити нові реєстрації вже через два дні.
Запуск також захитав акції чіпів США і породив нові сумніви щодо лідерства Америки в галузі ШІ.
Один тест, який називається ExploitBench, використовує реальні вразливості браузера Chrome, розроблені Університетом Карнегі-Меллон. Kimi K3 отримав 32%. Це перевершило китайський GLM-5.2 з результатом 24%. Але він поступався найкращим американським моделям, які досягли приблизно 76%.

Найскладнішим кроком є повний контроль над цільовою машиною. Kimi K3 не вдалося виконати цей крок у всіх 41 тесті. Найкращі американські моделі впоралися з цим у 20 випадках.
Ще один тест, під назвою The Last Ones, — це імітація атаки на мережу компанії з 32 кроками. Людському експерту знадобиться близько 20 годин, щоб завершити його. Kimi K3 в середньому досяг 17-го кроку. Найкращі моделі з США досягли 28,5 кроку. Kimi K3 повністю завершив тест лише один раз із 10 спроб.
Найкращі американські системи, як повідомляється, зробили це шість або сім разів.
Але розрив може виглядати більшим, ніж він є
Але цифри не розповідають всю історію. Самі дрібні друковані умови звіту містять кілька пасток.
Спочатку американські моделі були протестовані з вимкненими фільтрами безпеки. Цей налаштування показує їхню повну потужність. Публічні версії зберігають ці фільтри ввімкненими. Тому результати США — це оптимістичний сценарій, а не реальний життєвий стан.
Команда також рано завершила роботу і обмежилася невеликим обсягом. Вона оцінила Kimi K3 лише на одному тесті та виконала лише частину повного набору. Тому її рейтинг є нестійким. Деякі тести також є приватними, тому зовнішні сторони не можуть перевірити роботу.
Також існує базова різниця. Kimi K3 — це відкрита модель, яку може завантажити будь-хто. Моделі США — це закриті, приватні системи. Британський інститут виявив, що відкриті моделі зазвичай відстають на чотири-сім місяців від найкращих закритих. Вони проведуть повний тест Kimi K3 лише після того, як Moonshot випустить її для загального доступу.
Ці тести також не є реальними атаками. Фальшива мережа не мала людських захисників і не мала сигналізації, яку можна було б спрацювати. Навіть так, Kimi K3 переміг останню найкращу відкриту модель. І він все ж здійснив повну атаку один раз.
Терміни та джерело також викликають питання. CAISI раніше був США Інститутом безпеки ШІ. Адміністрація Трампа перейменувала його в червні 2025 року. Він знаходиться в тому ж відомстві, що обмежує продаж чипів США Китаю. І його звіт про китайського конкурента з’явився лише через день після звинувачень у крадіжці.
Слабкі заходи безпеки все ще підвищують ставки
Тим не менше, низькі бали не означають, що Kimi K3 безпечний. Тест виявив, що його захисні механізми не завадили йому спробувати створити хаки або атакувати системи.
Це має значення через те, що буде далі. Moonshot планує випустити повну версію 27 липня. Після випуску її не можна буде відкликати. Будь-хто може завантажити її та видалити фільтри безпеки.
Тест також відбувається після звинувачень у крадіжці. Вашингтон стверджує, що Moonshot створив Kimi K3 на базі крадіжкової американської ШІ-технології. Голова технологічного відділу Білого дому Майкл Кратсіос сказав, що фірма таємно скопіювала Claude Fable 5 від Anthropic. Цей прийом, який називається дистиляцією, навчає нову модель на відповідях більш потужної.
Anthropic підтверджує цю твердження. У лютому вона встановила понад 3,4 мільйона чатів Claude через сотні фальшивих акаунтів. Вона попередила, що скопійовані моделі втрачають системи безпеки оригіналу. Це сама слабка сторона, яку виявив цей тест.
США все ще витрачають у 23 рази більше на ШІ, ніж Китай. Однак китайські лабораторії продовжують скорочувати розрив. Справжній тест настане, коли Kimi K3 буде запущений у публічний доступ, і зовнішні експерти зможуть перевірити твердження самостійно.
