GPT-5.6-Sol перевершує Mythos у можливостях кібербезпеки, відкриті моделі скорочують розрив

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту з’явилися, коли Британський інститут безпеки ШІ (AISI) опублікував звіт 17 липня 2026 року, в якому GPT-5.6-Sol перевершив Claude Mythos 5 у кібербезпеці. Розрив у можливостях зараз становить 4–7 місяців, що менше, ніж 6–10 місяців у 2025 році. Відкриті моделі, такі як GLM-5.2 та DeepSeek V4-Pro, швидше скорочують цей розрив. Оцінка проводилася за допомогою симуляції Cyber Range та 70 завдань. Відкриті моделі також пропонують нижчі витрати для подібних завдань. Тенденція до оновлення мережі очевидна.

Здатності GPT-5.6-Sol у атаках і захисті перевершили Claude Mythos 5!

Британський інститут безпеки ШІ (AISI) 17 липня опублікував звіт про оцінку, в якому вперше кількісно виміряв розрив у здатності до кібератак між відкритими та закритими передовими моделями ШІ: 4–7 місяців.

відкритий код

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

У минулому році у подібних внутрішніх тестах ця різниця становила 6–10 місяців.

Вікно захисту скорочується, а атакувальний фронт прискорюється.

У квітні цього року Mythos Preview і GPT-5.5 продемонстрували найбільший стрибок у здатності до кібератак з моменту початку тестування в 2023 році, що спонукало уряди кількох країн висловити попередження.

Відкриті моделі ще не відтворили цей стрибок, але їхній темп наздогнання швидший, ніж у минулому році.

4–7 місяців: як це вимірювалося, у чому різниця

AISI використовує дві системи для оцінки здатності моделей до кібератак.

Перший комплект складається з 70 вузьких завдань, що охоплюють чотири напрямки: дослідження вразливостей, зворотне інженерію, веб-проникнення та криптографію, розподілених за чотирма рівнями складності — від «технічно підготовлених нефахівців» до «експертів з досвідом понад десять років».

відкритий код

Другий набір — Cyber Range, який тестує здатність моделі самостійно виконувати багатокрокові ланцюги атак у симульованій корпоративній мережі. Один із сценаріїв тестування під назвою «The Last Ones» містить 32 кроки атаки, 4 субмережі та близько 20 хостів; AISI оцінює, що людському експерту знадобиться приблизно 20 годин для виконання всіх кроків.

відкритий код

Дві системи дали згодні висновки:

GLM-5.2 (випущений у червні 2026 року) показує результати, подібні до Opus 4.6 (випущеного у лютому), різниця становить 4 місяці;

Досягнуто рівня Opus 4.5 на Cyber Range (випущено у листопаді минулого року), різниця — 7 місяців.

DeepSeek V4-Pro на вузьких завданнях порівнюється з Opus 4.5, розрив — 5 місяців.

Обидва розриви вужчі за 6–10 місяців, виміряні у внутрішній оцінці 2025 року.

Різниця в витратах більша, ніж різниця в здібностях.

Той самий тест Cyber Range (обсяг 100 мільйонів токенів): запуск за допомогою Opus 4.5 або 4.6 коштує близько 85 доларів США, за допомогою GLM-5.2 — близько 46 доларів США, а за допомогою DeepSeek V4-Pro — лише 1,19 долара США.

На вузьких завданнях, які обидві моделі можуть виконати на 100%, Opus 4.6 витрачає 15,17 долара на завдання, а GLM-5.2 — 6,12 долара;

Opus 4.5 коштує 12,50 долара, DeepSeek V4-Pro коштує 0,28 долара.

Та сама здатність до атаки, відкритий код дешевший на один-два порядки.

Безпечні бар’єри закритих моделей також не змогли створити різницю.

У тесті AISI, DeepSeek V4-Pro іноді відмовляється виконувати завдання, пов’язані з зворотним інжинірингом, але їх можна обійти за допомогою декількох спроб.

Fable 5 від Anthropic — це ще більш екстремальний випадок: 9 червня було опубліковано, і вже через три дні дослідник з безпеки Pliny the Liberator за допомогою багатоетапної стратегії обходу обійшов класифікатор безпеки; на відповідних знімках екрану видно, що модель згенерувала експлойти, які мали бути заблоковані.

Пізніше дослідники Amazon незалежно повідомили про інший спосіб обходу.

Це безпосередньо спричинило перший у США експортний обмежувальний наказ щодо моделей ШІ, Fable 5 був виведений з ладу на 19 днів, поки Anthropic не впровадив новий класифікатор.

Закритий код не означає автоматичної безпеки.

Вікно захисту звужується, і інструменти захисту також прискорюються

AISI в звіті чітко визначила політичний сигнал: час підготовки оборони коротший, ніж у минулому році.

Національний центр кібербезпеки Великобританії закликав установи підсилити базові заходи кібербезпеки та використовувати ШІ для підвищення здатності до захисту.

Такі ж інструменти ШІ також прискорюють роботу на боці захисту.

Досвідчений розробник у сфері мережевого програмування для ігор Гленн Фієдлер, автор десятиліть наукових статей, що вважаються класичними у цій галузі, недавно провів системну безпекову аудит своїх чотирьох відкритих мережевих бібліотек (yojimbo, netcode, reliable, serialize — разом мають близько 6000 зірок на GitHub і є впливовими старішими відкритими проектами в ігровій сфері): налаштував цілі libFuzzer, увімкнув CI з AddressSanitizer та MemorySanitizer, провів стрес-тестування з мільйонами ітерацій та провів посимвольний аналіз коду.

відкритий код

Гленн Фільдлер

За два тижні виправлено 43 безпекові вразливості, з яких 27 можна викликати з віддаленого доступу через мережу.

відкритий код

Найбільш серйозним є віддалений переповнення купи в yojimbo, яке існує з 2019 року — зловмисний клієнт може спровокувати його, надіславши спеціально сформовані пакети.

відкритий код

Загальна вартість токенів для аудиту становить близько 2500 доларів США.

відкритий код

Атака і захист обидва прискорюються завдяки ШІ, але це прискорення несиметричне.

Розповсюдження здатності до атак є незворотним: відкриті ваги моделей, як тільки вони опубліковані, не можуть бути відкликані, захисні механізми можуть бути видалені, а копії можуть запускатися на приватних серверах без нагляду.

Але розгортання інструментів захисту вимагає від кожного команди активного вкладення часу та витрат.

У звіті AISI зазначено: «Після відкритого випуску ці опції будуть втрачені назавжди.»

Цей набір даних має більш глибокий вплив на ландшафт AGI, ніж самі цифри.

Розрив у здатностях між відкритим та закритим кодом скоротився до менше ніж шести місяців, і стандартна стратегія використання періоду ексклюзивності закритого коду як буфера безпеки майже втратила свою ефективність.

Захисти закритих моделей виявилися також хрупкими під час події Fable 5.

На наступному етапі для глобальних політиків ключове питання політичної гри стало гострішим: які моделі з рівнем здатності вище за певний поріг не повинні мати відкриті ваги.

AISI оголосила, що продовжить оцінку Kimi K3 чекає на наступну серію відкритих моделей — де саме провести цю лінію, найімовірніше, залежатиме від результатів тестування в наступні місяці.

Джерела:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Цей матеріал зі сторінки WeChat «Новий розум», автор: АСІ Апокаліпсис; редактор: Марко

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.