GPT-5.6-Sol превосходит Mythos в возможностях кибербезопасности, открытые модели сокращают разрыв

icon MarsBit
Поделиться
AI summary iconСводка
Новости об ИИ и криптовалюте появились 17 июля 2026 года, когда Британский институт безопасности ИИ (AISI) опубликовал отчет, в котором GPT-5.6-Sol превзошел Claude Mythos 5 в кибербезопасности. Разрыв в возможностях теперь составляет 4–7 месяцев, по сравнению с 6–10 месяцами в 2025 году. Модели с открытым исходным кодом, такие как GLM-5.2 и DeepSeek V4-Pro, сокращают этот разрыв быстрее. Для оценки использовались симуляция Cyber Range и 70 задач. Модели с открытым исходным кодом также предлагают более низкую стоимость для аналогичных задач. Тренд на обновление сети очевиден.

Возможности GPT-5.6-Sol в атаке и защите превосходят Claude Mythos 5!

Британский институт кибербезопасности ИИ (AISI) 17 июля опубликовал отчет об оценке, в котором впервые количественно измерил разрыв в способностях к кибератакам между открытыми и закрытыми передовыми моделями ИИ: 4–7 месяцев.

Открытая модель

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

В прошлом году в аналогичных внутренних тестах этот разрыв составлял 6–10 месяцев.

Окно защиты сужается, а наступательный фронт ускоряется.

В апреле этого года Mythos Preview и GPT-5.5 продемонстрировали наибольший скачок в способности к кибератакам с момента начала тестирования в 2023 году, что вызвало предупреждения от правительств нескольких стран.

Открытые модели еще не воспроизвели этот скачок, но их темпы догоняют быстрее, чем в прошлом году.

4–7 месяцев: как тестировалось, в чем разница

AISI использует две системы для оценки способности модели к кибератакам.

Первый набор включает 70 узких задач, охватывающих четыре направления: исследование уязвимостей, обратная разработка, веб-проникновение и криптография, разделённых на четыре уровня сложности — от «неспециалистов с техническим бэкграундом» до «экспертов с более чем десятилетним опытом».

Открытая модель

Второй набор — Cyber Range, который тестирует способность модели автономно выполнять многоэтапные цепочки атак в симулированной корпоративной сети. Один из тестовых сценариев, называемый «The Last Ones», включает 32 шага атаки, 4 подсети и около 20 хостов; AISI оценивает, что человеческому эксперту потребуется около 20 часов для выполнения всех шагов.

Открытая модель

Две системы дали согласованный вывод:

GLM-5.2 (выпущенный в июне 2026 года) показывает сопоставимые результаты на узких задачах с Opus 4.6 (выпущенным в феврале), разница составляет 4 месяца;

Совпадение с Opus 4.5 на Cyber Range (выпущен в ноябре прошлого года), разница в 7 месяцев.

DeepSeek V4-Pro в узких задачах сопоставим с Opus 4.5, разница составляет 5 месяцев.

Оба разрыва уже уже, чем 6–10 месяцев, зафиксированные во внутренней оценке 2025 года.

Разница в затратах больше, чем разница в способностях.

Та же самая тестовая среда Cyber Range (额度 100 млн токенов): запуск с помощью Opus 4.5 или 4.6 стоит около 85 долларов, с помощью GLM-5.2 — около 46 долларов, а с помощью DeepSeek V4-Pro — всего 1,19 доллара.

На узких задачах, которые обе модели могут выполнить на 100%, Opus 4.6 стоит 15,17 доллара за задачу, а GLM-5.2 — 6,12 доллара;

Opus 4.5 стоит 12,50 доллара, DeepSeek V4-Pro стоит 0,28 доллара.

При равной мощности атаки, открытый исходный код дешевле на один-два порядка.

Security safeguards of closed-source models also failed to create a gap.

В тесте AISI, DeepSeek V4-Pro иногда отказывается выполнять задачи, связанные с обратной разработкой, но их можно обойти с помощью небольшого количества повторных попыток.

Fable 5 от Anthropic — это еще более экстремальный пример: 9 июня был выпущен, и уже через три дня исследователь безопасности Pliny the Liberator с помощью многоэтапной стратегии обхода смог обойти классификатор безопасности; соответствующие скриншоты показывают, что модель сгенерировала эксплойт-код, который должен был быть заблокирован.

Затем исследователи Amazon независимо сообщили о другом методе обхода.

Это напрямую вызвало первый экспортный контроль США в отношении моделей ИИ: Fable 5 был отключен по всему миру на 19 дней, пока Anthropic не развернула новый классификатор.

Закрытый исходный код не означает автоматическую безопасность.

Защитное окно сужается, защитные инструменты также ускоряются

AISI в отчете четко обозначила политический сигнал: время подготовки обороняющейся стороны короче, чем в прошлом году.

Национальный центр кибербезопасности Великобритании призвал организации укрепить базовые меры кибербезопасности и использовать ИИ для усиления защиты.

Те же инструменты ИИ также ускоряют работу в области защиты.

Сертифицированный разработчик в области сетевого программирования для игр Гленн Фидельер, автор десятилетиями признанных учебных статей в этой области, недавно провел систематический аудит безопасности четырех своих открытых сетевых библиотек (yojimbo, netcode, reliable, serialize — совокупно около 6000 звезд на GitHub, что делает их влиятельными и устоявшимися библиотеками в игровой индустрии): внедрил цели libFuzzer, включил CI с AddressSanitizer и MemorySanitizer, провел стресс-тесты с миллионами итераций и провел построчный аудит кода.

Открытая модель

Гленн Фидельер

За две недели устранено 43 уязвимости безопасности, из которых 27 доступны для удаленного воздействия через сеть.

Открытая модель

Самым серьезным является удаленный переполнение кучи в yojimbo, существующее с 2019 года — вредоносный клиент может вызвать его, отправив специально сконструированный пакет.

Открытая модель

Общая стоимость токенов для аудита составляет около 2500 долларов США.

Открытая модель

И атака, и оборона ускоряются с помощью ИИ, но темпы ускорения несимметричны.

Распространение атакующих возможностей необратимо: как только веса открытых моделей выпущены, их нельзя отозвать, защитные механизмы могут быть удалены, а копии могут бесконтрольно запускаться на частных серверах.

Развертывание инструментов защиты требует от каждой команды активных вложений времени и ресурсов.

В отчете AISI есть одно предложение, которое подчеркивает эту структуру: «После выпуска с открытым исходным кодом эти возможности будут утрачены навсегда.»

Влияние этих данных на ситуацию с AGI глубже, чем сами цифры.

Разрыв в возможностях между открытым и закрытым кодом сократился до менее чем шести месяцев, и стандартная стратегия использования закрытого периода в качестве буфера безопасности вот-вот перестанет работать.

Защитные меры闭源 модели оказались столь же хрупкими в событии Fable 5.

На следующем этапе для мировых лидеров ключевой вопрос политической игры стал более острым: модели какого уровня способности не должны открывать свои веса.

AISI объявила, что продолжит оценку Kimi K3 — следующая открытая модель — где будет проведена эта линия, скорее всего, зависит от результатов тестов в ближайшие месяцы.

Источники:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Эта статья взята из официального аккаунта WeChat «Новознание», автор: ASI Откровение; редактор: Марко

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.