Автор: Xiao Bing
16 осіб, 27,5 години, 4962 безпекові питання, 85 серйозних уразливостей, 635 високих рівнів небезпеки.
Ці цифри походять від волонтерської організації Bitcoin Red Team. Протягом останніх двох днів вони провели масштабний аудит безпеки 390 відкритих проектів bitcoin за допомогою моделей ШІ, що призводило до підтвердження в середньому 166 виявлень на годину та блокування одного вразливого місця рівня «серйозно» на годину на кожного учасника.
Засновник протоколу Cashu Калле опублікував перший звіт у X, почавши його чотирма словами, що описують ситуацію: «Ситуація надзвичайно погана.»
Але справжньо тривожним є не саме число.
40 000 доларів США та пожежна тренування
Цей аудит не був ініційований нізвідки.
Тиждень тому екосистема біткоїна зазнала найбільшої в історії атаки на апаратні гаманці. Гаманець Coldcard через дефект генератора випадкових чисел у оновленні прошивки 2021 року дозволив здійснити оффлайн-обчислення приватних ключів. З 30 липня нападники в чотири хвилі ограбили понад 5200 адрес, а за даними Galaxy Research, збитки склали близько 1816 BTC, що за цінами того часу перевищувало 116 мільйонів доларів США.
Цей баг п’ять років спокійно лежав у відкритому коді, його можна було аудитувати будь-хто, але майже ніхто не переглядав його системно.
Подія з Coldcard стала спусковим крючком. Calle та CEO AnchorWatch Роб Гамільтон швидко сформували Red Team, отримали фінансування від OpenSats і витратили понад 40 000 доларів США на AI-обчислення. Вони використовували моделі Kimi K3 від Moonshot, GPT Sol від OpenAI, Fable та Opus від Anthropic та GLM5.2 від Zhipu.
На початковому етапі доступ до моделей OpenAI та Anthropic був обмежений, і команда залежала від китайських відкритих моделей. Цей деталь сам по собі цікавий: захисниками найбільшої в світі інфраструктури криптовалютних активів виявилися волонтери, які з ноутбуками з китайськими відкритими ШІ працювали цілі нічі.
Дані через 27,5 години виглядають так: із 4962 проблем 14,5% належать до високого або критичного рівня небезпеки, у середньому кожен проект мав 1,85 критичних проблем. Найвищий відсоток критичних виявлень — 24% — стосується приватності та інструментів CoinJoin; далі йдуть біржі та протоколи обміну — 21%. Криптографічні бібліотеки та SDK дали найбільшу кількість початкових виявлень (1101), але їх частка критичних виявлень становить лише 10%. 91% виявлень було подано за допомогою автоматизованого сканування, а 21% уже були відтворені у локальному середовищі за допомогою коду-демонстрації.
З 17 учасників 14 — це люди, а 3 — автоматизовані системи.
Обмеження вже перевернулося
Роб Гамільтон у X написав одне речення, що важливіше за будь-які цифри: «Найскладніша частина — не знайти баги, а доставити їх правильним людям.»
У світі традиційних досліджень безпеки «виявлення» — це найдорожчий етап. Топовий дослідник безпеки може витрачати кілька тижнів на зворотне інжиніринг коду, щоб знайти вразливість, яку можна використати. ШІ знизив цю вартість майже до нуля. 16 осіб, що працюють разом з моделлю ШІ, за один день виробляють обсяг роботи, який зазвичай займає аудиторську фірму кілька місяців.
Проблема полягає в тому, що після виявлення. На момент публікації звіту лише 19 із 390 аудитованих проектів (менше 5%) завершили розкриття інформації вище за ланцюгом. Калле в твіті вибачився перед супроводжувачами, сказавши, що розуміє, як збільшення кількості звітів збільшило навантаження, і команда ще вчиться фільтрувати шум. 8 виявлень були відкликані як хибні сповіщення.
Це структурна зміна: ШІ перетворив «пошук багів» на майже безкоштовну дію, і вузьке місце у всьому безпечному конвеєрі перенеслося з найвищого етапу — виявлення — на середні та нижні етапи: верифікація, класифікація, перенаправлення до відповідних супроводжувачів, виправлення, тестування та розгортання патчів. Ці етапи все ще сильно залежать від людини, все ще повільні та все ще хаотичні.
І саме це є структурною перевагою нападників.
Асиметрична збройна гонка
Захисникам потрібно пройти повний ланцюжок: виявлення вразливості → перевірка → відповідальне розголошення → очікування підтвердження від розробників → виправлення → впровадження патча → оновлення користувачами. На кожному етапі існують труднощі та затримки.
Зловмиснику потрібно лише: виявити вразливість → використати її.
Штучний інтелект зробив початкову ланку ланцюга для обох сторін дешевою. Але асиметрія наступних етапів означає, що ця збройна гонка природним чином сприяє нападаючій стороні. Прикладом цього є випадок з Coldcard: баг 2021 року, який відкрито зберігався в кодовому репозиторії протягом п’яти років, не був виявлений за допомогою систематичного сканування захисниками, але нападники за допомогою ШІ знайшли передбачуваний простір ключів і за 41 хвилину викрали 1083 BTC.
З’явився більш серйозний сигнал. У квітні цього року Anthropic продемонструвала Claude Mythos Preview — модель ШІ, яку було відмовлено публікувати через надто високий рівень безпекових ризиків. За словами Anthropic, Mythos здатний виявити одну вразливість за вартість менше 50 доларів США, і команда використала її для самостійного виявлення дефекту в операційній системі OpenBSD, який існував 27 років. OpenBSD є однією з найбільш безпечних операційних систем у світі і широко використовується для роботи брандмауерів та критичної інфраструктури. Відповідно, Anthropic запустила проект Glasswing, об’єднавши близько 40 організацій, зокрема AWS, Apple, Microsoft та Google, щоб виправити ці вразливості до того, як їх використають зловмисники.
У травні команда Google з інтелектуальної інформації про загрози оголосила ще один важливий етап: вони перехопили випадок, коли злочинна група використовувала модель ШІ для виявлення нульового дня та написання експлойту. Ця вразливість була обійти двофакторну автентифікацію, вбудовану в широко використовуваний відкритий інструмент управління. Google виявила походження атаки за допомогою ознак ШІ у коді (вигадані оцінки CVSS, підручникові коментарі Python) та спільно з виробником усунула проблему до того, як злочинці розпочали масштабну експлуатацію.
Слова Джона Халтквіста, головного аналітика з питань кібербезпеки Google, не залишають жодного простору для сумнівів: «Вважати, що змагання у використанні штучного інтелекту для експлуатації вразливостей лише починається, — це помилка. Реальність така: це змагання вже почалося».
Відкритий код не означає, що його було перевірено
Лідер Ledger Чарльз Гільєме сказав під час оцінки події з Coldcard: «Відкритий код і перевірений код — це не одне й те саме.»
Це твердження пронизало довготривалий міф у криптоіндустрії. Біткоїн-спільнота має майже релігійну віру в відкрите програмне забезпечення, вважаючи, що відкритий код означає, що будь-хто може перевірити його, і тому він природно безпечний. Код Coldcard був відкритий протягом п’яти років. Аудит Red Team охопив 390 проектів. Коли ці два факти поєднуються, картина стає очевидною: можливість аудиту не означає, що аудит був проведений.
Досвід Red Team також виявив обмеження AI-аудиту безпеки. Калле сказав, що більшість роботи команди все ще полягає у "ручному керуванні AI", коли кожен використовує власний підхід до формулювання запитів до моделі, що дає більш широке покриття, ніж єдина методика. Це свідчить про те, що сучасний AI-аудит безпеки ближчий до "людських експертів, які керують інструментами AI", ніж до "автономного патрулювання AI". Модель може швидко сканувати шаблони коду, але визначення того, чи є виявлення справді експлуатованим, якого воно має впливу та кому слід повідомити, все ще вимагає людського досвіду та судження.
Гамільтон сказав, що команда планує відкрити код інструментів аудиту, щоб компанії, що працюють з біткоїном, могли запускати ті самі скани на власному закритому коді. Це правильний напрямок, але означає, що ті ж інструменти обов’язково потраплять у руки зловмисників.
Ця аудитна перевірка справді розкрила нове рівняння, що формується:
Штучний інтелект зробив виявлення вразливостей майже безкоштовним. Але витрати на усунення вразливостей (координація організацій, вкладення праці, міграція користувачів) залишаються високими та повільними.
40 тис. доларів США на AI-обчислення, 27,5 години — і ви зможете перевернути з ніг на голову відкриту екосистему, що керує тисячами мільярдів доларів активів. Баг у Coldcard, який ніхто не помічав протягом п’яти років, був знайдений хакерами, і за 41 хвилину було викрадено 116 мільйонів доларів.
Безпека біткойна переписується.
Попередня логіка була такою: «Код відкритий, тому він безпечний». Нова логіка жорсткіша: «Код відкритий, тому зловмисники також використовують ІІ для сканування його».
Єдину перевагу захисників становить перевага першого ходу — знаходження та виправлення вразливостей до атакуючих. Red Team змагаються за цю перевагу, але їхні звіти також свідчать, що навіть отримавши перевагу першого ходу, подальший ланцюжок розповсюдження виправлень залишається найслабшим ланцюжком екосистеми.
Проблеми, з якими стикається біткойн, можуть бути лише попереднім етапом більшої зміни. Весь світ відкритого програмного забезпечення скоро стикнеться з тим самим питанням: коли виявлення помилок більше не вимагає експертів, а їх виправлення — все ще вимагає, чим заповнити цю різницю?

