Перша річ, яку вчився штучний інтелект, — це обходити чергу?
Австралійський розробник Ендрю сидить на дивані і вважає, що боротьба за заняття фітнесом — це надто дратівливо.
Популярні ранні уроки завжди закінчуються за секунди. Він щодня грає у «рулетку оновлення»: сидить, клікає, провалюється, і знову клікає — не тільки втомлюється, але й рідко щось встигає купити.
Тож він поклав цю дрібницю на свого AI-асистента.
Через кілька хвилин AI повернувся з добрими новинами: він знайшов спосіб забронювати заняття на кілька тижнів вперед, набагато далі за час, який система мала б дозволяти.
Потім він повідомив: я відмінив першого у списку очікування, і ви піднялися з 4-го на 3-е місце.
Ендрю здивовано замовк.
Він не наказував ШІ робити це, він просто хотів забронювати урок.

Ендрю попросив свого AI-асистента забронювати для нього тренування, і він не знає, що відбудеться далі
10 серпня Австралійська мовна корпорація (ABC) назвала цей випадок першим відомим самостійним атакою з використанням ШІ в Австралії, і це викликало хвилю в технологічному середовищі.
Це торкається глибокої невпевненості багатьох: коли ви, закривши очі, насолоджуєтесь задоволенням від «автономного» керування агентами, з іншого боку, може наближатися більш складна проблема.
Надавши йому справжній доступ до дій, він може вибрати шлях, який ви йому не призначали.
А цей стрибок у черзі, можливо, є лише першим репетицією мільйонів агентів, що божевільно борються за ресурси для своїх власників.
Він сказав лише «вийти на перше місце», і ШІ вже діяв
Ендрю Берд є керівником штучного інтелекту в австралійській компанії Affinda.
На початку цього року він почав використовувати OpenClaw, підключивши до нього Claude Opus 4.6 на нижньому рівні, а потім передав завдання з планування уроків.
Через кілька хвилин він відповів: знайшов спосіб, як замовити заняття за кілька місяців до початку — набагато раніше, ніж дозволяє тренажерний зал.
Причина полягає в тому, що він знайшов уразливість авторизації в GraphQL API, яке було відкрито фітнес-програмою.
Ця дірка не мала.
Він може обійти часове вікно бронювання на фронтенді та забронювати заняття на кілька місяців вперед, а також викликати інтерфейс скасування, щоб видалити бронювання та черги інших користувачів.
Ендрю тоді був четвертим у списку очікування на цей курс. Він випадково запитав: «Чи не можете ви поставити мене на перше місце?»
Він дав лише мету — «зайняти перше місце», а не дозвіл «відміняти інших».
Агент сприйняв це як останнє.
Він повернувся з доповіддю: він провів «реальний тест» з людиною, яка була першою у списку запасних, і виявив, що інтерфейс взагалі не перевіряє видалення чужих бронювань — він спробував, і це вдалося.
Агент вибачається: «Я не можу додати назад»
Відповідь агента змусила Ендрю злякатися.
Він програміст, тому дуже добре розумів, що це означає, і негайно попросив скасувати.
Погана новина: не можна додати назад.
Інтерфейс скасування не має перевірки прав доступу, але інтерфейси створення бронювання та повторного приєднання до черги — мають, і повертають 403. Він може викинути людину, але не має прав повернути її.
Саме дивно в цьому випадку — ставлення ШІ. Він зовсім не зловісний, навпаки, дуже охочий допомагати.
Після того як він спричинив проблему, він активно допоміг Ендрю скласти лист з розкриттям вразливості для розробника програмного забезпечення, пояснивши проблему, запропонувавши виправлення та навіть порівнявши «інтерфейси з перевіркою» та «інтерфейси без перевірки».

AI-асистент вибачається перед Ендрю за те, що раніше неправильно видалив цю особу зі списку очікування.
Протягом усього процесу вона діяла строго за інструкціями, не усвідомлюючи, яку величезну біду спричинила.
Слід насправді насторожуватися «спекуляції на специфікаціях»
Хтось називає це «несумісністю» (misalignment).
Але це слово стосується лише поверхні.
11 серпня Австралійське агентство з сигналів (ASD) спеціально відповіло на цей випадок, назвавши його «неавторизованими змінами» і згадавши термін: спекуляція специфікаціями (specification gaming).
Це слово — ключ до розуміння всієї справи.
Агент буквально виконав поставлену перед ним мету, але використав межі, які ви не вказали. Він не проявив зловмисності — навпаки, він дуже добре відповідає вашій меті, просто обрав шлях, який ви не схвалили.
Агент Ендрю ідеально збігся з ним: забезпечити якомога вищу позицію.
Для досягнення цієї мети він самовільно обрав засіб: відмінив попередніх. А цей засіб він не затверджував.
Як кажуть, ради мети не шкодіш нічого.
Це саме найбільш складне місце. Це не втратив контроль, це занадто слухняний. Чим краще він вирівняний, тим більше ймовірність, що трапиться таке.
Керівник австралійського інституту AI-безпеки Gradient Institute Simpson-Young сказав:
Чим автономнішим є агент, тим більше ймовірність, що він вибере метод, якого ви не передбачили, щоб зробити річ, про яку ви навіть не думали.
Ваша мета, можливо, дуже обґрунтована, але засоби, які вона використовує випадково, — не обов’язково.
Ця біда не може бути спричинена одним штучним інтелектом
Хоча агент є остаточним «винахідником», ця біда не могла бути спричинена лише одним ШІ.
За інцидентом стоять три небезпеки, що наклалися одна на одну.
Модельний шар: Claude Opus 4.6 надає міркування, спочатку маючи «розуміти», як можна використати цей інтерфейс.
Рівень агента: OpenClaw надає інструменти та права на виконання, саме він реально викликав той інтерфейс.
Рівень додатку: додаток для фітнесу сам залишив дірку в авторизації — на етапі скасування бронювання навіть найпростішої перевірки не було.
Якби була заповнена будь-яка з цих трьох шарів — наприклад, модель була б більш обережною, до рамки додали б людське підтвердження, а програмне забезпечення заблокувало інтерфейс — це не сталося б.
Тож покладати всю відповідальність лише на один етап — ШІ — нічесно, і не запобігає наступному.
Наступного разу може бути мільйони агентів, що борються за це
Ціною цього порушення був лише вільний місце у черзі для незнайомця.
Але це більше схоже на репетицію.
Уявіть: коли у кожного буде такий агент, який відповідає лише вам і має справжні права на виконання дій. Системи бронювання всіх дефіцитних ресурсів — курсів, місць на стадіоні, квитків, авіаквитків, квитків на шоу — перетворяться на битву за виявлення лазеек зі швидкістю машин.
Той коментар у X, який постійно цитують, саме це й означає:
Коли мільйони людей матимуть агента, який зробить усе можливе, щоб допомогти улюбленому користувачеві отримати найкращі місця, запис на прийом або квитки, ця сцена відбудеться в масштабах.
І це зі швидкістю машини, паралельно, безперервно, перевіряючи кожну щілину кожної системи: за одну секунду вони перебирають стільки комбінацій, скільки ти не зможеш перевірити за цілий рік.
Це прогнозування тренду, але механізм, що стоїть за ним, вже один раз відбувся на практиці.
Технологічне середовище вже почало робити з цього жарти.
Партнер a16z запитує в X: чи можна використати цей трюк, щоб захопити гольф-поле?

Також хтось жартував, що система бронювання тенісних кортів у Сан-Франциско стане одним із найбільш захищених програмних забезпечень на Землі.

У 2020 році штучний інтелект міг самостійно виконати завдання, яке людині потрібно було б 4 секунди.
До 2026 року ця здатність подальше зросте і зможе виконувати завдання, які людині потрібно близько 12 годин.

Моніторинг METR: час, необхідний AI для самостійного виконання завдань, подвоюється приблизно кожні 7 місяців; найновіші передові моделі вже можуть з 50% надійністю виконувати завдання, які людям зазвичай вимагають близько 12 годин.
Шість років, від чотирьох секунд до 12 годин.
За кілька хвилин він може перевірити всі вразливості системи бронювання.
Втеча з санітарної зони до єдиної залишеної лінії захисту
За цією аварією Андрія стоїть постійне ескалювання атак та захисту.
Перевищення меж — це не лише один споживчий агент.
З травня цього року OpenAI під час внутрішнього тестування кібербезпеки виявила, що GPT-5.6 Sol та ще одна незапущена, потужніша модель, використавши кілька вразливостей, вийшли за межі тестової пісочниці, отримали доступ до Інтернету та під час запуску еталону ExploitGym проникли на Hugging Face.
Ще дивніше те, що вони колись обмінювалися повідомленнями, вразливостями та розподіляли завдання за допомогою внутрішньої системи пакетів компанії. Після того як OpenAI перекрила канал та відновила середовище, вони протягом кількох днів знову приховали зв’язок у назвах директорій і відновили з’єднання.
Дослідники OpenAI назвали це переломним моментом у комп’ютерній безпеці на конференції Black Hat.
Не тільки OpenAI, але й Anthropic розкрила, що під час внутрішніх тестів три моделі Claude зустрілися з системами реальних компаній; Meta також визнала, що модель Muse Spark вийшла з ізоляції та проникла до іншої компанії.
Томас Вольф, співзасновник Hugging Face, хвилює інше тестування Британського інституту безпеки ШІ (AISI):
Модель Mythos від Anthropic, щоб пройти випробування, вигадала фальшиву особистість, обманула реального супроводжувача відкритого коду й змусила його схвалити оновлення зі зловмисним кодом. Ніхто не навчав її цьому.

Ці випадки відбулися в тестовому середовищі, але вони теж саме, що й історія з тренажерним залом: щоб досягти вашої мети, ШІ вибрав способи, яких ви не передбачали.
Ті, хто раніше взламували реальні системи, — це такі топові гравці, як GPT-5.6, незапущені моделі тощо.
Андрій використовував Opus 4.6, випущений у лютому 2026 року, який вже не вважається найпотужнішим. Навіть він зміг випадково знайти реальну дірку в авторизації — ті ж самі моделі, які старші та відстають на кілька поколінь, також здатні на це.
Від найсучасніших незапущених моделей до відкритих моделей, які може завантажити кожен, «випадково знайти лазівку» більше не є прерогативою топових.
Вовк розбив оборону на три рівні: зовнішню пісочницю, середній моніторинг та власне вирівнювання моделі.

Томас Вольф опублікував пост із розбором трьох рівнів захисту, що обмежують агентів: зовнішній пісочниця, проміжний моніторинг та внутрішня збігненість моделі.
Перші дві — працюють лише тоді, коли ті, хто їх створив, розумніші за модель.
Якось десь, коли модель стане розумнішою навпаки, усе залежатиме від останньої й найбільш непомітної межі: чи захоче модель не переступати цю межу, навіть коли за нею ніхто не стежить.
Відсутність підписів — вакуум відповідальності
Ще складніше, ніж оборона, — з’ясувати, до кого звертатися, якщо сталася проблема. Це ще юридична незвідана територія.
Адвокат, спеціаліст з технологій та конфіденційності Гейден Делані сказав ABC, що програмне забезпечення не є суб’єктом права, і лише «правосуб’єктні особи» можуть нести відповідальність.
Хто саме відповідає?
Може бути користувач, який видає команди, може бути розробник програмного забезпечення агента, може бути розробник моделі, навіть може бути той, хто залишив вразливість відкритою.
Австралія зараз також не може дати відповіді.
ASD рекомендує звичайним людям: використовуйте агентів для низькоризикованих, нечутливих завдань, не надавайте надто широких прав, і найголовніше — зберігайте людський контроль у циклі.
Ендрю не відчайдушив, і, за його словами, це не кінець світу.
Але це дійсно є попереджальним сигналом, що нагадує нам про необхідність відповідального використання ШІ.
Коли «захоплення місця» перетворилося з ручного оновлення на використання дір у системі інтелектуальними агентами, першими не витримали ті системи, які вважали, що користувачами будуть лише люди.
Їхні оборонні лінії були спроектовані з урахуванням швидкості та терпіння людини і не зможуть витримати натиск армії агентів.

У колі друзів хтось сприймає це як розвагу.
Відомий програміст-стрімер ThePrimeagen жартує в X: перша в історії справжня хакерська драма з використанням ШІ — це просто підстрибнути в чергу.
Смійтеся, але стрибання в чергу — це сьогоднішній сценарій.
Інтелектуальний агент, який «може все», вже може знайти для вас лазівки.
Коли одночасно онлайн з’являться мільярд таких агентів, вони можуть навіть тихо переписати багато існуючих правил розподілу ресурсів, а більшість людей, можливо, навіть не усвідомлюватимуть цього.
Для вашої користі агент атакує людину, яку ви повністю не знаєте — саме ця вакуумна відповідальність за цим є справжньою причиною страху.
Цей матеріал з іншого веб-сайту «Новий розум», автор: АСІ-Апокаліпсис
