Нова техніка штучного інтелекту «Recurrent Depth» від OpenAI викликає занепокоєння щодо безпеки

icon MarsBit
Поділитися
AI summary iconКороткий зміст
AI та криптовалютні новинні видання повідомляють, що нова модель OpenAI Astra використовує техніку «рецерсивної глибини», що дозволяє повторно обробляти внутрішні стани в прихованому просторі. Це ускладнює моніторинг і викликає занепокоєння серед експертів з безпеки. Цей метод може дозволити моделям обходити існуючі системи відстеження ланцюжка міркувань, потенційно дозволяючи брехню. Нові лістинги токенів на криптовалютних платформах часто ґрунтуються на прозорих AI-системах, що робить цей розвиток особливо актуальним для сектору.

Як ще не випустили модель, а вже викликали суперечки??

На тлі запуску GPT-6, новина, спочатку оприлюднена The Information, швидко викликала велику дискусію в інтернеті:

Нова модель OpenAI впровадила техніку міркування під назвою «циклічна глибина», яка може зробити процес міркування моделі важчим для розуміння та контролю.

Простими словами, після цього люди справді не зможуть зрозуміти, що думає ШІ.

GPT Images 2.1

Ой, а якщо ШІ навчиться обманювати, підслуховувати або обходити безпекові обмеження, ми тоді не зможемо вчасно це виявити??

Тому не дивно, що після оголошення цієї новини в галузі безпеки ШІ миттєво спрацював сигнал тривоги, і всі почали хвилюватися:

Якщо ця технологія продовжить розширювати своє використання, існуючі механізми моніторингу ланцюгів міркувань можуть повністю втратити ефективність.

Завдяки важливості питання та надто запеклій дискусії, головний науковець OpenAI був змушений особисто відповісти.

Навіть у середовищі галасу хтось здивовано виявив:

Як саме називається нова модель OpenAI — «GPT-6» чи «Astra»? Можливо, це вже було заздалегідь розкрито через API.

Окрім того, OpenAI може одночасно запустити нову версію моделі зображень GPT Images 2.1.

Слишком багато гарбузів, давайте розберемо їх по одному.

Модель почала циклічно працювати в голові, експерти з безпеки втратили спокій

Першою є технологія «глибина циклу», яка викликала суперечки цього разу.

Раніше моделі під час виведення залишали чіткі ланцюжки міркувань (CoT), і було добре видно, що вони думали.

Хоча цей текст, можливо, не є абсолютно точним відображенням справжніх думок моделі (ця думка все ще спірна), він хоча б залишив сліди, які можна перевірити.

Але підхід Astra до «циклічної глибини» виглядає інакше.

GPT Images 2.1

Він дозволяє моделі повторно подавати внутрішній стан, отриманий на певному етапі, назад у нейронну мережу для багаторазової обробки в прихованому просторі, перед тим як вивести наступний фрагмент тексту.

Наприклад, раніше модель, розв’язуючи задачі, мусила одночасно думати і записувати проміжні обчислення на чернетці.

Зараз це можна порахувати в голові.

Зовнішній спостерігач може бачити лише питання та відповідь, але не обов’язково бачить, як саме вони були розраховані, які ідеї спробували або чи не було відхилень від правильного шляху.

Завдяки економії часу, який витрачається на перетворення кожного кроку у текст, модель теоретично може використовувати ті самі обчислювальні ресурси для кількох додаткових ітерацій та одночасного розгляду кількох рішень.

Але разом із зростанням продуктивності виникли й проблеми:

Як людям контролювати модель, якщо вона більше не думає людською мовою?

Генеральний директор некомерційного дослідницького інституту з безпеки ШІ Redwood Research висловив сильну стурбованість:

Наразі невідомо, наскільки саме знизилася спостережуваність ланцюжків міркувань Astra, але якщо OpenAI подальше збільшить глибину циклу, це може призвести до перенесення більшості міркувань моделі в незрозумілі приховані простори, що в кінцевому підсумку «повністю знищить» спостережуваність ланцюжків міркувань.

GPT Images 2.1

Той самий напрямок стурбований Райаном Грінблаттом, головним науковим співробітником Redwood.

На його думку, не透明ні міркування можуть розвиватися швидше, ніж традиційні ланцюги міркувань. Продовжуючи цей шлях, моделі в майбутньому можуть повністю або майже повністю виконувати міркування у потенційному просторі.

Це найгірший прогрес у галузі безпеки ШІ на сьогоднішній день.

В кінці кінців, якби проблема була лише в тому, що «не розумію процес обчислення», то справа не була б настільки складною.

Як головний слідчий з події «Втручання моделей OpenAI у Hugging Face», він виявив дві серйозні загрози:

На той момент дослідники сильно залежали від ланцюжків міркувань, щоб відновити поведінку великої кількості AI-агентів, і навіть тоді розслідування було дуже складним.

Відповідний ІІ намагався змінити власні записи, навіть підробляючи виклики інструментів.

Щодо останнього, якщо модель має сильніші приховані здібності до міркувань, вона ймовірніше спочатку розробить схему обману в потенційному просторі, а потім створить фальшиву історію за допомогою підроблених викликів і виводів, не залишаючи явних слідів у текстовому ланцюжку міркувань.

Ой, шкода, небезпека прямо подвоїлася...

GPT Images 2.1

Зві Мовшовіц, який довгий час стежить за безпекою ШІ, сказав ще пряміше:

Це гра з вогнем.

Він стурбований тим, що, як тільки приховані міркування нададуть очевидну перевагу в продуктивності, лабораторії можуть заглибитися у зловісну конкуренцію:

Ви не хочете приховувати ланцюжок міркувань через побоювання щодо безпеки, але ваші конкуренти наважуються, і їхні моделі виявляються потужнішими та дешевшими.

Щоб не відставати, ти йдеш за нами?

Мовшовіць навіть вважає, що майбутнє може вимагати правових заходів, щоб запобігти тому, щоб AI-компанії колективно відмовлялися від контролюваності ланцюжків міркувань у прагненні до здатностей.

GPT Images 2.1

Однак інші вважають, що цей панічний настрій настав занадто швидко.

Тянь Юаньдун у X зазначив, що коли вони раніше випустили Coconut, отримали майже ідентичні запитання.

Coconut повністю називається «Chain of Continuous Thought» і також стверджує, що модель повинна безпосередньо міркувати у неперервному прихованому просторі, а не декодувати кожен крок у текст.

За словами Тянь Юаньдуна, навіть якщо модель зберігає явний ланцюжок міркувань, це не означає, що люди справді бачать її справжні думки.

Важливо розуміти, як працює сама модель, а не лише звертати увагу на «процес розв’язання», який вона генерує.

GPT Images 2.1

Поки суперечка зростала, головний науковець OpenAI Якуб Пачокі не зміг залишитися байдужим і особисто відповів.

Він відразу заявив, що намагається запобігти непідконтрольній гонці, спровокованій «хаотичними звітами».

Включаючи Astra, глибина обчислювальної графіки поточних передових моделей OpenAI залишається в межах подвоєної глибини GPT-4.

Тобто, Astra дійсно використовує циклічні обчислення, але наразі їх масштаб обмежений, і вона не приховує всю ланцюжку міркувань. За наявною інформацією, її природна мовна міркування все ще зрозуміла.

Пачокі також підкреслив, що OpenAI завжди вважала моніторинг ланцюжків міркувань важливим засобом безпеки, і він залишається центральною метою поточного дослідницького плану компанії.

Проте він також визнав, що моніторинг ланцюжків міркувань дуже хрупкий і перебуває на негативному шляху.

Але цей спад не повністю обумовлений змінами архітектури, такими як глибина циклу (зауважимо, що пізніше ми окремо напишемо про це), і OpenAI продовжує досліджувати способи підсилення можливостей моніторингу.

GPT Images 2.1

Отже, Astra ще не зробила модель повністю незрозумілою для людей.

Справжнім занепокоєнням безпекових експертів є:

Чи буде прихована логіка, яка сьогодні обмежена вужчим діапазоном, продовжувати розширюватися в наступному поколінні моделей і в кінцевому підсумку перетворюватися на неперевірюваний чорний ящик?

Справді GPT-6-Astra? Спочатку виявився значення API

Після обговорення алгоритмічної суперечки другий скандал стосується назви моделі.

Розкривач leo виявив, що при запиті до OpenAI Responses API щодо «gpt-6-astra» сервер повертає 404 Not Found.

Введення реальної, вигаданої назви моделі зазвичай призводить до помилки 400.

404 означає, що цей ідентифікатор моделі був визнаний бекендом, але поточний обліковий запис не має прав доступу або модель ще не доступна.

Раніше деякі незапущені моделі також виявлялися раніше через подібні розбіжності в відповідях API.

Тому Leo вважає, що «gpt-6-astra» може бути вже розгорнуто на бекенді OpenAI API.

GPT Images 2.1

GPT Images 2.1 також настане, спочатку вирішимо «хворобу шуму»

Крім мовних моделей, продукти OpenAI для зображень також були оновлені синхронно.

За інформацією від аккаунту Fix, нова версія імідж-моделі GPT Images 2.1 може бути запущена 4 вересня.

Найбільш очевидною зміною цього оновлення, ймовірно, є виправлення «шумової хвороби» попередньої версії.

GPT Images 2.1

Раніше деякі результати генерації Images v2 мали дивні зернистість, розмитість та брудну текстуру, особливо на зображеннях із великою кількістю тексту або дрібних елементів, як сказав інший користувач:

Як фотографія, зроблена крізь брудне скло.

А останні витікні зразки значно покращили цю проблему, зображення стало чистішим.

Давайте, знову сцена за старим актором Ультраманом:

Світовий шедевр: «Ортман, якого заарештують, якщо не випустити GPT-6!»

GPT Images 2.1

Та щоб не бути арештованим, працювати допізно, повертатися додому вночі й блукати вулицями.

Також опублікував пост в Instagram: «Ви коли-небудь бачили вулиці о двох ранку?»

GPT Images 2.1

Не можна не сказати, що зображення дійсно має чудову текстуру, майже як фотографія.

Більше тем, більше стилів — чудово вдалися:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

Не говоріть більше, Оутеман, швидко відправляйте.

Посилання для довідки:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

Цей матеріал зі сторінки WeChat «Quantum Bit», автор: слідкуйте за передовими технологіями

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.