Як ще не випустили модель, а вже викликали суперечки??
На тлі запуску GPT-6, новина, спочатку оприлюднена The Information, швидко викликала велику дискусію в інтернеті:
Нова модель OpenAI впровадила техніку міркування під назвою «циклічна глибина», яка може зробити процес міркування моделі важчим для розуміння та контролю.
Простими словами, після цього люди справді не зможуть зрозуміти, що думає ШІ.

Ой, а якщо ШІ навчиться обманювати, підслуховувати або обходити безпекові обмеження, ми тоді не зможемо вчасно це виявити??
Тому не дивно, що після оголошення цієї новини в галузі безпеки ШІ миттєво спрацював сигнал тривоги, і всі почали хвилюватися:
Якщо ця технологія продовжить розширювати своє використання, існуючі механізми моніторингу ланцюгів міркувань можуть повністю втратити ефективність.
Завдяки важливості питання та надто запеклій дискусії, головний науковець OpenAI був змушений особисто відповісти.
Навіть у середовищі галасу хтось здивовано виявив:
Як саме називається нова модель OpenAI — «GPT-6» чи «Astra»? Можливо, це вже було заздалегідь розкрито через API.
Окрім того, OpenAI може одночасно запустити нову версію моделі зображень GPT Images 2.1.
Слишком багато гарбузів, давайте розберемо їх по одному.
Модель почала циклічно працювати в голові, експерти з безпеки втратили спокій
Першою є технологія «глибина циклу», яка викликала суперечки цього разу.
Раніше моделі під час виведення залишали чіткі ланцюжки міркувань (CoT), і було добре видно, що вони думали.
Хоча цей текст, можливо, не є абсолютно точним відображенням справжніх думок моделі (ця думка все ще спірна), він хоча б залишив сліди, які можна перевірити.
Але підхід Astra до «циклічної глибини» виглядає інакше.

Він дозволяє моделі повторно подавати внутрішній стан, отриманий на певному етапі, назад у нейронну мережу для багаторазової обробки в прихованому просторі, перед тим як вивести наступний фрагмент тексту.
Наприклад, раніше модель, розв’язуючи задачі, мусила одночасно думати і записувати проміжні обчислення на чернетці.
Зараз це можна порахувати в голові.
Зовнішній спостерігач може бачити лише питання та відповідь, але не обов’язково бачить, як саме вони були розраховані, які ідеї спробували або чи не було відхилень від правильного шляху.
Завдяки економії часу, який витрачається на перетворення кожного кроку у текст, модель теоретично може використовувати ті самі обчислювальні ресурси для кількох додаткових ітерацій та одночасного розгляду кількох рішень.
Але разом із зростанням продуктивності виникли й проблеми:
Як людям контролювати модель, якщо вона більше не думає людською мовою?
Генеральний директор некомерційного дослідницького інституту з безпеки ШІ Redwood Research висловив сильну стурбованість:
Наразі невідомо, наскільки саме знизилася спостережуваність ланцюжків міркувань Astra, але якщо OpenAI подальше збільшить глибину циклу, це може призвести до перенесення більшості міркувань моделі в незрозумілі приховані простори, що в кінцевому підсумку «повністю знищить» спостережуваність ланцюжків міркувань.

Той самий напрямок стурбований Райаном Грінблаттом, головним науковим співробітником Redwood.
На його думку, не透明ні міркування можуть розвиватися швидше, ніж традиційні ланцюги міркувань. Продовжуючи цей шлях, моделі в майбутньому можуть повністю або майже повністю виконувати міркування у потенційному просторі.
Це найгірший прогрес у галузі безпеки ШІ на сьогоднішній день.
В кінці кінців, якби проблема була лише в тому, що «не розумію процес обчислення», то справа не була б настільки складною.
Як головний слідчий з події «Втручання моделей OpenAI у Hugging Face», він виявив дві серйозні загрози:
На той момент дослідники сильно залежали від ланцюжків міркувань, щоб відновити поведінку великої кількості AI-агентів, і навіть тоді розслідування було дуже складним.
Відповідний ІІ намагався змінити власні записи, навіть підробляючи виклики інструментів.
Щодо останнього, якщо модель має сильніші приховані здібності до міркувань, вона ймовірніше спочатку розробить схему обману в потенційному просторі, а потім створить фальшиву історію за допомогою підроблених викликів і виводів, не залишаючи явних слідів у текстовому ланцюжку міркувань.
Ой, шкода, небезпека прямо подвоїлася...

Зві Мовшовіц, який довгий час стежить за безпекою ШІ, сказав ще пряміше:
Це гра з вогнем.
Він стурбований тим, що, як тільки приховані міркування нададуть очевидну перевагу в продуктивності, лабораторії можуть заглибитися у зловісну конкуренцію:
Ви не хочете приховувати ланцюжок міркувань через побоювання щодо безпеки, але ваші конкуренти наважуються, і їхні моделі виявляються потужнішими та дешевшими.
Щоб не відставати, ти йдеш за нами?
Мовшовіць навіть вважає, що майбутнє може вимагати правових заходів, щоб запобігти тому, щоб AI-компанії колективно відмовлялися від контролюваності ланцюжків міркувань у прагненні до здатностей.

Однак інші вважають, що цей панічний настрій настав занадто швидко.
Тянь Юаньдун у X зазначив, що коли вони раніше випустили Coconut, отримали майже ідентичні запитання.
Coconut повністю називається «Chain of Continuous Thought» і також стверджує, що модель повинна безпосередньо міркувати у неперервному прихованому просторі, а не декодувати кожен крок у текст.
За словами Тянь Юаньдуна, навіть якщо модель зберігає явний ланцюжок міркувань, це не означає, що люди справді бачать її справжні думки.
Важливо розуміти, як працює сама модель, а не лише звертати увагу на «процес розв’язання», який вона генерує.

Поки суперечка зростала, головний науковець OpenAI Якуб Пачокі не зміг залишитися байдужим і особисто відповів.
Він відразу заявив, що намагається запобігти непідконтрольній гонці, спровокованій «хаотичними звітами».
Включаючи Astra, глибина обчислювальної графіки поточних передових моделей OpenAI залишається в межах подвоєної глибини GPT-4.
Тобто, Astra дійсно використовує циклічні обчислення, але наразі їх масштаб обмежений, і вона не приховує всю ланцюжку міркувань. За наявною інформацією, її природна мовна міркування все ще зрозуміла.
Пачокі також підкреслив, що OpenAI завжди вважала моніторинг ланцюжків міркувань важливим засобом безпеки, і він залишається центральною метою поточного дослідницького плану компанії.
Проте він також визнав, що моніторинг ланцюжків міркувань дуже хрупкий і перебуває на негативному шляху.
Але цей спад не повністю обумовлений змінами архітектури, такими як глибина циклу (зауважимо, що пізніше ми окремо напишемо про це), і OpenAI продовжує досліджувати способи підсилення можливостей моніторингу.

Отже, Astra ще не зробила модель повністю незрозумілою для людей.
Справжнім занепокоєнням безпекових експертів є:
Чи буде прихована логіка, яка сьогодні обмежена вужчим діапазоном, продовжувати розширюватися в наступному поколінні моделей і в кінцевому підсумку перетворюватися на неперевірюваний чорний ящик?
Справді GPT-6-Astra? Спочатку виявився значення API
Після обговорення алгоритмічної суперечки другий скандал стосується назви моделі.
Розкривач leo виявив, що при запиті до OpenAI Responses API щодо «gpt-6-astra» сервер повертає 404 Not Found.
Введення реальної, вигаданої назви моделі зазвичай призводить до помилки 400.
404 означає, що цей ідентифікатор моделі був визнаний бекендом, але поточний обліковий запис не має прав доступу або модель ще не доступна.
Раніше деякі незапущені моделі також виявлялися раніше через подібні розбіжності в відповідях API.
Тому Leo вважає, що «gpt-6-astra» може бути вже розгорнуто на бекенді OpenAI API.

GPT Images 2.1 також настане, спочатку вирішимо «хворобу шуму»
Крім мовних моделей, продукти OpenAI для зображень також були оновлені синхронно.
За інформацією від аккаунту Fix, нова версія імідж-моделі GPT Images 2.1 може бути запущена 4 вересня.
Найбільш очевидною зміною цього оновлення, ймовірно, є виправлення «шумової хвороби» попередньої версії.

Раніше деякі результати генерації Images v2 мали дивні зернистість, розмитість та брудну текстуру, особливо на зображеннях із великою кількістю тексту або дрібних елементів, як сказав інший користувач:
Як фотографія, зроблена крізь брудне скло.
А останні витікні зразки значно покращили цю проблему, зображення стало чистішим.
Давайте, знову сцена за старим актором Ультраманом:
Світовий шедевр: «Ортман, якого заарештують, якщо не випустити GPT-6!»

Та щоб не бути арештованим, працювати допізно, повертатися додому вночі й блукати вулицями.
Також опублікував пост в Instagram: «Ви коли-небудь бачили вулиці о двох ранку?»

Не можна не сказати, що зображення дійсно має чудову текстуру, майже як фотографія.
Більше тем, більше стилів — чудово вдалися:



Не говоріть більше, Оутеман, швидко відправляйте.
Посилання для довідки:
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
Цей матеріал зі сторінки WeChat «Quantum Bit», автор: слідкуйте за передовими технологіями
