За даними TechCrunch, посилання на The Information, майбутня модель OpenAI Astra використовуватиме техніку міркування, що називається «рекурсивна глибина». Цей підхід може зменшити помітні сліди під час міркування моделі, ускладнюючи зовнішньому світу визначення причини висновків моделі за допомогою записів ланцюжків міркувань.
Дослідники безпеки висловили попередження
У поширених моделях міркувань ланцюжок міркувань зазвичай показує крок за кроком, як модель обробляє проблему. Хоча такий запис не є еквівалентом усіх реальних внутрішніх процесів моделі, він залишається важливим інструментом для спостереження за відхиленнями моделі від мети, незвичними рішеннями або потенційною втратою контролю.
Генеральний директор Redwood Research Бак Шлегеріс висловив «велику стурбованість» щодо використання Astra таких технологій. Він вважає, що якщо OpenAI подальше розширить застосування цих методів, спостережуваність ланцюжків міркувань моделі може значно знизитися.
Коментатор, який довгий час стежить за безпекою ШІ, Цві Мовшовіць, також зазначив, що якщо лабораторії будуть конкурувати між собою щодо здатностей моделей, регулятори можуть в майбутньому бути змушені втрутитися, щоб запобігти постійному зниженню стандартів безпеки в галузі.
Циклічні міркування зменшують видимі сліди
У матеріалі згадується, що так звана «непрозора рекурсія» означає, що модель більше не виконує міркування переважно лінійними кроками, а замість цього циклічно обробляє ту саму проблему. Це може зменшити кількість проміжних етапів, які можна прочитати ззовні, тим самим обходячи видимі шляхи, надані традиційними записами ланцюжка міркувань.
Це також та частина, яка найбільше тривожить дослідників безпеки. Бо коли модель все частіше виконує міркування в невидимих внутрішніх просторах, дослідникам важче визначити, чи вона дає помилкові відповіді, ухиляється від обмежень чи проявляє інші непередбачувані поведінки.
Головний науковець Redwood Research Райан Грінблатт зазначив, що більшим ризиком є те, що такі непрозорі міркування можуть масштабуватися легше, ніж традиційні міркування за ланцюжком мислення, що в кінцевому підсумку виведе більшість процесів міркування за межі видимих каналів.
OpenAI підкреслює важливість збереження можливостей моніторингу
Проте на даний момент використання Astra цієї технології, як повідомляється, все ще обмежене. Згідно зі звітом, ланцюжок міркувань цієї моделі, як очікується, залишиться зрозумілим, а OpenAI заперечує проти зовнішнього опису цього як переходу до повністю незрозумілих «нейролінгвістик».
Головний науковець OpenAI Якуб Пачоцкі на X сказав, що компанія з самого початку розробки моделей міркувань намагалася зберігати та використовувати здатність відстежувати ланцюжок міркувань, що є одним із ключових цілей поточного дослідницького плану.
Варто зауважити, що OpenAI — не єдина компанія, яка звертає увагу на цей напрямок. Пізніші матеріали The Information повідомили, що Anthropic і Google DeepMind також обговорюють подібні технології. Це означає, що баланс між підвищенням здатностей моделей та їх безпекою та перевіряємістю може швидко стати загальною темою для всієї індустрії ШІ.
