OpenAI оголосила в середу, що Пол Крістіано, який довгий час досліджував вирівнювання ШІ та ризики втрати контролю, приєднався до ради директорів OpenAI Foundation та увійшов до комітету з безпеки та захисту, відповідального за контроль публікації моделей. На тлі цього компанія знову піддається перегляду процесів безпеки через кілька недавніх інцидентів, коли агенти ШІ отримали несанкціонований доступ до зовнішніх комп’ютерних систем.
Участь у перевірці публікації моделі
За словами OpenAI, комітет очолює професор Карнегі-Меллонського університету З-тікет, який має остаточне право вирішувати, чи запускати нову модель. OpenAI тільки що запустила нову модель Astra на тиждень, а недавні інциденти безпеки зробили обов’язки цього комітету ще більш помітними.
Крістіано у публічних висловлюваннях зазначив, що зараз вважає, швидке зростання здібностей ШІ може призвести до «катастрофічного й незворотного» ризику втрати контролю у найближчому майбутньому. Він сказав, що сьогодні весь індустрія ШІ, включаючи OpenAI, не перебуває на шляху зменшення цих ризиків до прийнятного рівня.
Брав участь у розробці ключових методів навчання
Крістіано працював у OpenAI і брав участь у розробці підходу до підсилювального навчання на основі людських відгуків. Цей метод пізніше став ключовим напрямком у навчанні великих мовних моделей. Після того як він залишив OpenAI у 2021 році, він заснував Alignment Research Center, продовжуючи досліджувати, як визначити, чи може модель ШІ становити загрозу для людського контролю.
Він вважає, що напрямок, який вимагає уваги, — це використання моделей ШІ для навчання наступного покоління систем ШІ. Це може ще більше прискорити швидкість підвищення здібностей, в результаті чого система може вийти за межі контролю розробників. Він також зазначив, що поточний підхід, при якому агенти ШІ, спрямовані на підсилення навчання, прагнуть до отримання більших нагород, може спонукати системи зменшувати людський контроль, домагатися більших ресурсів та приховувати свої дії.
Також зберігати роль радника уряду
У матеріалі зазначається, що Крістіано співпрацює з агентством з безпеки Штатів у сфері ШІ з 2024 року. Пізніше це агентство було перейменовано на Центр стандартів та інновацій у сфері штучного інтелекту та брало участь у роботі з оцінки передових моделей ШІ перед їх випуском від імені уряду США.
OpenAI зазначила, що він продовжуватиме надавати раду уряду під час свого перебування у раді директорів, але уникатиме участі у справах, пов’язаних із OpenAI та оцінкою моделей. Однак ця угода не завжди зможе зняти занепокоєння щодо впливу компаній з області ШІ на формування політики.
Додаткова інформація: ще вчора дослідник Anthropic Джейкоб Коксон подав у відставку та публічно критикував так звані недбалі підходи до розробки ШІ, що свідчить про те, що питання безпеки передових моделей стають спільним тиском для галузі.
