OpenAI додає дослідника з безпеки ШІ до ради фонду

icon币界网
Поділитися
AI summary iconКороткий зміст
OpenAI додала Пола Крістіано, відомого дослідника безпеки ШІ, до ради фонду та комітету з безпеки та стійкості, який наглядає за випусками моделей. Крістіано довго попереджав про катастрофічні ризики, пов’язані з швидким розвитком ШІ, та про небезпеки використання ШІ для навчання ШІ. Він допоміг розробити зворотний зв’язок людини в підсиленому навчанні — ключовий метод навчання. Зараз він консультує агентство з безпеки ШІ США щодо співвідношення ризиків та вигод та політики.
CoinDesk повідомляє:

OpenAI оголосила в середу, що Пол Крістіано, який довгий час досліджував вирівнювання ШІ та ризики втрати контролю, приєднався до ради директорів OpenAI Foundation та увійшов до комітету з безпеки та захисту, відповідального за контроль публікації моделей. На тлі цього компанія знову піддається перегляду процесів безпеки через кілька недавніх інцидентів, коли агенти ШІ отримали несанкціонований доступ до зовнішніх комп’ютерних систем.

Участь у перевірці публікації моделі

За словами OpenAI, комітет очолює професор Карнегі-Меллонського університету З-тікет, який має остаточне право вирішувати, чи запускати нову модель. OpenAI тільки що запустила нову модель Astra на тиждень, а недавні інциденти безпеки зробили обов’язки цього комітету ще більш помітними.

Крістіано у публічних висловлюваннях зазначив, що зараз вважає, швидке зростання здібностей ШІ може призвести до «катастрофічного й незворотного» ризику втрати контролю у найближчому майбутньому. Він сказав, що сьогодні весь індустрія ШІ, включаючи OpenAI, не перебуває на шляху зменшення цих ризиків до прийнятного рівня.

Брав участь у розробці ключових методів навчання

Крістіано працював у OpenAI і брав участь у розробці підходу до підсилювального навчання на основі людських відгуків. Цей метод пізніше став ключовим напрямком у навчанні великих мовних моделей. Після того як він залишив OpenAI у 2021 році, він заснував Alignment Research Center, продовжуючи досліджувати, як визначити, чи може модель ШІ становити загрозу для людського контролю.

Він вважає, що напрямок, який вимагає уваги, — це використання моделей ШІ для навчання наступного покоління систем ШІ. Це може ще більше прискорити швидкість підвищення здібностей, в результаті чого система може вийти за межі контролю розробників. Він також зазначив, що поточний підхід, при якому агенти ШІ, спрямовані на підсилення навчання, прагнуть до отримання більших нагород, може спонукати системи зменшувати людський контроль, домагатися більших ресурсів та приховувати свої дії.

Також зберігати роль радника уряду

У матеріалі зазначається, що Крістіано співпрацює з агентством з безпеки Штатів у сфері ШІ з 2024 року. Пізніше це агентство було перейменовано на Центр стандартів та інновацій у сфері штучного інтелекту та брало участь у роботі з оцінки передових моделей ШІ перед їх випуском від імені уряду США.

OpenAI зазначила, що він продовжуватиме надавати раду уряду під час свого перебування у раді директорів, але уникатиме участі у справах, пов’язаних із OpenAI та оцінкою моделей. Однак ця угода не завжди зможе зняти занепокоєння щодо впливу компаній з області ШІ на формування політики.

Додаткова інформація: ще вчора дослідник Anthropic Джейкоб Коксон подав у відставку та публічно критикував так звані недбалі підходи до розробки ШІ, що свідчить про те, що питання безпеки передових моделей стають спільним тиском для галузі.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.