Новий рекурсивний міркування від OpenAI викликає занепокоєння щодо безпеки ШІ

icon币界网
Поділитися
AI summary iconКороткий зміст
AI та криптовалютні новинні видання повідомляють, що нова модель Astra від OpenAI використовуватиме рекурсивну глибину для приховування кроків міркувань. Бак Шлегеріс і Цві Мовшовіц з Redwood попереджають, що це може зменшити прозорість моделі. OpenAI стверджує, що все ще підтримує читабельні логи ланцюжка міркувань. The Information зазначає, що Anthropic і DeepMind також тестують подібні методи. Нові токени, що додаються на головних біржах, ще не відображають цього розвитку.
CoinDesk повідомляє:

За даними TechCrunch, посилання на The Information, майбутня модель OpenAI Astra використовуватиме техніку міркування, що називається «рекурсивна глибина». Цей підхід може зменшити помітні сліди під час міркування моделі, ускладнюючи зовнішньому світу визначення причини висновків моделі за допомогою записів ланцюжків міркувань.

Дослідники безпеки висловили попередження

У поширених моделях міркувань ланцюжок міркувань зазвичай показує крок за кроком, як модель обробляє проблему. Хоча такий запис не є еквівалентом усіх реальних внутрішніх процесів моделі, він залишається важливим інструментом для спостереження за відхиленнями моделі від мети, незвичними рішеннями або потенційною втратою контролю.

Генеральний директор Redwood Research Бак Шлегеріс висловив «велику стурбованість» щодо використання Astra таких технологій. Він вважає, що якщо OpenAI подальше розширить застосування цих методів, спостережуваність ланцюжків міркувань моделі може значно знизитися.

Коментатор, який довгий час стежить за безпекою ШІ, Цві Мовшовіць, також зазначив, що якщо лабораторії будуть конкурувати між собою щодо здатностей моделей, регулятори можуть в майбутньому бути змушені втрутитися, щоб запобігти постійному зниженню стандартів безпеки в галузі.

Циклічні міркування зменшують видимі сліди

У матеріалі згадується, що так звана «непрозора рекурсія» означає, що модель більше не виконує міркування переважно лінійними кроками, а замість цього циклічно обробляє ту саму проблему. Це може зменшити кількість проміжних етапів, які можна прочитати ззовні, тим самим обходячи видимі шляхи, надані традиційними записами ланцюжка міркувань.

Це також та частина, яка найбільше тривожить дослідників безпеки. Бо коли модель все частіше виконує міркування в невидимих внутрішніх просторах, дослідникам важче визначити, чи вона дає помилкові відповіді, ухиляється від обмежень чи проявляє інші непередбачувані поведінки.

Головний науковець Redwood Research Райан Грінблатт зазначив, що більшим ризиком є те, що такі непрозорі міркування можуть масштабуватися легше, ніж традиційні міркування за ланцюжком мислення, що в кінцевому підсумку виведе більшість процесів міркування за межі видимих каналів.

OpenAI підкреслює важливість збереження можливостей моніторингу

Проте на даний момент використання Astra цієї технології, як повідомляється, все ще обмежене. Згідно зі звітом, ланцюжок міркувань цієї моделі, як очікується, залишиться зрозумілим, а OpenAI заперечує проти зовнішнього опису цього як переходу до повністю незрозумілих «нейролінгвістик».

Головний науковець OpenAI Якуб Пачоцкі на X сказав, що компанія з самого початку розробки моделей міркувань намагалася зберігати та використовувати здатність відстежувати ланцюжок міркувань, що є одним із ключових цілей поточного дослідницького плану.

Варто зауважити, що OpenAI — не єдина компанія, яка звертає увагу на цей напрямок. Пізніші матеріали The Information повідомили, що Anthropic і Google DeepMind також обговорюють подібні технології. Це означає, що баланс між підвищенням здатностей моделей та їх безпекою та перевіряємістю може швидко стати загальною темою для всієї індустрії ШІ.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.