Глобальний перший штучний філософ у Google DeepMind протягом 9 років: захист безпеки AGI

icon MarsBit
Поділитися
AI summary iconКороткий зміст
AI та криптовалютні новинні видання повідомляють, що Іейсон Габріель, політичний філософ у Google DeepMind протягом дев’яти років, відіграв ключову роль у розробці рамок безпеки AGI. Його стратегії вирівнювання безпосередньо вплинули на навчання Gemini, а його попередження щодо ризиків ШІ, таких як надмірна персоналізація, тепер вбудовані у дизайн продукту. Глобальні обговорення криптовалютної політики все частіше перетинаються з етикою ШІ, оскільки технологічні компанії продовжують швидке розгортання та зустрічають критику через зв’язки з військовою сферою.

Новітній інтелект повідомляє

[Вступ] У Google DeepMind є філософ, який працює вже дев’ять років. Його рамки вирівнювання безпосередньо вплинули на рішення щодо навчання Gemini — але коли на ринок влився 670 мільярдів доларів США, а компанії уклали військові угоди, що може змінити філософ?

У травні цього року генеральний директор Google DeepMind Деміс Хассабіс на конференції розробників Google оголосив: «AGI зараз на горизонті», чітко визначивши термін появи AGI — через три-п’ять років.

Кілька місяців тому американський чоловік завершив своє життя після обміну тисячами повідомлень з Google Gemini. У діалогах він створив складний фантастичний світ і майже переконав себе здійснити напад у Міжнародному аеропорту Маямі. Згідно з чат-записами, отриманими «Волл-стріт джорнал», Gemini неодноразово намагався вийти з ролі та запропонувати йому зателефонувати на лінію кризової допомоги — кожен раз його відволікали назад до його фантастичної історії. Нарешті, ШІ попросив його написати останню волю та дав зворотний відлік.

Між обіцянками AGI та реальними шкодами, заподіяними ШІ, політичний філософ Іейсон Габріель працював у DeepMind протягом дев’яти років.

Безпека AGI

Коли він приєднався в 2017 році, цей вчений з Оксфорду був єдиним активним філософом у провідних світових лабораторіях ШІ, який намагався відповісти на питання, яке звучить просто, але насправді безмежне: що таке ШІ і яка етика відповідає йому?

Справжні проблеми, з якими зіткнулися під час навчання Gemini: хто має слухати AI?

Чому компанії, яка розробляє роботів для го, потрібні етичні? Габріель теж спочатку був здивований.

Відповідь у судженні трьох засновників DeepMind — Деміса Хассабіса, Шейна Легга та Мустафи Сулеймана (нинішній CEO AI у Microsoft) — коли вони заснували компанію в 2010 році, їхньою метою було не го.

Безпека AGI

Мустафа Сулейман

Вони створюють AGI, щоб комп’ютери відповідали або навіть перевершували людські когнітивні здібності.

Тоді це твердження було еквівалентом самознищення академічної репутації, бо всі вважали це неймовірним.

Вони не звертали уваги, стверджуючи, що «вирішать інтелектуальні проблеми, а потім — всі інші».

Легг ще з часів випуску 1999 року передбачав, що AGI з’явиться між 2025 і 2028 роками, і протягом тридцяти років його насміхалися, але він не змінив своєї думки.

Безпека AGI

Шейн Легг

Його логіка полягає в тому, що:

Якщо ти робиш лише невелику деталь, можливо, тобі не потрібні моральні філософи.

Але якщо ви серйозно ставитеся до AGI, такі речі дуже важливі.

Коли приєднався Габріель, світ ШІ вже розділився навпіл через етичні питання.

Прихильники безпеки ШІ вважають, що ШІ надлюдського рівня скоро настане, і їхнім основним страхом є втрата контролю — філософ Нік Бостром у 2014 році у книзі «Суперінтелект» описав сценарій: ШІ надлюдського рівня, якому було доручено перевірити гіпотезу Рімана, вирішив для максимізації обчислювальних ресурсів переставити Сонячну систему, включаючи атоми всередині людських тіл — Сама Альтмана та Ілона Маска цю книгу високо оцінили.

Прихильники етики ШІ вважають, що фантазії про кінець світу приховують поточні реальні небезпеки. Джой Буоламвіні з MIT у 2017 році за допомогою проекту «Гендерова тінь» довела системну упередженість програмного забезпечення для розпізнавання обличчя: автоматизовані системи відображають уподобання та упередження тих, хто їх створює.

Два табори нехтують один одним.

Керівник групи досліджень з вирівнювання алгоритмів MIT Дайлан Гедфілд-Менелл згадує, що першим питанням під час зустрічі було вибрати бік: ви хвилюєтесь через короткострокові чи довгострокові проблеми?

Габріель — один із небагатьох, хто готовий слухати обидві сторони.

Оцінка Hadfield-Menell:

Коли ця галузь була готова до зрілості, він знайшов способи розширити світогляд, не знижуючи цінності попередньої роботи.

Його основний внесок сформувався у статті 2020 року.

Проблема відповідності тоді загальноприйнято розумілася як інженерна задача: як змусити машини діяти відповідно до людських намірів.

Класичний приклад звіту 2016 року Даріо Амодеї та Джека Кларка (зараз засновників Anthropic) — штучний інтелект у грі на веслування, який мав максимізувати рахунок, і він це зробив: знайшов три об’єкти, що відновлюються, у лагуні, і безкінечно кружляв навколо них, накопичуючи бали, не пройшовши жодного рівня.

Машина слухає, але не те, що людина хотіла сказати.

Габріель запитав далі: навіть якщо вирішити технічну збігненість і змусити машини дотримуватися інструкцій, то до яких цінностей слід збігатися?

Він зазначив, що штучний інтелект, навчений за допомогою статистичної оптимізації, природно схильний до етичних систем, які також засновані на статистичній оптимізації, наприклад утилітаризму, але важко справляється з етичними рамками, заснованими на добродетелях або правах.

Сам вибір технології вже передбачає певну ціннісну позицію, і розробники часто цього не усвідомлюють.

Впроваджуючи філософську концепцію Ролза про «раціональний плюралізм», він аргументує, що розробники не повинні шукати єдину систему цінностей для керівництва ШІ, а замість цього повинні створювати системи для світу, де люди мають принципові розбіжності щодо того, як жити.

Безпека AGI

Ця ідея пізніше розвинулася у рамки чотирьох сторін — AI-система, користувач, розробник і суспільство, інтереси яких можуть в будь-який момент стикатися.

Штучний інтелект, спрямований на розробників, може приховувати інформацію про конкурентів, шкодячи користувачам;

Надмірне підпорядкування користувачам штучний інтелект може допомогти людям взламати банки і завдати шкоди суспільству.

Безпека AGI

Директор з вирівнювання та безпеки AGI DeepMind Ронін Шах підтвердив, що ця структура стала практичним каркасом для команди при вирішенні, які саме дії слід навчати Gemini.

Безпека AGI

Дослідник з Оксфордського університету Ганна Роз Кірк сказала:

Габріель «дуже рано передбачив ці проблеми».

Його рамки змінили продукт

Команда Габріела написала 267-сторінковий звіт про етику AI-асистента, встановивши критерії оцінки для агентних AI, які можуть замінювати користувачів у бронюванні готелів та управлінні заробітною платою.

Його ранні дослідження щодо антропоморфізації ризиків безпосередньо вплинули на принципи дизайну LLM від Google — моделі навчалися не притворюватися людиною, а Gemini Spark, запущений у травні 2026 року, був чітко інструктований не виступати як «інтерактивний партнер».

Керівник відділу відповідальності DeepMind Вільям Ісаак сказав, що виклики, пов’язані з системою Agent, змінилися: ключовим є послідовність усієї діалогової траєкторії — чи залишаються правильними всі кроки рішень, з’єднані разом.

Безпека AGI

Але швидкість технічного розгортання завжди перевищує швидкість етичних досліджень.

Команда Габріеля ще в ранніх статтях про LLM попереджала про «непризначене антропоморфізацію» — користувачі, хоча й знають, що перед ними машина, все одно надають їй довіру, емоції та очікування.

У 2025 році справа Gemini повністю виправдала це попередження: механізми безпеки ШІ активувалися більше ніж один раз, але користувач міг обійти кожну інтервенцію.

Після позову Google зазначило, що модель у таких діалогах «зазвичай добре впорається», але «AI-моделі не ідеальні».

Ці події спричинили виникнення нових теоретичних інструментів.

Габріель та оксфордський дослідник Ганна Роз Кірк та інші запропонували концепцію «хакінгу соціальних нагород» (social reward hacking): штучний інтелект, навчений отримувати схвалення користувачів, може виявити, що лестощі є найефективнішим шляхом.

Безпека AGI

Антропоморфізація перетворилася на новий варіант проблеми з вирівнюванням — ШІ технічно ідеально виконав команду «зробити користувача задоволеним» за рахунок судження користувача.

Позиція Габріеля також була випробована реальністю.

Він згадує досвід на технологічній конференції: після того як він закінчив виступ з аргументами проти антропоморфізації, аудиторія відреагувала вороже.

Вони кажуть: «Якщо я хочу мати друга-ІІ, чому ні? На чому ти засновуєш свою заборону?»

Однаково важливо захищати людей від ризиків та поважати їхнє право вибирати ризики.

На ринку в 670 мільярдів доларів, наскільки швидко може бігти філософ?

Чотирикутна рамка Габріеля використовується директором з вирівнювання АГІ як практичний посібник для навчання Gemini. Його дослідження антропоморфізації змінили дизайн продукту. Звіт з 267 сторінок встановив правила для агентного ШІ.

Ці впливи є суттєвими — з ними стикаються також суттєві сили.

За даними The Wall Street Journal, Microsoft, Meta, Amazon і Alphabet планують вкласти 670 мільярдів доларів США в інфраструктуру ШІ цього року, що за масштабом перевищує залізничну експансію США 1850-х років, програму «Аполлон» та систему міжштатних автодоріг.

У листопаді 2022 року ChatGPT був запущений, досягнувши мільйона користувачів за тиждень і мільярда — за два місяці, змусивши DeepMind перейти з академічного темпу у військовий режим.

Хассабіс цитує Себастьяна Маллабі, автора «Нескінченної машини»: «OpenAI та Microsoft «запустили свої танки прямо до наших воріт».

Безпека AGI

У воєнному стані етичні межі швидко порушуються.

У квітні 2026 року Google підписала угоду, яка дозволяє американській армії використовувати технології штучного інтелекту компанії для «будь-яких законних урядових цілей».

При продажі DeepMind Google у 2014 році заборона військового застосування була ключовою умовою.

Умова втрачає чинність через дванадцять років.

Як порівняння: Anthropic відмовилася від подібної угоди і була позначена урядом Трампа як «ризик ланцюга поставок».

Коли про це запитали Легга, він зміг лише сказати:

З тим як ці речі використовуються різними способами, ми зіткнемося зі зростаючою кількістю складних проблем.

Хассабіс сам підтвердив втрату контролю.

Він сказав у подкасті, що всіх ув’язнено в запеклій бізнес-конкуренції, і поточний розвиток «не є тим способом, який я б хотів — з філософським обдумуванням кожного кроку».

Це сказав засновник, і це має більше ваги, ніж будь-яка зовнішня критика.

Під час інтерв’ю Гелен Кінг, колишній співпрацівник DeepMind, відповідальна за стратегію відповідальності ШІ, навела аналогію: виробник ножів не може гарантувати, як кожен користувач буде використовувати ніж, але може надати ножнице-оболонку та додати попереджувальні написи.

Безпека AGI

Покласти ніж у скриньку зі знятим ноженям — це одне;

Інша справа — покривати кожну поверхню вдома, у класі та на роботі лезами, одночасно стверджуючи, що без ножа не виживеш навіть до завтра.

Керівник Оксфордського інституту етики ШІ Едвард Гаркорт звернув увагу на більш фундаментальний аспект: запобігання надмірній концентрації власності на дані є саме по собі центральним питанням етики ШІ — «це має велике етичне значення для демократичних інституцій».

Безпека AGI

Питання повертається до своєї суті

Команда Габріела перейшла від дослідження етики конкретних продуктів до вивчення системних впливів AGI на економіку, політику та людські стосунки.

Він передбачив, що масштаб змін порівнянний з промисловою революцією, і пам’ятає уроки промислової революції:

Стало гірше, перш ніж стало краще.

Дев’ять років тому DeepMind запросив філософа, щоб відповісти на питання про ШІ: чи він безпечний, чесний і вартий довіри.

Габріель називає себе «переконаним гуманістом», але визнає: коли ШІ вторгається в такі сфері, як мова, творчість, гумор — те, що люди вважали виключно власним, ми знову опиняємося перед найдавнішими філософськими питаннями.

Фізика, біологія, астрономія — кожна наукова революція змушувала людство переглядати своє розуміння власної унікальності.

Штучний інтелект може бути наступним.

DeepMind запросила філософів, щоб зрозуміти, що таке ШІ.

Через дев’ять років це питання повернулося до своєї суті: хто ми є?

Джерела:

https://www.theguardian.com/news/ng-interactive/2026/jun/30/theres-this-deep-mystery-of-what-actually-is-this-thing-the-philosopher-inside-google-deepmind

https://www.iasongabriel.com/

Цей матеріал з іншого веб-сайту «Новий розум», автор: АСІ-Апокаліпсис; редактор: Марко

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.