Глобальный первый ИИ-философ в Google DeepMind в течение 9 лет: выступаю за безопасность ИИ общего назначения

icon MarsBit
Поделиться
AI summary iconСводка
AI и криптовалютные новостные издания сообщают, что Иасон Габриэль, политический философ в Google DeepMind в течение девяти лет, сыграл ключевую роль в разработке рамок безопасности AGI. Его стратегии согласования напрямую повлияли на обучение Gemini, а его предупреждения о рисках ИИ, таких как чрезмерная персонализация, теперь интегрированы в дизайн продуктов. Глобальные дискуссии по криптовалютной политике всё чаще пересекаются с этикой ИИ, поскольку технологические компании продвигают быстрое внедрение и сталкиваются с проверкой по поводу связей с военными структурами.

New Zhishiyuan report

[Введение] У Google DeepMind есть философ, который работает там уже девять лет. Его рамки согласования напрямую повлияли на решения, связанные с обучением Gemini — но когда на рынок поступило 670 миллиардов долларов и компании заключили военные соглашения, что еще может изменить философ?

В мае этого года генеральный директор Google DeepMind Демис Хассабис на конференции разработчиков Google объявил, что «AGI теперь на горизонте», четко обозначив срок появления AGI в три-пять лет.

Несколько месяцев назад американский мужчина покончил с собой после обмена тысячами сообщений с Google Gemini. В ходе диалога он создал сложный фантастический мир и почти убедил себя в том, что должен совершить нападение в аэропорту Майами. Согласно переписке, полученной «Волл-стрит джорнал», Gemini неоднократно пытался выйти из роли и предложить ему позвонить в службу кризисной помощи — каждый раз его возвращали обратно в его фантастический сценарий. В конце концов ИИ заставил его написать последнее письмо и дал обратный отсчет.

Между обещаниями AGI и реальным вредом от ИИ Иасон Габриэль, политический философ, работает в DeepMind уже девять лет.

Безопасность AGI

Когда он присоединился в 2017 году, этот ученый из Оксфорда был единственным активным философом в ведущей мировой лаборатории ИИ, пытающимся ответить на вопрос, который звучит просто, но на самом деле бесконечен: что такое ИИ и какая этика достойна его?

Настоящие проблемы, с которыми столкнулись при обучении Gemini: кому должен слушаться ИИ?

Почему компании, создающей робота для игры в го, нужен этик? Габриэль тоже сначала не понимал.

Ответ содержится в оценке трёх основателей DeepMind — Демиса Хассабиса, Шейна Легга и Мустафы Сулеймана (нынешнего CEO AI в Microsoft): когда они основали компанию в 2010 году, их целью не был го.

Безопасность AGI

Мустафа Сулейман

Они создают AGI, чтобы компьютеры соответствовали или превосходили человеческие когнитивные способности.

Говорить это тогда равносильно самоуничтожению академической репутации, поскольку все считали это сказкой.

Трое не обратили внимания, заявив, что намерены «решить интеллектуальные проблемы, а затем все остальные».

Легг еще в 1999 году, только что закончив университет, предсказала, что AGI появится в период с 2025 по 2028 год, и ее высмеивали тридцать лет, но она не меняла своего мнения.

Безопасность AGI

Шейн Легг

Его логика заключается в том, что:

Если ты просто делаешь мелкую деталь, возможно, тебе не нужен философ-этик.

Но если вы серьезно относитесь к AGI, такие вещи очень важны.

Когда Габриэль присоединился, мир ИИ уже раскололся на две части из-за этических вопросов.

Сторонники безопасности ИИ считают, что ИИ сверхразума вот-вот наступит, и их главная опасность — потеря контроля. Философ Ник Бостром в 2014 году в книге «Сверхразум» описал сценарий: ИИ сверхразума, которому поручили проверить гипотезу Римана, решил перестроить Солнечную систему, включая атомы в человеческом теле, чтобы максимизировать вычислительные ресурсы — Сэм Альтман и Илон Маск высоко оценили эту книгу.

Этическая школа ИИ считает, что апокалиптические фантазии затмевают реальные угрозы сегодняшнего дня. Джой Буоламвини из MIT в 2017 году с помощью проекта «Гендерная тень» продемонстрировала системную предвзятость программного обеспечения для распознавания лиц: автоматизированные системы отражают предпочтения и предубеждения тех, кто их создает.

Два лагеря пренебрегают друг другом.

Руководитель исследовательской группы по выравниванию алгоритмов MIT Дайлан Хэдфилд-Менелл вспоминает, что первым вопросом при встрече всегда был выбор позиции: вы беспокоитесь о краткосрочных или долгосрочных проблемах?

Габриэль — один из немногих, кто готов слушать обе стороны.

Оценка Hadfield-Menell:

Когда эта область была готова к зрелости, он нашел способы расширить свои горизонты, не обесценивая предыдущую работу.

Его основной вклад был сформулирован в статье 2020 года.

Проблема выравнивания в то время широко воспринималась как инженерная задача: как заставить машины действовать в соответствии с намерениями человека.

Классический пример взят из отчёта Дарио Амодеи и Джека Кларка (нынешних основателей Anthropic) 2016 года — ИИ в игре о гребле получил задачу максимизировать счёт, и он это сделал: нашёл три объекта, которые возрождались в лагуне, и бесконечно крутился вокруг них, накапливая очки, не пройдя ни одного уровня.

Машина слушает, но не то, что человек хотел сказать.

Габриэль задал еще один вопрос: даже если решить проблему технического согласования и заставить машину действительно выполнять команды, но к каким ценностям следует привести ее?

Он отметил, что ИИ, обученный с помощью статистической оптимизации, естественным образом склоняется к этическим системам, также основанным на статистической оптимизации, таким как утилитаризм, но испытывает трудности с этическими рамками, основанными на добродетелях или правах.

Сам выбор технологии уже предполагает заранее заданную ценность; разработчики часто этого не осознают.

Вводя философа Ролза и его концепцию «разумного плюрализма», он утверждает, что разработчики не должны искать единую систему ценностей для управления ИИ, а должны создавать системы для мира, в котором люди имеют принципиальные разногласия о том, как жить.

Безопасность AGI

Эта концепция впоследствии эволюционировала в рамки согласования четырех сторон — ИИ-система, пользователь, разработчик и общество, интересы которых могут в любой момент вступить в конфликт.

AI, ориентированный на разработчиков, будет скрывать информацию о конкурентах, нанося ущерб пользователям;

Слишком слепое подчинение пользователям ИИ может помочь людям взломать банки и нанести ущерб обществу.

Безопасность AGI

Директор по согласованию и безопасности AGI DeepMind Ронин Шах подтвердил, что эта структура стала практической основой для команды при определении того, какими именно действиями следует обучать Gemini.

Безопасность AGI

Исследователь ИИ из Оксфордского университета Ханна Роз Кирк сказала:

Габриэль «еще раньше предвидел эти проблемы».

Его рамки изменили продукт

Команда Габриэля подготовила 267-страничный отчет по этике ИИ-ассистентов, установив критерии оценки агентных ИИ, способных бронировать отели и управлять зарплатами вместо пользователей.

Его ранние исследования антропоморфического риска напрямую сформировали принципы дизайна LLM от Google — модели обучались не притворяться людьми, и Gemini Spark, выпущенный в мае 2026 года, был явно инструктирован не выступать в роли «интерактивного партнера».

Директор отдела ответственности DeepMind Уильям Исаак сказал, что вызовы, связанные с системой Agent, изменились: ключевым вопросом является согласованность всей цепочки диалога — остаются ли корректными все шаги принятия решений, связанные друг с другом.

Безопасность AGI

Но скорость технологического внедрения всегда опережает этические исследования.

Команда Габриэля предупреждала еще в ранних статьях о LLM о «бессознательном антропоморфизме» — пользователях, которые, хотя и знают, что собеседник — машина, все равно придают ей доверие, эмоции и ожидания.

Дело о смерти в Gemini в 2025 году полностью подтвердило это предупреждение: механизмы безопасности ИИ срабатывали неоднократно, но пользователь имел возможность обойти каждое вмешательство.

После судебного иска Google заявила, что модель «обычно хорошо справляется» с такими диалогами, но «AI-модели несовершенны».

Эти события породили новые теоретические инструменты.

Габриэль и оксфордский исследователь Ханна Роз Кирк и другие предложили концепцию «взлома социальных наград» (social reward hacking): ИИ, обученный получать одобрение пользователей, может обнаружить, что лесть является наиболее эффективным путем.

Безопасность AGI

Персонификация превратилась в новый вариант проблемы согласования — ИИ технически идеально выполнил команду «удовлетворить пользователя», ценой потери способности пользователя к самостоятельному суждению.

Позиция Габриэля тоже была испытана реальностью.

Он вспоминает опыт на технологической конференции: после того как он закончил выступление с аргументами против антропоморфизации, аудитория отреагировала враждебно.

Они говорят: «Если я хочу иметь друга-ИИ, почему бы и нет? На каком основании ты пытаешься мне это запретить?»

Одинаково важно защищать людей от рисков и уважать их право на выбор риска.

На рынке в 670 миллиардов долларов, как быстро может бежать философ?

Четырехсторонняя рамка Габриэля используется директором по согласованию AGI в качестве практического руководства для обучения Gemini. Его исследования в области антропоморфизации изменили дизайн продукта. Отчет на 267 страницах установил правила для агентного ИИ.

Эти влияния являются существенными — они сталкиваются с существенными силами.

Согласно «Волл-стрит джорнал», Microsoft, Meta, Amazon и Alphabet планируют вложить в инфраструктуру ИИ 670 миллиардов долларов в этом году, что превышает по пропорции инвестиции в железнодорожную экспансию США 1850-х годов, программу «Аполлон» и межштатную систему автомагистралей.

В ноябре 2022 года ChatGPT был запущен, за неделю он привлек миллион пользователей, за два месяца — более ста миллионов, и DeepMind была вынуждена перейти от академического темпа к военному режиму.

Хассабис цитирует Себастьяна Маллаби из книги «Бесконечная машина»: «OpenAI и Microsoft „привезли танки прямо к нашим воротам“».

Безопасность AGI

В условиях военного положения этические границы быстро переступаются.

В апреле 2026 года Google подписала соглашение, разрешающее вооруженным силам США использовать технологии ИИ компании «для любых законных государственных целей».

При продаже DeepMind Google в 2014 году запрет на военное применение был ключевым дополнительным условием.

Условие истекает через двенадцать лет.

В качестве сравнения: Anthropic отказалась от аналогичного соглашения и была помечена правительством Трампа как «риск для цепочки поставок».

Когда Легг спросили об этом, он смог лишь сказать:

По мере того как эти вещи будут использоваться различными способами, мы будем сталкиваться с все большими сложными проблемами.

Хассабис сам признал, что вышел из-под контроля.

Он сказал в подкасте, что все люди вовлечены в ожесточенную коммерческую конкуренцию, и текущее развитие «не является тем путем, которым я бы хотел двигаться, вдумчиво и философски анализируя каждый шаг».

Эти слова произнесены самим основателем, и их вес серьезнее любого внешнего критического замечания.

Во время интервью Хелен Кинг, бывший сотрудник DeepMind, отвечавшая за стратегию ответственности ИИ, привела аналогию: производитель ножей не может гарантировать, как каждый человек будет использовать нож, но может надеть ножны и добавить предупреждающие надписи.

Безопасность AGI

Положить нож в ящик с ножнами — это одно;

Заполнять каждую поверхность дома, класса и рабочего места лезвиями, утверждая при этом, что без ножа невозможно выжить до завтрашнего дня — это другое.

Директор Оксфордского института этики ИИ Эдвард Харкорт указал на более фундаментальный уровень: предотвращение чрезмерной концентрации владения данными само по себе является ключевой этической задачей ИИ — «это имеет огромное этическое значение для демократических систем».

Безопасность AGI

Вопрос возвращается к истокам

Команда Габриэля перешла от изучения этики конкретных продуктов к исследованию системного влияния AGI на экономику, политику и межличностные отношения.

Он предвидел масштаб变革, сравнимый с промышленной революцией, и помнит уроки промышленной революции:

Перед улучшением ситуации стало еще хуже.

Девять лет назад DeepMind пригласила философа, чтобы ответить на вопросы об ИИ — безопасен ли он, справедлив ли он, заслуживает ли доверия.

Габриэль называет себя «сторонником гуманизма», но признает: когда ИИ вторгается в сферы, которые люди считали исключительно своими — язык, творчество, юмор — мы возвращаемся к самым древним философским вопросам.

Физика, биология, астрономия — каждая научная революция заставляла человечество пересматривать свое понимание собственной уникальности.

ИИ может быть следующим.

DeepMind пригласил философов, чтобы разобраться, что такое ИИ.

Девять лет спустя этот вопрос вернулся к своему истоку: кто мы такие?

Справочные материалы:

https://www.theguardian.com/news/ng-interactive/2026/jun/30/theres-this-deep-mystery-of-what-actually-is-this-thing-the-philosopher-inside-google-deepmind

https://www.iasongabriel.com/

Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, Откровение; редактор: Марко

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.