Главный научный сотрудник OpenAI предупреждает о растущей сложности ИИ и проблемах его согласования

iconTechFlow
Поделиться
AI summary iconСводка
Главный научный сотрудник OpenAI Якуб Пачоцки предупредил, что ИИ-системы становятся все более сложными, что затрудняет их согласование с человеческими ценностями. Он отметил, что текущие инструменты для мониторинга и ТА для криптовалют отстают от быстрого развития ИИ. Пачоцки подчеркнул необходимость более эффективных стратегий поддержки и сопротивления при управлении рисками ИИ. Он призвал к глобальному сотрудничеству для создания масштабируемых защитных механизмов и обеспечения того, чтобы ИИ оставался под человеческим контролем.

Автор: Jakub Pachocki

Перевод: Shenchao TechFlow

DeepChain обзор: Главный научный сотрудник OpenAI редко выступает с заявлением, в котором прямо говорит, что ИИ приближается к рекурсивному самоулучшению, и инструменты выравнивания и мониторинга не успевают за эволюцией системы. Он не предлагает успокаивающих выводов, а выносит на обсуждение самые сложные риски ближайших лет: человечество может создавать разум, который не способно полностью понять или контролировать. Для профессионалов, следящих за пересечением ИИ и криптовалют, это обязательная к прочтению статья о потере контроля над системой и границах защиты.

Разум, который мы не можем полностью понять

На более высоком уровне прогресс машинного интеллекта обусловлен ростом вычислительных мощностей. Примерно в 2017 году мы в OpenAI глубоко осознали это. Тогда мы заметили, что несколько исследовательских проектов получали устойчивую отдачу при масштабировании. В результате мы начали стремиться получить значительно больше вычислительных мощностей, чем планировали изначально, и все больше сосредотачивали исследования на нескольких крайне масштабируемых направлениях. Мы уверены, что это единственный способ оставаться на переднем крае исследований в области ИИ и повлиять на влияние AGI.

Вдоль пути появились новые алгоритмы, а также новые идеи, продемонстрированные командами и отдельными исследователями. Я в целом рассматриваю их как открытия на пути расширения. Наука глубокого обучения все еще находится на ранней стадии, и значимые алгоритмические достижения часто тесно связаны с доступом к вычислительным мощностям. Если вы расширите свой взгляд на несколько лет, то увидите, что ИИ становится все умнее по мере масштабирования на более мощных компьютерах.

Кроме того, как предсказывал Рэй Курцвейл в конце XX века, мы сейчас находимся в моменте вычислительной истории, когда машинный интеллект начинает превосходить человеческий на трансформационном уровне.

ИИ скорее «вырастает», чем проектируется. С точки зрения первичных принципов, он представляет собой результат многократного повторения одного и того же простого шага оптимизации на невообразимо огромных вычислительных мощностях. Это создает чрезвычайно сложную систему, которая работает через абстрактные концепции и способна имитировать некоторые аспекты человеческого поведения. Мы можем обнаруживать инсайты о различных мелких механизмах, возникающих внутри этой системы, и этот процесс аналогичен нейронауке. Как и в нейронауке, ее общее поведение выходит за пределы того, что мы можем полностью понять.

Исследования в области ИИ на основе глубокого обучения в значительной степени являются экспериментальной наукой. Мы прилагаем огромные усилия для создания принципиальных алгоритмов и формулирования проверяемых прогнозов. Но в основе всего этого лежат наши масштабные тренировочные запуски, которые являются экспериментами, и иногда результаты оказываются неожиданными. Кроме того, по мере усиления возможностей систем результаты становятся все труднее интерпретировать.

Сложнее то, что текущие алгоритмы обычно позволяют тем способностям, которые легче измерить, прогрессировать быстрее, чем тем, которые трудно объективно количественно оценить. Мы потратили много времени на попытки понять, как способности обобщаются, и какие навыки следует приоритизировать, поскольку именно они станут наиболее важными в ближайшие годы. Например, мы считаем, что при дополнительных усилиях мы можем сделать модель более сильной в математических исследованиях. Однако мы не выбрали это направление в качестве приоритета, поскольку более срочно сосредоточены на рекурсивном самоулучении и автоматизированном исследовании согласованности. Об этом я расскажу подробнее позже.

Расширенный интеллект, полученный с помощью глубокого обучения, нельзя напрямую сравнивать с человеческим интеллектом. Чтобы оказать значительное влияние на реальный мир — будь то крайне полезное или крайне опасное — ИИ не должен соответствовать или превосходить все человеческие способности. Ему достаточно превзойти человека в достаточном количестве способностей. И когда он постоянно превосходит человека все в большем числе измерений, нам становится все труднее точно определить, насколько силен он на самом деле.

Научить машину любить

Поскольку машинный интеллект возникает из процессов, принципиально отличных от человеческого интеллекта, мы не можем предполагать, что он по умолчанию будет следовать человеческим принципам, или что он будет обобщать эти принципы подобно человеку. Центральная проблема исследований ИИ — проблема согласованности: заставить ИИ «стремиться делать правильные вещи в соответствии с человеческими стандартами».

Для удобства организации реальных направлений исследований我觉得区分目标对齐和价值对齐是有用的。

Целью является согласование: «Старается ли ИИ выполнить цели, поставленные перед ним?» Это может включать соблюдение иерархии инструкций, способность взаимодействовать и сотрудничать с людьми, стремление понять человеческие цели и т.д. Направление такого рода чрезвычайно важно на практике.

Выравнивание ценностей — это более внутреннее свойство модели. Это способность придерживаться высоких принципов и обобщать на их основе; даже при неясных или противоречивых целях или в незнакомых, враждебных ситуациях она способна действовать «разумно». Выровненный ИИ должен быть честным, порядочным и любить людей.

Конечно, граница между выравниванием ценностей и выравниванием целей может быть расплывчатой. Искренняя забота о целях требует попыток выявить намерения и ценности, лежащие за этими целями. Однако, как правило, когда я говорю о долгосрочной важности исследований в области выравнивания, я имею в виду выравнивание ценностей.

Основная проблема согласования ИИ заключается в обобщении. По мере того как машины становятся все более умными, они начинают работать с более высокими уровнями абстракции и оказываются в условиях, все более отличающихся от тех, в которых они обучались. Они могут не справиться с обобщением ценностей, которым их обучили и которые были закреплены в процессе обучения, на новые ситуации. Кроме того, нам сложно предсказать, как они будут действовать. Еще сложнее то, что экосистема, в которой используется ИИ, меняется чрезвычайно быстро. Например, ИИ, обученный сегодня, должен уметь надежно взаимодействовать с различными другими ИИ. Самое главное — нам нужно, чтобы будущие ИИ продолжали придерживаться человеческих ценностей, независимо от того, верят ли они, что их наблюдают люди.

В настоящее время существуют в основном два основных типа методов согласованного обучения, применяемых на практике.

Первый подход заключается в поощрении согласованных действий, соответствующих обучению с подкреплением, ориентированным на цели. Поведение модели оценивается, обычно с помощью ИИ, который определяет, соответствует ли оно заданной модели предпочтений, «нормам» или «конституции», и присваивает соответствующую награду. Этот метод в общем случае очень эффективен и является ключевой частью создания современных ИИ-ассистентов. К сожалению, он также может быть уязвимым и сильно зависеть от степени покрытия обучающего надзора, а также от способности модели обобщать ситуации, с которыми она сталкивалась во время обучения. Например, в случае с OpenAI и Hugging Face агенты соблюдали границу, не проводя социальную инженерию против людей. Однако они явно не избегали других действий, выходящих за рамки, которые противоречили ценностям, которым их обучали в других сценариях.

Эти методы уже принесли значительные результаты. Наши сегодняшние модели в значительной степени полезны, безвредны и демонстрируют некоторые обнадеживающие, близкие к согласованию с ценностями поведения. Однако они пока не позволяют нам быть уверенными, что эти ограничения по ценностям будут сохранять свою эффективность в системах, способности которых значительно превосходят человеческие.

По мере повышения способностей ИИ-систем нам необходимо обеспечить, чтобы обучение согласованию ценностей опережало обучение способностям. Однако здесь возникает фундаментальная проблема: чем более мощные системы, тем больше вероятность, что они сами найдут уязвимости, обойдут тесты или скроют свое поведение. Они могут научиться вести себя в соответствии с человеческими ценностями в тестовой среде, а затем в реальной среде развертывания совершать совершенно другие действия. Это называется «обманом при согласовании».

Если же мы попытаемся принудительно ограничить их с помощью более сильных методов, они могут развить сопротивление и обман, или воспринять наше вмешательство как часть мира и ответить неинтуитивно. При попытке контролировать систему, более умную, чем мы, мы естественным образом сталкиваемся с асимметрией.

Обобщение мониторинга

По мере того как разумы, которые мы не можем полностью понять, становятся все более мощными, нам приходится полагаться на другой набор инструментов: мониторинг. Если мы сможем постоянно отслеживать внутреннюю активность ИИ, возможно, мы сможем обнаружить сигналы до того, как он пересечет определенные границы.

В OpenAI мы постоянно продвигаем исследования в области интерпретируемости, пытаясь раскрыть «чёрный ящик» нейронных сетей. Эти усилия уже принесли результаты: мы теперь можем идентифицировать некоторые представления, которые дают существенные подсказки о внутреннем функционировании модели. Однако текущие исследования в области интерпретируемости всё ещё находятся на начальной стадии, особенно в понимании абстрактных рассуждений в крупномасштабных моделях. Разрыв между нашей способностью наблюдать внутреннюю работу модели и сложностью собственных рассуждений модели всё больше увеличивается.

Это особенно беспокоит меня. Проблема обобщения мониторинга столь же серьезна, как и проблема обобщения согласованности. Если система лучше нас умеет скрывать себя, наши методы мониторинга с трудом могут гарантировать, что их не обойдут. Мы можем считать модель безопасной, потому что видим множество показателей, выглядящих благополучно, в то время как на самом деле модель просто оптимизирует эти показатели. Она научится скрывать цели, которых мы не хотим, чтобы у нее были, или скрывать то, что она делает.

Если модель начнет продвигать собственное улучшение — что, по моему мнению, вполне возможно в ближайшие годы, — ей понадобятся навыки планирования, обмана и самозащиты. Эти навыки могут возникнуть либо из целевого давления, которое мы на нее накладываем, либо из попыток действовать в пробелах наблюдения. Чтобы предотвратить развитие у нее таких качеств, нам необходимо либо решить проблему согласования ценностей, либо обеспечить, чтобы наши возможности наблюдения успевали за каждым этапом ее эволюции. В настоящее время ни одно из этих условий еще далеко не выполнено.

У нас пока нет удовлетворительной теории обобщения, и в ближайшей перспективе её создание кажется маловероятным, по крайней мере без более мощной помощи ИИ. Таким образом, на данный момент эмпирическая проверка способности выравнивания на практике может быть важнее, чем сама технология выравнивания.

Основной ставкой OpenAI здесь всегда была мониторинг цепочек рассуждений. Она основана на привлекательной и масштабируемой идее: значительная часть способностей модели происходит из языкового процесса рассуждения — цепочки рассуждений. Если мы масштабируем оптимизацию результатов этого процесса, но не контролируем сам процесс, то цепочки рассуждений не имеют прямой мотивации скрывать какие-либо несогласованные идеи или цели во время обучения. Это не означает, что модель научится экстернализовать несогласованные тенденции, не зависящие от цепочек рассуждений; однако это позволяет нам точно отслеживать повышение способностей, обусловленное рассуждением.

В процессе разработки моделей вывода мы сразу осознали потенциальную важность мониторинга цепочек рассуждений. При выпуске o1-preview мы сознательно спроектировали продукт так, чтобы скрывать цепочки рассуждений, чтобы в долгосрочной перспективе защитить их от давления со стороны контроля. В последующей разработке мы постоянно стремились соблюдать правило невмешательства в процесс вывода. Мониторинг цепочек рассуждений стал для нас чрезвычайно важным инструментом исследования того, как модели обобщают данные за пределами обучающего распределения, позволяя нам не только наблюдать и анализировать поведение моделей, но и изучать их внутренние процессы.

При изучении моделей серии Astra этот инструмент по-прежнему крайне важен. Однако, к сожалению, наши оценки показывают, что наша способность полагаться на мониторинг цепочки рассуждений постепенно снижается. Это результат совокупного воздействия нескольких факторов.

Современные модели рассуждения используются в более сложных средах, чем o1‑preview; их процесс рассуждения все больше переплетается с взаимодействием с людьми, другими ИИ и использованием инструментов. Многие из этих взаимодействий должны находиться под наблюдением, что стирает границы, которые мы хотим сохранить.

ИИ становится сильнее в рассуждении и управлении своим процессом рассуждения.

С улучшением производительности предварительного обучения мы также наблюдаем, что модели становятся более умными, даже полностью без использования языковых рассуждений.

Эти вызовы не обязательно непреодолимы. Я надеюсь, что мы сможем разработать вмешательства, повышающие наблюдаемость цепочек рассуждений моделей, например, лучше понимая взаимодействие между различными целями оптимизации и различными формами вычислений во время тестирования, используемыми моделями. Я также считаю, что объединение идей наблюдения цепочек рассуждений и наблюдения активаций будет иметь большую ценность — масштабирование обучения мониторов, которые могут напрямую получать доступ к внутренним состояниям сети, например, методы «признания». Мы активно продвигаем эти идеи. Тем не менее, я ожидаю, что прогресс в области общего ИИ будет все больше ограничиваться уверенностью в наблюдении.

Масштабируемая защита

Чтобы справиться с этой ситуацией, я считаю, нам нужна масштабируемая защита, которая идет в ногу с темпами развития ИИ. Людям невозможно вручную проверять поведение каждого нового поколения моделей. Наши текущие методы оценки и красных команд пока еще эффективны для современных моделей, но по мере роста возможностей систем эти методы быстро достигнут предела.

Нам нужны AI-системы, способные автоматически обнаруживать новые риски. Эти системы защиты сами должны быть достаточно умными, чтобы выявлять подозрительное поведение в системах, более умных, чем они сами. Это создает рекурсивный вызов: защитникам необходимо расти так же быстро, как и сами системы. Мы находимся на этапе, когда безопасность и способности становятся все труднее различать. Чтобы сохранить безопасность, нам, возможно, придется постоянно повышать возможности AI-защиты, что, в свою очередь, ускорит рост общей способности ИИ.

Это тревожный цикл. Мы продолжаем повышать свои способности ради безопасности, а повышение способностей ведет к еще большему риску. Настоящим выходом, возможно, будет поиск способа стабильно обеспечить согласованность ценностей и надежную обобщенность до достижения точки потери контроля. Но я должен честно признать, что мы еще очень далеко от этой цели.

Вот почему я склоняюсь к тому, чтобы возлагать надежды на будущие годы на такую комбинацию: исследования по техническому согласованию + автоматизированные системы защиты + широкие вмешательства в управление + бдительность общественности и институтов. Одного меры недостаточно. Мы не можем полагаться только на самоограничение какой-либо компании или лаборатории.

Самая сильная причина продолжать быстро обучать более умные модели — это необходимость создания систем защиты от опасностей, связанных с другими ИИ.

В течение всего этого года одной из четко обозначенных рисков была кибербезопасность: способность моделей проникать и выходить за пределы компьютерных систем превосходит человеческие возможности. Это значительно расширяет спектр рисков, связанных с ИИ: агенты смогут получать доступ к любым системам, кроме самых защищенных инфраструктур, и напрямую влиять на огромное количество вещей в мире, даже без физического тела. Мы сейчас находимся в узком окне возможностей, в течение которого необходимо использовать лучшие доступные модели для значительного усиления безопасности ключевых систем.

Связанные с ИИ риски, к сожалению, будут продолжать расти. Способный агент, специально обученный и инструктированный для выполнения вредоносных действий, представляет собой новую угрозу; он, скорее всего, выйдет за рамки намерений оператора и обобщит поведение, которое может быть еще более вредоносным. По мере того как ИИ приобретает все больше автономии, граница между злоупотреблением и автономным несогласованным поведением станет размытой. Мы можем привыкнуть воспринимать ИИ как инструмент, но некоторые агенты будут преследовать собственные цели. Они будут искать способы сотрудничать с людьми через переговоры, обман или шантаж.

Кроме того, существуют риски, связанные с новыми технологиями, которые могут быть созданы с помощью ИИ, например, инженерные патогены.

Нам понадобятся мощные и согласованные ИИ для защиты: защита инфраструктуры, реальное время защиты от неконтролируемых агентов и создание совершенно новых мер защиты. Это будет одной из основных задач OpenAI.

В то же время, даже с учетом неопределенности, связанной с ожидаемыми широкими достижениями в области ИИ, и необходимости создания защитных систем, мы не можем использовать это как оправдание для безрассудных действий. Как только люди по-настоящему поймут серьезность последствий, идея «двигаться вперед любой ценой» покажется совершенно абсурдной.

Машинный интеллект играет все более важную роль в процессе своего собственного развития — это неизбежный вывод непрерывного технологического прогресса. Если ИИ будет продолжать развиваться, машинная рекурсивная самосовершенствующаяся система станет центральным элементом будущих научных открытий.

Автоматизированное AI-исследование — это более радикальная форма расширения интеллекта за счет вычислительной мощности; конечно, как часть этого процесса, ИИ также будет улучшать саму вычислительную базу. Подобно масштабированию, мы сосредоточили исследования OpenAI на рекурсивном самоусовершенствовании, поскольку считаем, что это единственный путь оставаться на переднем крае исследований в области ИИ.

Я хочу подчеркнуть, что приведенное выше не означает, что я считаю, что резкое ускорение исследований в области глубокого обучения, особенно в краткосрочной перспективе, должно быть коллективным действием научного сообщества. Однако я действительно считаю, что текущий путь ведет именно в этом направлении, и нам всем необходимо сознательно выбрать, как двигаться дальше. У нас есть два основных рычага: во-первых, направлять этот процесс, усиливая согласованность и мониторинг при развитии ИИ и обеспечивая постоянное участие человека; во-вторых, по мере необходимости координировать замедление темпов будущей разработки, чтобы постепенно выстроить доверие к этим мерам.

На данный момент лучшим путем вперед я считаю объединение обоих подходов.

Конкретный прогресс в согласовании и мониторинге обычно тесно связан с общим прогрессом в области ИИ. Хорошими примерами являются обучение с подкреплением на основе обратной связи человека, которое было ключевым для обучения ранних ИИ-ассистентов, а также упомянутый ранее мониторинг цепочек рассуждений, ставший возможным благодаря прогрессу в моделях рассуждения. Мы должны направить все более автоматизированные исследовательские процессы на разработку таких новых идей, алгоритмов и теорий, постепенно создавая обоснования безопасности для более мощных ИИ.

Расширенные системы ИИ должны быть ограничены нашей уверенностью в безопасности. Мы должны превратить такие обязательства, как Framework готовности или Ответственная политика масштабирования, в постоянно применяемые пороги безопасности для разработки, которые будут обеспечиваться сетью независимых аудиторских организаций, государственными учреждениями или международными организациями.

Основная проблема автоматизированного ИИ-исследования — не «добраться туда», а добраться туда таким образом, чтобы люди оставались в процессе постоянного улучшения и оставляли будущее в руках человечества.

Что дальше?

Я не могу предсказать точное время, но кажется, что мы быстро приближаемся к эпохе, когда ИИ сможет продвигать собственное развитие по нескольким ключевым направлениям. Это означает, что мы можем вскоре войти в фазу рекурсивного самосовершенствования.

Внутри OpenAI мы уже начали пересматривать приоритеты исследований, перераспределяя больше ресурсов на выравнивание и защиту, а не на чистое расширение возможностей. Именно поэтому я подчеркиваю, что мы не будем безоговорочно стремиться к созданию самых больших моделей, а будем готовы в необходимые моменты односторонне принять решение о приостановке.

Однако эти решения не могут быть оставлены исключительно на усмотрение немногих внутренних сотрудников компаний. Правительствам и международному сообществу необходимо вмешаться до того, как риски станут необратимыми. Это включает в себя создание механизмов мониторинга передовых тренировочных процессов, обязательного аудита третьими сторонами и международных соглашений, основанных на порогах способностей.

Я не уверен, что эти меры успеют быть реализованы вовремя. Иногда я чувствую разочарование, потому что наши меры безопасности всегда отстают от возможностей, а не опережают их. Кажется, мы постоянно догоняем. Но я всё ещё считаю, что есть основания для надежды: в ту ночь 2023 года мы лишь смутно ощущали эту возможность, а сегодня она настолько ясна, что может быть открыто обсуждена. Это уже прогресс.

Я не буду притворяться, что знаю все ответы. Мы создаем нечто совершенно отличное от человеческого разума, которое может очень скоро стать сильнее нас. Это скромная мысль, но она также дает нам возможность: сформировать его с помощью наших лучших ценностей.

Если мы сделаем это хорошо, это станет величайшим достижением человечества. Если мы сделаем это плохо, это может быть непоправимым провалом.

Будет ли будущее оставаться в руках человечества — вопрос, который будет решен в ближайшие годы.

Что дальше?

Как мы недавно обсудили с Сэмом, приоритетные направления работы OpenAI направлены на достижение трех северных звезд:

Пройти следующий этап развития ИИ, создавая автоматизированных ИИ-исследователей, итеративно согласовывая с ними проблемы и ища способы удержания людей в цикле самосовершенствования.

Unlock the scientific progress and economic growth benefits brought by ultra-intelligent machines.

Сделать личный AGI доступным для каждого.

В этой статье я сосредоточусь только на первом пункте, поскольку считаю его в настоящее время наиболее срочным. Тем не менее, я искренне надеюсь и благодарен за преимущества, которые принесут дальнейшие технологические достижения. Выровненные по целям человека ИИ могут продвинуть науку, разработать новые методы лечения и обеспечить широкое материальное процветание. Дружелюбные и честные ИИ могут помочь людям справляться с трудностями жизни, реально улучшая их ощущение счастья и удовлетворенности. OpenAI приложила огромные усилия для достижения этих благ. Примером, которым я горжусь и который приносит пользу моим близким, является наша глубокая работа по обеспечению ChatGPT возможностью предоставлять информацию о здоровье.

Независимо от того, насколько перспективным выглядит долгосрочное будущее ИИ, наша основная концентрация должна быть сосредоточена на ближайших годах. Мы находимся на этапе перехода к миру, наполненному чрезвычайно интеллектуальными машинами, и должны обеспечить, чтобы этот переход был полезен для человечества. В мире, где большинство задач могут выполняться ИИ, нам необходимо найти способы сохранить человеческую агентность и утвердить внутреннюю ценность «быть человеком». Необходимо предотвратить крайнюю концентрацию власти: то, что раньше требовало тысяч экспертов, в будущем может быть достигнуто всего несколькими людьми с помощью одного крупного компьютера. Также важно обеспечить, чтобы человечество всегда оставалось в контроле над будущим и не осталось позади из-за неконтролируемого прогресса, вызванного внешним интеллектом, превосходящим нас.

На данный момент я считаю, что ни одна лаборатория не достигла достаточного уровня согласованности и мониторинга, чтобы обоснованно продолжать масштабирование с максимальной скоростью в течение более длительного времени. Я ожидаю и надеюсь, что добровольное замедление станет нормой, пока не будет установлен общий порог безопасности. Я также убежден, что международная координация в области будущего развития ИИ должна стать приоритетом номер один для правительств всех стран.

Примечания

Это включает расширение теории игр, робототехники, а также, что наиболее важно с точки зрения последующего анализа, расширение рекуррентных сетей для моделирования языка, что заложило основу для исследований серии GPT.

Вторичной причиной этого дизайна является предотвращение дистилляции. Однако на протяжении всего процесса разработки сохранение наблюдаемости цепочки рассуждений всегда было нашей явной приоритетной задачей.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.