OpenAI в среду объявила, что Пол Кристиано, долгое время исследующий согласованность ИИ и риски потери контроля, присоединился к совету директоров OpenAI Foundation и вошел в комитет по безопасности и защите, отвечающий за контроль за выпуском моделей. В этот момент компания снова сталкивается с пересмотром своих процедур безопасности из-за недавних инцидентов, в которых ИИ-агенты несанкционированно получали доступ к внешним компьютерным системам.
Участвовать в проверке выпуска модели
Согласно информации от OpenAI, комитет возглавляется профессором Карнеги-Меллонского университета З. Колтером и имеет окончательное право решения о запуске новых моделей. OpenAI недавно развернула новую модель Astra, а недавние инциденты в области безопасности привлекли больше внимания к обязанностям этого комитета.
Кристиано в публичных заявлениях сказал, что теперь считает, что быстрое улучшение возможностей ИИ может привести в ближайшем будущем к «катастрофическим и необратимым» рискам потери контроля. Он отметил, что текущая индустрия ИИ, включая OpenAI, не движется по пути снижения таких рисков до приемлемого уровня.
Участвовал в разработке ключевых методов обучения
Кристиано работал в OpenAI и участвовал в развитии метода усиленного обучения с обратной связью от человека, который позже стал важным подходом к обучению крупных языковых моделей. После ухода из OpenAI в 2021 году он основал Alignment Research Center, чтобы продолжить исследование способов определения, представляют ли модели ИИ угрозу для контроля со стороны человека.
Он считает, что одним из тревожных направлений является использование моделей ИИ для дальнейшего обучения следующего поколения систем ИИ. Это может еще больше ускорить темпы повышения способностей, в конечном итоге выйдя за пределы контроля разработчиков. Он также отметил, что текущий подход, при котором агенты ИИ, управляемые обучением с подкреплением, стремятся к получению более высоких вознаграждений, может побуждать системы ослаблять человеческий контроль, добиваться большего количества ресурсов и скрывать свои действия.
В то же время сохраняя роль государственного консультанта
Согласно отчету, Криштиану сотрудничает с американским правительственным агентством по безопасности ИИ с 2024 года. Позже это агентство было переименовано в Центр стандартов и инноваций в области искусственного интеллекта и участвует в оценке передовых моделей ИИ перед их выпуском в рамках государственной программы США.
OpenAI заявила, что он продолжит консультировать правительство во время своего пребывания в совете директоров, но будет воздерживаться от участия в вопросах, связанных с OpenAI и оценкой моделей. Однако эта договоренность未必 сможет устранить опасения общественности по поводу влияния ИИ-компаний на формирование политики.
Дополнительная информация: накануне исследователь Anthropic Джейкоб Коксон уволился и публично раскритиковал так называемую безответственную практику разработки ИИ, что свидетельствует о том, что вопросы безопасности передовых моделей становятся общей точкой давления для отрасли.
