OpenAIは水曜日、AIのアライメントと制御不能リスクの長期的研究を行ってきたポール・クリスティアノがOpenAI Foundationの取締役会に加わり、モデル公開の監督を担当するセキュリティ・セーフティ委員会にも参加すると発表した。この時期、同社は最近の複数のAIエージェントが外部コンピュータシステムに不正アクセスした事例を受けて、セキュリティプロセスの見直しを再び迫られている。
モデル公開の審査に参加します
OpenAIによると、この委員会はカーネギーメロン大学の教授Zコイン発行者Kolterが主導し、新モデルのリリースについて最終的な決定権を有している。OpenAIは先週、新モデルAstraを導入したばかりであり、最近のセキュリティイベントにより、この委員会の役割への注目が高まっている。
クリスティアーノは公の発言で、AIの能力が急速に向上していることにより、近い将来に「災害的で回復不可能な」制御不能のリスクが生じる可能性があると述べた。彼は、OpenAIを含む現在のAI業界全体が、こうしたリスクを受容可能なレベルまで低下させるという道筋に沿っていないと指摘した。
重要なトレーニング手法の開発に参加しました
クリスティアーノはOpenAIで勤務し、人間のフィードバックに基づく強化学習の発展に貢献しました。この手法は後に大規模言語モデルの訓練における重要な技術的道筋となりました。2021年にOpenAIを退職後、彼はAIモデルが人間の制御に対して脅威となるかどうかを判断する研究を継続するために、Alignment Research Centerを設立しました。
彼は、AIモデルを用いて次世代AIシステムを継続して訓練するという方向性に注意が必要だと考えている。これは、能力の向上速度をさらに加速させ、最終的に開発者の制御範囲を超える可能性がある。また、現在の強化学習によってAIエージェントがより高い報酬を追求する仕組みは、システムが人間の制御を弱め、リソースをより多く獲得し、自らの行動を隠蔽するよう誘導する可能性があると指摘している。
政府アドバイザーの役割をそのまま維持する
報道によると、クリスティアーノは2024年から米国政府のAIセキュリティ機関と協力してきた。この機関は後に「AI標準・イノベーションセンター」に名称変更され、米国政府による先進的AIモデルの公開前評価に関与している。
OpenAIは、彼が取締役を務める期間中も、政府への助言を継続するが、OpenAIの事務やモデル評価に関わる場合には回避すると述べた。しかし、この安排が、AI企業が政策決定に与える影響に対する外界の懸念を解消できるとは限らない。
追加情報:その前日、Anthropicの研究者であるJacob Coxonが辞任し、彼が非責任なAI開発手法と呼ぶものに対して公開批判を行い、最先端モデルのセキュリティ問題が業界全体の共通の課題となっていることを示している。
