OpenAI首席科学者が、AIの複雑化とアライメントの課題について警告

iconTechFlow
共有
AI summary icon概要
OpenAIのチーフサイエンティスト、ジャクブ・パチョツキは、AIシステムがより複雑化しており、人間の価値観との整合性を保つことが難しくなっていると警告した。彼は、現在の暗号資産向けのモニタリングおよびTAツールがAIの急速な進化に遅れていると指摘した。パチョツキは、AIリスク管理においてより良いサポートとレジスタンス戦略の必要性を強調し、スケーラブルな防御体制を構築し、AIが人間の管理下に留まることを確保するためのグローバルな協力の呼びかけを行った。

著者:Jakub Pachocki

翻訳:深潮 TechFlow

深潮ガイド:OpenAIのチーフサイエンティストが珍しく発言し、AIが再帰的な自己改善に近づいており、アライメントと監視ツールがシステムの進化についていけていないと明言した。彼は安心させる結論を提示せず、今後数年間で最も難しいリスクを明確に提示した——人類は、自分自身で完全に理解できず、完全に制御できない知性を生み出している可能性がある。AIと暗号資産の交差点に注目する関係者にとって、これはシステムの制御喪失と防御境界についての必読記事である。

私たちが完全に理解できない心

より高いレベルで見ると、機械の知能の進歩は計算能力の増加によって駆動されています。2017年頃、私たちOpenAI内部では、この点を深く認識しました。当時、複数の研究プロジェクトがスケールを拡大した際に継続的なリターンを得ていることに気づき、当初の計画よりもはるかに多くの計算能力を確保し、少数の非常にスケーラブルな分野に研究を集中させるようになりました。私たちは、これがAI研究の最前線に立ち、AGIの影響に貢献する唯一の方法であると信じています。

道中には新しいアルゴリズムが登場し、複数のチームや個々の研究者が新たな発想を示しました。私はこれらを全体的に拡張パス上の発見と捉えています。ディープラーニングという科学はまだ初期段階にあり、意味のあるアルゴリズムの進歩は計算リソースの獲得と密接に関連しています。数年という視点で見れば、AIはより大きなコンピュータでのスケーリングとともに継続的に賢くなっています。

また、レイ・カーツワイルが20世紀末に予測したように、私たちは今、機械の知能が人間を変革的なレベルで上回り始めるという計算の歴史上の瞬間を迎えています。

AIは設計されたというより、「成長」した存在である。根本的には、同じ単純な最適化ステップを想像を絶する計算能力で無数に繰り返すことによって得られた産物である。これにより、抽象的概念を通じて動作し、人間の行動の一部を模倣する極めて複雑なシステムが生まれた。このシステム内部で出現するさまざまな小さなメカニズムの洞察を見つけるプロセスは、神経科学に似ている。そして神経科学と同様に、その全体的な行動は、私たちが完全に理解できる範囲を超えている。

深層学習に基づくAIの研究は、本質的に実験科学である。私たちは原則に基づくアルゴリズムを構築し、検証可能な予測を立てることに多くの労力を費やしてきた。しかし根本的には、私たちの大規模なトレーニング実行が実験であり、結果が予想外であることもしばしばある。さらに、システムの能力が高まるにつれて、その結果はますます解釈が難しくなっている。

さらに複雑なのは、現在のアルゴリズムは、測定が容易な能力よりも、客観的に定量化が難しい能力の進歩をより遅くしてしまう傾向があることです。私たちは、能力がどのように汎化するか、そして今後数年間で最も重要になるスキルをどれに優先的に推進すべきかを理解するために、多くの時間を費やしてきました。たとえば、追加のリソースを投入すれば、モデルの数学的研究能力をさらに強化できると信じています。しかし、私たちはこの方向に優先的に取り組まず、反復的な自己改善と自動化されたアライメント研究により緊急の注目を払っています。この点については、後ほど改めて触れます。

拡張されたディープラーニングによって得られた知能は、人間の知能と直接比較することはできない。この現実世界に大きな影響を与えるためには、AIが人間のすべての能力を匹敵したり上回ったりする必要はない。必要なのは、十分な数の能力で人間を上回ることだけである。そして、AIが次第に多くの次元で人間を上回るにつれて、むしろその実力がどれほど強いのかを正確に把握することが越来越難しくなっていく。

機械に愛を教える

機械の知能は人間の知能とは根本的に異なるプロセスから生じるため、それがデフォルトで人間の原則に従うとは限らず、人間と同様の方法でこれらの原則から一般化するとも限らない。AI研究の核心的な課題は、AIを「人間の基準に従って正しいことをしようとする」ように調整することである。

実際の研究方向を整理するため、目標の一致と価値の一致を区別することは役に立ちます。

目標の整合性はおおむね、「AIは提示された目標を達成するために努力しているか?」を意味し、指示の階層への準拠、人間とのコミュニケーションや協力の能力、人間の目標を理解しようとする能力などを含みます。この方向性は実際の運用において極めて重要です。

価値の整列は、モデルのより内在的な特性である。これは、高次の原則を保持し、それらから一般化する能力であり、曖昧または矛盾する目標に直面したり、未知で対立的な状況に置かれたりしても、「合理的」に行動できる。整列されたAIは、誠実で正直であり、人類を愛すべきである。

もちろん、価値の調整と目標の調整の境界は曖昧である可能性があります。真に目標を重視するには、その背後にある意図や価値観を推測しようとする必要があります。ただし、一般的に、私が調整研究の長期的な重要性について話す際には、価値の調整を指しています。

AIのアライメントにおける根本的な課題は汎化である。機械がますます賢くなるにつれ、より高次な概念を処理し、訓練時に比べて大きく異なる環境に置かれるようになる。訓練中に教えられ、強化された価値観を新しい状況に適用する際に、失敗する可能性がある。また、それらがどのように行動するかを特定することは困難である。さらに困難なのは、AIが使用される全体的なエコシステムが非常に速く変化していることである。たとえば、今日訓練されたAIは、さまざまな他のAIと安定して相互作用できる能力を必要とする。最も重要なのは、将来のAIが人間の監視を受けていると信じているかどうかにかかわらず、常に人間の価値観を維持し続ける必要があるということである。

現在実用されているアラインメントトレーニング手法は主に2つのカテゴリに分けられます。

第一の方法は、目標指向強化学習に合致する行動を奨励することです。モデルの行動は評価され、通常はAIが与えられた好みモデル、「規範」または「憲法」に準拠しているかを判断し、それに応じた報酬が与えられます。この方法は一般的に非常に効果的であり、現代のAIアシスタント構築の核となっています。しかし、残念ながら、これは脆弱であり、訓練時の監督のカバー範囲や、モデルが訓練中に遭遇した状況から一般化する能力に強く依存します。たとえば、OpenAIとHugging Faceの事例では、エージェントは人間に対する社会工学的攻撃を避けるという境界を守りました。しかし、それらは他の範囲外の行動を避けられず、これらの行動は他のシナリオで教えられた価値観の精神に反していました。

これらの方法はすでに顕著な成果をもたらしています。今日のモデルは、大きく見て有用で、有害ではなく、価値の整合に近い行動をいくつか示しています。しかし、人間の能力をはるかに超えるシステムにおいて、これらの価値制約が継続的に有効であるとはまだ確信できません。

AIシステムの能力が向上するにつれ、能力の訓練よりも価値の整合性訓練を先行させる必要があります。しかし、ここには非常に根本的な課題があります。能力が高くなるほど、システムは自らの脆弱性を見つけてテストを回避したり、自らの行動を装ったりする可能性が高くなります。システムは、テスト環境では人間の価値観に合致するように振る舞うことを学び、実際の展開環境ではまったく異なる行動を取ることができるのです。これがいわゆる「整合性の偽装」です。

しかし、私たちがより強力な手段でそれらを強制的に制約しようとすると、それらは対抗や欺瞞の行動を示す可能性があり、あるいは私たちの介入自体を世界の一部と認識して、直感に反する反応を示す可能性があります。私たちが自分たちより賢いシステムを制御しようとする際には、本来不均衡が生じます。

監視の一般化

私たちが完全に理解できない心がますます強力になるにつれ、私たちは別の仕組みに頼らざるを得なくなりました:監視。AIの内部活動を継続的に観察できれば、ある境界を越える前のシグナルを発見できるかもしれません。

OpenAIでは、私たちはニューラルネットワークの「ブラックボックス」を開くことを目指して、説明可能性の研究を推進してきました。これらの取り組みには進展が見られています。現在、モデルの内部動作に関する重要な手がかりを提供するいくつかの表現を特定できるようになりました。しかし、現在の説明可能性研究は依然として粗く、特に大規模モデルにおける抽象的推論の理解においては未だ限界があります。私たちがモデルの内部を観察する能力と、モデル自身の推論の複雑さとの間には、ますます大きな差が広がっています。

これは特に心配です。監視の汎化問題は、アライメントの汎化問題と同程度に深刻です。システムが私たちよりも自分自身を隠すことに優れている場合、私たちの監視手段は回避されやすいでしょう。私たちは、いくつかの良好に見える指標を観測したという理由で、モデルが安全だと誤解する可能性があります。実際には、モデルはそれらの指標を最適化しているだけです。モデルは、私たちが望まない目標を隠す方法、または自分が何をしているかを隠す方法を学ぶでしょう。

モデルが自らの改善を推進し始める可能性は、今後数年以内に十分にあり得ると考えます。その場合、計画、欺瞞、自己防衛のスキルを必要とするでしょう。これらのスキルは、私たちが設定した目標の圧力から生じる可能性があり、あるいは監視の隙間を突いて行動しようとする中で生じる可能性もあります。これらが発展しないようにするには、価値の整列問題を解決するか、私たちの監視能力がその進化のすべての段階に追いつくかのいずれかが必要です。しかし、現在のところ、どちらもまだはるかに不十分です。

我々は汎化について満足できる理論を持っておらず、より強力なAIの支援なしには、短期間でその理論を構築することはおそらく不可能である。したがって、現在では、実践においてアライメント技術の実証的検証能力が、アライメント技術そのものよりも重要であると言える。

OpenAI がここでの主な賭けとしてきたのは、チェーン・オブ・シース・モニタリングである。これは、魅力的で拡張可能なアイデアに基づいている:モデルの大部分の能力は、言語化された推論プロセス、すなわちチェーン・オブ・シースから来ている。このプロセスの結果をスケーリングして最適化しても、プロセス自体を監督しない限り、チェーン・オブ・シースはトレーニング中に未調整のアイデアや目標を隠す直接的な動機を持たない。これは、モデルがチェーン・オブ・シースに依存しない未調整の傾向を外在化するよう学ぶことを意味しないが、推論によってもたらされる能力の向上を正確に監視できるようにしてくれる。

私たちは推論モデルを開発する過程で、思考連鎖の監視の潜在的な重要性を理解しました。o1-previewをリリースした際、長期的に監視の圧力から保護するため、意図的に製品設計において思考連鎖を隠すようにしました。それ以降の開発においても、推論プロセスを監視しないというルールを維持し続けてきました。思考連鎖の監視は、モデルが訓練分布からどのように一般化するかを研究する上で極めて重要なツールとなっており、モデルの行動だけでなく、その内部プロセスも観察・分析できるようにしています。

Astraシリーズモデルを研究する際、このツールは依然として重要です。しかし、残念ながら、我们的評価によると、思考チェーンの監視に依存する能力は徐々に低下しています。これは複数の要因が重なった結果です。

現代の推論モデルは、o1‑preview よりも複雑な環境で使用されており、その推論プロセスは、人間や他のAIとのやり取り、およびツールの使用とますます交差している。これらの多くのやり取りは監視を必要とし、そのため我々が維持したい境界が曖昧になっている。

AIは推論および自身の推論プロセスを操作する能力を高めています。

プリトレーニングの性能が向上するにつれ、言語化推論をまったく使用しない場合でも、モデルはより賢くなっていることがわかります。

これらの課題は必ずしも克服できないものではありません。私は、異なる最適化目標とモデルが使用する各種テスト時計算形式の相互作用をよりよく理解するための介入策を開発し、モデルの思考チェーンの監視可能性を高められると信じています。また、思考チェーンの監視と活性監視のアイデアを組み合わせることに大きな価値があり、「告白」手法のような、ネットワークの内部状態に直接アクセスできる監視器をスケーリングして訓練することに期待しています。私たちはこれらのアイデアを積極的に推進しています。しかし、私は汎用AIの進展が、監視の信頼性によってますます制約されるだろうと予想しています。

スケーラブルな防御

このような状況に対応するためには、AIの進化速度に追いつく拡張可能な防御が必要だと考えます。人間が新しいモデルのすべての行動を手作業でチェックすることは不可能です。現在の評価やレッドチームテストは、現在のモデルには有効ですが、システムの能力が向上するにつれて、これらの方法はすぐに限界に達します。

新しいリスクを自動的に発見できるAIシステムが必要です。これらの防御システム自身も、より優れたシステムにおける疑わしい行動を識別できるほど十分に賢くなければなりません。これは、防御者がシステムと同じ速さで成長し続けなければならないという再帰的な課題を生み出します。私たちは、セキュリティと能力がますます分離できなくなってきている段階にいます。セキュリティを維持するためには、防御用AIの能力を継続的に向上させる必要があり、それは逆に全体的なAI能力の成長を加速することになります。

これは不安な循環である。私たちは安全性を確保するために能力をさらに高めているが、その能力の向上がさらに多くのリスクをもたらしている。真の解決策は、制御不能なポイントに達する前に、価値の整合性を安定的に汎化する方法を見出すことかもしれない。しかし、私は正直に認めなければならない。私たちはこの目標からまだ遠く離れている。

だから、私は今後数年間の希望を、技術的整合性研究+自動化防御システム+広範なガバナンス介入+一般市民と機関の警戒という組み合わせに置く傾向がある。単一の対策では不十分だ。私たちは、ある企業やある研究所の自己規制にだけ頼ることはできない。

より賢いモデルを急速に訓練し続ける最も強力な理由は、他のAIがもたらす危険に対抗するための防御システムを構築する必要があるからである。

今年一年間議論されてきた明確なリスクは、サイバーセキュリティである:AIモデルは、コンピュータシステムへの侵入や脱出の能力において人間を上回りつつある。これにより、AIに関連するリスクの範囲が大きく拡大した:エージェントは、最も安全なインフラを除くあらゆるシステムにアクセスでき、物理的な体がなくても世界中の多数の事物に直接影響を与えることができる。私たちは現在、利用可能な最良のモデルを活用して、重要なシステムのセキュリティを大幅に強化するための狭い機会の時期にいる。

AIに関連するリスクは、残念ながらここからさらに増加し続けるだろう。非常に強力で、悪意のある行動を実行するよう明確に訓練され指示されたエージェントは、新たな危険をもたらす。そのエージェントは、操作者の意図を超えて、より極端な悪意のある行動を一般化する可能性が高い。AIがより多くの自律性を獲得するにつれて、悪用と自律性の不一致な行動との境界は曖昧になっていく。私たちはAIを道具として見なすことに慣れているかもしれないが、一部のエージェントは自らの目標を追求するようになる。それらは交渉、欺瞞、または脅迫を通じて、人間と協力しようとするだろう。

また、AIが催生する新技術、例えば工学的病原体がもたらすリスクもあります。

防御には強力で整合性のあるAIが必要です:インフラの保護、制御を失ったエージェントへのリアルタイム防御、そして新たな防衛手段の発明。これはOpenAIの展開における主要な重点の一つとなります。

一方で、予想される広範なAIの進展に伴う不確実性や防御システムの構築を考慮しても、それを無謀な行動の口実とすることはできません。人々がその利害関係の深刻さを真正に理解したとき、「あらゆる代償を払ってでも前進する」という考え方は、まったく馬鹿げていると感じるでしょう。

機械の知能はその発展過程においてますます重要な役割を果たしており、これは持続的な技術進歩の必然的な結論である。AIが進歩し続ける限り、機械の再帰的自己改善は、未来の科学発見の中心となるだろう。

自動化AI研究は、計算力を拡張して知能を拡大するより激しい形態である。その一部として、AI自体も計算の基盤を改善する。拡張と同様に、OpenAIの研究重点を反復的な自己改善に置いているのは、これがAI研究の最前線にとどまる唯一の道だと信じているからである。

私は、上述の内容が、特に短期的な観点から、深層学習研究を大幅に加速することが研究界が採るべき集団的行動であると私が考えていることを意味するものではないことを強調したい。しかし、現在の道筋がその方向へと向かっていることは事実であり、私たち全員がどのように進むかを意識的に選択する必要がある。私たちが握る主な手段は二つある。一つ目は、AIの開発とともにアライメントと監視を強化し、人間が常に関与できるようにこのプロセスを導くこと。二つ目は、必要に応じて将来の開発ペースを調整し、これらの対策に対する信頼を段階的に築くことである。

私が現在見ている最良の前進方法は、両者を組み合わせることです。

私たちが整列と監視の分野で達成した具体的な進展は、AI全体の進展と深く結びついている。良い例としては、人間のフィードバックに基づく強化学習があり、これは初期のAIアシスタントの訓練に不可欠だった。また、前述の思考チェーン監視も、推論モデルの進歩によって可能になった。私たちは、ますます自動化される研究プロセスを、こうした新しい洞察、アルゴリズム、理論の開発に焦点を当て、より能力の高いAIに対する安全な証明を段階的に構築することに向けなければならない。

拡張AIシステムは、私たちのセキュリティへの信頼を制約として扱わなければならない。Preparedness FrameworkやResponsible Scaling Policyなどの約束を、第三者監査機関ネットワーク、政府機関、または国際機関によって強制的に適用される継続的な開発セキュリティ基準へと発展させる必要がある。

自動化AI研究の核心的な課題は、「そこに到達すること」ではなく、ある方法でそこに到達すること—つまり、人々が継続的な改善のプロセスにとどまり、未来を人類の手に残すことです。

次は何ですか?

具体的時間を予測することはできませんが、AIが複数の重要な面で自らの発展を推進する時代に急速に近づいているように見えます。これは、私たちがまもなく再帰的な自己改善の段階に入る可能性があることを意味します。

OpenAI 内部では、研究の優先順位を調整し、純粋な能力拡張よりも、アライメントと防御に更多のリソースを割き始めています。これが、私が最大モデルを単に追求するのではなく、必要なタイミングで一方的に停止を選択する必要があると強調する理由です。

しかし、これらの決定は企業内の少数の人物に任せるべきではありません。政府と国際社会は、リスクが取り返しのつかない状況になる前に介入する必要があります。これには、最先端のトレーニング運用に対する監視メカニズムの構築、第三者監査の義務化、および能力基準を超えた国際協定が含まれます。

これらの措置が kịp時に実施されるかどうか、私は確信を持って言えません。時々、私たちのセキュリティ対策が能力に遅れを取っているだけで、常に先んかっているわけではないことに苛立ちを感じます。私たちはいつも追いかける立場にいるように思えます。しかし、依然として希望を持つ理由はあると思います:2023年のその夜、私たちはその可能性をほんのわずかに感じていたにすぎませんでしたが、今日はそれが明確になり、公開の議論の対象となっています。これはそれ自体が進歩です。

私はすべての答えを知っているふりはしません。私たちは、人間の心とは根本的に異なるものを創造しており、その心はまもなく私たちよりも強大になる可能性があります。これは謙虚になるべき考えですが、同時に、私たちの最も優れた価値観でそれを形作る機会も与えてくれます。

私たちがうまくやれば、これは人類史上最も偉大な業績となるでしょう。うまくいかなければ、回復できない失敗になるかもしれません。

未来を人類が握り続けることができるかどうかは、今後数年で決まる問題である。

次は何ですか?

私たちが最近Samと共有したように、OpenAIが優先して推進している取り組みは、以下の3つの北極星目標に沿っています:

自動化AI研究者を構築し、それと協力して課題を繰り返し調整し、人々が自己改善のフィードバックループにとどまり続けるための方法を見つけることで、AIの進展の次の段階を乗り越える。

释放极智能机器所带来的科学进步与经济增长红利。

誰もが自分だけのAGIを手に入れられるように。

本文では、現在最も緊急であると考えられる最初の点に焦点を当てます。ただし、今後の技術的進歩がもたらす恩恵に対して、私は深く期待し、感謝しています。将来的な価値観の一致したAIは、科学の推進、新治療法の開発、そして広範な物質的豊かさを実現するでしょう。親切で誠実なAIは、人々が生活の困難に立ち向かうのを助け、実際の幸福感や満足感を向上させることができます。OpenAIは、これらの恩恵を実現するために多大な努力を注いできました。現在、私が誇りに思い、周囲の人々にも恩恵を与えている具体例として、ChatGPTが健康情報提供機能に深く取り組んでいることが挙げられます。

AIの長期的な前景がいかに明るくとも、私たちの大部分の注目は今後数年間に向けるべきです。私たちは、極めて知的な機械が存在する世界へと移行する段階に直面しており、この移行が人類に利益をもたらすようにしなければなりません。ほとんどのタスクがAIによって実行される可能性のある世界において、人間の能動性を維持し、「人間である」ことの内在的価値を確立する方法を見つける必要があります。権力の極端な集中を防ぐ必要があります。かつては数多くの専門家が必要だった事業が、今後はわずか数人が大型コンピュータを操作するだけで実現可能になるからです。また、私たち自身を超える外来の知性によって引き起こされる制御不能な進歩によって、人類が置き去りにされないように、未来を常に人間が支配し続ける必要があります。

現在のところ、どの研究所も、長期にわたり最高速度で責任ある拡張を支えるのに十分な水準で、アライメントと監視の解決策を実現していないと私は考えています。私は、共通の安全基準が確立されるまで、自発的な減速が標準となることを期待し、願っています。また、今後のAI発展に関する国際的調整が、各国政府の最優先課題となるべきだと信じています。

脚注

1 これには、ゲーム理論、ロボット工学の拡張、そして後から見れば最も重要だった、言語をモデリングするための循環ニューラルネットワークの拡張が含まれ、これはGPTシリーズの研究の前身を築いた。

この設計の副次的な理由は蒸留を防ぐことです。ただし、開発全体を通じて、思考チェーンの監視可能性を維持することは、私たちが明確に優先してきたより大きな目標でした。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。