AIに自分に代わって次世代のAIを開発させるには文章執筆者、出典:微信公衆号「APPSO」
中国のAIエンジニアで、技術が優れており、経歴が素晴らしく、北京大学这样的顶尖学府出身なら、何でもできる可能性があるが、働くことは絶対にない。
健康と生活を「最も重要な調整作業」としてThinking Machines Labを退職した翁荔は、すぐにOpenAIへの復帰が報じられた。同社広報によると、彼女は内部研究を加速するチームを率い、AIが自らの次世代モデルの訓練と改善に参加する「反復的自己改善」の探求に携わる。

同じように、彼女の元同僚でかつてOpenAIの中心人物だったIlya Sutskeverが設立したSafe Superintelligenceも、密閉された研究からようやく一筋の光が差し込んだ。NVIDIAは稀有な内部研究へのアクセスを得た後、SSIに投資し、次世代のVera Rubinシステムを用いてその計算能力を1桁拡大することを決定した。

エヌビディアは、SSIが過去2年間、既存の大規模モデルの路線とは異なる新しい研究方向を推進してきたと確信している。これについて、イリヤはさらに詳しい情報は明かさず、「我々には拡大する価値のある研究がある」とだけ述べた。
好奇心を刺激された人々はさらに熱狂し、ソーシャルメディア上に公開された手がかりに対する逆解析記事が登場し、SSIが次なるより大きな事前学習手法を探しているのではなく、モデルを訓練完了後に静止させず、フィードバック、実験、継続的な学習を通じてより強力な次世代を継続的に生み出す新たな反復・進化の方法を求めていると推測された。

この判断はSSIによって確認されていないが、Ilyaの過去の一貫した主張と非常に一致している。彼は以前、単にデータと計算力のスケーリングに頼る時代が限界に近づいており、AIは人間のように少ない経験でより深い理解を形成し、環境との相互作用を通じてさらに成長する方法を再学習する必要があると繰り返し述べてきた。
これらのすでに非常に成功を収めたトップAI人材たちは、すべて同じ方向を見ているようだ:AIに次世代のAIを自ら開発させる方法を。
「自我进化」はAIが真夜中に脳を書き換えることではない
再帰的な自己改善と言えば、AIが自らの欠点に気づき、突然ニューラルネットワークの重みを変更し、目覚めたときには昨日より10倍賢くなっているというSF的な情景が思い浮かびやすい。

現実の出発点ははるかに単純である。AIの開発は常に繰り返される生産ラインである:研究者は論文や実験記録を読み、仮説を立て、トレーニングコードを修正し、実験をキューに並べて実行し、結果が出た後に指標を比較し、失敗の原因を探し、次のサイクルの計画を立てる。
今日の大規模モデルは、多くの工程に参加できるようになっており、コードベースを読み取り、論文を再現し、実験スクリプトを記述し、計算リソースを呼び出してテストを実行し、数十の結果を整理し、どのパラメータに問題があるかを分析した上で、さらにコードを修正できる。かつてはチームが数日かけて1ラウンドを完了していたが、今後は複数のエージェントが並列で数十のルートを試行し、最も有望な結果を人間が判断するようになるだろう。
翁荔は7月初めに投稿した長文『Harness Engineering for Self-Improvement』で、彼女が今後担当する研究方向をほぼ予見していた。彼女は、最近の現実的な自己改善の道筋は、モデルが直接脳を書き換えることではなく、AIがまず自らの作業環境を改造する方法を学ぶことであると考えている。つまり、失敗記録を自動分析し、コンテキスト管理やツール呼び出し、ワークフローを調整した上で、新たな実験結果を通じてこのシステムを継続的に最適化するというプロセスである。より成熟したharnessは自動化された研究を推進し、より強力なモデルは逆にharnessをより単純化することができ、両者は循環を形成する。

これにより、翁荔とIlyaの二つの路線に興味深い呼応が生まれました。OpenAIは既存の研究プロセスを段階的にAIに委ね、AIをまず実働可能な研究エンジンとして育てようとしているのに対し、SSIはより基礎的なレベルで新しい学習パラダイムを探求し、モデル自体に継続的な反復と進化の能力を持たせようとしている可能性があります。
AIは、最初から自らの重みを直接変更できる必要はない。訓練プロセスを改善し、データをフィルタリングし、評価方法を設計したり、モデルの外側にあるハーネスを最適化するだけで、自らの後継者を生み出すことに参加している。
前者は工程サイクルの内側へ向かって進み、後者はモデルメカニズムの外側へ向かって進む。両者の目標は、1世代のAIから次世代のAIまでの距離を短縮することである。
同時に、千人以上の署名を集めて速度を落とすよう要請
大牛たちがこの路線に加速して賭けようとしている一方で、業界内には別の声が上がっている。
今週、OpenAI、Anthropic、Google、Meta などの企業から1100人以上の専門家が署名し、「自動化AI研究」の速度を制御するための技術と調整ツールを早期に構築するよう要請する声明を発表しました。署名者には、OpenAIのチーフサイエンティストであるJakub Pachocki、Anthropicの共同創業者であるJack ClarkとJared Kaplanをはじめとする上級研究者たち、そしてIlya自身が含まれています。

請願はAI研究の停止を求めておらず、自己改善がもたらす可能性のある価値を否定しているわけでもありません。懸念されているのは、AIがAI開発を著しく加速し始めた場合、その能力の成長が人間の理解やシステムの制御を上回る速度になる可能性があることです。

よく考えてみると、この「矛盾のように見える」繰り返しは、同じグループ、甚至同じ個人から生じている。同じ瞬間に、彼らは自動化研究がAIの次なる飛躍の鍵であると信じると同時に、このフィードバックループが本格的に機能し始めた際には、業界が必要に応じて減速する能力を備えるべきであるとも考えている。
このサイクルが形成されると、過去のようにより強力なモデルをリリースするのとは異なります。過去の進歩の速度は、人間の研究チームによって最終的に制限されていました。人間が問題を提起し、実験を計画し、結果を判断する必要があり、予算や人手、組織プロセスのせいで進捗が止まることもありました。
自動化AI開発の目標は、これらのボトルネックを段階的に解消することです。モデルが強化されるほど、チームは次世代モデルをより速く開発できるようになり、次世代モデルはさらに優れた研究者となり、次の開発サイクルの時間をさらに短縮します。
進歩しながらも、スピードをコントロールしましょう
したがって、一見矛盾するように見える二つの力は、同じ前提を共有している:自動化AIの研究開発は、遠い理想から具体的な工学的目標へと変わっている。
ウォンがOpenAIに戻ったことは、再帰的自己改善がすでに専門の組織と責任者を得始めたことを示している;NVIDIAがSSIの秘密研究を閲覧した後、巨額の資金と最新の計算リソースを投入したことは、新しい学習ルートが少なくとも拡大検証に値する段階に達していることを示している。

請願者は、このルートが成功しないと考えているからではなく、成功した後に何が起こるかを真剣に考え始めたからこそ、ブレーキをかけるよう求めています。
真の違いは、AIが人間の研究を支援すべきかどうかではない。コード生成、論文検索、実験の自動化はすでに研究室に導入されている。問題は、AIが研究者の効率を高めるためのツールから、自ら提案を立て、実験を実行し、結果を評価し、次のプロセスを修正する研究システムへと進化したとき、人間がどの段階で意思決定の権限を保持すべきかである。
これは議論が必要な一連の問題を意味する:誰がその最適化の目標を設定するのか?一見してスコアを向上させる変更がセキュリティの境界を損なっていないかどうかを誰が判断するのか?複数の研究所が競争している中で、どの企業が有効なイテレーションを単独で一時停止するつもりなのか?もしモデルの開発サイクルが本当に1年から数ヶ月、数週間に短縮された場合、外部評価と内部セキュリティチームはそのスピードに追いつけるのか?

AI企業が今争っているのは、バズモデルを生み出すことだけでなく、継続的により強力なモデルを生み出す研究開発システムである。
一方是Ilyaや翁荔这样的顶尖研究者,他们希望找到新的迭代方式,让AI参与自身的进化;另一方是同一行业中上千名研究者,要求提前准备一套减速机制。在这两种立场之间,阵营随时变化,态度也并非针锋相对,所有人都面临着一个共同的难题:当研究工具开始加速研究本身时,谁还能决定下一代AI应该在何时到来?
