ねえ、聞いた?
人間の研究者にとっての良い日は、せいぜい残り2年しかない。
2年後、人類がAIの研究を行うことは、今日人類がチェスを指すようなものになる。
もちろんまだ下げられるが、誰もお前の下げ方がどうかなど気にしない。

これは、以前のOpenAI推論モデルのトップ担当者であるジェリー・トワレックが発表した最新の暴論である。
彼は2019年にOpenAIに入社し、7年間在籍した。当時、強化学習はスケールさせることができなかったが、彼はそれを諦めず、必死に推し進めて成功させた。O1とO3という2つの主力モデルは、彼が自らチームを率いて開発した。

「私たちはAGIを構築したい。」これは2019年、彼がOpenAIに入社した直後の全社ミーティングで、イリヤが提示したすべてのロードマップだった。7年後、彼は自ら独立した。
さらに恐ろしいのは、この言葉が彼一人だけのものではないということだ。現在、AI研究者間で最も流行している内部ジョークは以下の通りだ——
残りわずか数日しか働けません。今できるうちにしっかり働いて、その後は一緒に退職して休んでください。
みんなはこれをブラックユーモアとして繰り返し語っている。しかし、冗談を言うそれぞれの心の中は、はっきりと理解している。
この冗談は、おそらく現実だ。

しかし、これはほんの前菜にすぎません。このインタビュー全体を通して、彼は次々とこのような強気な発言を繰り返しました:
- エージェントは確かに創造性があるが、それは極めて低品質で、大量に積み重ねられた創造性であり、アイデアは多様だが、概してひどいものばかりだ
- 前沿モデルを訓練からデプロイまで実際に手掛けるのは、世界でたった30〜50人程度であり、残りの全員は彼らを支えているだけだ。
- トランスフォーマーを最適解と見なすという仮定は、ほぼ成立しない。
- OpenAIで過ごした7年間で、本気で基盤アーキテクチャを変更しようとしたのは、3〜4回だけだった。
- 世界は私たちが働かなければ回らないという前提はそもそも成り立たない。
以下が整理されたバージョンです。お楽しみください。
半分の仕事は、もう誰もやらなくなった
この数字の2年は、ランク付けとも計算能力とも関係ありません。
他の数え方では、この研究において、まだどれだけの作業が人間によって行われているかを示しています。
そしてこの仕事はすでに二つに切り裂かれている。
一つはアイデアを出し、どこに向かうべきかを明確にすること。もう一つは、その考えを実行可能なコードに変えて、データを取り戻すこと。
そして、作業の部分はすでにAgentに移行しています。
Tworekは今年4月、Core Automationという会社を設立し、スローガンは「世界で最も自動化されたAIラボを構築する」である。
彼らでは、一つの実験の完全なサイクルが、一个月からたった一日に短縮されました。効率がなんと30倍に向上しました!

ただし、この部分の提案については、エージェントは現在対応できません。理由は——
それらは間違いなく創造力の高い種です。
しかし、それらは極めて低品質で大量に積み重ねられる形で創造力を浪費している。アイデアは確かに多様だが、そのほとんどがひどく劣っている。
世界中でたった30人から50人です
これだけ聞いていると、アイデアを出すこの部分はまだ安定しているようだ。
本当に意見を出せる人なんて、もはやほとんど残っていない。
インタビューで司会者は、OpenAIの内部研究者が自分に内緒で話したことを明かした——
世界中で、最先端のモデルをどのように訓練し、どのようにデプロイするかをエンドツーエンドで理解できる人は、おそらく30人から50人程度だろう。
残りの全員が、この数十人の頭脳の下で働いており、その中には最も優れた企業の大多数の正社員も含まれている。
Tworekは反論しなかった。
彼も、あらゆるトップチームはこのように動いていると考えている。少数の者が方向を定め、その背後には轟音を立てて動く実行機械がついていく。
この数十人がどれほど人気かを知るには、彼自身の採用リストを見れば十分だ。
Core Automationの共同創業者であるRohan Anilは、Anthropic出身で、その前はGoogle DeepMindに在籍していました。
DeepMindでGeminiを担当していたAnmol Gulatiも引き抜かれた。OpenAIの元人事責任者であるJulia Villagraまでが一緒に移った。
すべてのラボが同じ池で人を釣っている。そして、この池にはたった数十匹の魚しかいない。

したがって、この2年という数字は、人類全体とは何の関係もありません。
この数十人がさらにどれほど持ちこたえられるか。
七年間、アーキテクチャは真剣に変更されたのは三四回だけだった
人が残りわずかとなった今、AIの前に立ちはだかる最後の壁とは何か?
Tworekの答えは「Transformer」の一つだけです。
彼の見解では、これは最適解であることはほぼあり得ない。

まず、モデルはデプロイ後には学習を続けることができません。どれほど多くやり取りしても、それは強化されず、次の会話でも元のままです。コンテキストウィンドウも限界があり、自身はCodexを使って20分ほどで圧縮が必要になると述べています。
また、継続的な微調整で補おうとすると、効率が極めて低く、かつ重大な忘却が発生し、新しいことを学ぶと古いことを忘れてしまうことがわかります。
したがって、この数年間、業界全体がTransformerに対して行っていた大部分の作業は、実際にはそれを安価にすることであり、それを強化しようとした人はほとんどいませんでした。
しかし、Tworekが本当に欲しかったものは、アーキテクチャそのものにはなかった。
彼が求めているのは、テスト時に学習を継続できるモデルであり、ユーザーのインタラクションやユーザーのデータから継続的に成長するタイプのモデルである。アーキテクチャの変更は、その実現への手段にすぎない。
この道理は業界の人なら誰でも知っている。しかし、ここまで長い年月が経過したのに、なぜTransformerはいまだにしっかりとその地位を保っているのか?
その背後にある理由は、単純すぎて馬鹿げているほどだ——ほとんど試していなかったからだ。
OpenAIで7年間の間、基盤アーキテクチャを本気で置き換えようとしたのは、3〜4回だけだった。

プロセスは以下の通りです。
研究者はまず小規模な検証実験を実施し、少なくとも3か月間実行する。結果が良好に見えるまで、スケールを拡大しない。
そしていわゆる拡大とは、生死を握る約10人の人をあなたの舌で説得し、その10人があなたという無底洞に3〜6ヶ月分の資金を投じることを意味する。
最後には、Transformerがすでに雪球のように巻き上げたその運動エネルギーに圧倒されるか、一部が吸収されて、その一部のネジとなるしかない。
七年で、三〜四回。これが世界最強のAI研究所がアーキテクチャ革新において有するすべての生産能力である。
「Jare、この計算能力を燃やして」
彼自身もOpenAIでまったく同じ行き詰まりに陥ったことがある。そして、それを解きほぐしたのは、たった一文だった。
当時のその一連の半死半活な実験は、わずかに「生命の兆し」を示した。良いとは言えないが、少なくとも芽は出た。
そのまさにその瞬間、後にOpenAIの首席科学者となるJakub Pachockiが彼に接触した。
「ジャレ、これらのGPUを全部お前にあげる。手元の結果をもっと大きく、もっと強くしてみてくれ。」

「今、あなたはこれらのGPUを手にしています。」彼がこの文を繰り返したとき、o1にはまだ名前がなかった。
この言葉は彼をパラドックスから救い出した——
結果を出さなければ、計算能力を要求する資格はない。
しかし、結果を出し出すには、まずその計算能力を確保しなければなりません。
トワレクは、ほとんどの最先端分野がこのパラドックスに陥っていると述べた。実験室で計算リソースを巡って繰り広げられる陰謀は、結局のところ、脱出の道を見つけるためのものである。
そして出口は、時として経営陣のひとつの判断で 点点 Confidence.
誰かが上から「あなたにしっかりした算力クォータを割り当てて、思い切りやれ」と言えば、それで十分だ。
扉が開けば、その後は止められなくなる。
強化学習は、このノードから数桁の規模で進化しました。
そしてo1の脱皮により、無数の人々によって絶望された推論モデルという道を、彼は見事に生き返らせた。
10万ドルで専門家1人分の価値
そして今回は、誰かの指示を待つ必要がない。
チェーン全体で最もコストがかかる工程は、抽象的なアイデアを実際に動作するコードに変換することである。そして、これが現在のエージェントが最も得意とする仕事である。
例えばCore Automationは、この手法をGPUのコアに適用したことがあります。
具体的には、彼らはQR分解カーネルをプログラミングエージェントに渡して4週間実行させ、約10万ドルの呼び出しコストを消費し、最終的にそのカーネルの速度を元の60倍まで向上させました。
この仕事は底层パフォーマンスエンジニアリングに属し、GPU上で行列演算をいかに高速に実行するかを微調整するもので、普段はごく少数の専門家が一行ずつ手動で最適化する必要がある。
このような専門家は、世界中でもわずか数人しかいません。
今や10万ドルで一つが手に入る。説得も必要なく、三〜六个月待つ必要もない。
七年間閉ざされていたその障壁が、ついに突破された。
それ以後、私たちは何ができるのでしょうか?
最も硬い構造さえも緩んだ以上、数十人の手に握られているハンドルも、もう長くは持てない。
インタビューの最後で、司会者がこのことを明確に指摘し、その日が本当に来たとき、人間には何が残るのかと尋ねた。
これについて、トレビックは二つの情景を描いた。
最初の一枚は古代ギリシャです。
人々は広場で集まり、のんびりと一日中哲学について語り、その後運動し、オリーブを食べながらワインを飲む。
彼自身が描き終えると笑い、これはおそらく自分の願望を投影しているだけだと認めた。

「広場で会って、おしゃべりしよう。」彼はAGI時代の人間の日常をこのように説明し、自分自身でまず笑った。
二枚目は高校、あるいは大学です。
彼は、人間が「優れたこと」そのものへの追求を保つべきだと考えている。新しいことを貪欲に学び、体と脳を限界まで鍛え続けること。
これはプロスポーツに少し似ています。経済的な理由などなく、わざわざ血と汗を流す必要はないのに、人間の内なる誇りが、「偉大」というものを手にしようとさせるのです。
私たちは、このことを実現するためのさまざまな方法を見つける必要があります。
次の世界では、「あなたがやらなければ、この世界は崩壊する」というようなことはもうない。世界は、私たちがすでに構築したインフラの上を自ら動き続ける。

「私たちは常に学び続けるべきです。」彼はそれを娯楽ではなく義務のように語った。
そして彼は静かに底牌を明かした。
私たちは働かなければ、この世界は回らない。この仮定は、そもそも成立する必要がない。

「多くの人の自己価値は仕事から来ています。」彼は、それが自分自身を含めて最も乗り越えにくい壁であると認めた。
彼自身もこのリストに含まれている
正直に言うと、全体を聞いて最も気味が悪いのは、その2年ではない。
彼自身も、自分がこのカウントダウンにアクセルを踏んでいることを知っている。
彼が作ろうとしているものは、自ら学び、自ら強化されるものであり、もはや誰かが横で餌をやる必要がない。それが実現すれば、数十人の職位がさらに速く消えることになる。
そして、彼はさらに厳しいことを言っている。最初に裁くのは自分自身だ。
あなたが最も恐ろしい計算能力を保有し、最大規模のラボでなければ、惨憺たる結果になるだろう。

この言葉を発したとき、Core Automationは設立からわずか4ヶ月で、帳簿上の収益はゼロだった。
彼は、起業以来、ほぼ毎週のように誰かがやってきて、「ジャレ、遅すぎるよ、あの天に届く梯子はもう取り上げられてしまった」と言うと言った。
彼の返答は、自社のスローガンの一文だけだった。
私たちの会社の人たちは、いつも「すべてはスキルの問題だ」と言います。
結局、失敗したのは大環境のせいではなく、自分自身の技術が足りなかったからだ。
いや、このインタビューの文脈では、確かにそのような雰囲気があるね。
改めて最初の流行り文句を見返してみよう。
残りわずか数日しか働けません。今できるうちに、すぐに行動しましょう。
その口調には、興奮なのか、悲しみなのか、私たちは知る由もない。
その言葉を言う人にとって、その二つの感情は本来同じものだからだ。
Tworekは、この仕事のリズムは非常に体力を消耗し、ここまで長年続けてきたのは本当にとてもとても疲れると言った。

しかし、もし私たちが本当にそれを信じるなら、これは私たちのキャリア全体で最も重要な時期です。
おそらく、それは非常に価値があるでしょう。
参考資料:
https://x.com/MTSlive/status/2092387349623935322
本文は微信公众号「新智元」より、著者:ASI启示録、編集:モーセ
