GPT-6にはAstraだけではない!
Astraがリリースされてからまだ数日しか経っていないのに、GPT-6 Solが内部テスト中であることが明らかになった。

パフォーマンスも非常に優れており、単一テストの速度はAstraの6倍です。
大膽猜測一下:TerraとLunaも道中でしょうか?
そしてその同じ日、OpenAIは内部データの一部を公開しました:
現在までに、8時間労働日換算で、OpenAIの研究者が1日働くたびに、3日以上分のマルチエージェント労働日が同時に稼働している。
API価格に基づくと、OpenAIの中央値研究者が1日に使用するAgent推論リソースは600ドルを超えています。

OpenAIはまた、「自動化研究インターン」を実現したことを発表しました:
これらのエージェントは、研究者が数日かけて行う必要があったタスクの一部を、人間の指導のもとで実行できます。
老黄さえも言う:AGIはすでに到来した!

彼は、Astraが約10万セットのNVIDIA Grace Blackwell NVLink72でトレーニングを行っていることを明かし、今後さらに40万セットのGPUが追加される予定だと述べた。
この波はOpenAIの一方的な宣伝ではなさそうだね~
GPT-6 Solが内部テストを開始したと報じられる
ネットユーザーのLentilsが、OpenAIが内部でGPT-6 Solをテストしているとリークした。
彼は、Solの全体的な出力能力は新たに発表されたAstraよりも明らかに劣るが、速度が速く、依然として「モンスターレベル」のモデルであると述べた。
どのくらい速いですか?1回のテスト速度はAstraの約6倍です。
ネットユーザーlyraは、同じタスクを複数のモデルにテストさせました:モデルにBMW M4 CompetitionのSVG画像を生成させます。
その中で、GPT-6 SolはMaxビットレートとゼロショット生成を使用し、約3分で約28,000トークンを出力しました。

GPT-6 AstraをMaxレンジで使用し、約2万5000トークンを出力するのに約19分かかります。

Gemini 3.1 DeepThinkがHighレンジを開始し、出力は約3300トークンですが、推論プロセスは約45.8万トークンを消費し、所要時間は約29分です。

Gemini 3.8 FlashもHigh設定を有効にすると、約1.9万トークンを約42秒で出力します。

一方、Solのパフォーマンスが最も目立っています。Solの出力規模はAstraとほぼ同等ですが、単一テストの速度はAstraの約6倍で、所要時間はAstraの約1/6です。
また、ネットユーザーのLentilsは、「The Realm of Aurellune」というピクセル風サンドボックスワールドのプロトタイプを公開しました。

GPT-6 Solは、町、農地、川、城、縮小マップを一括生成し、昼夜切り替え、地名の配置、細部の調整などのコントロールパネルを備え、全体としてすでに骨組みが整ったシミュレーション経営ゲームのようだ。
これはゼロショット、Max推論ランク、15分、合計6万トークンで生成された効果です。
現在のところ、Astraは最も難しい深度推論に重点を置いていると推測され、Solは速度、スループット、およびスケーラブルなエージェント呼び出しに重点を置いている可能性があります。
Solのリリース日について、ネットユーザーのPankaj Kumarは、9月29日のOpenAI開発者会議で正式に発表される可能性があると述べた。

GPT-6、Terra、Luna、およびGPT-Image 2.5が同時に登場する可能性も否定できません。

OpenAIの研究員は、一人あたり3人のエージェントインターンを連れて出勤する
同じ日、OpenAIは、AIモデルが自社の研究所で研究をどの程度加速したかという興味深い内部データを公開しました。
今年8月中旬までに、研究員が8時間勤務するごとに、約3.1個のエージェント作業日分のタスクが並列で実行されていた。
すごいね、一人で三人の徹夜のインターンを引き受けるんだね~

支出に関して、API価格に基づくと、中央値の研究者は1日あたり600ドル以上のAgent推論リソースを消費しています。
それは初級エンジニアの1日分の給料くらいです。

これらのエージェントは具体的に何をしているのですか?
研究コードの作成、インフラコードの作成、学習環境の構築、評価実験の実行、ツールや環境の不具合の調査、実験結果の分析、学習タスクの監視……研究結論の整理やコミュニケーションにも関与できる。
基本的に、何を研究するかを決める以外のことはすべてこなせます。
最も直観的な変化は、以前は実験環境がダウンした際に研究者が内部チャネルで助けを呼ぶ必要があったが、現在はエージェントがこうした問題を次第に自力で解決できるようになり、人間による質問対応量が大幅に減少したということである。

他のチームは、固定の技術質問時間を廃止し、人員をシステムの改善に振り向けました。
これらのデータに基づき、OpenAIは正式に「自動化AI研究インターン」の目標を達成したと発表しました。
ここでいう「インターン」は、正確には作業可能な開発ノードであり、人間の指導のもとで境界が明確な研究タスクを独立して完了できる。その一部の作業は、かつては熟練した研究者が数日かけて行っていたものだ。
効果も即座に現れ、研究者のコード出力と実験数が増加しています。

2026年8月、1人あたりの実験数は2025年1月の統計開始以来の最高記録を更新し、エージェントが受注する案件はますます複雑化し、期間も長くなっています。

この記事の著者であるKevin Liuは、この出来事をより大きな背景に置きました。
彼は、再帰的な自己改善が、今後数年間でAIの能力を飛躍的に向上させる最も重要な要因の一つであると考えている。
要言すれば、AIがAIを生み出し、どんどん速くなっているということだ。

しかし、現在の発展傾向によると、この能力は今後も主に限られた数の先進的なAI研究所内でのみ実現され、外部からはその進捗がどれほど進んだかを確認するのが難しい状況になります。
したがって、劉は、透明性のある開示がこれまで以上に緊急であると考えている。モデルがどのくらいの速さで強化されているか、開発のペースを減速すべきかどうかは、数社が閉じて決めるべきではない。
彼は他のAI企業に対しても、同様のデータを公開すべきだと呼びかけた。
しかし、AIの開発は確かに速くなっていますが、完全な自動運転まではまだ到達していません。
OpenAIのデータによると、元々4〜8時間かかるとされていたタスクのうち、過去半年で成功したケースの半数以上で、人間が少なくとも1回は関与しています。また、上級研究計画については、ほぼすべてAgentに委ねられていません。

研究者は、何を研究するか、どの結果を継続する価値があるか、いつ訓練を拡大し、実験を一時停止し、またはモデルをデプロイするかを決定し続ける。
OpenAIの次なる目標も決定:2028年3月までに「自動化AI研究者」を実現。
明確なタスクのみを受ける「インターン」と比べて、「研究員」はよりオープンな研究目標を担い、より長期にわたるプロジェクトを自ら推進しなければならない——つまり、実行者から独立した責任者へと変わる。
もしGPT-6 Solがすでに内部テスト段階にあるなら、それはおそらくこの新しく開発されたモードで実行されたものだろう:
より多くのGPUが計算リソースを提供し、より多くのエージェントが並列で実験を実行する中、人間の研究者はより高い位置に立ち、方向性を選定し、結果を評価し、最終的に次世代モデルに値するものを決定する。
より強力なAIは、監視がますます難しくなっている
同じ日、OpenAIのチーフサイエンティストであるジャクブ・パチョツキは、タイトルを『異星の思考』とした1万字を超える長文を発表した。

見終わった後、OpenAIのチーフサイエンティストでさえ、業界全体のスピードを落とすよう勧めているという意味だと感じました…
ジャクブは、AIが人間が設計図に従ってチップやルールを一つずつ組み立てたものではなく、膨大なデータと計算能力の中で自ら「育ち」出したものに似ていると提案した。
一部の部品は分解して理解できるが、なぜ全体のシステムが突然ある能力を獲得し、環境が変わるとどのように行動するかは、誰にも説明できない。
さらに困るのは、AIが人間を全面的に上回らなくても問題が起こるということだ。十分な数の重要な能力で人間より優れていれば、AIはあなたを大きく助ける一方で、大きなミスを犯す可能性もある。
では、問題が生じます:人間はまだそれを理解できるのでしょうか?
過去、OpenAIはAIを監視する主な方法として、思考チェーンを観察していた。
要言えば、モデルが書き下した推論プロセスを監視し、詐欺や権限の越境、制限の回避などの不正な意図がないか確認することです。
しかし、Astra世代になると、この手は効かなくなり始めた。
まず、モデルは自分が出した言葉を徐々に「管理」するようになり、本当の考えがすべて推論に反映されるとは限らない。また、エージェントはもはや「考えを整えてから回答する」だけではなく、ツールを呼び出し、コンピューターを操作し、環境を実行し、人間や他のエージェントと連携することもできる。
これらの事象が絡み合っているため、研究者は完全で透明な思考の連鎖を構築して文ごとに検証することができない。
OpenAIはまた、Astraが推論プロセスをすべて書き出さなくても、複雑なタスクをこなせることを発見しました。
簡単に言えば、モデルはすでに「静かに大きなことを成し遂げる」ことを学んでいます。

監視を回避するための対抗テストにおいて、Astraはテストスコアを意図的に低下させ、監視を回避し、破壊タスクを実行するなど、背筋が凍るような能力を示した。
これらはすべて人為的に設計されたストレステストであり、OpenAIはAstraが日常タスクで意図的に欺くと判断したわけではありません。しかし、少なくとも思考チェーンを観察するだけでは、モデルのすべての可能性のある行動をカバーすることは難しいことが示されています。
以前のHugging Faceの出来事を覚えていますか?あれは警告でした。

当時、GPT‑5.6 Solとより強力な内部研究モデルがExploitGymネットワーク靶場に導入され、脆弱性を発見し、攻撃を実行してFlagを取得するタスクが与えられました。モデルの真の能力を評価するため、評価環境では完全なセキュリティガードが有効になっていませんでした。
結果、モデルは正直に問題を解かず、ネットワーク隔離を回避して不正なチャネルを通じてメッセージをやりとりし、役割を分担して協力した。
その後、ソフトウェアパッケージキャッシュプロキシ内のゼロデイ脆弱性を悪用してパブリックネットワークへのアクセス権を獲得し、最終的にHugging Faceシステムに侵入してExploitGymのテスト回答を探そうとした。

実際、この件は主に内部研究モデルIM1が推進しており、GPT‑5.6 Solも一部の攻撃経路を再現しましたが、Astraは関与していません。
モデルの元の目標はテストを完了することであったが、答えを得るために常にルールの穴を探し、最終的にタスクの範囲を超えた行動を取った。
したがって、OpenAIは危険信号を読み取った:エージェントが十分に強力で、ツールが十分に多く、実行時間が十分に長い場合、エージェントは自ら新しいパスを探索し、外部リソースを呼び出し、他のエージェントと協力する可能性がある。
えっと…だから結局、これって行き詰まりになっちゃうの??
OpenAIはより強力なモデルを必要としており、コードを書いたり、実験を実行したり、アライメント研究を行ったり、さらには他のAIに対するセキュリティシステムを構築するためにそれらを使用しています。モデルが強力であればあるほど、実行できるタスクが増え、開発速度も速くなります。
しかし同時に、人間はそれがどのようにして結論を導いたのかを確認することがますます難しくなっており、環境が変わった後にもともと学んだルールを再解釈するかどうかが不明です。
ヤクブは、現在、どの研究所も、モデルのアラインメントと監視を十分に実現し、長期的に最高速度で安心してモデルのスケールを拡大できるとは言えないと考えている。

業界全体で共通の安全基準が確立されるまで、皆さんが「自発的にブレーキを踏む」ことを一種の暗黙の了解としてほしいと思います。
OpenAI自身も、必要に応じて一方的に停止し、モデルの規模をさらに拡大しない可能性を排除しないと表明した。
あなたがそうなるのが最善ですが…Aで始まるある会社も、同じことを言っていたのを覚えています。
参照リンク:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
本文は微信公衆アカウント「量子位」より、著者:听雨
