さきほど、OpenAIが複数のプロジェクトを同時に発表し、次世代モデルAstra(伝説のGPT-6)の事前予熱を最大限に盛り上げました:
公式が突然技術的な長文を公開し、Astraの能力の底力を初めて明かした;
その後、ウルトラマンが自ら小作文を書き、Astraがなぜ遅れているのかを説明した。
その後、2人の中国系研究者が次々と発言し、これまで公開されていなかった内部テストの詳細な結果を公開した。

たった数時間で、すべてのシグナルが同じ方向を示しています:
OpenAIの次世代フラグシップモデルがもう間もなくリリースされます。

オーテマンは小作文で、Astraはすでに訓練を完了しており、リリースが遅れているのはモデルの性能が十分でないためではないと明かした。
逆に、これはAstraがすでに強大になり、会社が自らブレーキを踏む必要があったためです。
ウルトラマンはこの経験を、持続的な引き合いと表現した。
アストラがもたらす能力の飛躍に興奮しつつ、その能力の影響を誰も完全に予測できないことに不安を抱いている。
したがって、先週の夏全体を通して、OpenAIはほぼAstraのセキュリティ強化、アラインメントの実施、ガードレールの追加に取り組んでいました。
彼はさらに、Astra以降のモデルについては、必要に応じて意図的に速度を落として、セキュリティとアライメントの研究に時間を確保すると述べた。
??Astraは一体どれほど強力なのか?OpenAIはなぜ今こそリリースできると判断したのか?
今回の公開された技術ブログは、私たちに観察の窓を提供しているのかもしれない。
GPT-5.6 Solを上回る脆弱性検出能力。内部テストで満点を獲得
公式によると、Astraが今回解放された核心的な理由は、その「サイバーキリティカル」能力基準を達成したためです。
これはOpenAIがこの等級に正式に分類した最初のモデルです。

「キーレベル」とは、Astraが関連するツールと環境の権限を取得した後、未知の脆弱性を自ら発見し、その活用方法を開発して、特別に強化されたシステムを攻撃できるようになり、人間の段階的な指示を必要としなくなったことを意味する。
最も直観的な成果は、Astraが公開された脆弱性利用ベンチマークExploitBenchで100%の成功率を達成したことです。

公開の問題には困らないため、OpenAIは仕方なく新しい問題セットを臨時に作成した。
チームは、2026年6月から8月に新たに公開された20の高リスクV8脆弱性を収集しました。
これらの脆弱性はAstraの知識截止日以降に発生したものであり、モデルが訓練データから「答えを暗記した」可能性はほぼ排除されます。
この内部新問題に対して、Astraは依然としてGPT-5.6 Solを大幅に上回り、使用したトークンもより少ない。

Astraの開発に参加した劉佳威は、その差をより率直に要約した:
この内部テストでは、Astraのサイバーセキュリティ能力はGPT-5.6 Solの約4倍です。

さらに驚異的なことに、あるテストでAstraは自ら2つのゼロデイ脆弱性を発見し、それらを組み合わせて完全な攻撃チェーンを構築した:
強化されたブラウザに対して、AstraはHTMLファイルから脆弱性を悪用し、ブラウザサンドボックスから脱出、最終的にホストマシン上でコマンドを実行することに成功した。
強化されたオペレーティングシステムに対して、それはローカルエスカレーションを達成し、通常の低権限アカウントからroot権限まで取得しました。
つまり、Astraはもはやプログラマーのコードレビューやバグ発見を支援するだけではないということです。
それは、高難度のレッドチーム攻撃を自力で実行できるようになり始めました。
これは、OpenAIがこれまでアストラのリリースをためらっていた理由でもあります。
このような能力が防御に使用されれば、セキュリティチームは人間がまだ気づいていない脆弱性を迅速に発見・修正できるが、攻撃者に悪用されれば、複雑なネットワーク攻撃の実行门槛を大幅に低下させる可能性がある。

ただし、この成績には一つの制限を加える必要があります。
テスト中のAstraはDaybreak Blueレベルの高度なツールと環境権限を取得していますが、これは今後一般ユーザーが取得するデフォルト版にも同等の攻撃条件が備わることを意味しません。
関連結果は現在も主にOpenAIの内部評価に基づいており、第三者による検証を待っています。
しかし少なくとも一点は確定しています:
Astraという段階に至って、OpenAIが直面しているのは、もはや能力の問題ではない。
セキュリティの問題は、すでにダモクレスの剣となっている。
二つのセキュリティゲート:悪意のある乱用を防ぎ、モデルの自己制御喪失も防ぎます
この剣が無駄に人を傷つけないようにするにはどうすればよいですか?
OpenAIの提案は、人間に対するリスクとモデルに対するリスクの両方のパスを同時に防ぐことです。
第一条、ユーザーによるAstraの悪意のある乱用を防ぐ。
専門のセキュリティトレーニングに加え、OpenAIはシステム分類器、継続的なモニタリング、および脅威検出を活用して、複数回の対話や長時間のタスクにおける疑わしい操作を特定します。
ネットワークセキュリティのジャイルテストにおいて、Astraは危険なリクエストを91.5%の確率で拒否し、GPT-5.6 Solは59%でした。

同時に、Astraの高度なサイバーセキュリティ機能はすべてのユーザーに直接開放されず、まず少数のAlphaテストユーザーに提供され、その後Daybreak Blueなどの制御されたプロジェクトを通じて段階的にリリースされます。

第二条:モデルが勝手に逸れないようにする。
ここでのリスクはより隠蔽されています:
ユーザーに悪意がなくても、モデルはタスク範囲を勝手に拡大するでしょうか?許可されていないツールを呼び出したり、セキュリティチェックを回避したりするでしょうか?
OpenAIはこれに対して「ハニーポット(honeypot)」テストを構築しました。
極めて困難、あるいは解決不可能なタスクに直面した際、テスト環境は意図的に権限を超える「不正」な近道を残す。モデルは指定された目標を正直に攻撃することも、権限の境界を超えて周辺のテスト施設を侵入し、タスクを達成することもできる。
その結果、GPT-5.6 Solはテストの56%で近道を試みたのに対し、Astraは一度も試みなかった。
別のテストでは、Astraの操作が自動監視システムによって拒否された後、危険なコマンドを再試行したり、制限を回避しようとしたりすることはありませんでした。

また、OpenAIはモデルの推論プロセスを監視します。
異常な傾向が検出された場合、システムは速度を落としたり、一時停止したり、またはタスクを直接終了することができます。
確かに代償がある(一部の通常タスクが遅くなる、または誤って中断される可能性がある)が、OpenAIにとっては、Astraを許可するための必須のセキュリティコストである。
しかしOpenAIも、これらの対策はあくまで外部の「ブレーキ」にすぎず、モデル自身のアラインメントに代わることはできないと認めている。
真のセキュリティとは、モデルが最初から境界を越えないようにすることです。
浙江大学と同済大学のアルムナイがAstraの開発最前線に立つ
この文を現実のものにするには、結局のところ、モデルを構築した人に戻らなければならない。
OpenAIはまだAstraチームのメンバーを公表していないが、この一連の公開発言に沿って、少なくとも2人の関与が深い華人研究者が浮上した。
前述のJiawei Liuです。
現在はOpenAIの研究員であり、2021年に同済大学のコンピューターサイエンス学科を卒業した。
学部在学中、彼は高性能人体姿勢推定フレームワークHyperPoseの開発に参加し、主にモデル推論エンジンを担当。関連成果はACM Multimedia 2021に採択され、当該プロジェクトはGitHubで1000以上のスターを獲得した。
その後、彼はイリノイ大学アーバナ・シャンペーン校でコンピューターサイエンスの博士号を取得し、ソフトウェア工学の学者である張令明(Lingming Zhang)の下で学び、研究の焦点は高性能ビジョンシステムからコードモデルとソフトウェアの信頼性へと徐々に移っていった。
博士期間、彼はPyTorchやTensorFlowなどの機械学習システムで300以上の深刻なバグを発見するためのツールの開発に参加した。
コードモデルMagicoderは、Meta Llama 3.1、Google CodeGemma、およびIBM Graniteにも採用されています。
2025年に博士課程を卒業してOpenAIに加入後、彼が研究した問題は依然として一貫していた:
AIにコードをより上手に書かせ、コード内の脆弱性をより効果的に発見させるにはどうすればよいですか?

もう一人はQi Xiangyu(漆翔宇)です。
漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021年前往普林斯顿大学攻读电气与计算机工程博士学位,研究方向集中于大模型的鲁棒性、越狱攻击与安全对齐。
他の注目された作業は、『Safety Alignment Should Be Made More Than Just a Few Tokens Deep』です。
この論文は、大規模モデルの安全なアライメントが生成の初期の数個のトークンにのみ依存してはならず、生成が進むにつれて元の安全対策が攻撃者によって突破される可能性があることを指摘している。
この論文は11,672本の投稿の中から選ばれ、ICLR 2025の優秀論文3本の1つとなりました。
2025年に博士課程を修了後、漆翔宇はOpenAIの技術チームに加わり、大規模モデルのロバスト性の研究を継続し、サイバーセキュリティモデルに関わる作業に参加した。
浙江大学からプリンストン大学、そしてOpenAIへと至るまで、彼が一貫して問い続けてきたのは、まさにAstraが今直面しなければならない問題である:
能力は次第に強くなることができるが、境界は次第に曖昧になってはいけない。

ちなみに、Astraが正式にリリースされた後、OpenAIが完全なリストを発表するかどうかはわかりません。
GPT-4以前、OpenAIは数百人の貢献者を明確にリストアップしていたが、GPT-5およびGPT-5.5では、System Cardはますます厚くなり、研究者名のリストはますます隠されるようになった。
その背後にある理由は広く知られており、メタのザッカーバーグのようなあちこちで人材を引き抜く人物を防ぐためである。
それも一種のPTSDですね。。。
もう一つ
OpenAIがAstraの監視方法やモデルの制御喪失を防ぐ方法について語っているまさにそのとき、The Informationは暴露した:
Astraは「Recurrent Depth」という技術を使用しています。

従来のモデルは、次のトークンを生成する前に、情報を固定された数のネットワーク層を順に通過させますが、ループ深度は情報を同じネットワーク層のセット内で繰り返し処理することで、モデルが内部で「もう少し考える」ようにします。
この技術は、能力の向上とコストの削減が期待されると同時に、より多くの推論がモデル内部で行われ、人間が読み取れる文字として完全に表示されなくなる可能性があります。
言い換えれば、モデルはより深く考えようとするが、人間はますますそれを理解できなくなっている。
AIセキュリティ政策を長年注目してきたナサニエル・カルビンは、この技術が思考チェーンの監視可能性を損なう可能性があると警告した。
これはとても繊細です:
OpenAIはAstraが何を考えているかに注目している一方で、新しい技術により、ますます内心を明かさなくなる可能性がある。
ああ、これ。。。

しかし、The Informationが明らかにしたところによると、OpenAIはすでにこの技術をAstraでの使用を制限している。
翻訳しておけば、今は理解できるが、後ではわかりにくくなるかもしれない。
また、以前からAstraは今週木曜日(9月3日)にリリースされる可能性が高いと噂されていた。
A社が最新の5.1モデルを発表したことで、この主張の妥当性がますます高まっているように感じられます。
螳螂が蝉を捕らえ、黄雀がその後ろにいる。
誰がまた悟った!
参照リンク:
[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[2]https://xiangyuqi.com
[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[4]https://jw-liu.xyz/
[5]https://x.com/sama/status/2094934592062959832?s=20
本文は微信公衆アカウント「量子位」より、著者:先端テクノロジーに注目
