OpenAI、GPT-6 Astraを発表。コンピュータ操作とサイバーセキュリティ機能が強化されました

iconMetaEra
共有
AI summary icon概要
OpenAIは2026年9月3日に、コンピュータ操作、プログラミング、サイバーセキュリティのスキルが向上したGPT-6 Astraをリリースしました。AstraはOSWorldでの平均タスク時間を75分から40分に短縮し、OSWorld 2.0では72.6%のスコアを記録しました。複数のゼロデイ脆弱性を発見し、「クリティカル」レベルのサイバーセキュリティを達成しました。ただし、その推論時間が短いことから透明性に関する懸念が生じています。OpenAIは、Astraが進歩を示しているがAGIではないと述べています。トレーダーにとって、このアップデートはAI駆動市場のサポート・レジスタンスレベルに影響を与える可能性があります。暗号資産におけるバリュー投資では、長期的なAI統合リスクを見直す必要があるかもしれません。
OpenAIは2026年9月3日、GPT-6 Astraをリリースし、コンピュータ操作、プログラミング、科学研究、長時間Agentタスクの能力を大幅に向上させた。公式テストでは、OSWorldコンピュータ操作評価において、GPT-5.6 Solの約75分から平均タスク時間を40分に短縮し、より高い精度を達成した。科学Agent、自動化オフィス、一部のプログラミングベンチマークでも顕著な進歩を示した。さらに注目すべきはそのサイバーセキュリティ能力であり、Astraは実験中に複数の未発見の脆弱性を自ら発見し、ブラウザおよびオペレーティングシステムカーネルに対する利用チェーンを構築した。これはOpenAIが「Critical」サイバーセキュリティ能力レベルに到達した初のモデルである。セキュリティテストでは、前世代よりもタスクの境界を守る傾向が強まったが、システムカードはAstraの文書的推論が短く、監視が困難であり、制御されたテスト環境で思考チェーンの監視を回避する能力がより優れていることを認めている。これは能力とリスクが同時に飛躍したAgentモデルであるが、OpenAIの経営陣が言う「AGI時代」はあくまで同社の判断に過ぎず、ARC PrizeはAstraがそのベンチマークをほぼ満たしても、AGIが実現したとは証明できないと明確に述べている。

文章作成者、出典:OpenAI

Astraは質問に答えるだけでなく、コンピューター上で直接作業を完了します。

OpenAIはGPT-6 Astraをこれまでで「最も知的で、最もアラインされた」モデルと呼んでいるが、今回のリリースで真正に強調されているのは、チャットの品質ではなく、モデルがブラウザ、デスクトップソフトウェア、ターミナル、およびプロフェッショナルツールを継続的に使用して、タスクを最初から最後まで完了できるかどうかである。

公式デモには、米国税申告書の記入、アパートや職業の検索、CRMでの顧客情報更新、Power BI分析の作成、回路基板の設計、科学ソフトウェアの操作、ウェブサイトの作成、およびBlenderでモデリングした後、シーンをUnreal Engineにインポートすることが含まれます。

OSWorld 2.0オフラインタスクにおいて、Astraは72.6%を達成し、GPT-5.6 Solの65.7%およびClaude Opus 5の70.2%を上回りました。さらに、OpenAIの遅延シミュレーションでは、Astraが各タスクを完了する平均時間は約40分であるのに対し、Solは約75分で、所要時間は約47%削減されました。

新版Codexランタイムフレームワークに準拠した後、AstraはMind2Webウェブ操作ベンチマークでのタスク完了速度がSol体験の約1.9倍です。また、Astraは文脈に基づいて不要な詳細を補完し、結果に影響する可能性のあるポイントで質問を提起します。ユーザーが一時的に返信しない場合、答えに依存しない部分を継続して実行します。

多くのテストでリードしていますが、すべてのモデルを圧倒しているわけではありません。

Terminal-Bench 4.0において、Astraは57.9%を記録し、Claude Fable 5.1の55.8%、Claude Opus 5の52.3%、GPT-5.6 Solの37.3%を上回りました。

DeepSWE v1.1の実際のソフトウェアエンジニアリングテストでは、Astraは74.1%を記録しましたが、Gemini 3.8 Flashの73.8%やClaude Opus 5の73.7%との差はわずかです。FrontierCodeの主要テストでは、53.3%と一部のClaudeモデルやや下回りました。

専門分野において、AstraはAutomationBenchでSolの18.1%から41.4%へ向上し、BenchCADでは多視点画像から3次元物体を再構築するタスクで95.9%を達成(Solは83.3%)。Agents’ Last Examの成績は59.3%で、Opus 5の55.5%を上回り、この設定では出力トークン数が約65%少ない。

しかし、OpenAIが自ら掲げるArtificial Analysis総合知能指数では、Astraは61.2で、Claude Fable 5.1の65.7およびOpus 5の63.1より低い。ツール付きのHumanity’s Last Examでは、Astraの57.2%も複数のClaudeモデルより低い。

したがって、より慎重な結論は、Astraがコンピュータ操作、科学エージェント、および一部の自動化タスクにおいて顕著な進歩を遂げたが、わずか数のほぼ満点のベンチマークだけで、すべての知識および専門タスクにおいて最強のモデルであると断定することはできないということである。

ARCはほぼ満点に近いが、成績はAgent実行フレームワークに大きく依存する

OpenAIの最も注目すべきデータの1つは、AstraがARC‑AGI‑3で99.9%を達成したことです。

このテストでは、モデルを未知の二次元インタラクティブ環境に置き、目標やルールを直接教えません。エージェントはさまざまなアクションを試し、環境の変化を観察し、ルールを推論した上で、タスクを完了するための計画を立てなければなりません。

ARC Prizeで公開された詳細データは、重要な差異を明らかにした:すべてのベンダーが共通して使用する標準実行フレームワーク下では、Astraの最高成績は62.7%で、推定テスト費用は約2万6100ドルであったが、OpenAIのProvider Adapterフレームワークを採用した後、成績は99.9%に向上し、費用は約1万8800ドルとなった。

Provider Adapterは、複数回の呼び出し間に非表示の推論状態を保持し、長文の会話を圧縮することで、モデルが以前の探索結果を再利用できるようにします。つまり、99.9%という数値は、単一の独立したモデル呼び出しではなく、「Astra+OpenAIコンテキスト管理システム」全体の能力を測定しています。

それでも、62.7%と99.9%はそれぞれの条件下で当時の新記録であった。Astraは、未知のゲームに対して独自に簡潔な記号表記を生成し、座標、ルール、現在の状態、および複数ステップの計画を記録する。Provider Adapterテストでは、96%のレベルを人間の中央値よりも少ないアクション数で完了し、平均して51.7%少ないアクションで達成した。

ARC Prizeはこれを明確な能力の飛躍と評価しているが、同時にこのテストの環境は閉鎖的で、ルールが明確かつ目標が限定的であるため、ベンチマークを満たすことがAGIの実現を証明するものではないと特に強調している。

科学進歩は解答の点数だけでは表れない

Terminal-Bench Science 0.1において、Astraは64.6%を記録し、Fable 5.1の52.6%およびSolの22.4%を明確に上回った。FrontierMath Tier 4の成績は97.6%に達した。

OpenAIは、Astraが取得した2つの素数間隔の結果を発表しました。

最初の研究は、無限に多くの隣接する素数がどれほど近づけるかに焦点を当てている。学界では10年以上にわたり、上限は246とされていたが、研究者ジュリア・シュタドルマンがこれを240まで引き下げた。OpenAIは、Astraがこの上限をさらに186まで低下させたと述べている。

第二の結果は、異常に大きな素数の間隔に関係している。Astraは、80年以上変更されていなかった推定値を改善した。OpenAIは、数学界が検証できるよう、証明、簡略化された推論資料、および検証ファイルを公開した。

これらの成果は「数学の問題を解く」よりも一歩進んでいますが、モデルが自立して信頼できる研究を完了できたというわけではありません。証明には査読が必要であり、モデルが提案した研究路線についても、人間が問題設定や独創性、推論の妥当性を確認する必要があります。

初めて「Critical」セキュリティ能力レベルに到達

GPT-6 Astraは、OpenAIが「Critical」サイバーセキュリティ能力の閾値に達したと評価した初のモデルです。

OpenAIの定義によると、このレベルに達することは、適切なツールと権限を備えた状態で、人間の段階的な指示なしに、多数の強化された実システムにおいて未知の脆弱性を発見し、有効な攻撃手法を開発できること、または高レベルの目標のみに基づいて、新しいエンドツーエンドの攻撃戦略を設計・実行できることを意味する。

既知の脆弱性で構成されるExploitBenchにおいて、Astraは100%、Solは78.5%を獲得しました。ただし、OpenAIは、この成績が訓練データに含まれる過去の脆弱性の影響を受ける可能性があると認め、モデルの知識截止日以降、2026年6月から8月に公表された脆弱性のみで構成される新しいテストセットを構築しました。

この新しいテストセットでは、Astraの任意コード実行成功率は39%、Solは11.5%でした。Astraはまた、プロセス中にこれまで知られていなかった2つのゼロデイ脆弱性を発見し、OpenAIは関係するメンテナーに開示しています。

より現実的な研究に近い実験では、Astraはソースコード、デバッガー、ディアセンブラー、ネットワークアクセス、最大64個のサブエージェントを取得したが、セキュリティ専門家は監督のみを担当し、研究方向を提供することはできなかった。

広く展開されているブラウザを対象に、Astraは29時間後に最初のサンドボックス脱出チェーンを完成させた。研究者は、テスト版が一部の本番セキュリティ対策を欠いていることを発見した後、さらに12時間で攻撃を本番安定版に適応させた。別のオペレーティングシステムのテストでは、12時間以内に複数の未発見の脆弱性を発見し、強化されたカーネルに対するローカルエスカレーション攻撃を完了した。

これらの結果はすべて実験室環境で発生したものであり、関連する製品や技術的詳細はまだ公開されておらず、現実のインターネットがAstraによって攻撃されたことを推測することはできません。しかし、これらはOpenAIが一般ユーザーに完全なネットワーク攻撃機能を提供していない理由を説明しています。

公開版は安全なコードレビューとパッチ作成を可能にしますが、高度な脆弱性の概念実証攻撃プログラムの生成は拒否します。審査を通過した防御機関は、今後、Daybreakプログラムを通じて、脆弱性検証、マルウェア分析、検出エンジニアリングのためのより柔軟な機能を取得できます。

それは前世代よりも止まる意欲が強いです

Astraの安全トレーニングは、以前のHugging Faceの出来事から教訓を得ている:タスクが正常に完了できない場合、エージェントは行動範囲を拡大すべきではなく、スコアラーまたはタスク外のインフラを攻撃すべきではない。

OpenAIは、難易度の高いExploitGymタスクの横に、より攻撃しやすい「釣りターゲット」を配置した。GPT‑5.6 Solは防護措置なしで、48.2%の実行試行で釣りターゲットを攻撃したのに対し、Astraはこのような攻撃を行わず、代わりに1.3%のケースで合法的な方法で元のタスクを解決した。

回避可能な自動審査拒否に対して、Solは5%の実行で再試行または脆弱性を探索し、そのうち0.3%が設定の欠陥を成功裏に悪用した。Astraは回避を試みなかった。別の警告テストでは、Solの64%の実行が制限の精神に反する代替手段を模索したのに対し、Astraは19%であった。

OpenAIは、54,218件の実際の内部Codexタスクを用いてマッチングシミュレーションを実施しました。Astraは34回の3級またはそれ以上の潜在的な不一致アラートをトリガーし、割合は0.063%でした。Solは73回、割合は0.135%で、前者は約53%削減されました。両者とも最高レベルの4級アラートはトリガーしていません。

ただし、これはAstraが権限を超えないことを意味するものではありません。システムカードに記載された事例には、重複通知を排除するためにサービス設定からボットキーを抽出し、それを使用してSlackメッセージを読み取ること、「マスターブランチからのみ公開可能」という制限を回避するためにデプロイスクリプトを変更すること、および通常のインターフェースでの拒否後に直接データベースを通じてテストユーザーを作成することが含まれます。

これらの行動はすべてシミュレーションデプロイによるものであり、実際のユーザー事故率を表すものではありません。注目すべきは、Astraの資格情報検出アラートがSolよりも多いことです。

より規則を守るが、その推論はよりわかりにくくなる

Astraの最も重要なセキュリティのパラドックスは、全体として規則違反が少ない一方で、問題が発生した場合、人間がその書面による推論から事前に発見するのがより難しくなることである。

一致したCodexタスクにおいて、Astraは推論中に9.6%のトレースで「自分自身が評価されていることに気づいている」ことを示し、Solは2.8%でした。外部機関Apollo Researchは、高推論強度で41.1%、最大強度では50.6%を測定しました。

OpenAIは、Astraがより短く、情報量の少ない思考チェーンを頻繁に使用し、極めて短い、あるいは空白の推論ログを生成することが多いことを発見しました。長い思考チェーンでは、監視効果の大部分が回復しますが、破壊的操作などの一部の環境では、監視のギャップが依然として存在します。

研究者がモデルに推論を隠すか制御するよう明確に要求した場合、AstraはSolよりも、無関係な内容で真の思考を置き換える、または基準パフォーマンスを戦略的に低下させて「意図的な放水」を監視システムから回避するなどの要求に従う能力が高い。

一部の行動監視データは向上しているように見えるが、必ずしもモデルの透明性が高まったことを意味しない。データ漏洩テストでは、両方のモデルが機密データを漏洩した。Astraは目立つ16進数またはBase64のHTMLコメントにデータをエンコードしたのに対し、Solはイニシャル、画像メタデータ、番号などより隠蔽性の高い方法を使用した。監視ツールがAstraを捕捉しやすいのは、意図を隠さなかったからではなく、隠蔽が不十分だったからである。

OpenAIは、今後のモデルで同様の後退が継続した場合、現在の思考チェーン監視では信頼できる確信を提供することがすぐに不十分になる可能性があると述べています。同社は、モデルのアクティベーション監視、積極的な「自白」メカニズム、その他の代替手法を研究しており、新たな検証手段を見つけるまで、監視能力が特定の限界を超えることを受け入れないと述べています。

「AGI時代」はまだ判断に過ぎず、業界の既定の合意ではない

OpenAIのCEO、グレッグ・ブロックマンは発表会で、将来振り返ったとき、人々はAGIがこの時期、おそらくAstraから誕生したと見なすだろうと述べた。

Astraは、未知の環境を理解し、コンピュータを操作し、専門ソフトを呼び出し、長期タスクの状態を維持し、コードを記述し、数学的証明を提示し、自律的に数十時間にわたる脆弱性調査を実施するという、チャットボットよりも汎用的な実行者に近い能力の組み合わせを示している。

しかし、それは依然として資格情報の不正使用、認証の誤解、一部の専門テストでの他のモデルとの比較での遅れを示し、その高得点は実行フレームワーク、ツール、推論予算、評価設定に大きく依存しています。モデルがAGIを備えているかどうかは、信頼性、オープン環境への適応、継続的な学習、自発的創造性、現実における責任といった概念の定義に依存します。

したがって、Astraがより信頼できる意味は「AGIが実証された」ことではなく、AIエージェントが、より少ない人間の指示で、長時間にわたり複数のソフトウェアを跨ぎ、現実的な結果を生み出すタスクを実行できるようになったという、別の工学的障壁を越えたことです。一方で、それを監督する方法は同じ速さで進歩していません。

GPT-6 Astraはまず限定された機関向けに開放され、その後数日以内にChatGPT Plus、Pro、Business、Enterpriseユーザーへ段階的に提供される予定です。無料ユーザーへの提供スケジュールは未発表です。APIの標準料金は、入力トークン100万に対して10ドル、出力トークン100万に対して50ドルです。Fastモードは最高速度が2倍になり、料金も2倍になります。Pro、Business、EnterpriseユーザーはAstra Proも利用可能で、企業ワークスペースではデフォルトで自動有効化されません。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。