GPT-6 Astra、ARC-AGI-3でほぼ完璧なスコアを記録し、AGIについての議論を巻き起こす

iconMetaEra
共有
AI summary icon概要
GPT-6 Astraは、シンボリックなワールドモデルを用いて、ARC-AGI-3で96%のタスクで人間よりも優れたパフォーマンスを発揮し、ほぼ完璧なスコアを記録しました。このテストのコストは18,000ドルで、批評家たちは、真のAGIではなく外部ツールに依存していたと指摘しています。リスクオン資産への関心が高まる中、このモデルの性能は、真のAIの進歩と高コストな計算の違いについて疑問を投げかけています。CFT機関は、AIの進歩が規制枠組みにどのような影響を与えるかをすでに注視しています。
GPT-6 AstraがARC-AGI-3テストで99%に迫る成績を収め、注目を集めている。このモデルは、効率的な「シンボリックワールドモデル」を生成することで、現実世界を論理的シンボルと因果コードに抽象化し、未知のグラフィカルゲームにおいて自らDSL代数システムを構築して環境ルールを記録し、仮想サンドボックスを構築してシミュレーションを実行した後、行動を起こす。しかし、その高得点の裏には、1問あたり360ドル、全体で1万8000ドルに及ぶ膨大な計算リソースコストがかかる。ARC Prize財団の社長Greg Kamradtは、この高得点はHarnessという外部フレームワークによる支援に依存しており、真のAGIの突破ではなく、AIが徐々に賢くなっていることを示しているだけだと指摘している。

記事執筆者、出典:雷峰網

AI知能テストを突破!GPT-6 Astraのシンボリックワールドモデルは、画期的な進歩か、資金力によるスコア操作か?

1問あたり360ドルを消費、GPT-6は本当にAGIを突破したのか?

OpenAIの最強モデルGPT-6 Astraがついに登場し、コンピュータ操作、科学研究、セキュリティ防御において驚異的な進歩を遂げました。その中でも、大衆の注目を集めたのは、ARC-AGI-3テストで99%に迫る成績を収めたことです。

AI知能テストを突破!GPT-6 Astraのシンボリックワールドモデルは、画期的な進歩か、資金力によるスコア操作か?

ARC-AGI-3とは何ですか?これは現在、グローバルなテクノロジー界で広く認知されているAIの「知能」評価ランキングであり、AI界のメンサクラブ入会試験と捉えることができます。

このテストはすべて変化し続ける図形の規則性の問題であり、問題を暗記して対応することは不可能である。AIは人間のように環境を探索し、目的を推測し、その場での反応と推論能力によって規則性を見出さなければならない。これはさまざまな評価においてより高度な課題であり、AIが単なるツールにすぎないのか、それとも真の知能を備えているのかをよりよく測定できる。

一方、GPT-6 Astraはこのテストを完全に突破した。前モデルであるGPT-5.6 Solの得点が38.3%だったことを考えると、これは驚異的な飛躍である。この知能は人間をはるかに上回り、96%のステージで人間よりも操作効率が高く、平均アクションステップ数は人間より51.7%少ない。

もしAIが完全に未知の環境において、論理的規則を構築し問題を解決する真正な能力を備えたとしたら、未来には、未知の自動運転道路状況で正しい判断を下したり、新たな未知のウイルスが流行した際に迅速に有効な薬の分子構造を推論する可能性があるだろう。

GPT-6 Astraがなぜ如此に賢いのかを探究するため、ARC Prize公式がそのバックエンドログを再検証したところ、ゲームをプレイする際に効率的な「シンボリックワールドモデル」を生成していることが判明した。

AI知能テストを突破!GPT-6 Astraのシンボリックワールドモデルは、画期的な進歩か、資金力によるスコア操作か?

シンボリックワールドモデルは「ワールドモデル」の高度な派生形です。ワールドモデルがアーティストのように画像で未来を予測するのに対し、シンボリックワールドモデルは数学者のように、現実世界を論理的記号と因果コードに抽象化します。

この技術は、AIが高度な推論へと進化するための必須の道と広く認識されています。

シンボルワールドモデルとは何ですか?

過去、多くの大規模モデルがARC-AGIベンチマークシリーズで高得点を取れなかった主な理由の一つは、「試行錯誤を繰り返す」ことに慣れていたためである。AIはゲーム画面をピクセルブロックに分割し、適当にクリックして不正解なら方向を変えて、運に頼ってクリアしようとする。

このモードでは、一部のスコアを突破したとしても、AIはゲームのルールを真正に理解したり習得したりしているわけではありません。

シンボリックワールドモデルが全体を制御できるのは、周囲の環境の物理法則と因果関係を十分に理解し、精密な計算に基づいて選択を行うからである。

実際のテストでは、GPT-6 Astraが未知のグラフィックゲームに侵入すると、独自に開発したDSL、すなわち専用の代数記号システムを用いて、観察した環境について大量のノートを取る。たとえば、ゲームの潜在的な非公式ルール、次に実行される一連のコマンド、さらには各ピクセルの運動経路を座標系に正確にマッピングする。

この代数的な記録方式は、一意に決定された世界の状態をもたらします。従来のモデルが自然言語によるインタラクションによって生み出していた曖昧さと比較すると、この記号化された表現は精度を劇的に向上させます。

そして、彼は頭の中でPythonコードのロジックを書き出す:“Aを押すと、グラフィックは90度左に曲がる”。

その後、自身の脳内で「仮想サンドボックス」を構築し、次の計画をシミュレーションします。論理的な閉ループが確認され、正確であることを確認した後、ようやく現実のゲームで最初のステップを実行します。これが、その操作効率が人間をはるかに上回る理由です。

GPT-6 Astraの能力限界を探るため、レッドチームテストプラットフォームPRO‑LONGは、AIが独自にカスタムコードを書き、実行できるようにコードサンドボックスに組み込みました。

その結果、GPT-6 Astraは各ゲームごとに「オーダーメイド」のツールを生成し始めた。たとえば、警備員が巡回する複雑な迷宮ゲームでは、GPT-6 Astra自らナビゲーションシステムを書き、戦闘ルールを追加し、警備員の巡回ルートをシミュレートした。その後、この自作のツールチェーンを通じて成果を完璧に予測・検証した。

以前、この記号推論や自作ツールの能力は、外部のHarnessハックフレームワークに完全に依存していた。ハックはモデルの画面変換、状態記録、結果検証を支援したが、欠点は非常に明確だった:モデルとハック間のデータ送信により高い遅延が発生し、ハックのエンジニアリング能力は大規模モデルの重み訓練と完全に分離されていた。クラウド計算環境と外部スクリプトへの重度の依存により、こうした高度な機能はエッジデバイスへの展開が非常に困難だった。

一方で、GPT-6 Astraは、Harnessの多くの機能をモデルの重み自体に内包しています。シンボリックな世界モデルを長年提唱してきたトップ研究者であるGary Marcusは、GPT-6 Astraをこのアプローチにおける大きな勝利と称賛しています。

過去1〜2年で、ハーバード大学やMIT、Google DeepMindをはじめとする学術界および産業界では、この分野において多数の核心的な成果が生まれており、すべての関係者が「シンボリックワールドモデル」に注目している。AGIへの無数の分岐点の前で、業界はある種の基盤的な技術的合意に達しつつある。

このスコアなら、AGIは確実?

出題者が自ら冷や水を浴びせる

興味深いことに、ネット全体がこのランキングスコアに沸き立っている中、多くの人がOpenAIのCEOグレッグ・ブロッカマンの「AGIはすでに到来した」という言葉を共有している一方で、ARC Prize財団のCEOグレッグ・カムラッドが自ら冷や水を浴びせた。

彼は出題者の中の中心的人物であり、ベンチマークの設計やスコアの解釈について、最も発言権を持っている。評価の観点から彼は、スコアは確かに本物だが、AGIとはまだ遠く及ばないと考えている。

これまでに、PRO-LONG(超強力なメモリーアシスト)、Tycho(深層推論に優れる)、Prime Agent(自己進化可能なプログラミング環境を備える)など、複数のチームがAgent Harnessを用いてARC-AGI-3で90%以上を達成しています。

これらの高得点製品には、損失のないメモリ、プログラムによる分析、明示的な仮説検定、永続的な状態、低コストの内部計算の5つの共通技術的要素があります。

無損メモリが記憶を担当し、プログラム化分析が論理を担当し、明示的な仮説検定が推論を担当し、持続的な状態が複数回のインタラクションのコンテキストを担当し、低コストの内部計算が安価な内部計算リソースを担当することで、AIは仮想環境内で過剰な試行錯誤を重ねた後、正しい答えを出力できる。これらはすべて、モデルの欠点を補う強力なハーネスを構成する。

GPT-6 Astraは100%の成績に迫っており、同様に高級なHarnessを活用し、専用にカスタムされた「サプライヤーアダプターベース」を用いて、連続対話とコンテキスト圧縮により論理チェーンを支えています。1ゲームを完了するたびに、360ドルという高額な計算リソースを消費します。完全なテストを実行した場合、合計計算リソースの費用は驚異的な1万8,000ドル(約135,000人民元)に達します!

人間が1つの図形パズルを解くには数分しかかからない。人間の脳の20万ワットの代謝パワーを電気代に換算すると、0.5セントにも満たない。被験者への実際の時給補助を含めても、1回あたり12.78ドルに過ぎない。一方、AIには360ドルかかる。このような「金銭力」で得られた成果は、一般の人々が手にできるAGIとなることができるのだろうか?

もちろん、GPT-6 Astra はすでに Harness の能力を段階的に内部化し始めています。今後も発展すれば、モデル内部の潜在的な計算能力はさらに向上するでしょう。しかし、その推論プロセスが徐々に不透明になり、開発者たちは、AIが本当に理解したのか、それともより効率的な不正な手段を見つけただけなのか、分からなくなっています。

上の質問に戻ると、GPT-6 Astraは本当にAGIと呼べるのでしょうか?

この質問に対して、グレッグ・カムラッドは彼の長文の最後に、哲学的な返答を示した。人間が「汎用知能」と見なされる理由は、人間がどんな未知の世界にも適応できるからである。たとえ古代の赤ん坊を現代に置いたとしても、彼は地下鉄に乗ったり、スマートフォンを使ったりすることを学べる。この知能は数千年にわたり継承され、科学技術の進歩を常に推進してきた。しかし現在のテクノロジー業界がAIに課す評価は、ただの「グラフィック消しゴマ試験」にすぎない。

これはAIが賢くなっていることを示すにすぎず、AGIの到来を示す証拠ではない。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。