GPT-6 Astra、最終フロンティア数学Tier 4問題を解決

icon MarsBit
共有
AI summary icon概要
AI+暗号通貨ニュース:GPT-6 AstraがFrontierMath Tier 4の最終課題を解決し、高度なベンチマークのすべてのチャレンジを完了しました。Epoch AIが60人以上の数学者と共同で開発したAstraは、97.6%の精度を達成し、これまで解かれていなかった最後の課題を破りました。このプロジェクトは、オープンリサーチと形式化されたチャレンジの新しいフェーズに移行し、AI進展における重要なプロジェクト発表となります。

先ほど、FrontierMath Tier 4の最後の問題がGPT-6 Astraによって解かれました。

これで、かつて大規模モデルの数学的噩夢とされていたこの研究用テストの全問題が、AIによって少なくとも1回は成功裏に解かれたことになった。

Epoch AIも正式にFrontierMath Tier 4が飽和したと結論づけました。

FrontierMath

上記の図から見ると、Astraはまだ100%に達していないようですが、OpenAIが公表した成績は97.6%です。

しかし、Epochのアルゴリズムによると、「すべて解き終わった」とは、異なるモデルや異なる時間での試行を累積した結果、Tier 4の各問題がいずれも一度は正解されたことを意味します。

そしてアストラが攻略したのは、これまでAIがまだ突破できなかった唯一の壁だった。

簡単に言えば、Astraはあるテストで誤答した可能性があるが、その問題はこれまで誰も解けなかったものだった。

FrontierMath

正直に言うと、この発展速度はかなり異常です。

モデル評価に注目しているなら、2025年7月11日にTier 4がリリースされた当時、ランキング最高成績は約5%に過ぎなかったことをご存知でしょう。

現在、ちょうど1年2ヶ月が経過し、かつての「高墙」はすでに「段差」へと変わり、AIが近道を通って解決できなかった最後の難題も乗り越えられました。

出題者であるマーケット大学数学准教授のジェイ・パントンも、過去のAIは数値的な近道を見つけてきたが、今回はAIの解法が自分と非常に似ていたと述べた。

FrontierMath

しかし、最近GPT-6 Astraが数学界に猛烈な攻勢をかけ、頻繁にミレニアム問題を解決している中、パンテーンはもはや驚くことが難しくなったと語りました!

数学は、アストラが最近最も存在感を示している分野の一つと言える。

2%未満から、専門の「研究レベルの防衛線」を追加まで

FrontierMathは2024年11月7日に最初にリリースされ、その誕生の目的は、数学BenchmarkがAIによって急速に突破されるのを防ぐことでした。

当時、GSM8KやMATHのような従来の数学ベンチマークは、トップモデル間の差を縮めるのがますます難しくなっていたため、Epoch AIは60人以上の数学者と協力し、これまで公開されたことのないオリジナルの問題セットを再設計しました。

その中には、陶哲軒、ティモシー・ガワーズ、リチャード・ボーチャーズなどのフィールズ賞受賞者が含まれます。

陶哲軒はいくつかの研究レベルの問題を看完した後、これらの問題は「非常に難しい」と率直に述べ、最難のTier 3はAIがさらに数年間も躓き続ける可能性があると判断した。

FrontierMath

最初のテスト結果によると、予想通り、最上位モデルの正解率は2%にも満たなかった。

最初、FrontierMathの核心問題庫には300問の問題があり、難易度に応じてTier 1、Tier 2、Tier 3の3つのレベルに分かれています。

FrontierMath

Tier 1は難易度の高い学部レベルの問題や数学オリンピックにほぼ該当するが、より高度なツールの使用を許可している。Tier 2は上級大学院生レベルに達している。Tier 3は博士課程初期に遭遇する探索的研究問題に近い。

しかし推論モデルの登場により、この上位3層も次第に不十分になってきたため、2025年、Epochはさらに1層追加し、Tier 4を設けました。

Tier 4は主に数学の教授とポスドクによって設計され、各人は自身の研究分野を中心に数週間の短期研究を行い、その成果を自動検証可能な問題に凝縮する。

FrontierMath

最初、Tier 4には合計50問が収録されています。これらは解析、数論、組合せ数学、トポロジー、代数幾何学などをカバーしています。

リリース当初、すべてのモデルがこれまで行ったテスト合計で、たった3問しか解かれず、それらの解答も正しいが十分に証明されていない仮定に依存していた。

これを受けて、Epochは公式サイトの公開サンプル問題ページに、一部の問題は数十年にわたってAIによって解決されない可能性があると記載していた。

FrontierMath

(この文は今から繰り返し攻撃される)

しかし、モデルがますます強力になるにつれて、別の問題も浮上しました。問題集自体もAIの「試練」に耐えられなくなってきたのです。

OpenAIはテスト中に、FrontierMathに予想以上に多くのエラーが存在することを発見しました。

その後、Epochは独立監査を開始し、まずGPT-5.5とClaude Opus 4.7で疑わしい点をスクリーニングし、その後数学者が各問題を個別に再確認した。最終的に2026年6月にv2バージョンをリリースし、Tier 4では12問を修正し、7問を削除して43問を残した。

改訂後、モデルの成績は依然として上昇し続けている。

GPT-5.6 Solは83.0%、Claude Fable 5は90.2%を達成し、GPT-6 Astraでは97.6%に達しました。

FrontierMath

さらに重要なことに、AstraはこれまでAIが解けなかった唯一の問題を解き明かしました。

FrontierMath

これで、Tier 4のすべての問題が、少なくとも一度はAIによって成功裏に突破された。この最強モデル向けに特別に構築された研究レベルの防衛線も、最終的に突破された。

しかし、これは「数学がAIによって解決された」という意味ではありません。逆に、FrontierMath自体が次の段階へと進み始めています。

現在、このプロジェクトはTier 1-4に加えて、真正的なOpen Problemsと、Erdősの未解決問題をLeanに形式化したFrontierMath Erdősが追加されました。

FrontierMath

前者は、数学界でまだ解決されていない研究課題を直接モデルに問う;後者は、AIに形式検証を通過できる完全な証明を書かせる。

今回は、AstraがFrontierMath Erdősの68問のうち2問だけを解きました。

物語はまだ続いています~

本文は微信公衆アカウント「量子位」より、著者:henry

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。