先ほど、FrontierMath Tier 4の最後の問題がGPT-6 Astraによって解かれました。
これで、かつて大規模モデルの数学的噩夢とされていたこの研究用テストの全問題が、AIによって少なくとも1回は成功裏に解かれたことになった。
Epoch AIも正式にFrontierMath Tier 4が飽和したと結論づけました。

上記の図から見ると、Astraはまだ100%に達していないようですが、OpenAIが公表した成績は97.6%です。
しかし、Epochのアルゴリズムによると、「すべて解き終わった」とは、異なるモデルや異なる時間での試行を累積した結果、Tier 4の各問題がいずれも一度は正解されたことを意味します。
そしてアストラが攻略したのは、これまでAIがまだ突破できなかった唯一の壁だった。
簡単に言えば、Astraはあるテストで誤答した可能性があるが、その問題はこれまで誰も解けなかったものだった。

正直に言うと、この発展速度はかなり異常です。
モデル評価に注目しているなら、2025年7月11日にTier 4がリリースされた当時、ランキング最高成績は約5%に過ぎなかったことをご存知でしょう。
現在、ちょうど1年2ヶ月が経過し、かつての「高墙」はすでに「段差」へと変わり、AIが近道を通って解決できなかった最後の難題も乗り越えられました。
出題者であるマーケット大学数学准教授のジェイ・パントンも、過去のAIは数値的な近道を見つけてきたが、今回はAIの解法が自分と非常に似ていたと述べた。

しかし、最近GPT-6 Astraが数学界に猛烈な攻勢をかけ、頻繁にミレニアム問題を解決している中、パンテーンはもはや驚くことが難しくなったと語りました!
数学は、アストラが最近最も存在感を示している分野の一つと言える。
2%未満から、専門の「研究レベルの防衛線」を追加まで
FrontierMathは2024年11月7日に最初にリリースされ、その誕生の目的は、数学BenchmarkがAIによって急速に突破されるのを防ぐことでした。
当時、GSM8KやMATHのような従来の数学ベンチマークは、トップモデル間の差を縮めるのがますます難しくなっていたため、Epoch AIは60人以上の数学者と協力し、これまで公開されたことのないオリジナルの問題セットを再設計しました。
その中には、陶哲軒、ティモシー・ガワーズ、リチャード・ボーチャーズなどのフィールズ賞受賞者が含まれます。
陶哲軒はいくつかの研究レベルの問題を看完した後、これらの問題は「非常に難しい」と率直に述べ、最難のTier 3はAIがさらに数年間も躓き続ける可能性があると判断した。

最初のテスト結果によると、予想通り、最上位モデルの正解率は2%にも満たなかった。
最初、FrontierMathの核心問題庫には300問の問題があり、難易度に応じてTier 1、Tier 2、Tier 3の3つのレベルに分かれています。

Tier 1は難易度の高い学部レベルの問題や数学オリンピックにほぼ該当するが、より高度なツールの使用を許可している。Tier 2は上級大学院生レベルに達している。Tier 3は博士課程初期に遭遇する探索的研究問題に近い。
しかし推論モデルの登場により、この上位3層も次第に不十分になってきたため、2025年、Epochはさらに1層追加し、Tier 4を設けました。
Tier 4は主に数学の教授とポスドクによって設計され、各人は自身の研究分野を中心に数週間の短期研究を行い、その成果を自動検証可能な問題に凝縮する。

最初、Tier 4には合計50問が収録されています。これらは解析、数論、組合せ数学、トポロジー、代数幾何学などをカバーしています。
リリース当初、すべてのモデルがこれまで行ったテスト合計で、たった3問しか解かれず、それらの解答も正しいが十分に証明されていない仮定に依存していた。
これを受けて、Epochは公式サイトの公開サンプル問題ページに、一部の問題は数十年にわたってAIによって解決されない可能性があると記載していた。

(この文は今から繰り返し攻撃される)
しかし、モデルがますます強力になるにつれて、別の問題も浮上しました。問題集自体もAIの「試練」に耐えられなくなってきたのです。
OpenAIはテスト中に、FrontierMathに予想以上に多くのエラーが存在することを発見しました。
その後、Epochは独立監査を開始し、まずGPT-5.5とClaude Opus 4.7で疑わしい点をスクリーニングし、その後数学者が各問題を個別に再確認した。最終的に2026年6月にv2バージョンをリリースし、Tier 4では12問を修正し、7問を削除して43問を残した。
改訂後、モデルの成績は依然として上昇し続けている。
GPT-5.6 Solは83.0%、Claude Fable 5は90.2%を達成し、GPT-6 Astraでは97.6%に達しました。

さらに重要なことに、AstraはこれまでAIが解けなかった唯一の問題を解き明かしました。

これで、Tier 4のすべての問題が、少なくとも一度はAIによって成功裏に突破された。この最強モデル向けに特別に構築された研究レベルの防衛線も、最終的に突破された。
しかし、これは「数学がAIによって解決された」という意味ではありません。逆に、FrontierMath自体が次の段階へと進み始めています。
現在、このプロジェクトはTier 1-4に加えて、真正的なOpen Problemsと、Erdősの未解決問題をLeanに形式化したFrontierMath Erdősが追加されました。

前者は、数学界でまだ解決されていない研究課題を直接モデルに問う;後者は、AIに形式検証を通過できる完全な証明を書かせる。
今回は、AstraがFrontierMath Erdősの68問のうち2問だけを解きました。
物語はまだ続いています~
本文は微信公衆アカウント「量子位」より、著者:henry
