剛剛,最後一道 FrontierMath 第 4 級難題被 GPT-6 Astra 攻破了。
至此,這套曾被視為大模型數學噩夢的研究級測試,所有題目都已至少被 AI 成功解答過一次。
Epoch AI 也正式給它下了結論,FrontierMath 第 4 級,飽和了。

雖然從上面的圖中看,Astra 還沒有直接達到 100%,OpenAI 自己公佈的成績也是 97.6%。
但根據 Epoch 的算法,「全部解出」指的是將不同模型、不同時間的嘗試累積起來後,Tier 4 裏的每一道題都已經有過成功解答。
而 Astra 攻破的,正是此前唯一尚未被 AI 攻破的那道。
(簡單理解就是 Astra 可能在某次測試中出錯了,但它答對的那道題是此前沒被解出來的)

說真的,這個發展速度還是相當驚人。
如果你關注模型評測的話,就知道 2025 年 7 月 11 日,第 4 級剛推出時,榜上最高成績只有大約 5%。
現在剛過了一年零2個月,這個曾經的「高牆」已經變成了「臺階」,最後一道難以被 AI 透過捷徑繞道解決的問題也被跨越。
出題人、馬凱特大學數學副教授 Jay Pantone 也表示,以往 AI 都會尋找數值捷徑,而這次,AI 的解法與自己相當接近。

不過,就在最近 GPT-6 Astra 集中向數學界猛攻,三天兩頭解決千禧年難題之際,Pantone 表示自己已經很難驚訝了!
可以说,數學簡直已成為 Astra 最近最積極展現存在感的領域之一。
從不足 2%,到專門增加一道「研究級防線」
FrontierMath 最早於 2024 年 11 月 7 日發布,而它誕生的目的,本身就是为了避免數學 Benchmark 過快被 AI 刷穿。
當時,像 GSM8K、MATH 這樣的傳統數學 Benchmark 已經越來越難以拉開頭部模型之間的差距,於是 Epoch AI 聯合 60 多位數學家,重新設計了一批此前從未公開過的原創題。
Among them are Fields Medalists such as Terence Tao, Timothy Gowers, and Richard Borcherds.
陶哲軒在看完其中一些研究級題目後直言,這些題目“極其困難”,甚至判斷最難的 Tier 3 可能還會讓 AI 卡上好幾年。

第一輪測試結果不出所料,領先模型的準確率還不到 2%。
具體而言,FrontierMath 的核心題庫最初共有 300 道題,根據難度分為 Tier 1、Tier 2 和 Tier 3 三個等級。

第 1 級大致接近高難度本科題目和數學奧林匹克,但允許使用更進階的工具;第 2 級已達到高年級研究生難度;第 3 級則更接近博士生早期會遇到的探索性研究問題。
但隨著推理模型的出現,這前三層也開始越來越不夠用,於是在2025年,Epoch 又往上加了一層,第 4 級。
第 4 級大多由數學教授和博士後設計,每個人會圍繞自己的研究方向,進行數週左右的短期研究,最後再把成果壓縮成一道可以被自動驗證的問題。

最初,第 4 級共收錄了 50 道題。它們覆蓋的範圍包括分析、數論、組合數學、拓撲、代數幾何……
在發布之初,所有模型歷次測試加起來,也只有 3 道題曾經被解出,而且這些解答還依賴了一些正確、但沒有被充分論證的假設。
鑑於此,Epoch 曾在官網的公開樣題頁面上寫道:其中一些題目,可能幾十年都不會被 AI 解決。

(這句話現在開始被反覆鞭屍)
但隨著模型越來越強,另一個問題也浮現出來:題庫本身也開始經不起AI的「考驗」了。
OpenAI 在測試過程中發現,FrontierMath 裡的錯誤比預期更多。
隨後 Epoch 啟動獨立審計,先用 GPT-5.5 和 Claude Opus 4.7 篩查疑點,再交由數學家逐題複核。最終於 2026 年 6 月推出 v2 版本,其中 Tier 4 修正了 12 道題、移除了 7 道題,留下 43 題。
After revision, the model's performance continues to rise steadily.
GPT-5.6 Sol 達到 83.0%,Claude Fable 5 達到 90.2%,而 GPT-6 Astra 的成績已達到 97.6%。

更重要的是,Astra 還解答了此前唯一一道未被 AI 解出的題目。

至此,Tier 4 中的每一道題,都已至少被 AI 成功攻破一次。這套專為最強模型設置的研究級防線,最終也被刷穿了。
不過,這並不意味著「數學已經被 AI 解決了」。恰恰相反,FrontierMath 自己已經開始邁向下一階段。
目前,整個項目除了 Tiers 1-4 外,還增加了真正的 Open Problems,並將 Erdős 開放問題形式化為 FrontierMath Erdős。

前者直接以數學界尚未解決的研究問題測試模型;後者則要求 AI 寫出能通過形式化驗證的完整證明。
這次,Astra 在 FrontierMath Erdős 的 68 道問題裡,只解決了 2 道。
故事仍在繼續~
本文來自微信公眾號「量子位」,作者:henry
