AI 在 88 小時內解決千禧年數學難題,引發學術與倫理爭議

icon MarsBit
分享
AI summary icon精華摘要
AI 與加密貨幣新聞爆出,據報導 OpenAI 的內部模型在 88 小時內使用 10,000 個 AI 代理解決了納維-斯托克斯問題。該結果尚未經數學家驗證。鏈上新聞顯示,這一 AI 突破與 FrontierMath 第 4 級基準的飽和發生在同一天。當天,25 位菲爾茲獎得主批評 AI 公司目標不一致。OpenAI 因未將一位對論文有貢獻的 Anthropic 員工列為作者而面臨反彈。

AI 已經強大到能解開人類最難的數學題,也能消滅我們。

說這話的,是《華爾街日報》專欄作家 Ben Cohen。

9月11日,他寫了一篇關於 AI 和數學的專欄。

Cohen 承認自己不懂納維-斯托克斯方程,但他認為,你不需要懂任何數學,也能明白 OpenAI 這次聲稱取得的突破意味著什麼:

AI 的進步正在加速,而且這種加速令人恐懼。

Fields 奖

一條數學圈的硬核新聞,一下子變成了關乎所有人類命運的問題。

同一天,陶哲軒等25位菲爾茲獎得主聯名發布聲明:《AI在數學中的嚴重失配》(A Severe Misalignment of AI in Mathematics)。

Fields 奖

他們所說的「失配」,是指 AI 公司和數學家想要的東西對不上:數學家要的是新方法、新理解,AI 公司要的是拿名題給模型刷分。

一邊是專欄作家在喊末日,一邊是頂級數學家在談失配。

如果你把這一週的事情排在一起看,就會明白他們為什麼坐不住了:

9月3日,GPT-6 Astra 發布,在 FrontierMath 第 4 級取得 97.6%;

9月5日,OpenAI 一個尚未發布的內部模型,在首批智能體啟動約 88 小時後,得到納維-斯托克斯問題的一套解法;

9 月 8 日,OpenAI 公開結果,當天即被 NYU 數學家指控搶跑,並引發「不讓 Anthropic 員工上論文」的署名爭議;

9月10日,Epoch AI 宣布 FrontierMath 第 4 級已經飽和;

9月11日,25位菲爾茲獎得主聯名發聲。當晚,《華爾街日報》將數學突破與AI滅絕風險放入同一個標題。

Seven days, five events all point to a gap: the speed at which AI creates knowledge, the speed at which humans verify knowledge, and the speed of rule adjustments are severely out of sync.

14 個月,AI 突破最難數學基準

FrontierMath 第 4 級,這是一組由 Epoch AI 設計、專門測試最強模型的研究級數學題。

這裡的題目極其变态,有些題目,哪怕是頂尖研究者也要花上幾天才能解開。

2025 年 7 月第 4 級剛上線時,最強模型只能做出約 5%,基本等於交白卷。

但不到14個月,Epoch宣布:每一道Tier 4題,都至少被AI解出過一次。

其中,最後一題由 GPT-6 Astra 拿下,出題人是數學家 Jay Pantone。

Epoch 特別提到:過去數學家經常抱怨模型靠「意外捷徑」繞過自己精心設計的題目,但最後這一題,沒走捷徑。

隨後,Epoch 得出一個冷酷的結論:這個基準已經飽和。

Fields 奖

The exam paper has fallen behind the candidates—it's time to switch papers.

Epoch 也已將戰場轉向真正的開放性問題,AI 評測體系開始轉向人類自己也不知道答案的盲區。

The speed at which AI capabilities are growing has outpaced our methods of measuring them.

正如 Epoch 的 Greg Burnham 所感慨的:一個時代落幕,另一個時代開啟。

88 小時,AI 首次像研究所那樣運轉

如果 FrontierMath 證明的是「基準開始追不上模型」,那麼納維-斯托克斯事件所展示的則是一幅更具顛覆性的畫面:

AI 不只是會做題,它已經開始像一個龐大的科研組織那樣運轉了。

這根本不是一場單打獨鬥,而是一場多达一萬個智能體的「大兵團作戰」。

它們被分為不同的小組,有的進行證明,有的進行證偽,彼此通信、共享中間結論,甚至在中途無縫切換至模型的最新版本。

首批智能體啟動約 88 小時後,其中一個組提交了一份長達百頁的最終證明。

Fields 奖

OpenAI 公布的納維-斯托克斯奇點機制示意:流體向內螺旋(inward spiral)、沿軸拉伸(axial stretching),橙色為高速旋轉區,青色為低速區。渦心越縮越快,速度無界而總能量有限。

This entire process perfectly replicates the operational model of the world's top scientific research institutions.

機器狂奔88小時生成結果,人類確認卻要以年計

在人類世界裡,納維-斯托克斯的狀態依然是「未解決」。

Fields 奖

根據千禧年大獎的規則,一個解答必須先於合格渠道發表,發表後至少等待兩年,並獲得全球數學界的普遍認可,Clay 才會啟動正式審議。

Clay主席Martin Bridson對AFP表示,評估過程「刻意不急」,而且必須「絕對嚴格」。OpenAI自己也表示,不打算申領這100萬美元。

因此,這件事最準確的說法是:OpenAI 公布了一套千禧年難題的解法,聲稱已完成 Lean 形式化驗證,但尚未得到數學共同體的獨立確認。

機器生成結果,88 小時。人類確認結果,至少兩年,這恐怕是本周 AI 數學最刺目的一組反差。

這不是說人類驗證太慢。問題在於機器將「發現」加速了幾百倍,但人類的「理解」並未同步加速。

所以,真正的问题是,當機器開始以「幾天一個重大結果」的節奏批量生產知識,之後幾年甚至幾十年的閱讀、檢查、解釋、簡化和吸收,誰來做?

簽名制度最先撞牆

On the day the Navier-Stokes results were made public, the mathematics community was abuzz.

紐約大學數學家 Tristan Buckmaster 與在 Anthropic 任職的 Levent Alpöge,整個 8 月其實也一直在研究相關的流體方程。

根據《紐約時報》的還原,這兩人的工作方式如下:

Buckmaster 提出問題,Alpöge 將問題交給 Anthropic 內部模型;模型生成結果後,兩人再根據輸出調整問題,繼續反饋數據。

根據 Buckmaster 的說法,事後,OpenAI 提出了多個安撫方案:允許他先發布自己的結果、讓他成為 OpenAI 論文的第一作者、提供算力讓他繼續研究。

但最大的障礙是:OpenAI 不想讓 Levent 出現在論文上。

Fields 奖

黑板上是 Buckmaster 和 Alpöge 整個 8 月的進展時間線:歐拉方程 8 月 15 日、Lean 形式化 8 月 22 日、8 月 31 日……還有 Figalli、Hairer 等同行的名字。

在商言商,一個 OpenAI 投入重金的內部項目,憑什麼要署上競爭對手 Anthropic 員工的名字?

隨後,事情又延伸到了另一個更為敏感的話題。Buckmaster 過去數月一直在使用 Codex 整理 AI 生成的數學草稿。

那麼,他輸入 Codex 但尚未公開的獨家科研思路,有沒有可能透過隱秘的數據管線,成為了 OpenAI 自己研究模型的養料?

Buckmaster 自己承認沒有證據,但在他看來,事件的時間線和 OpenAI 的證明路線,都在暗示著這一點。

OpenAI 於 9 月 10 日發出緊急更新公告,經內部徹查,Buckmaster 過去兩個月的 Codex 提示詞絕對不可能通過訓練或其他任何方式影響這套內部模型。

誰對誰錯,這裡暫時成了一筆糊塗賬,但它真正暴露出來的,是一整組過去從來沒人認真回答過的問題:

一個人的私有提示詞到底算不算受保護的科研資料?

企業內部的砸錢研究項目能否署上競爭對手公司員工的名字?

如果模型參考過海量的公開資料,又該怎樣界定新的貢獻與既有工作的邊界?

普林斯頓高等研究院的 Peter Sarnak 對《紐約時報》說:「這種討價還價,我這輩子沒聽過。」

數學界幾百年沉澱下來的學術規則,從來沒有為這種狂暴的機器生產速度設計過防撞帶。

25 位菲爾茲獎得主真正擔心的事

就在一天後,25 位菲爾茲獎得主聯合發表了一份重磅聲明。

陶哲軒、Peter Scholze、James Maynard、Maryna Viazovska……數學圈最頂尖的大腦幾乎全員出動。

Fields 奖

這份聲明,並非什麼「反AI檄文」。

事實上,陶哲軒本人一直都在極其積極地嘗試用 AI 輔助數學研究。

而且聲明也承認,AI 確實有潛力加速真正的數學理解。

他們真正深惡痛絕的是將「解題」直接等同於數學,在當下狂熱的AI圈中,AI公司為了股價和宣傳,正急功近利地把「解掉名題」當成最高優化目標。

In their eyes, the Millennium Prize Problems seem to be nothing more than a benchmark to prove how powerful the model is.

但數學的真正寶貴之處,在於在枯燥的解題過程中誕生新方法和新概念,最終沉淀成人類的共同知識體系。

現在 AI 公司隔三差五就推出令人震驚的成果,快到沒人來得及消化。這條延續了數千年的鏈條,隨時可能斷裂。

聯名信還特別指出,結果發布得太快,這些解答根本來不及清楚區分哪些是新想法、哪些是站在前人的肩膀上,因而必然導致嚴重的署名與歸屬混亂。

為什麼一個數學突破,會和「末日警告」掛上鉤?

普通人真正關心的,不是「AI 超過了數學家」。

機器創造知識的速度,首次以壓倒性姿態,快過了人類確認、歸屬、消化知識的速度。

這並非危言聳聽,GPT-6 Astra 系統卡寫明,它是 OpenAI 第一個達到網絡安全「Critical」閾值的模型,在 ExploitBench 上拿了 100%。

具備解決千禧年難題的組織能力、零日漏洞的攻擊能力,以及更難被看清的推理能力,這三者同時出現在同一個模型身上。

OpenAI 在納維-斯托克斯公告的最後一段,還有一句話:

Next, they need to fully understand this new model before deciding how fast to move forward, and may need to make more cautious choices regarding the pace of progress.

是的,剛交出千禧年難題答卷的 AI 公司,主動談起了減速。

Cohen 還在專欄末尾提到了一件事。

上個月,OpenAI 將一批頂尖數學家請到舊金山辦公室開閉門會議,假設 AI 終將在數學上超越人類,然後大家討論教育該如何應對、科研合作該如何進行、論文發表該如何處理,以及下一代數學家該如何培養。

Fields 奖

Talked all day, no answer.

這道題也無法打包交給 Lean 進行自動驗證。

只能由人類自行解開。

參考資料:

https://www.wsj.com/tech/ai/ai-math-millennium-prize-safety-openai-anthropic-05179825

https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=release-date

https://www.nytimes.com/2026/09/10/science/tristan-buckmaster-openai-math-navier-stokes.html?utm_source=chatgpt.com

https://www.daniellitt.com/blog/2026/8/11/the-end-of-mathematics/

本文來自微信公眾號「新智元」,作者:ASI啟示錄

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露