Anthropic 的 Claude 在 11 天內用 13M 行代碼證明了費馬最後定理

icon MarsBit
分享
AI summary icon精華摘要
Anthropic 的 Claude AI 在 AI 與加密貨幣新聞領域取得重大突破,於 11 天內完成費馬大定理的首個完整機器驗證證明。該 AI 在清華大學彭天奕的領導下,生成了 1300 萬行程式碼並驗證了 29,500 個定理,其規模超越了目前最大的數學定理庫 Mathlib。此進展凸顯了 AI 在複雜問題解決中的日益重要角色,為加密貨幣新聞領域的研究人員和開發者提供了全新的工具。

就在剛剛,數學圈又有驚人消息。

Qinghua Yao Class genius leads team, completely solves Fermat's Last Theorem using Claude.

至此,AI 完成了數學史上最大的證明。

過去,費馬大定理折磨了人類350多年,需要數學家耗費數年心血,寫下129頁天書才能證明。

今天,Anthropic 卻宣布,Claude 僅用 11 天,就完成了費馬大定理的首個端到端機器驗證證明!

Fermat's Last Theorem

為此,Claude 疯狂敲了 1300 萬行代碼,產出了 30300 條可驗證定理,最後有 29500 條被採用,直接進了最終證明。

這個體量,是全球最大數學定理庫 Mathlib 的 5 倍還多!而且,整個過程燒掉了足足 60 億 Token。

這是迄今為止編寫的最大 Lean 證明。

消息一出,全網震動。有人驚呼:「一個月就把費馬大定理形式化了?這種秀肌肉方式,讓數學界看起來像蝸牛在爬。」

Fermat's Last Theorem

姚班大神 彭天翼

350 年的世紀難題,Claude 11 天解決

1637 年,法國數學家費馬看書時,隨手在書頁空白處寫了句:

當整數 n > 2 時,關於 x、y、z 的方程 xⁿ + yⁿ = zⁿ 沒有正整數解。

然後他還不忘補一刀:「我確信已發現了一種美妙的證法,可惜這裡空白的地方太小,寫不下。」

This statement tormented mathematicians for over 300 years.

Until 1995, British mathematician Wiles used advanced modern mathematical tools to produce a 129-page proof paper, finally putting an end to this 350-year-old mystery.

Fermat's Last Theorem

但問題來了:懷爾斯的證明,實在太複雜了。

現代數學已經發展到普通人連題目都看不懂的地步。證明一個定理,就像搭一條超複雜的邏輯鏈條,只要中間一個環節斷了,整個全崩。

懷爾斯在1993年首次公佈時,就被發現存在一個致命漏洞,他又閉關痛苦地煎熬了一年才修復它。對於此類頂級的數學證明,人類驗證其正確性通常需要頂級專家耗費數月甚至數年的時間。

有沒有一種方法,讓電腦像檢查計算器結果一樣,跑一遍就知道對不對?

有!這就是「形式化」。

簡單來說,就是將人類撰寫的數學證明翻譯成計算機能運行的程式語言(例如 Lean),然後讓機器一步一步推導,如果能順利運行,就代表這個證明絕對正確。

但將費馬大定理「形式化」,數學界公認是「以年為單位」的超級大工程。

僅僅是帝國理工教授 Kevin Buzzard 牽頭的項目,第一階段的藍圖就有 86 頁!

Fermat's Last Theorem

然後,Claude 到來了。

人類預計要幹好幾年的活,它僅僅花了 11 天,而且是「基本自主工作」。

1300萬行代碼,60億Token

「11 天,1300 萬行程式碼」——這背後,是 AI 的暴力美學+精密系統設計的雙重暴擊。

來看看 Claude 到底幹了啥:

它不僅證明了費馬大定理本身。

因為形式化證明必須從最底層的公理開始,一層一層往上建構,所以 Claude 順手也證明了中間所需的 29,000 多條其他數學定理。

其中涉及代數、幾何、數論、調和分析……許多分支此前根本未被形式化,Claude 直接為其「開荒」。

在整個過程中,人類幾乎沒有介入。

研究員給了一些高層指令,例如「雅可比簇作為一個概形優先級挺高」「盡快推進馬祖爾定理」這種。

Fermat's Last Theorem

剩下的,就是幾十個 Claude 智能體在那兒瘋狂互相对話、定義概念、證明中間定理,然後一層層往上壘。

最後,Lean 編譯器全檢查通過,只依賴了三條最基礎的標準公理。

當程式執行完畢,控制台彈出那句神聖的「PROVED」(已證明)時,Claude 自己的內部日誌都激動了:

「!!! 費馬大定理根節點讀取為 PROVED……這是本次戰役的目標……歷史性的時刻。」

Look, even AI knows how amazing this is.

幕後大神:清華「姚班」出身的超級學霸

能指揮 Claude 干出這種神蹟的,那肯定不是一般人。

領頭的是哥倫比亞大學商學院助理教授、Anthropic 研究員——彭天翼。

這傢伙的履歷,簡直就是「開掛」本掛:

2013至2017年本科就讀於清華「姚班」,曾獲最佳畢業論文獎,並入選資訊學奧林匹克國家集訓隊。

博士去了 MIT,運籌學方向,GPA 滿分 5.0 畢業。

目前一邊擔任哥倫比亞大學助理教授,一邊在 Anthropic 研究 AI 智能體和形式化工具。

有趣的是,彭天翼對「AI 自動驗證數學證明」這件事的執念,其實來自大學時期一段「慘痛經歷」。

當時他的導師想把他論文中的成果寫入《Nature》,但問他:「你百分百確定證明對嗎?」

他老實回答:「有 99% 的把握吧,但這麼長,真沒法 100% 確定。」

因為那1%的不確定,他錯失了登上《Nature》的機會。

現在好了,他用 AI 親手把那個「1%」給堵死了。

從翻車到封神:Prove2Me 如何救了 AI 一命

你以為讓 AI 證明定理,就是輸入一句「請證明費馬大定理」,它就啪啪吐出 1300 萬行代碼?

完全錯誤。

一開始,實驗差點翻車。

Anthropic 表示,早期數十個 Claude 智能體協作不久後就完全亂套,像無頭蒼蠅一樣,彼此無法跟上進度,合作效率低到爆炸。早期失敗嘗試所貢獻的代碼,最終僅佔 7%。

大模型的「健忘症」和「幻覺」,在嚴謹數學面前就是致命傷——一行錯,後面幾百萬行全廢。

在關鍵時刻,彭天翼團隊推出了 Prove2Me 平台。

這玩意兒等於給 AI 們配了個「超級專案經理」,專治各種不服:

Theorem DAG(任務樹):為每個 AI 提供一張清晰的地圖,告知其下一步應證明哪個中間節點,大幅緩解記憶衰退,讓數十個智能體能高效並行。

Separation of Statement and Proof: Faster compilation, less resource usage.

Natural Language Index: Each theorem includes a plain-language description, making it much easier for AIs to retrieve and reuse the results.

Fermat's Last Theorem

With Claude Code’s multi-agent framework, AIs race through mathematical mazes like soldiers with navigation systems, clearing all levels in 11 days.

數學界服了

Results released, X and major tech forums were immediately flooded.

帝國理工那位原本計劃花幾年搞形式化的教授,看完都服了,評價極高:「這是現代數學文獻自動形式化的一大步!以後可以用來查人類數學庫裡的錯,還能核驗大模型生成的數學結論。」

但網友們的腦洞更奇特。

有人神評:「AI 解決數學的方式是——給你一個極其複雜的答案(1300 萬行程式碼),你想證明它是錯的,比自己解一遍還難。所以你只能放棄抵抗,接受它對了。這不就是數學界的 PUA 嗎?」

還有人說:「寫了1300萬行程式碼,只為了讓一個350年的定理在機器面前乖乖坐好……人類的桌子還未準備好接受這種規模的東西。」

更絕的是,Anthropic 為了秀肌肉,還順手做了一個小實驗。

用 3 個普通帳號,在 Prove2Me 上花了 3 天,就把數論裡著名的「維諾格拉多夫三素數定理」也給形式化了!

也就是說,只要有合適的工具,以後民間科學家買幾個消費級 AI 帳號,也能去驗證人類最頂級的數學定理了!

AI 不會取代數學家,但會徹底改變數學

所以,數學家是不是要失業了?

Anthropic 官方已作出回應:不會取代,但會徹底改變玩法。

歷史上,數學驗證有許多「悲劇」。

例如,1998 年有人證明了開普勒猜想,評審團花了 4 年時間,最後只能說「99% 確定」;佩雷爾曼證明龐加萊猜想,整個數學界花了 4 年寫了 3 本超過 300 頁的書,才勉強看懂;還有一些定理,被當作真理接受了好幾年,別人在上面蓋了樓,最後發現地基是塌的。

而 Claude 帶來的技術,就是要終結這種「不確定性」。

未來,AI 不僅是數學家的計算器,更是最嚴格的裁判員。

當 AI 能快速生成數以千計的新猜想和證明時,人類無法一一審閱,那就將「附帶形式化驗證代碼」變成論文的標準配置。

在大模型時代,大規模自動形式化以接近工程化落地的方式,開啟新的可能。

參考資料:

https://www.anthropic.com/research/formalizing-fermats-last-theorem

編輯:Aeneas

本文來自微信公眾號「新智元」(ID:AI_era),作者:ASI啟示錄

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露