AnthropicのClaudeが1300万行のコードで11日間でフェルマーの最終定理を証明

icon MarsBit
共有
AI summary icon概要
AnthropicのClaude AIは、AIと暗号通貨のニュース分野で大きなブレークスルーを達成し、清華大学の彭天一の指導のもと、11日間でフェルマーの最終定理の最初の完全な機械検証証明を完了しました。AIは1300万行のコードを生成し、29,500の定理を検証しました。この成果は、最大の数学定理ライブラリであるMathlibを上回る規模です。この進展は、AIが複雑な問題解決においてますます重要な役割を果たしていることを示しており、暗号通貨ニュース分野の研究者や開発者に新しいツールを提供しています。

さっき、数学界に驚きのニュースが入りました。

清華姚班の神がClaudeを率いて、フェルマーの最終定理を完全に解決した。

これで、AIは数学史上最大の証明を完了しました。

かつて、フェルマーの最終定理は人類を350年以上も悩ませ、数学者が数年の心血を注いで129ページに及ぶ天書を書き上げてようやく証明された。

今日、Anthropicは、Claudeがたった11日でフェルマーの最終定理の最初のエンドツーエンドの機械検証証明を完了したと発表しました!

フェルマーの最終定理

その結果、Claudeは1300万行のコードを書き、30,300の検証可能な定理を生成し、そのうち29,500条が採用されて最終証明に直接組み込まれました。

この規模は、世界最大の数学定理ライブラリMathlibの5倍以上です!さらに、このプロセス全体で60億トークンが消費されました。

これはこれまでに書かれた最大のLean証明です。

ニュースが発表されると、ネット全体が震撼した。誰かが叫んだ。「たった1か月でフェルマーの最終定理を形式化した?この筋肉見せ方では、数学界がカタツムリが這うように見える。」

フェルマーの最終定理

姚班の神様、彭天翼

350年の歴史的難題を、Claudeが11日で解決

1637年、フランスの数学者フェルマーが本を読んでいる際に、ページの余白に次のように書き残した:

n > 2 の整数に対して、方程式 xⁿ + yⁿ = zⁿ は正の整数解を持たない。

そして彼はさらに一言付け加えた。「私は素晴らしい証明を発見したが、ここには余白が狭すぎて書ききれない。」

この一文が、その後の数学者たちを300年以上にわたり苦悩させた。

1995年まで、イギリスの数学者ワイルズは、高度な現代数学のツールを用いて、129ページに及ぶ証明論文を完成させ、350年以上にわたるこの難題をようやく解決した。

フェルマーの最終定理

しかし問題が生じます:ワイルズの証明はあまりにも複雑です。

現代数学は、一般の人々が問題自体を理解できなくなるほど発展した。定理の証明は、非常に複雑な論理の連鎖を構築するようなもので、その途中の一つの环节が途切れれば、全体が崩壊してしまう。

ワイルズが1993年に最初に発表した際、致命的な欠陥が見つかり、彼は再び閉じこもって1年間苦悩し、ようやくそれを修正した。このような最高レベルの数学的証明について、その正しさを人間が検証するには、最高レベルの専門家が数ヶ月から数年を要することが多い。

コンピューターに、計算機の結果をチェックするように、実行すればすぐに正誤がわかる方法はありますか?

あります!これが「形式化」です。

簡単に言えば、人間が書いた数学的証明を、コンピューターが実行できるプログラミング言語(例:Lean)に翻訳し、機械がステップごとに推論を進めます。もし実行が成功すれば、その証明は絶対に正しいということになります。

しかし、フェルマーの最終定理を「形式化」することは、数学界で「年単位」の超大規模なプロジェクトと広く認識されている。

イマージェント・カレッジ・ロンドンのケビン・バズァード教授が主導するプロジェクトだけで、第一段階のブループリントは86ページに及ぶ!

フェルマーの最終定理

そして、Claudeが登場しました。

人間が何年もかかる作業を、それはたった11日で、しかも「基本的に自律的に作業」した。

1300万行のコード、60億トークン

「11日間、1300万行のコード」——その背後には、AIの暴力的美学と精密なシステム設計の二重の衝撃がある。

Claudeが実際に何をしたか見てみましょう:

それはフェルマーの最終定理そのものを証明しただけでなく、

形式化証明は最下層の公理から始めて段階的に構築しなければならないため、Claudeはその過程で必要な他の29,000以上の数学的定理も同時に証明しました。

代数、幾何、数論、調和解析など、これまでまったく形式化されていなかった多くの分野を、Claudeが直接「開拓」した。

このプロセス全体で、人間はほとんど関与していません。

研究員は、「ヤコビ多様体をスキームとして優先的に進める」「マズールの定理をできるだけ早く推進する」などの上層部への指示を出した。

フェルマーの最終定理

残りは、数十のClaudeエージェントが激しく会話し合い、概念を定義し、中間定理を証明しながら、段階的に積み上げていくことだけです。

最後に、Leanコンパイラの完全チェックが通過し、最も基本的な3つの公理のみに依存しました。

プログラムが完了し、コンソールに神聖な「PROVED」(証明済み)が表示されたとき、Claudeの内部ログまで興奮した:

「!!! フェルマーの最終定理のルートノードが PROVED と読み取られました……これが今回の戦いの目標です……歴史的な瞬間です。」

見なさい、AIでさえこの出来事がどれほど素晴らしいかわかっている。

裏の巨匠:清華大学「姚班」出身の超エリート

この奇跡をClaudeにさせられるのは、きっと普通の人ではない。

リーダーは、コロンビア大学ビジネススクールの助教授でAnthropicの研究員である彭天翼です。

この人の経歴は、まさに「チート」そのものだ:

2013年から2017年まで学部在籍、清華大学「姚班」、最優秀卒業論文を受賞し、情報オリンピック国家集訓隊にも選出された。

博士はMITで運営学を専攻し、GPA5.0満点で卒業しました。

現在、コロンビア大学の助教授でありながら、AnthropicでAIエージェントと形式化ツールを開発しています。

興味深いことに、彭天翼が「AIによる数学的証明の自動検証」にこだわる理由は、大学時代の「痛烈な経験」に由来している。

当時、彼の指導教員は彼の論文の成果を『Nature』に掲載しようと考えていたが、彼に尋ねた。「あなたは、この証明が100%正しいと確信できますか?」

彼は正直に答えた:「99%の確信はあるけど、これほど長いと、100%確実には言えない。」

その1%の不確実さのために、彼は『Nature』に掲載される機会を逃した。

今や、彼はAIを使ってその「1%」を完全に遮断した。

転落から神格化へ:Prove2MeはどのようにAIを救ったのか

AIに定理の証明をさせると、ただ「フェルマーの最終定理を証明してください」と入力すれば、パッと1300万行のコードを吐き出すと思う?

大間違いです。

最初、実験は失敗しかけた。

Anthropicは、初期の数十個のClaudeエージェントが協力し始めた直後に完全に混乱し、まるで頭のないハエのように進捗を追いつけず、協力効率が極端に低下したことを明らかにした。初期の失敗した試みから提供されたコードは、最終的に7%しか占めなかった。

大規模モデルの「健忘症」と「幻覚」は、厳密な数学の前では致命的な欠陥である——1行のエラーが、その後の数百万行をすべて無効にする。

重要な瞬間、彭天翼チームはProve2Meプラットフォームを開発した。

これはAIに「スーパープロジェクトマネージャー」を付けるようなもので、あらゆる不服を治します:

定理DAG(タスクツリー):各AIに明確なマップを提供し、次に証明すべき中間ノードを指示することで、記憶の劣化を大幅に軽減し、数十のエージェントが効率的に並列処理可能になります。

ステートメントと証明の分離:コンパイル速度を向上させ、リソースを節約します。

自然言語インデックス:各定理には人間が理解できる説明が残されており、AIが成果を検索して再利用しやすくなりました。

フェルマーの最終定理

Claude Codeのマルチエージェントフレームワークと組み合わせることで、AIたちはナビゲーションを搭載した工兵のように数学の迷宮を駆け抜け、11日で全レベルをクリアした。

数学界は敗北した

成果が発表されると、Xと主要な技術フォーラムで一気に波紋が広がった。

形式化に数年を費やそうとしていた帝国理工の教授は、これを閲覧した後、非常に高く評価し、「現代数学文献の自動形式化における大きな一歩だ!これにより、人間の数学ライブラリ内の誤りを検出でき、大規模モデルが生成した数学的結論の検証も可能になる。」と評した。

しかし、ネットユーザーの発想はさらに奇抜だ。

有人の神コメント:「AIが数学を解決する方法とは——非常に複雑な答え(1300万行のコード)を提示し、それが間違っていることを証明しようとするより、自分で一から解き直す方が難しい。だから、あなたは抵抗をあきらめ、それが正しいと受け入れるしかない。これは数学界のPUAではないか?」

また、誰かがこう言っている:「1300万行のコードを書いて、たった350年も前の定理を機械の前で静かに座らせようとする……人間の机は、このような規模のものを受け入れる準備ができていない。」

さらに、Anthropicは筋肉を誇示するために、小さな実験も行いました。

3つの通常アカウントを使って、Prove2Meで3日間かけて、数論の有名な「ヴィノグラドフの三素数定理」も形式化しました!

つまり、適切なツールがあれば、今後一般のサイエンティストでも、消費者向けAIアカウントを数個購入することで、人類最高峰の数学定理を検証できるようになるということです!

AIは数学者を置き換えないが、数学を根本的に変えるだろう

だから、数学者は職を失うのか?

Anthropicの公式回答:置き換えることはないが、ゲームのルールを完全に変えるだろう。

歴史的に、数学的検証には多くの「悲劇」がありました。

例えば1998年、ケプラー予想が証明された際、査読委員会は4年を費やしてようやく「99%確信する」としか言えなかった。ペレルマンがポアンカレ予想を証明した際、数学界全体で4年かけて3冊、各300ページ以上の本を書き上げてようやく理解できた。また、ある定理は数年間真理として受け入れられ、その上に多くの研究が築かれたが、後にその基盤が崩れていることが判明したこともある。

そしてClaudeがもたらす技術は、この「不確実性」を終わらせることです。

将来、AIは数学者の計算機ではなく、最も厳格な審判となる。

AIが数万件の新しい仮説と証明を迅速に生成できるようになった場合、人間がすべてを確認することは不可能なので、「形式化検証コードを付属させる」ことを論文の標準仕様とすべきである。

大規模モデル時代において、大規模な自動形式化が、エンジニアリング実装に近い形で新たな可能性を開く。

参考資料:

https://www.anthropic.com/research/formalizing-fermats-last-theorem

編集:Aeneas

本文は微信公衆アカウント「新智元」(ID:AI_era)より、著者:ASI启示録

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。