Claude daripada Anthropic membuktikan Teorem Terakhir Fermat dalam 11 hari dengan 13 juta baris kod

icon MarsBit
Kongsi
AI summary iconRingkasan
Claude AI dari Anthropic mencapai terobosan besar dalam AI + berita kripto, menyelesaikan bukti mesin yang diverifikasi sepenuhnya pertama terhadap Teorema Terakhir Fermat dalam 11 hari. AI tersebut menghasilkan 13 juta baris kod dan memverifikasi 29,500 teorem di bawah kepimpinan Peng Tianyi dari Universiti Tsinghua. Hasil ini melebihi skala Mathlib, perpustakaan teorem matematik terbesar. Kemajuan ini menonjolkan peranan semakin meningkat AI dalam penyelesaian masalah kompleks, menawarkan alat-alat baharu kepada penyelidik dan pembangun dalam ruang berita kripto.

Baru sahaja, ada berita mengejutkan dari kalangan matematik.

Dipimpin oleh ahli dari kelas Yao di Tsinghua, Claude telah sepenuhnya menyelesaikan Teorem Terakhir Fermat.

Dengan ini, AI telah menyelesaikan bukti terbesar dalam sejarah matematik.

Dulu, Teorem Terakhir Fermat menyeksa umat manusia selama lebih daripada 350 tahun, memerlukan ahli matematik menghabiskan bertahun-tahun usaha untuk menulis 129 muka surat kitab suci untuk membuktikannya.

Hari ini, Anthropic sebaliknya mengumumkan bahawa Claude hanya memerlukan 11 hari untuk menyelesaikan bukti pengesahan mesin end-to-end pertama bagi Teorem Terakhir Fermat!

Fermat's Last Theorem

Untuk itu, Claude menaip 13 juta baris kod, menghasilkan 30,300 teorem yang boleh disahkan, dan akhirnya 29,500 daripadanya diambil, langsung dimasukkan ke dalam bukti akhir.

Ukuran ini adalah lebih daripada lima kali ganda terbesar di dunia, pustaka teorem matematik Mathlib! Selain itu, keseluruhan proses ini telah menghabiskan sebanyak 6 bilion Token.

Ini adalah bukti Lean terbesar yang pernah ditulis.

Setelah berita itu keluar, seluruh internet bergoncang. Ada yang terkejut: “Membentuk Teorem Terakhir Fermat dalam sebulan? Cara memamerkan kekuatan ini membuat dunia matematik kelihatan seperti siput yang merangkak.”

Fermat's Last Theorem

Peng Tianyi dari Kelas Yao

Masalah abad selama 350 tahun, Claude menyelesaikannya dalam 11 hari

Pada tahun 1637, ahli matematik Perancis Fermat menulis secara spontan di ruang kosong halaman buku:

Apabila n > 2, persamaan xⁿ + yⁿ = zⁿ dalam sebutan x, y, z tidak mempunyai penyelesaian integer positif.

Kemudian dia tidak lupa menambahkan satu lagi: "Saya yakin telah menemukan bukti yang indah, tetapi ruang kosong di sini terlalu kecil untuk menulisnya."

Pernyataan ini menyebabkan ahli matematik selepas itu menderita selama lebih dari tiga ratus tahun.

Hingga tahun 1995, ahli matematik British Andrew Wiles baru berjaya menggunakan alat matematik moden yang canggih untuk menghasilkan bukti sepanjang 129 muka surat, akhirnya menyelesaikan kes selama 350 tahun ini.

Fermat's Last Theorem

Tetapi masalahnya muncul: bukti Wiles terlalu kompleks.

Matematik moden telah berkembang hingga titik di mana orang biasa pun tidak dapat memahami soalnya. Membuktikan satu teorem adalah seperti membina rantai logik yang sangat kompleks; sekiranya satu peringkat sahaja terputus, keseluruhan struktur akan runtuh.

Wiles pertama kali mengumumkan pada tahun 1993, tetapi segera ditemukan lubang mematikan, dan dia harus mengasingkan diri selama satu tahun penuh penderitaan untuk memperbaikinya. Untuk bukti matematika sekelas ini, manusia memerlukan waktu berbulan-bulan bahkan bertahun-tahun bagi pakar terkemuka untuk memverifikasi kebenarannya.

Adakah cara untuk membolehkan komputer menjalankan semula dan mengetahui sama ada ia betul atau tidak, seperti semakan keputusan kalkulator?

Ada! Ini adalah "formalisasi".

Secara ringkas, ia bermaksud menterjemahkan bukti matematik yang ditulis oleh manusia ke dalam bahasa pengaturcaraan yang boleh dijalankan oleh komputer (seperti Lean), kemudian membiarkan mesin membuat penurunan langkah demi langkah; jika ia berjalan dengan lancar, ia menunjukkan bahawa bukti tersebut adalah benar-benar betul.

Namun, memformalkan Teorem Terakhir Fermat dianggap oleh komuniti matematik sebagai projek super yang mengambil masa bertahun-tahun.

Hanya projek yang dipimpin oleh Profesor Imperial College London, Kevin Buzzard, laporan awal fasa pertama sudah mencapai 86 halaman!

Fermat's Last Theorem

Kemudian, Claude datang.

Manusia dijangka perlu bekerja bertahun-tahun, tetapi ia hanya mengambil masa 11 hari, dan ia adalah "kerja autonomi asas".

13 juta baris kod, 6 bilion Token

"11 hari, 13 juta baris kod" — di sebaliknya, adalah serangan ganda dari estetika kekerasan AI dan reka bentuk sistem yang tepat.

Mari kita lihat apa yang Claude lakukan:

Ia bukan sahaja membuktikan Teorem Terakhir Fermat itu sendiri.

Kerana bukti formal mesti bermula daripada aksiom paling asas dan dibina secara bertahap, Claude secara tidak sengaja membuktikan lebih 29,000 teorem matematik lain yang diperlukan di tengah-tengah proses tersebut.

Ia melibatkan algebra, geometri, teori nombor, analisis harmonik... banyak cabang yang sebelum ini tidak pernah diformalkan, dan Claude terus melakukan "pembukaan tanah".

Sepanjang proses itu, manusia hampir tidak terlibat sama sekali.

Penyelidik memberikan beberapa arahan tinggi, seperti “Jacobian variety sebagai skema mempunyai keutamaan tinggi” dan “percepatkan kemajuan Teorem Mazur”.

Fermat's Last Theorem

Yang tinggal ialah puluhan agen Claude yang saling berbual secara gila-gilaan, mentakrifkan konsep, membuktikan teorem sela, dan membina lapisan demi lapisan ke atas.

Akhirnya, pemeriksaan penuh oleh kompiler Lean lulus, hanya bergantung pada tiga aksioma standard paling asas.

Apabila proses selesai dan konsol menampilkan ayat suci 「PROVED」 (telah dibuktikan), log dalaman Claude sendiri menjadi bersemangat:

「!!! Root node of Fermat's Last Theorem read as PROVED…… This is the objective of this campaign…… A historic moment.」

Lihat, bahkan AI sendiri tahu betapa hebatnya perkara ini.

Makhluk di belakang layar: Sarjana cemerlang lulusan Kelas Yao, Tsinghua

Orang yang mampu menyuruh Claude melakukan keajaiban seperti ini pasti bukan orang biasa.

Pemimpinnya ialah Dr. Peng Tianyi, pensyarah bantuan di Sekolah Perniagaan Universiti Columbia dan penyelidik di Anthropic.

Latar belakang orang ini benar-benar seperti 'cheat code' itu sendiri:

Sarjana 2013-2017, Kelas Yao di Tsinghua, memenangi tesis kelulusan terbaik, serta terpilih ke pasukan latihan nasional Olimpiad Informatik.

Beliau pergi ke MIT, mengambil jurusan operasi penyelidikan, dan lulus dengan GPA sempurna 5.0.

Sekarang menjadi pensyarah bantuan di Columbia sambil bekerja di Anthropic dalam agen AI dan alat formalisasi.

Yang menariknya, keteguhan Peng Tianyi terhadap "pengesahan bukti matematik secara automatik AI" sebenarnya berasal dari pengalaman menyedihkan semasa sarjana muda beliau.

Pada masa itu, pembimbingnya ingin menulis pencapaian dalam tesisnya ke dalam jurnal《Nature》,tetapi bertanya kepadanya: “Apakah anda benar-benar yakin buktinya betul?”

Dia menjawab dengan jujur: "Kemungkinan 99%, tetapi sepanjang ini, memang tak mungkin 100% pasti."

Kerana 1% ketidakpastian itu, dia kehilangan peluang untuk muncul di Nature.

Sekarang baik-baik saja, dia menggunakan AI untuk secara langsung menutup "1%".

Dari kegagalan hingga menjadi legenda: Bagaimana Prove2Me menyelamatkan AI

Adakah anda berfikir bahawa dengan memasukkan satu ayat seperti "Sila buktikan Teorem Terakhir Fermat" kepada AI, ia akan mengeluarkan 13 juta baris kod secara serta-merta?

Sangat salah.

Pada awalnya, eksperimen hampir gagal.

Anthropic mengungkap bahawa awalnya, puluhan agen Claude yang bekerja sama gagal dengan cepat, seperti lalat tanpa kepala, tidak mampu mengikuti kemajuan satu sama lain, dan kecekapan kerjasama jatuh ke tahap yang sangat rendah. Kod yang dihasilkan daripada percubaan awal yang gagal akhirnya hanya menyumbang 7%.

“Lupa” dan “halusinasi” model besar merupakan kelemahan mematikan di hadapan matematik yang ketat—satu kesilapan, seluruh berjuta-juta baris seterusnya menjadi tidak berguna.

Pada masa kritikal, pasukan Peng Tianyi menghasilkan platform Prove2Me.

Ini seakan-akan memberi AI seorang "projek manager super", khas untuk mengatasi segala bentuk perlawanan:

Teorem DAG (pokok tugas): Memberi setiap AI peta yang jelas yang memberitahu ia node tengah mana yang perlu dibuktikan seterusnya, secara besar-besaran mengurangkan penurunan ingatan, membolehkan puluhan agen beroperasi secara selari dengan cekap.

Pemisahan pernyataan dan bukti: Mempercepat proses kompilasi, mengurangkan sumber daya.

Indeks bahasa semula jadi: Setiap teorem disertakan dengan pernyataan dalam bahasa manusia, memudahkan AI mencari dan menggunakan semula hasilnya.

Fermat's Last Theorem

Dengan kerangka agen pelbagai Claude Code, AI-ai itu seperti askar kejuruteraan yang dipasang navigasi, melaju pantas melalui labirin matematik, dan menyelesaikan semua tahap dalam 11 hari.

Matematik menyerah

Hasilnya dikeluarkan, X dan forum teknologi utama langsung diserang gelombang tsunami.

Profesor dari Imperial College London yang asalnya merancang untuk menghabiskan bertahun-tahun mengkaji formalisasi, setelah membacanya, terkesan dan memberi penilaian tinggi: “Ini merupakan langkah besar dalam formalisasi automatik literatur matematik moden! Ia boleh digunakan untuk memeriksa kesilapan dalam perpustakaan matematik manusia, serta mengesahkan kesimpulan matematik yang dihasilkan oleh model besar.”

Namun, imajinasi pengguna internet lebih unik lagi.

Komen bijak seseorang: “Cara AI menyelesaikan matematik adalah—memberi anda satu jawapan yang sangat kompleks (13 juta baris kod), dan anda ingin membuktikan ia salah, ia lebih sukar daripada menyelesaikannya sendiri. Oleh itu, anda hanya boleh menyerah dan menerima bahawa ia betul. Bukankah ini PUA dalam dunia matematik?”

Ada juga yang berkata: "Menulis 13 juta baris kod hanya untuk membuat teorem 350 tahun itu duduk tenang di hadapan mesin... Meja manusia belum bersedia menerima sesuatu sebesar ini."

Yang lebih menarik lagi, Anthropic telah menjalankan satu eksperimen kecil sebagai tanda kekuatan.

Menggunakan 3 akaun biasa, ia menghabiskan 3 hari di Prove2Me untuk memformalkan teorem tiga nombor perdana Vinogradov yang terkenal dalam teori nombor!

Dengan kata lain, selama ada alat yang sesuai, ilmuwan awam di masa depan boleh membeli beberapa akaun AI konsumer dan juga boleh mengesahkan teorem matematik paling tinggi manusia!

AI tidak akan menggantikan ahli matematik, tetapi akan mengubah matematik secara terperinci

Jadi, adakah ahli matematik akan kehilangan pekerjaan?

Anthropic memberikan jawapan rasmi: tidak akan menggantikan, tetapi akan mengubah cara permainan sepenuhnya.

Secara sejarah, terdapat banyak "tragedi" dalam pengesahan matematik.

Sebagai contoh, pada tahun 1998 seseorang membuktikan konjektur Kepler, panel penilai memerlukan masa empat tahun dan akhirnya hanya dapat mengatakan "99% yakin"; Perelman membuktikan konjektur Poincaré, seluruh dunia matematik memerlukan masa empat tahun untuk menulis tiga buku masing-masing lebih daripada 300 muka surat sebelum dapat memahaminya dengan susah payah; ada juga teorem yang diterima sebagai kebenaran selama bertahun-tahun, orang lain membina bangunan di atasnya, tetapi akhirnya ditemui bahawa tapaknya runtuh.

Teknologi yang dibawa oleh Claude adalah untuk mengakhiri "ketidakpastian" ini.

Di masa depan, AI bukan hanya kalkulator ahli matematik, tetapi juga hakim paling ketat.

Apabila AI mampu menghasilkan ribuan teori dan bukti baru dengan pantas, manusia tidak mampu memeriksa semuanya, maka jadikan "kod pengesahan formal yang dilampirkan" sebagai piawaian biasa dalam kertas kerja.

Di era model besar, formalisasi automatik berskala besar membuka kemungkinan baru dengan pendekatan yang mendekati pelaksanaan kejuruteraan.

Rujukan:

https://www.anthropic.com/research/formalizing-fermats-last-theorem

Disunting oleh: Aeneas

Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan" (ID: AI_era), penulis: Wahyu ASI

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.