AI Menyelesaikan Masalah Matematik Milenium dalam 88 Jam, Memicu Kekhawatiran Akademik dan Etika

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto meledak apabila model dalaman OpenAI dilaporkan menyelesaikan masalah Navier-Stokes dalam 88 jam menggunakan 10,000 agen AI. Keputusan itu masih belum disahkan oleh ahli matematik. Berita di rantai mengungkapkan terobosan AI itu berlaku serentak dengan pemenuhan tolok FrontierMath Tahap 4. Pada hari yang sama, 25 penerima Medal Fields mengkritik syarikat AI kerana matlamat yang tidak sejajar. OpenAI menghadapi kemarahan kerana mengeluarkan seorang kakitangan Anthropic daripada kertas itu walaupun sumbangan beliau.

AI sudah kuat hingga mampu menyelesaikan soal matematik paling sukar manusia, dan juga mampu memusnahkan kita.

Orang yang mengatakan ini ialah penulis kolom Wall Street Journal, Ben Cohen.

Pada 11 September, dia menulis sebuah kolom mengenai AI dan matematik.

Cohen mengaku tidak memahami persamaan Navier-Stokes, tetapi dia percaya bahawa anda tidak perlu memahami sebarang matematik untuk memahami apa yang dimaksudkan dengan terobosan yang diklaim oleh OpenAI kali ini:

Kemajuan AI sedang mempercepat, dan percepatan ini menakutkan.

Medal Fields

Sebuah berita ketat dari lingkaran matematika tiba-tiba berubah menjadi isu yang berkaitan dengan nasib semua manusia.

Pada hari yang sama, 25 penerima anugerah Fields, termasuk Terence Tao, mengeluarkan pernyataan bersama: "A Severe Misalignment of AI in Mathematics".

Medal Fields

Apa yang mereka maksud dengan "ketidaksesuaian" ialah bahawa apa yang diinginkan oleh syarikat AI dan ahli matematik tidak sepadan: ahli matematik ingin kaedah baru dan pemahaman baru, manakala syarikat AI ingin menggunakan soalan terkenal untuk meningkatkan skor model.

Di satu sisi, penulis kolom menyerukan kiamat, di sisi lain, ahli matematik terkemuka membincangkan ketidaksesuaian.

Jika anda melihat semua perkara minggu ini secara bersamaan, anda akan faham mengapa mereka tidak bisa duduk diam:

Pada 3 September, GPT-6 Astra dilancarkan, mencapai 97.6% di FrontierMath Tier 4;

Pada 5 September, satu model dalaman OpenAI yang belum dirilis mendapat satu set penyelesaian untuk masalah Navier-Stokes selepas sekitar 88 jam permulaan agen pertama;

Pada 8 September, OpenAI mengumumkan keputusanannya, dan pada hari yang sama, seorang ahli matematik dari NYU menuduhnya melanggar prosedur, serta menimbulkan kontroversi mengenai "tidak membenarkan pekerja Anthropic disenaraikan sebagai penulis kertas";

Pada 10 September, Epoch AI mengumumkan bahawa FrontierMath Tier 4 telah penuh;

Pada 11 September, 25 penerima Anugerah Fields mengeluarkan pernyataan bersama. Pada malam itu, The Wall Street Journal memasukkan terobosan matematik dan risiko kepunahan AI ke dalam tajuk yang sama.

Tujuh hari, lima perkara semuanya menunjukkan jurang seperti ini: kelajuan AI mencipta pengetahuan, kelajuan manusia mengesahkan pengetahuan, dan kelajuan penyesuaian peraturan sedang berpisah dengan serius.

14 bulan, AI menembusi piawai matematik paling sukar

FrontierMath Tier 4, satu set soalan matematik peringkat penyelidikan yang direka oleh Epoch AI untuk menguji model terkuat.

Soalan di sini sangat sukar; beberapa soalan, walaupun oleh penyelidik terkemuka, memerlukan beberapa hari untuk diselesaikan.

Pada Julai 2025, semasa Tier 4 baru dilancarkan, model terkuat hanya mampu mencapai sekitar 5%, hampir sama dengan menyerahkan kertas kosong.

Kurang dari 14 bulan, Epoch mengumumkan: setiap soal Tier 4 telah sekurang-kurangnya diselesaikan oleh AI sekali.

Di antaranya, soal terakhir dimenangkan oleh GPT-6 Astra, dengan soal yang dibuat oleh ahli matematik Jay Pantone.

Epoch juga secara khusus menyebut: Dahulu, ahli matematik sering mengeluh bahawa model menggunakan "jalan pintas kebetulan" untuk melalui soalan yang mereka reka dengan teliti, tetapi soalan terakhir ini tidak menggunakan jalan pintas.

Kemudian, Epoch mengeluarkan kesimpulan yang dingin: patokan ini telah jenuh.

Medal Fields

Kertas soalan sudah tidak mampu mengejar peserta, sudah masa untuk menukar kertas soalan.

Epoch juga telah mengalihkan medan pertempuran kepada soalan terbuka sebenar, sistem penilaian AI beralih kepada kawasan buta di mana manusia sendiri tidak tahu jawapannya.

Kecepatan pertumbuhan kemampuan AI telah melampaui kaedah yang kita gunakan untuk mengukurnya.

Seperti yang dikeluhkan oleh Greg Burnham dari Epoch: satu era berakhir, era lain bermula.

88 jam, AI berfungsi seperti sebuah institut untuk pertama kalinya

Jika FrontierMath membuktikan bahawa "piawai mulai tertinggal di belakang model", maka peristiwa Navier-Stokes pula menunjukkan gambaran yang lebih meruntuhkan:

AI bukan hanya mampu menjawab soal, ia sudah mulai beroperasi seperti sebuah organisasi penyelidikan yang besar.

Ini bukan sekadar pertempuran seorang diri, tetapi sebuah "operasi besar-besaran" yang melibatkan hingga sepuluh ribu agen.

Ia dibahagikan kepada kumpulan yang berbeza, ada yang membuktikan, ada yang membantah, berkomunikasi antara satu sama lain, berkongsi kesimpulan sementara, dan bahkan beralih tanpa putus kepada versi model terkini di tengah jalan.

Kira-kira 88 jam selepas agen pertama dimulakan, salah satu kumpulan telah menyerahkan bukti akhir yang panjangnya seratus muka surat.

Medal Fields

Gambaran mekanisme titik singular Navier-Stokes yang diperkenalkan oleh OpenAI: cairan berputar masuk (inward spiral), diregangkan sepanjang paksi (axial stretching), oren menunjukkan kawasan putaran pantas, biru muda menunjukkan kawasan perlahan. Pusat pusaran makin mengecil dengan lebih pantas, halaju tidak terbatas tetapi tenaga keseluruhan terhad.

Seluruh proses ini meniru dengan sempurna cara kerja institut penyelidikan terkemuka manusia.

Hasil yang dihasilkan oleh mesin dalam 88 jam memerlukan manusia untuk mengesahkan selama bertahun-tahun

Dalam dunia manusia, status Navier-Stokes masih "tidak terselesaikan".

Medal Fields

Menurut peraturan Hadiah Milenium, satu penyelesaian mesti terlebih dahulu diterbitkan di saluran yang layak, kemudian menunggu sekurang-kurangnya dua tahun, dan mendapat penerimaan umum daripada komuniti matematik global, sebelum Clay akan memulakan tinjauan rasmi.

Ketua Clay, Martin Bridson, berkata kepada AFP bahawa proses penilaian itu "sengaja tidak dipercepat" dan mesti "mutlak ketat". OpenAI sendiri juga menyatakan tidak berniat untuk mengklaim hadiah 1 juta dolar AS itu.

Oleh itu, pernyataan yang paling tepat mengenai perkara ini ialah: OpenAI mengumumkan penyelesaian bagi satu set masalah milenium, menyatakan bahawa ia telah selesai dengan pengesahan formal Lean, tetapi belum mendapat pengesahan bebas daripada komuniti matematik.

Hasil generasi mesin, 88 jam. Hasil pengesahan manusia, sekurang-kurangnya dua tahun. Ini mungkin merupakan perbezaan paling mencolok dalam matematik AI minggu ini.

Ini bukan bererti pengesahan manusia terlalu perlahan. Masalahnya ialah mesin mempercepatkan "penemuan" beberapa ratus kali ganda, tetapi "pemahaman" manusia tidak ikut dipercepatkan.

Jadi, soalan sebenarnya ialah, apabila mesin mula menghasilkan pengetahuan secara berterusan dengan kadar "satu keputusan besar setiap beberapa hari", siapakah yang akan melakukan pembacaan, pemeriksaan, penjelasan, penyederhanaan, dan penyerapan selama bertahun-tahun bahkan puluhan tahun seterusnya?

Sistem tanda tangan pertama kali membentur dinding

Pada hari keputusan Navier-Stokes diumumkan, komuniti matematik bergoncang.

Ahli matematik NYU, Tristan Buckmaster, dan Levent Alpöge yang bekerja di Anthropic, sebenarnya juga terus menyelidiki persamaan aliran yang berkaitan sepanjang bulan Ogos.

Menurut rekaan daripada The New York Times, cara kedua-dua orang ini bekerja adalah seperti berikut:

Buckmaster mengemukakan soalan, Alpöge meneruskan soalan tersebut kepada model dalaman Anthropic; selepas model menghasilkan output, kedua-duanya menyesuaikan soalan berdasarkan output dan terus memasukkan data semula.

Menurut Buckmaster, selepas kejadian, OpenAI mengusulkan beberapa cadangan penenang: membenarkannya menerbitkan keputusannya sendiri terlebih dahulu, menjadikannya penulis pertama pada kertas kerja OpenAI, dan menyediakan kuasa pengiraan untuk melanjutkan penyelidikannya.

Tetapi halangan terbesar ialah: OpenAI tidak mahu Levent muncul dalam kertas kerja itu.

Medal Fields

Papan hitam menunjukkan garis masa kemajuan Buckmaster dan Alpöge sepanjang Ogos: Persamaan Euler pada 15 Ogos, formalisasi Lean pada 22 Ogos, 31 Ogos... serta nama rakan sekerja seperti Figalli dan Hairer.

Dalam bisnis, mengapa projek dalaman OpenAI yang menghabiskan banyak dana perlu menyertakan nama kakitangan pesaing Anthropic?

Selepas itu, perkara itu terus meluas kepada topik yang lebih sensitif. Buckmaster telah menggunakan Codex selama beberapa bulan terakhir untuk mengatur draf matematik yang dihasilkan oleh AI.

Jadi, adakah kemungkinan bahawa idea penyelidikan eksklusif yang dimasukkan olehnya tetapi belum diumumkan, Codex, telah menjadi bahan baku untuk model penyelidikan OpenAI sendiri melalui saluran data rahsia?

Buckmaster mengakui sendiri tidak ada bukti, tetapi menurutnya, garis masa peristiwa dan jalan bukti OpenAI semuanya mengisyaratkan hal ini.

OpenAI pada 10 September mengeluarkan pengumuman darurat yang menyatakan bahawa setelah menyelidiki secara menyeluruh, petikan Codex milik Buckmaster dalam dua bulan terakhir tidak mungkin mempengaruhi model dalaman ini melalui latihan atau cara apa pun.

Siapa yang betul dan siapa yang salah, di sini sementara menjadi satu kekacauan, tetapi apa yang benar-benar diungkapkannya ialah satu set soal-soal yang sebelum ini tidak pernah dijawab dengan serius:

Adakah petunjuk peribadi seseorang dianggap sebagai bahan penyelidikan yang dilindungi?

Bolehkah nama pekerja syarikat pesaing disenaraikan sebagai penulis dalam projek penyelidikan yang dibiayai secara dalaman oleh syarikat?

Jika model merujuk kepada jumlah besar bahan awam, bagaimanakah batas antara sumbangan baharu dan kerja sedia ada ditentukan?

Peter Sarnak dari Institut Penyelidikan Lanjutan Princeton berkata kepada The New York Times: "Perjanjian seperti ini, saya belum pernah dengar seumur hidup saya."

Peraturan akademik yang telah terkumpul selama berhampiran seratus tahun dalam dunia matematik tidak pernah direka untuk menyediakan penghalang terhadap kelajuan penghasilan mesin yang ganas ini.

25 perkara yang benar-benar dikhawatirkan oleh penerima Medali Fields

Satu hari kemudian, 25 penerima Anugerah Fields mengeluarkan satu penyataan besar.

Terence Tao, Peter Scholze, James Maynard, Maryna Viazovska…… otak paling cemerlang di kalangan dunia matematik hampir kesemuanya turut serta.

Medal Fields

Pernyataan ini bukanlah apa-apa "manuskrip anti-AI".

Sebenarnya, Terence Tao sendiri terus berusaha secara aktif menggunakan AI untuk membantu penyelidikan matematik.

Selain itu, penyataan itu juga mengakui bahawa AI memang berpotensi mempercepat pemahaman matematik yang sebenar.

Yang benar-benar mereka benci ialah menganggap "menyelesaikan soalan" secara langsung sebagai matematik; dalam kalangan komuniti AI yang sedang gila sekarang, syarikat AI sedang bersikap tergesa-gesa untuk menjadikan "menyelesaikan soalan terkenal" sebagai sasaran pengoptimuman tertinggi demi harga saham dan pemasaran.

Dalam pandangan mereka, masalah Hadiah Milenium hanyalah alat penilaian untuk membuktikan seberapa hebat model tersebut.

Namun, nilai sebenar matematik terletak pada penciptaan kaedah dan konsep baru semasa proses penyelesaian masalah yang membosankan, yang akhirnya menjadi sistem pengetahuan bersama umat manusia.

Sekarang, syarikat AI terus-menerus mengeluarkan keputusan mengejutkan, sehingga cepat sehingga tiada siapa yang sempat mencerna. Rantai yang telah berlangsung ribuan tahun ini boleh putus kapan saja.

Surat bersama itu juga menekankan bahawa keputusan dikeluarkan terlalu pantas, sehingga jawapan-jawapan ini tidak sempat membezakan dengan jelas antara idea-idea baharu dengan yang dibina di atas karya orang sebelumnya, yang pasti akan membawa kekeliruan serius dalam pengesahan dan pengiktirafan.

Mengapa satu terobosan matematik dikaitkan dengan "amaran akhir zaman"?

Yang benar-benar menjadi perhatian orang biasa bukanlah "AI melebihi ahli matematik".

Kepantasan mesin mencipta pengetahuan, untuk pertama kalinya, melampaui kecepatan manusia mengesahkan, mengaitkan, dan mencerna pengetahuan.

Ini bukan sekadar penghinaan, sistem GPT-6 Astra secara jelas menyatakan ia adalah model pertama OpenAI yang mencapai ambang «Critical» dalam keselamatan siber, dengan skor 100% di ExploitBench.

Kemampuan organisasi untuk menyelesaikan masalah milenium, kemampuan serangan kelemahan zero-day, dan penalaran yang lebih sukar dilihat—ketiga-tiganya ada secara serentak dalam model yang sama.

Di akhir pengumuman Navier-Stokes, OpenAI juga menyatakan:

Seterusnya, mereka perlu memahami model baharu ini terlebih dahulu sebelum memutuskan seberapa pantas untuk meneruskan, dan mungkin perlu membuat pilihan yang lebih berhati-hati terhadap kelajuan kemajuan.

Ya, syarikat AI yang baru saja menyerahkan jawapan kepada masalah milenium secara aktif membincangkan perlambatan.

Cohen juga menyebutkan satu perkara di akhir kolom.

Bulan lepas, OpenAI mengundang sekumpulan ahli matematik terkemuka ke pejabatnya di San Francisco untuk pertemuan tertutup, mengandaikan bahawa AI akhirnya akan melampaui manusia dalam matematik, kemudian membincangkan bagaimana pendidikan, kerjasama penyelidikan, penerbitan kertas kerja, dan bagaimana membangunkan ahli matematik generasi seterusnya.

Medal Fields

Bercakap sepanjang hari, tiada jawapan.

Soalan ini juga tidak boleh dikemas dan dihantar kepada Lean untuk pengesahan automatik.

Hanya manusia yang boleh menyelesaikannya.

Rujukan:

https://www.wsj.com/tech/ai/ai-math-millennium-prize-safety-openai-anthropic-05179825

https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=release-date

https://www.nytimes.com/2026/09/10/science/tristan-buckmaster-openai-math-navier-stokes.html?utm_source=chatgpt.com

https://www.daniellitt.com/blog/2026/8/11/the-end-of-mathematics/

Artikel ini berasal daripada公众号 WeChat "Sinzhiyuan", penulis: Apokalips ASI

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.