Baru sahaja, soalan Tier 4 FrontierMath terakhir telah dipecahkan oleh GPT-6 Astra.
Sampai saat ini, semua soal dalam ujian peringkat penelitian yang dahulu dianggap sebagai mimpi buruk matematik model besar telah berjaya diselesaikan oleh AI sekurang-kurangnya sekali.
Epoch AI juga secara rasmi menyimpulkan bahawa FrontierMath Tier 4, telah jenuh.

Walaupun dari gambar di atas kelihatan bahawa Astra belum mencapai 100% secara langsung, pencapaian yang dipaparkan oleh OpenAI sendiri ialah 97.6%.
Namun, mengikut algoritma Epoch, "semua diselesaikan" bermaksud bahawa setiap soalan dalam Tier 4 telah berjaya dijawab setelah menggabungkan percubaan dari model dan masa yang berbeza.
Dan yang dihancurkan oleh Astra ialah satu-satunya yang sebelum ini belum ditembus oleh AI.
(Maksudnya dengan mudah, Astra mungkin membuat kesilapan dalam satu ujian tertentu, tetapi soal yang dijawabnya dengan betul adalah soal yang sebelum ini belum diselesaikan)

Sejujurnya, kelajuan perkembangan ini masih sangat luar biasa.
Jika anda mengikuti penilaian model, anda akan tahu bahawa pada 11 Julai 2025, semasa Tier 4 baru dilancarkan, pencapaian tertinggi di papan pemimpin hanyalah sekitar 5%.
Sekarang baru berlalu satu tahun dua bulan, "dinding tinggi" dahulu telah berubah menjadi "anak tangga", dan masalah terakhir yang sukar diselesaikan oleh AI melalui jalan pintas juga telah dilalui.
Penggubah soalan, Jay Pantone, pensyarah matematik di Universiti Marquette, juga menyatakan bahawa sebelum ini AI selalu mencari jalan pintas nombor, tetapi kali ini, penyelesaian AI sangat serupa dengan miliknya.

Namun, baru-baru ini, GPT-6 Astra secara agresif menyerang dunia matematik, sering menyelesaikan masalah Milenium dalam tempoh tiga hari dua hari, Pantone menyatakan bahawa dirinya sudah sukar lagi terkejut!
Boleh dikatakan bahawa matematik telah menjadi salah satu tempat paling aktif di mana Astra menarik perhatian baru-baru ini.
Dari kurang daripada 2%, hingga menambahkan "pertahanan peringkat penyelidikan" khas
FrontierMath pertama kali dilancarkan pada 7 November 2024, dan tujuan penciptaannya adalah untuk mengelakkan benchmark matematik dirobohkan terlalu pantas oleh AI.
Pada masa itu, benchmark matematik tradisional seperti GSM8K dan MATH semakin sukar membezakan perbezaan di antara model teratas, oleh itu Epoch AI bekerjasama dengan lebih daripada 60 orang ahli matematik untuk merancang semula satu set soalan orisinal yang sebelum ini tidak pernah diumumkan.
Di antaranya termasuk Terence Tao, Timothy Gowers, Richard Borcherds, dan penerima Anugerah Fields lainnya.
Setelah membaca beberapa soal peringkat penyelidikan, Tao Zhexiong secara terus terang mengatakan bahawa soal-soal ini "sangat sukar", bahkan menilai bahawa soal Tier 3 yang paling sukar mungkin masih akan menghalang AI selama beberapa tahun lagi.

Hasil ujian putaran pertama, seperti yang dijangka, ketepatan model terdepan kurang daripada 2%.
Secara khusus, pada awalnya, bank soal inti FrontierMath terdiri daripada 300 soal, yang dibahagikan kepada tiga tahap kesukaran: Tier 1, Tier 2, dan Tier 3.

Tier 1 hampir setara dengan soalan sarjana tahap tinggi dan olimpiad matematik, tetapi membenarkan penggunaan alat yang lebih canggih; Tier 2 sudah mencapai tahap pascasiswazah tingkat tinggi; Tier 3 pula lebih dekat dengan soalan penyelidikan eksploratori yang biasa dihadapi oleh pelajar doktorat pada peringkat awal.
Namun, dengan munculnya model penalaran, tiga lapisan pertama mulai menjadi semakin tidak mencukupi, sehingga pada tahun 2025, Epoch menambahkan satu lapisan lagi, Tier 4.
Tahap 4 kebanyakannya direka oleh profesor matematik dan pasca-doktoral, di mana setiap orang akan menjalankan penyelidikan jangka pendek selama beberapa minggu berdasarkan arah penyelidikan masing-masing, kemudian meringkaskan hasilnya menjadi satu soalan yang boleh diverifikasi secara automatik.

Pada mulanya, Tahap 4 merangkumi 50 soalan. Lingkungan yang dicakup termasuk analisis, teori nombor, matematik kombinatori, topologi, geometri algebra...
Pada awal pelancaran, kesemua ujian model sebelumnya hanya pernah menyelesaikan tiga soalan, dan penyelesaian ini bergantung kepada beberapa andaian yang betul tetapi tidak dibuktikan dengan cukup.
Mengingat ini, Epoch pernah menulis di halaman contoh soal rasmi laman web: beberapa soal mungkin tidak akan diselesaikan oleh AI selama puluhan tahun.

(Sekarang kalimat ini akan terus dipersoalkan berulang-ulang)
Namun, seiring model menjadi semakin kuat, masalah lain juga muncul: bank soal itu sendiri mulai tidak mampu menahan "tekanan" AI.
OpenAI menemui lebih banyak ralat dalam FrontierMath semasa pengujian.
Selepas itu, Epoch memulakan audit bebas, mula-mula menggunakan GPT-5.5 dan Claude Opus 4.7 untuk menyaring titik-titik mencurigakan, kemudian menyerahkan kepada ahli matematik untuk semak semula setiap soalan. Akhirnya, versi v2 dilancarkan pada Jun 2026, di mana Tier 4 memperbaiki 12 soalan, menghapuskan 7 soalan, dan meninggalkan 43 soalan.
Selepas diperbaiki, prestasi model terus meningkat.
GPT-5.6 Sol mencapai 83.0%, Claude Fable 5 mencapai 90.2%, dan pada GPT-6 Astra, skor telah mencapai 97.6%.

Lebih penting lagi, Astra juga menyelesaikan soal terakhir yang belum pernah dipecahkan oleh AI sebelumnya.

Sampai sini, setiap soal dalam Tier 4 telah berjaya ditembus sekurang-kurangnya sekali oleh AI. Pertahanan peringkat penyelidikan yang khusus ditambahkan untuk model terkuat akhirnya juga dapat ditembus.
Namun, ini tidak bermakna bahawa "matematik telah diselesaikan oleh AI". Sebaliknya, FrontierMath sendiri telah beralih ke peringkat seterusnya.
Sekarang, selain Tiers 1-4, projek ini juga menambahkan Open Problems yang sebenarnya, serta membentuk masalah Erdős dalam bentuk Lean di FrontierMath Erdős.

Yang pertama menguji model dengan soalan penyelidikan yang belum diselesaikan oleh komuniti matematik; yang kedua meminta AI menulis bukti penuh yang boleh melalui pengesahan formal.
Kali ini, Astra hanya menyelesaikan 2 daripada 68 soal FrontierMath Erdős.
Cerita masih berterusan~
Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: henry
