GPT-6 Astra Menyelesaikan Masalah Matematik Tahap 4

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto: GPT-6 Astra telah menyelesaikan masalah terakhir di FrontierMath Tier 4, menyelesaikan semua cabaran dalam tolok lanjutan. Dibangunkan oleh Epoch AI dengan lebih 60 ahli matematik, Astra mencapai ketepatan 97.6% dan memecahkan masalah terakhir yang belum diselesaikan. Projek ini kini berpindah ke fasa baharu dengan penyelidikan terbuka dan cabaran yang diformalkan, menandakan pengumuman penting dalam kemajuan AI.

Baru sahaja, soalan Tier 4 FrontierMath terakhir telah dipecahkan oleh GPT-6 Astra.

Sampai saat ini, semua soal dalam ujian peringkat penelitian yang dahulu dianggap sebagai mimpi buruk matematik model besar telah berjaya diselesaikan oleh AI sekurang-kurangnya sekali.

Epoch AI juga secara rasmi menyimpulkan bahawa FrontierMath Tier 4, telah jenuh.

FrontierMath

Walaupun dari gambar di atas kelihatan bahawa Astra belum mencapai 100% secara langsung, pencapaian yang dipaparkan oleh OpenAI sendiri ialah 97.6%.

Namun, mengikut algoritma Epoch, "semua diselesaikan" bermaksud bahawa setiap soalan dalam Tier 4 telah berjaya dijawab setelah menggabungkan percubaan dari model dan masa yang berbeza.

Dan yang dihancurkan oleh Astra ialah satu-satunya yang sebelum ini belum ditembus oleh AI.

(Maksudnya dengan mudah, Astra mungkin membuat kesilapan dalam satu ujian tertentu, tetapi soal yang dijawabnya dengan betul adalah soal yang sebelum ini belum diselesaikan)

FrontierMath

Sejujurnya, kelajuan perkembangan ini masih sangat luar biasa.

Jika anda mengikuti penilaian model, anda akan tahu bahawa pada 11 Julai 2025, semasa Tier 4 baru dilancarkan, pencapaian tertinggi di papan pemimpin hanyalah sekitar 5%.

Sekarang baru berlalu satu tahun dua bulan, "dinding tinggi" dahulu telah berubah menjadi "anak tangga", dan masalah terakhir yang sukar diselesaikan oleh AI melalui jalan pintas juga telah dilalui.

Penggubah soalan, Jay Pantone, pensyarah matematik di Universiti Marquette, juga menyatakan bahawa sebelum ini AI selalu mencari jalan pintas nombor, tetapi kali ini, penyelesaian AI sangat serupa dengan miliknya.

FrontierMath

Namun, baru-baru ini, GPT-6 Astra secara agresif menyerang dunia matematik, sering menyelesaikan masalah Milenium dalam tempoh tiga hari dua hari, Pantone menyatakan bahawa dirinya sudah sukar lagi terkejut!

Boleh dikatakan bahawa matematik telah menjadi salah satu tempat paling aktif di mana Astra menarik perhatian baru-baru ini.

Dari kurang daripada 2%, hingga menambahkan "pertahanan peringkat penyelidikan" khas

FrontierMath pertama kali dilancarkan pada 7 November 2024, dan tujuan penciptaannya adalah untuk mengelakkan benchmark matematik dirobohkan terlalu pantas oleh AI.

Pada masa itu, benchmark matematik tradisional seperti GSM8K dan MATH semakin sukar membezakan perbezaan di antara model teratas, oleh itu Epoch AI bekerjasama dengan lebih daripada 60 orang ahli matematik untuk merancang semula satu set soalan orisinal yang sebelum ini tidak pernah diumumkan.

Di antaranya termasuk Terence Tao, Timothy Gowers, Richard Borcherds, dan penerima Anugerah Fields lainnya.

Setelah membaca beberapa soal peringkat penyelidikan, Tao Zhexiong secara terus terang mengatakan bahawa soal-soal ini "sangat sukar", bahkan menilai bahawa soal Tier 3 yang paling sukar mungkin masih akan menghalang AI selama beberapa tahun lagi.

FrontierMath

Hasil ujian putaran pertama, seperti yang dijangka, ketepatan model terdepan kurang daripada 2%.

Secara khusus, pada awalnya, bank soal inti FrontierMath terdiri daripada 300 soal, yang dibahagikan kepada tiga tahap kesukaran: Tier 1, Tier 2, dan Tier 3.

FrontierMath

Tier 1 hampir setara dengan soalan sarjana tahap tinggi dan olimpiad matematik, tetapi membenarkan penggunaan alat yang lebih canggih; Tier 2 sudah mencapai tahap pascasiswazah tingkat tinggi; Tier 3 pula lebih dekat dengan soalan penyelidikan eksploratori yang biasa dihadapi oleh pelajar doktorat pada peringkat awal.

Namun, dengan munculnya model penalaran, tiga lapisan pertama mulai menjadi semakin tidak mencukupi, sehingga pada tahun 2025, Epoch menambahkan satu lapisan lagi, Tier 4.

Tahap 4 kebanyakannya direka oleh profesor matematik dan pasca-doktoral, di mana setiap orang akan menjalankan penyelidikan jangka pendek selama beberapa minggu berdasarkan arah penyelidikan masing-masing, kemudian meringkaskan hasilnya menjadi satu soalan yang boleh diverifikasi secara automatik.

FrontierMath

Pada mulanya, Tahap 4 merangkumi 50 soalan. Lingkungan yang dicakup termasuk analisis, teori nombor, matematik kombinatori, topologi, geometri algebra...

Pada awal pelancaran, kesemua ujian model sebelumnya hanya pernah menyelesaikan tiga soalan, dan penyelesaian ini bergantung kepada beberapa andaian yang betul tetapi tidak dibuktikan dengan cukup.

Mengingat ini, Epoch pernah menulis di halaman contoh soal rasmi laman web: beberapa soal mungkin tidak akan diselesaikan oleh AI selama puluhan tahun.

FrontierMath

(Sekarang kalimat ini akan terus dipersoalkan berulang-ulang)

Namun, seiring model menjadi semakin kuat, masalah lain juga muncul: bank soal itu sendiri mulai tidak mampu menahan "tekanan" AI.

OpenAI menemui lebih banyak ralat dalam FrontierMath semasa pengujian.

Selepas itu, Epoch memulakan audit bebas, mula-mula menggunakan GPT-5.5 dan Claude Opus 4.7 untuk menyaring titik-titik mencurigakan, kemudian menyerahkan kepada ahli matematik untuk semak semula setiap soalan. Akhirnya, versi v2 dilancarkan pada Jun 2026, di mana Tier 4 memperbaiki 12 soalan, menghapuskan 7 soalan, dan meninggalkan 43 soalan.

Selepas diperbaiki, prestasi model terus meningkat.

GPT-5.6 Sol mencapai 83.0%, Claude Fable 5 mencapai 90.2%, dan pada GPT-6 Astra, skor telah mencapai 97.6%.

FrontierMath

Lebih penting lagi, Astra juga menyelesaikan soal terakhir yang belum pernah dipecahkan oleh AI sebelumnya.

FrontierMath

Sampai sini, setiap soal dalam Tier 4 telah berjaya ditembus sekurang-kurangnya sekali oleh AI. Pertahanan peringkat penyelidikan yang khusus ditambahkan untuk model terkuat akhirnya juga dapat ditembus.

Namun, ini tidak bermakna bahawa "matematik telah diselesaikan oleh AI". Sebaliknya, FrontierMath sendiri telah beralih ke peringkat seterusnya.

Sekarang, selain Tiers 1-4, projek ini juga menambahkan Open Problems yang sebenarnya, serta membentuk masalah Erdős dalam bentuk Lean di FrontierMath Erdős.

FrontierMath

Yang pertama menguji model dengan soalan penyelidikan yang belum diselesaikan oleh komuniti matematik; yang kedua meminta AI menulis bukti penuh yang boleh melalui pengesahan formal.

Kali ini, Astra hanya menyelesaikan 2 daripada 68 soal FrontierMath Erdős.

Cerita masih berterusan~

Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: henry

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.