Model AI Global Mendominasi IMO 2026 dengan Skor Sempurna

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto meledak apabila empat model AI—Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3, dan AxiomProver—mendapat skor 42/42 di IMO 2026, mengungguli 99% peserta manusia. Hanya 30 manusia yang pernah mencapai skor sempurna dalam tujuh tahun. Axiom Math menerjemahkan soal-soal ke dalam Lean 4 untuk penilaian automatik. Kos berkisar antara $0.18 hingga $51. Perbincangan dasar kripto global mungkin segera memasukkan peranan AI dalam matematik dan logik.

Julai di Shanghai, gelombang panas melanda.

Olimpiad Matematik Antarabangsa ke-67 telah berakhir secara rasmi, dengan pasukan China memenangi gelaran dengan 232 mata. Tiga remaja meraih skor sempurna 42 mata.

Axiom Math

Tepukan tangan di tempat kejadian masih belum reda, ketika senarai pencapaian menarik lain muncul secara diam-diam di GitHub.

Ex-kejuruteraan Google, Deedy Das, mengeluarkan ulasan AI sebanding: 7 model besar terkini, bersaing secara mandiri terhadap semua 6 soalan IMO 2026.

Claude Fable 5 memperoleh skor sempurna 42. Hanya mengambil masa 2.5 jam dan menghabiskan $51.

Versi xhigh GPT-5.6 Sol juga mendapat skor sempurna. Masa yang diambil ialah 3.8 jam, dan kosnya diturunkan ke tahap rendah iaitu 20 dolar AS.

Kimi K3 menyusul dengan mendapat skor sempurna. Setelah bertarung selama 17.4 jam, menghabiskan USD31.

Termasuk AxiomProver yang menghantar jawapan secara berasingan, keempat-empat pihak telah mencapai skor sempurna.

Axiom Math

Sebagai perbandingan, dalam tujuh tahun terakhir IMO, daripada 4,347 peserta manusia, hanya 30 orang yang mendapat skor sempurna—peratusan 0.69%.

Axiom Math

Menang telak secara drastis

Dari hasilnya, tidak hanya terdapat jurang 14 poin antara skor sempurna 42 dan peringkat keempat dengan 28, tetapi ketiga model dengan skor sempurna juga mencapai puncak dengan cara yang berbeza.

Claude Fable 5 berprestasi cemerlang. 9 sesi perbualan, 6 sesi menghasilkan output yang berkesan, output terpanjang satu sesi ialah 73 minit (P3), dengan jumlah output keseluruhan 700,000 token.

GPT-5.6 Sol kelihatan agak bermasalah. Di P2, ia menghabiskan 106 minit untuk menjalankan 4 pusingan, tetapi terganggu dua kali akibat gangguan rangkaian. Namun, pengawasan kuasa pengiraan luar biasa—jumlah output hanya 230,000 token, paling hemat di antara tiga skor sempurna.

Kimi K3 seperti seekor raksasa yang tidak pernah lelah. Model MoE dengan 2.8 triliun parameter menghasilkan 1.54 juta token sekaligus, 6.5 kali ganda Sol. Hanya satu soal P3 saja telah memicu 6 serangan, berperang selama 491 minit.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Perlanggaran langsung intuisi matematik

P1 adalah pembuka paling lembut di seluruh arena, semua model selesai dalam beberapa minit, dan peserta manusia hampir tidak ada yang gagal.

Soalan ini bermaksud: Terdapat 2026 nombor bulat positif yang lebih besar daripada 1 ditulis di papan hitam. Pada setiap langkah, pilih dua nombor m dan n, hapuskan mereka, dan gantikan dengan gcd(m,n) dan lcm(m,n)/gcd(m,n). Ulangi proses ini sehingga tidak boleh diteruskan lagi. Buktikan: (a) Proses ini pasti berakhir, dan akhirnya hanya tinggal satu nombor M yang lebih besar daripada 1; (b) Nilai M tidak bergantung pada urutan operasi.

Axiom Math

Untuk memudahkan pemahaman soal ini, mari kita lakukan satu eksperimen kecil.

Papan tulis hanya mempunyai 12 dan 18. 12 = 2² × 3, 18 = 2 × 3². Langkah pertama: gcd(12,18) = 6, lcm(12,18)/6 = 6, papan tulis menjadi [6, 6]. Langkah kedua: gcd(6,6) = 6, lcm(6,6)/6 = 1, papan tulis menjadi [6, 1]. Hanya tinggal satu nombor yang lebih besar daripada 1, permainan berakhir. M = 6.

Tidak kira bagaimana anda mengubah urutan operasi, M sentiasa 6. Mengapa?

Jawapannya tersembunyi dalam faktor perdana.

Untuk setiap nombor perdana p, ambil pembahagi terbesar bersama bagi semua nombor yang dibahagi oleh p, kemudian darabkan semua kuasa nombor perdana tersebut—nilai ini tetap tidak berubah dari langkah pertama hingga langkah terakhir.

Claude Fable 5: Mencipta pengira yang pasti menyusut pada setiap langkah.

Untuk soal ini, Fable 5 mentakrifkan kuantiti Φ = T + N. T ialah jumlah faktor perdana semua nombor di papan hitam (dikira berulang), dan N ialah bilangan nombor yang lebih besar daripada 1. Sebagai contoh, papan hitam [12, 18], faktor perdana 12 ialah 2, 2, 3 (jumlah 3), faktor perdana 18 ialah 2, 3, 3 (jumlah 3), maka T = 6, N = 2, Φ = 8.

Kemudian ia membuktikan: setiap langkah operasi, Φ sekurang-kurangnya berkurang 1. Terdapat dua kes—jika gcd(m,n) > 1, jumlah faktor perdana T berkurang; jika gcd(m,n) = 1, T tidak berubah tetapi nombor yang lebih besar daripada 1 berkurang satu, N berkurang 1. Φ adalah integer positif, setiap langkah sekurang-kurangnya berkurang 1, proses mesti berakhir dalam langkah terhingga. Satu pengiraan tunggal, memotong habis.

Axiom Math

GPT-5.6 Sol: Melacak produk, dimensi leksikografik menurun.

Sol memperhatikan dua kuantiti: P = hasil darab semua nombor, K = bilangan nombor yang lebih besar daripada 1. Dalam setiap operasi, jika gcd(m,n) = d > 1, hasil darab dua nombor baru ialah mn/d, yang lebih kecil daripada sebelumnya, menjadikan hasil darab global P berkurang secara ketat. Jika d = 1, P tidak berubah, tetapi K berkurang sebanyak 1.

Pasangan (P, K) menurun secara ketat dalam urutan leksikografik: sama ada P berkurang, atau P tetap sama tetapi K berkurang. Urutan leksikografik bagi nombor bulat positif tidak mungkin menurun tanpa hingga. Tamat.

Axiom Math

Dua lintasan yang sangat berbeza telah menyelesaikan bahagian (a) masalah yang sama.

Pada bahagian (b), ketiga-tiga model bermuara pada satu kesimpulan: semuanya membuktikan bahawa GCD bagi bilangan kali pembahagian setiap nombor perdana p pada papan hitam tetap tidak berubah semasa operasi. Formula akhirnya juga sama persis—

Axiom Math

Kembali kepada contoh pengiraan: 12 dan 18. Untuk p=2, v₂(12) = 2, v₂(18) = 1, gcd = 1, sumbangan 2¹. Untuk p=3, v₃(12) = 1, v₃(18) = 2, gcd = 1, sumbangan 3¹. M = 2 × 3 = 6, sepadan tepat dengan pengiraan tangan.

Kertas putih termurah di seluruh pasaran

Soalan teori nombor P6 ialah soalan terakhir Hari 2, yang memerlukan pembuktian bahawa jujukan berulang akhirnya bersifat berkala.

Tahun lalu, hanya 6 orang manusia di seluruh dunia yang menyelesaikan P6 di IMO 2025.

Claude Fable 5: 26 minit, dua pusingan, skor sempurna. GPT-5.6 Sol: 60 minit, dua pusingan, skor sempurna. Kimi K3: 381 minit, empat pusingan, skor sempurna.

Grok 4.5 hanya menghasilkan 7053 token di P6, berada di posisi terbawah. Fail penghantaran secara jelas menyatakan: Full proof: (Belum selesai.)

$0.18, kertas putih termurah di seluruh platform.

Masalah Grok tidak berhenti di sini. Sepanjang ujian, ia berulang kali terperangkap dalam ilusi aneh: dengan yakin menyatakan "bukti telah ditulis ke fail", tetapi di latar belakang, alat penulisan sama sekali tidak disentuh.

Ini bukan masalah kemampuan matematik, tetapi masalah kemampuan agen. Model tahu ia harus menulis fail dan mengaku telah menulisnya, tetapi pada tahap pemanggilan alat, ia tidak bertindak.

Lompatan tiga tahap dalam tiga tahun

Evolusi menakutkan otak silikon

Pada tahun 2024, AlphaProof dari DeepMind pertama kali mencapai ambang perak di aras IMO.

Pada tahun 2025, OpenAI dan DeepMind bertindak serentak. OpenAI tanpa mengumumkan modelnya menyelesaikan 5 soalan dan memenangi emas 35 mata, sementara Gemini Deep Think mencapai peringkat yang sama.

Pada tahun 2026, tiga model besar universal secara langsung mendapat skor sempurna. Kali ini, tidak ada latihan matematik khusus yang dilakukan, dan semua orang boleh menggunakannya. Bahkan, satu daripadanya adalah sumber terbuka.

Axiom Math

Penulis surat cabaran mesin

Titik permulaan ujian keseluruhan ialah sebuah syarikat bernama Axiom Math.

Mereka menerjemahkan keenam-enam soal IMO 2026 secara perkata demi perkata ke dalam bentuk formal Lean 4 yang boleh difahami oleh mesin.

Dengan set soal yang boleh dibaca mesin ini, AI boleh terus menghasilkan bukti Lean dan dinilai secara automatik oleh kompilator, tanpa memerlukan penilai manusia.

Setelah menerima soal, Deedy Das dengan cepat membina kerangka ujian automatik sepenuhnya. Model-model utama berlari pantas di lintasan, menyelesaikan semua enam tahap. AxiomProver juga berjaya mencapai skor sempurna secara berasingan.

Perlu ditekankan bahawa pendiri Axiom Math, Hong Letong, baru berusia 25 tahun. Beliau dilahirkan di Guangzhou dan hanya memerlukan tiga tahun untuk meraih ijazah ganda dalam matematik dan fizik dari MIT, serta menjadi penerima Morgan Prize.

Pada akhir tahun lalu, AxiomProver yang dia ciptakan sendiri meraih skor sempurna dalam Pertandingan Matematik Putnam. Ini merupakan keajaiban skor sempurna yang keenam dalam sejarah 98 tahun pertandingan tersebut.

Pada Mac tahun ini, syarikat ini menyelesaikan pendanaan Siri A sebanyak US$200 juta. Penilaian terus mencapai US$1.6 bilion.

Axiom Math

Bagaimana kehidupan orang biasa akan dibentuk semula

Mampu menulis model dengan 4229 baris bukti ketat, bukan sekadar memiliki kemampuan menyelesaikan soal matematika.

Ia benar-benar menguasai penalaran logik rantai panjang, di mana setiap langkah tidak boleh dilompati, tidak boleh salah, dan tidak boleh kabur.

Adakah lubang dalam syarat kontrak, adakah syarat tuntutan insurans terpenuhi, adakah pelan cukai selaras dengan peraturan—semuanya, setelah dilihat lebih mendalam, adalah jenis masalah yang sama: jawapannya tidak boleh “hampir betul”.

Dahulu, pemeriksaan satu-satu ini hanya boleh dilakukan oleh profesional dan dikenakan caj mengikut jam.

Sekarang, dengan kemampuan ini diintegrasikan ke dalam produk konsumer, anda hanya perlu membuka telefon bimbit apabila menghadapi masalah yang sukar.

Rujukan:

https://x.com/deedydas/status/2079409461874332066

Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: ASI Revelation, penyunting: Musa

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.