Keputusan Olimpiade Matematik Antarabangsa ke-67 (IMO2026) telah diumumkan, model besar Xiaohongshu dots-note-3.0 memenangi emas dengan skor sempurna, menjawab semua enam soalan dengan betul. Ini merupakan pengesahan emas rasmi IMO pertama oleh model besar China, serta model besar kedua di dunia selepas Google Gemini yang mencapai pencapaian ini—dan dengan skor sempurna, manakala Google sebelum ini hanya menjawab 5/6 soalan dengan betul. IMO dianggap sebagai ujian penting terhadap kecerdasan dan kemampuan penalaran model besar; peserta perlu menulis bukti yang logik dan lengkap, dengan tahap kesukaran yang sangat tinggi. Garis emas tahun ini ialah 29 markah, manakala dots-note-3.0 berbeza 13 markah daripada garis emas. Pemenang dua emas CMO menilai penyelesaian model ini sebagai "betul dan cantik, struktur padat, dan logik yang semulajadi." Pencapaian skor sempurna ini membuktikan bahawa Xiaohongshu telah memiliki kemampuan penalaran generik yang boleh dipindahkan, dengan munculnya pemain baru yang perlu diperhatikan dalam bidang model asas.Penulis artikel, sumber: Xiaohongshu
Keputusan Pertandingan Matematik Antarabangsa ke-67 (IMO2026) baru saja diumumkan, di mana model besar Xiaohongshu dots-note-3.0 memenangi pingat emas dengan skor sempurna, menjawab semua enam soalan dengan betul. Ini merupakan pengesahan rasmi tingkat pingat emas IMO pertama oleh model besar China, serta model besar kedua di dunia yang mencapai pencapaian ini selepas Google Gemini—dan dengan skor sempurna, manakala Google sebelum ini hanya menjawab 5/6 soalan dengan betul.
IMO ialah singkatan bagi Pertandingan Matematik Antarabangsa, yang menghimpunkan pelajar menengah terkemuka sedunia setiap tahun, dengan separuh daripada penerima Anugerah Fields semasa termasuk Terence Tao berasal daripada pertandingan ini. Pertandingan dijalankan selama dua hari, dengan 4.5 jam setiap hari untuk menyelesaikan tiga soalan, yang meliputi empat bidang: algebra, kombinatorik, geometri, dan teori nombor, dengan setiap soalan bernilai 7 markah dan jumlah maksimum 42 markah. Peserta mesti menulis bukti yang logik dan boleh diterima serta melalui pemeriksaan bertahap, yang merupakan cabaran besar bagi model besar.

Jalan Gemini Google untuk IMO boleh dijadikan rujukan: Pada cabaran pertama pada 2024, ia hanya memperoleh pingat perak 28 mata, dan perlu menterjemahkan soalan ke dalam bahasa formal seperti Lean, dengan sebahagian soalan mengambil berjam-jam; pada 2025, Gemini Deep Think berjaya menyelesaikan bukti secara end-to-end menggunakan bahasa semula jadi, menyelesaikan lima soalan dalam masa 4.5 jam untuk memenangi pingat emas. Pertandingan matematik dianggap sebagai ujian kecerdasan dan kemampuan penalaran model besar, manakala IMO mempunyai kelebihan unik berbanding Benchmark biasa—ketidaktahuan. Soalan setiap tahun dibuat oleh pakar dan dijaga kerahsiaan ketat, jadi model tidak boleh dilatih secara khusus terlebih dahulu, tetapi hanya bergantung pada pemahaman, eksplorasi, dan penalaran ketat secara semasa.
Garis emas IMO tahun ini ialah 29 markah, turun 6 markah berbanding 35 markah tahun lepas, menunjukkan kesukaran keseluruhan soalan jelas lebih tinggi daripada tahun lepas. 29 markah bermaksud menyelesaikan sepenuhnya 4 soalan dan mendapat 1 markah daripada 2 soalan yang tinggal untuk memasuki zon emas, manakala model besar Xiaohongshu dots-note-3.0 menjawab semua soalan dengan betul, tetapi masih berbeza 13 markah daripada garis emas.
Skor sempurna pertama-tama membuktikan kestabilan sistem penalaran Agentic. Model perlu memahami syarat bahasa semula jadi, menilai maklumat penting, mengemukakan kesimpulan sementara, dan menyusunnya menjadi bukti lengkap; sebarang salah baca syarat atau lompatan penalaran akan dikenal pasti secara langsung oleh pemeriksa. dots-note-3.0 memperoleh skor penuh secara berterusan dalam enam kategori soalan yang berbeza, bermakna prestasi ini bukan bergantung pada ilham kebetulan pada satu soalan tertentu. Kedua, model secara langsung memproses secara end-to-end menggunakan bahasa semula jadi, memiliki lingkaran tertutup penuh dari pemahaman soalan hingga ekspresi jawapan, yang menunjukkan ia memiliki kemampuan penalaran generik yang boleh dipindahkan.

Dalam proses menjawab soal secara terperinci, dots-note-3.0 menggunakan pendekatan agen, menggabungkan bahasa semula dan pelaksanaan kod Python untuk menarik kesimpulan, serta memanfaatkan kemampuan kritik diri berulang untuk menilai hujahnya sendiri. Yang benar-benar mengejutkan ialah soal ketiga—sebuah masalah permainan kombinatorial. Pendekatan biasa adalah menukar masalah asal kepada isu keterhubungan teori graf sebelum membina bukti, tetapi dots-note-3.0 menggunakan kaedah induksi, menangkap struktur paling asas masalah tersebut, dan merancang objek serta proposisi induksi yang tepat.
Liu Hanzuo, pemenang emas CMO, menilainya "tepat dan indah, strukturnya padat dan logikanya alami, bahkan jika diletakkan dalam solusi IMO, ia termasuk salah satu yang paling ringkas dan elegan." Wang Qiantong, pemenang emas CMO, berpendapat ia "ringkas dan jelas, langsung menyentuh inti masalah, setiap langkahnya logis, tetapi sulit bagi peserta manusia untuk memikirkan pendekatan dari sudut ini."
Bagi Xiaohongshu, skor sempurna IMO merupakan penampilan teknikal yang penting. Sebelum ini, persepsi luar terhadap teknologi mereka terfokus pada komuniti kandungan, algoritma cadangan, dan pemahaman kandungan, dengan tiada bukti rasmi yang tersedia mengenai kedudukan mereka dalam bidang model asas. Skor sempurna IMO berbeza—42 markah itu sendiri sudah cukup, tanpa perlu penjelasan rumit, untuk membuktikan bahawa Xiaohongshu kini memiliki kemampuan model asas yang patut dipertimbangkan secara serius oleh industri, dan munculnya pemain baru yang perlu diperhatikan dalam bidang model asas. Dilaporkan, dots-note-3.0 akan segera dibuka sumber.
