Ang mga global na AI model ay nagdomina sa IMO 2026 na may perfectong puntos

icon MarsBit
I-share
AI summary iconSummary
Nabroke ang balita tungkol sa AI + crypto nang makamit ng apat na AI model—Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3, at AxiomProver—ang perfektong skor na 42/42 sa 2026 IMO, na higit sa 99% ng mga human na kalahati. Tanging 30 na tao lamang ang nakamit ang perfektong skor sa loob ng pitong taon. Ang Axiom Math ay isinalin ang mga problema sa Lean 4 para sa automated na pag-skor. Ang gastos ay nagsimula mula sa $0.18 hanggang $51. Maaaring isama na ng mga pag-uusap tungkol sa pandaigdigang polisiya sa crypto ang papel ng AI sa matematika at lohika.

Hulyo sa Shanghai, mainit at malakas ang alon ng init.

Nagwakas na ang 67th International Mathematical Olympiad, kung saan ang timog Tsina ay nakuha ang unang puwesto sa pamamagitan ng 232 puntos. Tatlong kabataan ang nakakuha ng perfektong 42 puntos.

Axiom Math

Hindi pa naglaho ang mga aplawdo sa lugar, kumalat naman sa GitHub ang isang iba pang nakakatangi na resulta.

Inilabas ni Deedy Das, dating engineer ng Google, isang komprehensibong paghahambing ng AI: 7 na advanced na malalaking modelo, nag-iisa at awtomatikong sinagot ang lahat ng 6 na tanong sa IMO 2026.

Kinuha ni Claude Fable 5 ang perfect score na 42 puntos. Nag-trabaho lamang sa loob ng 2.5 oras at nag-spent ng $51.

Ang xhigh version ng GPT-5.6 Sol ay parehong perfect. Nagsakop ng 3.8 na oras, at ang gastos ay napababa sa napakababang $20.

Kimi K3 ay sumunod at nakakuha ng perfekto. Pagkatapos ng 17.4 na oras ng pakikidigma, nagastos ng $31.

Kasama na ang independent submission na AxiomProver, lahat ng apat na puwersa ay nakamit ang perfect score.

Axiom Math

Para sa paghahambing, sa nakaraang pitong taon ng IMO, sa 4,347 na human na kalahok, only 30 ang nakakuha ng perfect score—0.69%.

Axiom Math

Nakalampas nang malaki ang marka

Mula sa mga resulta, hindi lamang mayroong 14-point na agwat sa pagitan ng perfect score na 42 at ikaapat na lugar na 28, kundi iba-iba rin ang paraan kung paano umabot sa puncyo ng tatlong modelo na nakakuha ng perfect score.

Ang Claude Fable 5 ay nagtatampok ng malinaw at maayos na pagganap. 9 na sesyon ng usapan, 6 na may epektibong output, pinakamahabang iisang pagkakataon ay 73 minuto (P3), kabuuang output ay 700,000 na token.

Ang GPT-5.6 Sol ay tila may ilang hamon. Sa P2, nagtrabaho ito ng 106 minuto para sa 4 round, na pinagdadaanan ng dalawang pagkakasira ng network. Ngunit ang pagkontrol sa computing power ay kahanga-hanga—ang kabuuang output ay lamang 230,000 na token, pinakamaliit sa tatlong perfect score.

Kimi Ang K3 ay parang isang hindi nakakapagpahinga na kalakal. Ang MoE model na may 2.8 trilyong parameter ay naglabas ng 1.54 milyong token nang iisa, na 6.5 beses ang dami ng Sol. Ang isang tanong lamang ng P3 ay nag-umpisa ng 6 pag-atake, at nagtagal ng 491 minuto.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Direct confrontation of mathematical intuition

Ang P1 ay ang pinakamababaw na appetizer sa buong palabas, na natatapos ng lahat ng modelo sa ilang minuto, at halos walang pagkakamali sa mga human na manlalaro.

Ang pangunahing ideya ay: Isinulat sa pader ang 2,026 na positibong buong bilang na mas malaki kaysa sa 1. Sa bawat hakbang, piliin ang dalawang bilang na m at n, tanggalin sila, at palitan ng gcd(m,n) at lcm(m,n)/gcd(m,n). Ulitin ang proseso hanggang hindi na maaaring patuloy. Patunayan na: (a) ang proseso ay tiyak na tatapos, at sa wakas ay mayroon lamang isang bilang na M na mas malaki kaysa sa 1; (b) ang halaga ng M ay hindi nakadepende sa pagkakasunod-sunod ng mga operasyon.

Axiom Math

Para mas madaling maintindihan ang tanong na ito, unang gawin natin ang isang maliit na eksperimento.

Ang mga numero sa pinto ay 12 at 18 lamang. 12 = 2² × 3, 18 = 2 × 3². Unang hakbang: gcd(12,18) = 6, lcm(12,18)/6 = 6, ang pinto ay naging [6, 6]. Ikalawang hakbang: gcd(6,6) = 6, lcm(6,6)/6 = 1, ang pinto ay naging [6, 1]. Natitira na lamang ang isang numero na higit sa 1, kaya tumigil na ang laro. M = 6.

Anuman ang pagkakasunod-sunod ng iyong mga aksyon, ang M ay laging 6. Bakit?

Ang sagot ay nakatago sa mga prime factor.

Para sa bawat prime na p, kunin ang pinakamalaking karaniwang dibisor ng bilang ng beses na hinahati ng p, at pagkatapos ay i-multiply ang mga potensya ng prime na ito—ang halagang ito ay patuloy na nagiging pareho mula sa unang hakbang hanggang sa huling hakbang.

Claude Fable 5: Direktang nilikha ang isang counter na laging bumababa sa bawat hakbang.

Para sa tanong na ito, tinukoy ng Fable 5 ang isang halagang Φ = T + N. Ang T ay ang kabuuang bilang ng mga primong faktor ng lahat ng mga numero sa board (na binibilang nang paulit-ulit), habang ang N ay ang bilang ng mga numero na mas malaki sa 1. Halimbawa, sa board [12, 18], ang mga primong faktor ng 12 ay 2, 2, 3 na may kabuuang 3, at ang mga primong faktor ng 18 ay 2, 3, 3 na may kabuuang 3, kaya T = 6, N = 2, at Φ = 8.

Atin ito ay patotoo: bawat hakbang, bumababa ang Φ ng hindi bababa sa 1. Dalawang kaso: kung ang gcd(m,n) > 1, bumababa ang kabuuang bilang ng mga prime factor T; kung ang gcd(m,n) = 1, nananatili ang T ngunit bumababa ang bilang ng mga numero na higit sa 1, kaya bumababa ang N ng 1. Ang Φ ay isang positive integer, at bawat hakbang ay bumababa ng hindi bababa sa 1, kaya dapat magwakas ang proseso sa limitadong bilang ng mga hakbang. Isang solong counter, isang malinaw na pagkakatigil.

Axiom Math

GPT-5.6 Sol: Tumutukoy sa produkto, pagsusuri sa leksikograpikong pagbaba.

Ang Sol ay tumitingin sa dalawang halaga: P = ang produkto ng lahat ng mga numero, K = ang bilang ng mga numero na mas malaki sa 1. Sa bawat hakbang, kung ang gcd(m,n) = d > 1, ang bagong produkto ng dalawang numero ay mn/d, na mas maliit kaysa sa orihinal, kaya ang pambuong produkto ay tumutuloy na bumababa. Kung ang d = 1, ang P ay hindi nagbabago, ngunit ang K ay bumababa ng 1.

Ang pares (P, K) ay stricly decreasing sa leksikograpikong pagkakasunod-sunod: o ang P ay bumababa, o ang P ay nananatili ngunit ang K ay bumababa. Ang leksikograpikong pagkakasunod-sunod ng mga positibong buong bilang ay hindi maaaring magpatuloy na bumaba nang walang hanggan. Katapusan.

Axiom Math

Dalawang magkakaibang paraan ang naglutas sa bahagi (a) ng parehong problema.

Sa bahagi (b), ang tatlong modelo ay nagtatapos sa parehong punto: lahat ay nagpapatotoo na ang pinakamalaking karaniwang dibisor ng bilang ng beses na bawat primong p ay nahahati sa lahat ng mga numero sa board ay nananatiling hindi nagbabago sa operasyon. Ang huling pormula ay eksaktong pareho—

Axiom Math

Balik sa halimbawa: 12 at 18. Para sa p=2, v₂(12) = 2, v₂(18) = 1, gcd = 1, kontribusyon 2¹. Para sa p=3, v₃(12) = 1, v₃(18) = 2, gcd = 1, kontribusyon 3¹. M = 2 × 3 = 6, tumpak na katumbas ng kamay na kalkulasyon.

Ang pinakamura na blanko sa buong platform

Ang Problem 6 na ito ay ang panghuling tanong sa Day 2, at hinihingi nito na patunayan na ang recursive sequence ay magiging periodic sa wakas.

Noong nakaraan, sa IMO 2025, mayroon lang na 6 na tao sa buong mundo ang nakakasolve ng P6.

Claude Fable: 5:26 minuto, dalawang runda, perpektong puntos. GPT-5.6 Sol: 60 minuto, dalawang runda, perpektong puntos. Kimi K3: 381 minuto, apat na runda, perfect score.

Ang Grok 4.5 ay naglabas ng lamang 7,053 na token sa P6, pinakamababa sa lahat. Nakasulat nang malinaw sa sumbong na file: Full proof: (Hindi pa kumpleto.)

$0.18, ang pinakamura na whitepaper sa buong platform.

Hindi lang dito nagtatapos ang mga problema ng Grok. Sa buong pagsubok, paulit-ulit itong nagsasalamin ng isang kakaibang delusyon: sinasabing "naisulat na ang patunay sa file," ngunit ang backend ay hindi pa nagamit ang anumang tool para sa pagsulat.

Hindi ito isyu sa kakayahan sa matematika, kundi isyu sa kakayahan ng agent. Alam ng modelo na dapat isulat ang file, at sinasabi nito na isinulat na ito, ngunit sa antas ng pagtawag sa tool, hindi ito gumawa.

Three-level leap in three years

Takot na evolusyon ng silikon-based na utak

Noong 2024, unang nakamit ng AlphaProof ng DeepMind ang antas ng bakal sa IMO.

Sa taon na 2025, parehong gumawa ng hakbang ang OpenAI at DeepMind. Ang OpenAI ay hindi inilabas ang modelo nito, ngunit nalutas ang 5 tanong at nakakuha ng ginto na 35 puntos, habang ang Gemini Deep Think ay nakamit ang parehong antas.

Sa taon na 2026, tatlong pangkalahatang malalaking modelo ay direktang nakakuha ng perfect score. Sa pagkakataong ito, hindi sila pinagsanay sa anumang espesyalisadong matematika, at lahat ng tao ay maaaring gamitin ang kanilang mga serbisyo. Kaya may isang modelo pa na open source.

Axiom Math

Ang sumulat ng liham ng hamon ng makina

Ang simula ng buong pagsubok ay isang kumpanyang tawagin Axiom Math.

Isinalin nila ang lahat ng anim na tanong sa IMO 2026, salita-salita, sa anyong pormal na Lean 4 na maunawaan ng machine.

Sa pamamagitan ng这套机器可读的题目,AI ay maaaring direktang maglabas ng Lean proof, na aayusin ng compiler, at hindi na kailangan ng mga human judge.

Pagkatapos makakuha ng problem statement, agad niyang itinayo ang awtomatikong framework para sa pagsubok. Ang mga malalaking model ay nagmamadali sa track at natapos ang lahat ng anim na checkpoint. Ang AxiomProver ay nagwagi nang mag-isa ng perfect score.

Mahalagang banggitin na si Hong Letong, ang tagapagtatag ng Axiom Math, ay may edad na 25 lang. Ipinanganak siya sa Guangzhou, at sa loob ng tatlong taon lang ay nagtapos ng double degree sa mathematics at physics sa MIT, at isang tagapagwagi ng Morgan Prize.

Noong huling bahagi ng nakaraang taon, ang AxiomProver na kanyang nilikha ay nakakuha ng perfect score sa Putnam Mathematics Competition. Ito ay ang ika-6 na perfect score sa 98-taong kasaysayan ng kompetisyon.

Noong Marso ng taong ito, natapos ng kumpanya ang pagsasama ng pondo ng A na may halagang $200 milyon. Ang pagpapahalaga ay tumama sa $1.6 bilyon.

Axiom Math

Paano mababago ang pang-araw-araw na buhay ng karaniwang tao

May kakayahan kang sumulat ng 4,229 na linya ng matiyak na patotoo, at ang iyong kamay ay hawak hindi lamang ang kakayahang lutasin ang mga problema sa matematika.

Ang tunay na kinokontrol nito ay ang mahabang proseso ng lohikal na pagdedebate, kung saan hindi maaaring mag-iskip, mali, o magkaron ng pagkakamali sa bawat hakbang.

May mga butas ba sa mga kundisyon ng kontrata, natutugunan ba ang mga kondisyon ng insurance claim, at komplikado ba ang tax plan? Pagkatapos ng lahat ng panlabas na anyo, ito ay iisang uri ng problema: ang sagot ay hindi maaaring “halos tama”.

Kanina pa, ang pag-verify ng bawat item ay gawin lamang ng mga propesyonal at binabayaran sa bawat oras.

Ngayon, kasabay ng pagpapalawig ng kakayahang ito sa mga produkto para sa konsumidor, kung may problema, kailangan lang i-open ang iyong cellphone.

Mga sanggunian:

https://x.com/deedydas/status/2079409461874332066

Ito ay mula sa WeChat public account na “Xinzhiyuan,” may-akda: ASI Revelation, editor: Moses

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.