Hulyo sa Shanghai, mainit at malakas ang alon ng init.
Nagwakas na ang 67th International Mathematical Olympiad, kung saan ang timog Tsina ay nakuha ang unang puwesto sa pamamagitan ng 232 puntos. Tatlong kabataan ang nakakuha ng perfektong 42 puntos.

Hindi pa naglaho ang mga aplawdo sa lugar, kumalat naman sa GitHub ang isang iba pang nakakatangi na resulta.
Inilabas ni Deedy Das, dating engineer ng Google, isang komprehensibong paghahambing ng AI: 7 na advanced na malalaking modelo, nag-iisa at awtomatikong sinagot ang lahat ng 6 na tanong sa IMO 2026.
Kinuha ni Claude Fable 5 ang perfect score na 42 puntos. Nag-trabaho lamang sa loob ng 2.5 oras at nag-spent ng $51.
Ang xhigh version ng GPT-5.6 Sol ay parehong perfect. Nagsakop ng 3.8 na oras, at ang gastos ay napababa sa napakababang $20.
Kimi K3 ay sumunod at nakakuha ng perfekto. Pagkatapos ng 17.4 na oras ng pakikidigma, nagastos ng $31.
Kasama na ang independent submission na AxiomProver, lahat ng apat na puwersa ay nakamit ang perfect score.

Para sa paghahambing, sa nakaraang pitong taon ng IMO, sa 4,347 na human na kalahok, only 30 ang nakakuha ng perfect score—0.69%.

Nakalampas nang malaki ang marka
Mula sa mga resulta, hindi lamang mayroong 14-point na agwat sa pagitan ng perfect score na 42 at ikaapat na lugar na 28, kundi iba-iba rin ang paraan kung paano umabot sa puncyo ng tatlong modelo na nakakuha ng perfect score.
Ang Claude Fable 5 ay nagtatampok ng malinaw at maayos na pagganap. 9 na sesyon ng usapan, 6 na may epektibong output, pinakamahabang iisang pagkakataon ay 73 minuto (P3), kabuuang output ay 700,000 na token.
Ang GPT-5.6 Sol ay tila may ilang hamon. Sa P2, nagtrabaho ito ng 106 minuto para sa 4 round, na pinagdadaanan ng dalawang pagkakasira ng network. Ngunit ang pagkontrol sa computing power ay kahanga-hanga—ang kabuuang output ay lamang 230,000 na token, pinakamaliit sa tatlong perfect score.
Kimi Ang K3 ay parang isang hindi nakakapagpahinga na kalakal. Ang MoE model na may 2.8 trilyong parameter ay naglabas ng 1.54 milyong token nang iisa, na 6.5 beses ang dami ng Sol. Ang isang tanong lamang ng P3 ay nag-umpisa ng 6 pag-atake, at nagtagal ng 491 minuto.






Direct confrontation of mathematical intuition
Ang P1 ay ang pinakamababaw na appetizer sa buong palabas, na natatapos ng lahat ng modelo sa ilang minuto, at halos walang pagkakamali sa mga human na manlalaro.
Ang pangunahing ideya ay: Isinulat sa pader ang 2,026 na positibong buong bilang na mas malaki kaysa sa 1. Sa bawat hakbang, piliin ang dalawang bilang na m at n, tanggalin sila, at palitan ng gcd(m,n) at lcm(m,n)/gcd(m,n). Ulitin ang proseso hanggang hindi na maaaring patuloy. Patunayan na: (a) ang proseso ay tiyak na tatapos, at sa wakas ay mayroon lamang isang bilang na M na mas malaki kaysa sa 1; (b) ang halaga ng M ay hindi nakadepende sa pagkakasunod-sunod ng mga operasyon.

Para mas madaling maintindihan ang tanong na ito, unang gawin natin ang isang maliit na eksperimento.
Ang mga numero sa pinto ay 12 at 18 lamang. 12 = 2² × 3, 18 = 2 × 3². Unang hakbang: gcd(12,18) = 6, lcm(12,18)/6 = 6, ang pinto ay naging [6, 6]. Ikalawang hakbang: gcd(6,6) = 6, lcm(6,6)/6 = 1, ang pinto ay naging [6, 1]. Natitira na lamang ang isang numero na higit sa 1, kaya tumigil na ang laro. M = 6.
Anuman ang pagkakasunod-sunod ng iyong mga aksyon, ang M ay laging 6. Bakit?
Ang sagot ay nakatago sa mga prime factor.
Para sa bawat prime na p, kunin ang pinakamalaking karaniwang dibisor ng bilang ng beses na hinahati ng p, at pagkatapos ay i-multiply ang mga potensya ng prime na ito—ang halagang ito ay patuloy na nagiging pareho mula sa unang hakbang hanggang sa huling hakbang.
Claude Fable 5: Direktang nilikha ang isang counter na laging bumababa sa bawat hakbang.
Para sa tanong na ito, tinukoy ng Fable 5 ang isang halagang Φ = T + N. Ang T ay ang kabuuang bilang ng mga primong faktor ng lahat ng mga numero sa board (na binibilang nang paulit-ulit), habang ang N ay ang bilang ng mga numero na mas malaki sa 1. Halimbawa, sa board [12, 18], ang mga primong faktor ng 12 ay 2, 2, 3 na may kabuuang 3, at ang mga primong faktor ng 18 ay 2, 3, 3 na may kabuuang 3, kaya T = 6, N = 2, at Φ = 8.
Atin ito ay patotoo: bawat hakbang, bumababa ang Φ ng hindi bababa sa 1. Dalawang kaso: kung ang gcd(m,n) > 1, bumababa ang kabuuang bilang ng mga prime factor T; kung ang gcd(m,n) = 1, nananatili ang T ngunit bumababa ang bilang ng mga numero na higit sa 1, kaya bumababa ang N ng 1. Ang Φ ay isang positive integer, at bawat hakbang ay bumababa ng hindi bababa sa 1, kaya dapat magwakas ang proseso sa limitadong bilang ng mga hakbang. Isang solong counter, isang malinaw na pagkakatigil.

GPT-5.6 Sol: Tumutukoy sa produkto, pagsusuri sa leksikograpikong pagbaba.
Ang Sol ay tumitingin sa dalawang halaga: P = ang produkto ng lahat ng mga numero, K = ang bilang ng mga numero na mas malaki sa 1. Sa bawat hakbang, kung ang gcd(m,n) = d > 1, ang bagong produkto ng dalawang numero ay mn/d, na mas maliit kaysa sa orihinal, kaya ang pambuong produkto ay tumutuloy na bumababa. Kung ang d = 1, ang P ay hindi nagbabago, ngunit ang K ay bumababa ng 1.
Ang pares (P, K) ay stricly decreasing sa leksikograpikong pagkakasunod-sunod: o ang P ay bumababa, o ang P ay nananatili ngunit ang K ay bumababa. Ang leksikograpikong pagkakasunod-sunod ng mga positibong buong bilang ay hindi maaaring magpatuloy na bumaba nang walang hanggan. Katapusan.

Dalawang magkakaibang paraan ang naglutas sa bahagi (a) ng parehong problema.
Sa bahagi (b), ang tatlong modelo ay nagtatapos sa parehong punto: lahat ay nagpapatotoo na ang pinakamalaking karaniwang dibisor ng bilang ng beses na bawat primong p ay nahahati sa lahat ng mga numero sa board ay nananatiling hindi nagbabago sa operasyon. Ang huling pormula ay eksaktong pareho—

Balik sa halimbawa: 12 at 18. Para sa p=2, v₂(12) = 2, v₂(18) = 1, gcd = 1, kontribusyon 2¹. Para sa p=3, v₃(12) = 1, v₃(18) = 2, gcd = 1, kontribusyon 3¹. M = 2 × 3 = 6, tumpak na katumbas ng kamay na kalkulasyon.
Ang pinakamura na blanko sa buong platform
Ang Problem 6 na ito ay ang panghuling tanong sa Day 2, at hinihingi nito na patunayan na ang recursive sequence ay magiging periodic sa wakas.
Noong nakaraan, sa IMO 2025, mayroon lang na 6 na tao sa buong mundo ang nakakasolve ng P6.
Claude Fable: 5:26 minuto, dalawang runda, perpektong puntos. GPT-5.6 Sol: 60 minuto, dalawang runda, perpektong puntos. Kimi K3: 381 minuto, apat na runda, perfect score.
Ang Grok 4.5 ay naglabas ng lamang 7,053 na token sa P6, pinakamababa sa lahat. Nakasulat nang malinaw sa sumbong na file: Full proof: (Hindi pa kumpleto.)
$0.18, ang pinakamura na whitepaper sa buong platform.
Hindi lang dito nagtatapos ang mga problema ng Grok. Sa buong pagsubok, paulit-ulit itong nagsasalamin ng isang kakaibang delusyon: sinasabing "naisulat na ang patunay sa file," ngunit ang backend ay hindi pa nagamit ang anumang tool para sa pagsulat.
Hindi ito isyu sa kakayahan sa matematika, kundi isyu sa kakayahan ng agent. Alam ng modelo na dapat isulat ang file, at sinasabi nito na isinulat na ito, ngunit sa antas ng pagtawag sa tool, hindi ito gumawa.
Three-level leap in three years
Takot na evolusyon ng silikon-based na utak
Noong 2024, unang nakamit ng AlphaProof ng DeepMind ang antas ng bakal sa IMO.
Sa taon na 2025, parehong gumawa ng hakbang ang OpenAI at DeepMind. Ang OpenAI ay hindi inilabas ang modelo nito, ngunit nalutas ang 5 tanong at nakakuha ng ginto na 35 puntos, habang ang Gemini Deep Think ay nakamit ang parehong antas.
Sa taon na 2026, tatlong pangkalahatang malalaking modelo ay direktang nakakuha ng perfect score. Sa pagkakataong ito, hindi sila pinagsanay sa anumang espesyalisadong matematika, at lahat ng tao ay maaaring gamitin ang kanilang mga serbisyo. Kaya may isang modelo pa na open source.

Ang sumulat ng liham ng hamon ng makina
Ang simula ng buong pagsubok ay isang kumpanyang tawagin Axiom Math.
Isinalin nila ang lahat ng anim na tanong sa IMO 2026, salita-salita, sa anyong pormal na Lean 4 na maunawaan ng machine.
Sa pamamagitan ng这套机器可读的题目,AI ay maaaring direktang maglabas ng Lean proof, na aayusin ng compiler, at hindi na kailangan ng mga human judge.
Pagkatapos makakuha ng problem statement, agad niyang itinayo ang awtomatikong framework para sa pagsubok. Ang mga malalaking model ay nagmamadali sa track at natapos ang lahat ng anim na checkpoint. Ang AxiomProver ay nagwagi nang mag-isa ng perfect score.
Mahalagang banggitin na si Hong Letong, ang tagapagtatag ng Axiom Math, ay may edad na 25 lang. Ipinanganak siya sa Guangzhou, at sa loob ng tatlong taon lang ay nagtapos ng double degree sa mathematics at physics sa MIT, at isang tagapagwagi ng Morgan Prize.
Noong huling bahagi ng nakaraang taon, ang AxiomProver na kanyang nilikha ay nakakuha ng perfect score sa Putnam Mathematics Competition. Ito ay ang ika-6 na perfect score sa 98-taong kasaysayan ng kompetisyon.
Noong Marso ng taong ito, natapos ng kumpanya ang pagsasama ng pondo ng A na may halagang $200 milyon. Ang pagpapahalaga ay tumama sa $1.6 bilyon.

Paano mababago ang pang-araw-araw na buhay ng karaniwang tao
May kakayahan kang sumulat ng 4,229 na linya ng matiyak na patotoo, at ang iyong kamay ay hawak hindi lamang ang kakayahang lutasin ang mga problema sa matematika.
Ang tunay na kinokontrol nito ay ang mahabang proseso ng lohikal na pagdedebate, kung saan hindi maaaring mag-iskip, mali, o magkaron ng pagkakamali sa bawat hakbang.
May mga butas ba sa mga kundisyon ng kontrata, natutugunan ba ang mga kondisyon ng insurance claim, at komplikado ba ang tax plan? Pagkatapos ng lahat ng panlabas na anyo, ito ay iisang uri ng problema: ang sagot ay hindi maaaring “halos tama”.
Kanina pa, ang pag-verify ng bawat item ay gawin lamang ng mga propesyonal at binabayaran sa bawat oras.
Ngayon, kasabay ng pagpapalawig ng kakayahang ito sa mga produkto para sa konsumidor, kung may problema, kailangan lang i-open ang iyong cellphone.
Mga sanggunian:
https://x.com/deedydas/status/2079409461874332066
Ito ay mula sa WeChat public account na “Xinzhiyuan,” may-akda: ASI Revelation, editor: Moses
