Şanghay'ın Temmuzu, sıcağın dalgalarıyla dolu.
67. Uluslararası Matematik Olimpiyatları resmen sona erdi, Çin takımı 232 puanla birincilik kazandı. Üç genç matematikçi 42 puanlık mükemmel puan aldı.

Sahnede alkışlar hâlâ devam ederken, GitHub’da başka bir dikkat çekici başarı listesi ortaya çıktı.
Önceki Google mühendisi Deedy Das, 7 ileri düzey büyük modelin IMO 2026'nın tüm 6 sorusunu tamamen kendi kendine çözmelerini karşılaştırıyor.
Claude Fable 5, 42 puanlık mükemmel puanı 2,5 saatte kazandı ve 51 dolar harcadı.
GPT-5.6 Sol'un xhigh sürümü aynı şekilde mükemmel puan aldı. 3,8 saatte tamamlandı ve maliyet 20 dolar olarak çok düşük seviyede tutuldu.
Kimi K3, 17,4 saatlik bir mücadele sonucu 31 dolar harcayarak ardından tam puanı kazandı.
AxiomProver'in ayrı ayrı teslimiyle birlikte, tam olarak dört güç tam puanla zirveye ulaştı.

Referans olarak, geçen yedi yıl içinde IMO'da 4.347 insan katılımcı vardı ve sadece 30 kişi mükemmel puan aldı—yani %0,69 oranında.

Sonuçlarla açık bir şekilde üstünlük sağlandı
Sonuçlara göre, mükemmel puan olan 42 ile dördüncü sıradaki 28 arasında 14 puanlık bir boşluk bulunuyor ve üç mükemmel puan alan modelin zirveye çıkış şekilleri tamamen farklı.
Claude Fable 5, temiz ve verimli bir şekilde çalıştı. 9 diyalog sırasında 6'sı etkili çıktı verdi, tek seferde en uzun süre 73 dakika (P3) sürdü ve toplamda 700 bin token çıktı üretti.
GPT-5.6 Sol biraz zorlu görünüyordu. P2 üzerinde 106 dakika boyunca 4 tur çalıştı, arada iki kez ağ hatası nedeniyle kesildi. Ancak hesaplama kontrolü korkutucu düzeydeydi—toplam çıktı sadece 230 bin token, üç mükemmel sonuç arasında en az tüketen.
Kimi K3, yorulmayan bir dev gibi. 2,8 trilyon parametreli MoE modeli, 1,54 milyon tokeni tek seferde salıverdi, bu, Sol'un 6,5 katı. Sadece P3 sorusu için bile 6 kez saldırı düzenledi ve 491 dakika süren bir savaş verdi.






Matematiksel sezginin doğrudan çatışması
P1, tüm turnuvanın en hafif açılışıdır, tüm modeller birkaç dakikada tamamlanır ve insan oyuncular neredeyse hiç hata yapmaz.
Tahtada 1'den büyük 2026 tane pozitif tam sayı yazıyor. Her adımda, iki m ve n sayısı seçilip silinip yerlerine gcd(m,n) ve lcm(m,n)/gcd(m,n) yazılıyor. İşlem, devam edilemeyene kadar tekrarlanıyor. Şunu kanıtlayın: (a) Süreç mutlaka sonlanır ve sonunda tam olarak bir tane 1'den büyük M sayısı kalır; (b) M'nin değeri işlemlerin sırasından bağımsızdır.

Bu soruyu daha iyi anlamak için küçük bir deney yapalım.
Tahtada sadece 12 ve 18 var. 12 = 2² × 3, 18 = 2 × 3². Adım 1: gcd(12,18) = 6, lcm(12,18)/6 = 6, tahta [6, 6] olur. Adım 2: gcd(6,6) = 6, lcm(6,6)/6 = 1, tahta [6, 1] olur. 1'den büyük yalnızca bir sayı kalır, oyun biter. M = 6.
İşlem sırasını ne şekilde karıştırırsanız karıştırın, M her zaman 6'dır. Neden?
Cevap asal çarpanlarda gizli.
Her asal sayı p için, tüm sayıların p ile bölünme sayılarının en büyük ortak bölenini alın ve bu asal kuvvetleri çarpın—bu değer, ilk adımdan son adıma kadar sabit kalır.
Claude Fable 5: Her adımda kesinlikle azalan bir sayaç doğrudan yarattı.
Bu soru için Fable 5, Φ = T + N miktarını tanımlar. T, tahtadaki tüm sayıların asal çarpanlarının toplam sayısıdır (tekrarlar dahil), N ise 1'den büyük sayıların sayısıdır. Örneğin, tahta [12, 18] ise, 12'nin asal çarpanları 2, 2, 3'tür ve toplam 3'tür; 18'in asal çarpanları 2, 3, 3'tür ve toplam 3'tür; T = 6, N = 2, Φ = 8'dir.
Sonra şu kanıtlanır: Her işlem adımında, Φ en az 1 azalır. İki durum vardır—eğer gcd(m,n) > 1 ise, asal çarpanların toplam sayısı T azalır; eğer gcd(m,n) = 1 ise, T değişmez ama 1'den büyük sayılar bir azalır ve N, 1 azalır. Φ pozitif bir tam sayıdır, her adımda en az 1 azalır, bu nedenle süreç sonlu sayıda adımda sona erer. Tek bir sayaç, tek bir darbeyle kesilir.

GPT-5.6 Sol: İzleme ürünü, sözlük sıralamasına göre azalan boyut.
Sol, iki miktarı inceliyor: P = tüm sayıların çarpımı, K = 1'den büyük olan sayıların sayısı. Her adımda, eğer gcd(m,n) = d > 1 ise, yeni iki sayının çarpımı mn/d olur ve bu orijinalinden küçüktür, böylece genel çarpım P kesinlikle azalır. Eğer d = 1 ise, P değişmez, ancak K bir azalır.
(P, K) ikilisi sözlük sıralamasında katı şekilde azalıyor: ya P küçülüyor ya da P sabit kalıyor ama K küçülüyor. Pozitif tam sayıların sözlük sıralaması sonsuz azalamaz. Sonlanıyor.

Aynı sorunun (a) kısmına iki tamamen farklı yol ile çözüldü.
(b) kısmına gelindiğinde, üç model de aynı sonuca varır: her p asal sayısı için, tahtadaki tüm sayıların p ile bölünme sayılarının en büyük ortak böleninin işlem sırasında değişmediğini gösterir. Son formül de tamamen aynıdır—

Örnek kontrolüne geri dönelim: 12 ve 18. p=2 için, v₂(12) = 2, v₂(18) = 1, gcd = 1, katkı 2¹. p=3 için, v₃(12) = 1, v₃(18) = 2, gcd = 1, katkı 3¹. M = 2 × 3 = 6, el ile hesaplanan sonuçla tamamen uyumlu.
Tüm alanda en ucuz beyaz kağıt
P6 sayısı teorisi sorusu, Gün 2'nin son sorusudur ve yinelemeli dizinin nihayetinde periyodik olacağını kanıtlamayı gerektirir.
Geçen yıl IMO 2025'te dünya çapında sadece 6 insan P6'yı çözdü.
Claude Fable: 26 dakika, iki tur, maksimum puan. GPT-5.6 Sol: 60 dakika, iki tur, maksimum puan. Kimi K3: 381 dakika, dört tur, maksimum puan.
Grok 4.5, P6 üzerinde sadece 7053 token çıkartarak son sırada yer aldı. Gönderilen dosyada açıkça şu cümle yer alıyor: Full proof: (Not yet complete.)
0,18 $, tüm alanda en ucuz beyaz kağıt.
Grok'un sorunları burada bitmiyor. Tüm test boyunca, "kanıt dosyaya yazıldı" diye kategorik olarak iddia edip arka planda yazma aracına bile dokunmadığı garip bir halüsinasyona düşüyor.
Bu matematiksel yetenek sorunu değil, agent yeteneği sorunu. Modelin dosya yazması gerektiğini biliyor ve yazdığını iddia ediyor, ancak araç çağrısı düzeyinde hiçbir şey yapmıyor.
Üç yıl içinde üç adım atma
Silikon tabanlı zekânın korkutucu evrimi
2024 yılında DeepMind'in AlphaProof, ilk kez IMO seviyesinde gümüş madalya sınırına ulaştı.
2025 yılında, OpenAI ve DeepMind aynı anda harekete geçti. OpenAI, modelini kamuoyuna açıklamadan 5 soruyu çözerek 35 puanlık gümüş madalya kazandı, Gemini Deep Think aynı seviyeye ulaştı.
2026 yılında, üç genel büyük model doğrudan mükemmel puan aldı. Bu sefer, hiçbir özel matematik eğitimi almadılar ve herkes bunları kullanabiliyor. Hatta biri açık kaynaklı.

Makine savaş mektubunu yazan
Tüm testin başlangıcı, Axiom Math adlı bir şirkettir.
Onlar, IMO 2026'nın tüm altı sorusunu, makine tarafından anlaşılabilir Lean 4 formel soru metinlerine harf harf çevirdi.
Bu makine tarafından okunabilir sorularla, AI doğrudan Lean kanıtı çıkarabilecek ve derleyici otomatik olarak puanlayabilecek, insan hakemlerin sınavı kontrol etmesine gerek kalmayacak.
Soruyu aldıktan sonra Deedy Das, tamamen otomatikleştirilmiş bir test çerçevesi kurdu. Tüm büyük modeller pistte kendi hızlarıyla ilerleyerek altı tüm engeli tamamladı. AxiomProver de ayrı olarak tam puan kazandı.
Dikkat edilmesi gereken nokta, Axiom Math'in kurucusu Hong Letong'un yalnızca 25 yaşında olmasıdır. Guangzhou'da doğan o, sadece üç yıl içinde MIT'de matematik ve fizik çift diplomasını kazanmış ve Morgan Ödülü'nün sahibidir.
Geçen yılın sonunda, onun geliştirdiği AxiomProver, Putnam Matematik Yarışması'nda mükemmel puan aldı. Bu, yarışmanın 98 yıllık tarihindeki altıncı mükemmel puan başarıydı.
Bu yıl Mart'ta, şirket 200 milyon dolarlık A serisi finansman turunu tamamladı. Değeri 1,6 milyar dolara ulaştı.

Ortak insanların yaşamı nasıl yeniden yapılandırılacak
4229 satır kesin ispatla yazılmış bir model yazabilmek, sadece matematik sorularını çözebilmek yeteneğiyle sınırlı değildir.
Gerçekten kontrol ettiği, uzun zincirli mantıksal çıkarımdır; her adım atlanamaz, hatalı olamaz ve belirsiz olamaz.
Sözleşme şartlarında boşluk var mı, sigorta tazminatı koşulları karşılanıyor mu, vergi planı yasal mı, yüzeyi soyununca hepsi aynı türden bir soru: Cevap “yaklaşık doğru” olamaz.
Bu tür tek tek doğrulamalar önce sadece profesyoneller tarafından yapılabiliyor ve saatlik ücretlendiriliyordu.
Şimdi bu yetenek tüketici ürünlerine entegre edildiğinden, zorlu sorunlarla karşılaştığınızda sadece telefonunuzu açmanız yeterli.
Kaynaklar:
https://x.com/deedydas/status/2079409461874332066
Bu yazı WeChat hesabından "Yeni Zihin" tarafından paylaşılmıştır, yazar: ASI Vahiyleri, editör: Musa
