Küresel Yapay Zeka Modelleri, IMO 2026’da mükemmel puanlarla hakimiyet kuruyor

icon MarsBit
Paylaş
AI summary iconÖzet
AI ve kripto haberleri, Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 ve AxiomProver adlı dört AI modelinin 2026 IMO'da 42/42 puan alarak insan rakiplerinin %99'unu geride bırakmasıyla patladı. Yedi yıl içinde sadece 30 insan mükemmel puan elde etti. Axiom Math, soruları otomatik puanlama için Lean 4'e çevirdi. Maliyetler 0,18 dolar ile 51 dolar arasında değişti. Küresel kripto politika tartışmaları yakında matematik ve mantıkta AI'nın rolünü içerebilir.

Şanghay'ın Temmuzu, sıcağın dalgalarıyla dolu.

67. Uluslararası Matematik Olimpiyatları resmen sona erdi, Çin takımı 232 puanla birincilik kazandı. Üç genç matematikçi 42 puanlık mükemmel puan aldı.

Axiom Math

Sahnede alkışlar hâlâ devam ederken, GitHub’da başka bir dikkat çekici başarı listesi ortaya çıktı.

Önceki Google mühendisi Deedy Das, 7 ileri düzey büyük modelin IMO 2026'nın tüm 6 sorusunu tamamen kendi kendine çözmelerini karşılaştırıyor.

Claude Fable 5, 42 puanlık mükemmel puanı 2,5 saatte kazandı ve 51 dolar harcadı.

GPT-5.6 Sol'un xhigh sürümü aynı şekilde mükemmel puan aldı. 3,8 saatte tamamlandı ve maliyet 20 dolar olarak çok düşük seviyede tutuldu.

Kimi K3, 17,4 saatlik bir mücadele sonucu 31 dolar harcayarak ardından tam puanı kazandı.

AxiomProver'in ayrı ayrı teslimiyle birlikte, tam olarak dört güç tam puanla zirveye ulaştı.

Axiom Math

Referans olarak, geçen yedi yıl içinde IMO'da 4.347 insan katılımcı vardı ve sadece 30 kişi mükemmel puan aldı—yani %0,69 oranında.

Axiom Math

Sonuçlarla açık bir şekilde üstünlük sağlandı

Sonuçlara göre, mükemmel puan olan 42 ile dördüncü sıradaki 28 arasında 14 puanlık bir boşluk bulunuyor ve üç mükemmel puan alan modelin zirveye çıkış şekilleri tamamen farklı.

Claude Fable 5, temiz ve verimli bir şekilde çalıştı. 9 diyalog sırasında 6'sı etkili çıktı verdi, tek seferde en uzun süre 73 dakika (P3) sürdü ve toplamda 700 bin token çıktı üretti.

GPT-5.6 Sol biraz zorlu görünüyordu. P2 üzerinde 106 dakika boyunca 4 tur çalıştı, arada iki kez ağ hatası nedeniyle kesildi. Ancak hesaplama kontrolü korkutucu düzeydeydi—toplam çıktı sadece 230 bin token, üç mükemmel sonuç arasında en az tüketen.

Kimi K3, yorulmayan bir dev gibi. 2,8 trilyon parametreli MoE modeli, 1,54 milyon tokeni tek seferde salıverdi, bu, Sol'un 6,5 katı. Sadece P3 sorusu için bile 6 kez saldırı düzenledi ve 491 dakika süren bir savaş verdi.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Matematiksel sezginin doğrudan çatışması

P1, tüm turnuvanın en hafif açılışıdır, tüm modeller birkaç dakikada tamamlanır ve insan oyuncular neredeyse hiç hata yapmaz.

Tahtada 1'den büyük 2026 tane pozitif tam sayı yazıyor. Her adımda, iki m ve n sayısı seçilip silinip yerlerine gcd(m,n) ve lcm(m,n)/gcd(m,n) yazılıyor. İşlem, devam edilemeyene kadar tekrarlanıyor. Şunu kanıtlayın: (a) Süreç mutlaka sonlanır ve sonunda tam olarak bir tane 1'den büyük M sayısı kalır; (b) M'nin değeri işlemlerin sırasından bağımsızdır.

Axiom Math

Bu soruyu daha iyi anlamak için küçük bir deney yapalım.

Tahtada sadece 12 ve 18 var. 12 = 2² × 3, 18 = 2 × 3². Adım 1: gcd(12,18) = 6, lcm(12,18)/6 = 6, tahta [6, 6] olur. Adım 2: gcd(6,6) = 6, lcm(6,6)/6 = 1, tahta [6, 1] olur. 1'den büyük yalnızca bir sayı kalır, oyun biter. M = 6.

İşlem sırasını ne şekilde karıştırırsanız karıştırın, M her zaman 6'dır. Neden?

Cevap asal çarpanlarda gizli.

Her asal sayı p için, tüm sayıların p ile bölünme sayılarının en büyük ortak bölenini alın ve bu asal kuvvetleri çarpın—bu değer, ilk adımdan son adıma kadar sabit kalır.

Claude Fable 5: Her adımda kesinlikle azalan bir sayaç doğrudan yarattı.

Bu soru için Fable 5, Φ = T + N miktarını tanımlar. T, tahtadaki tüm sayıların asal çarpanlarının toplam sayısıdır (tekrarlar dahil), N ise 1'den büyük sayıların sayısıdır. Örneğin, tahta [12, 18] ise, 12'nin asal çarpanları 2, 2, 3'tür ve toplam 3'tür; 18'in asal çarpanları 2, 3, 3'tür ve toplam 3'tür; T = 6, N = 2, Φ = 8'dir.

Sonra şu kanıtlanır: Her işlem adımında, Φ en az 1 azalır. İki durum vardır—eğer gcd(m,n) > 1 ise, asal çarpanların toplam sayısı T azalır; eğer gcd(m,n) = 1 ise, T değişmez ama 1'den büyük sayılar bir azalır ve N, 1 azalır. Φ pozitif bir tam sayıdır, her adımda en az 1 azalır, bu nedenle süreç sonlu sayıda adımda sona erer. Tek bir sayaç, tek bir darbeyle kesilir.

Axiom Math

GPT-5.6 Sol: İzleme ürünü, sözlük sıralamasına göre azalan boyut.

Sol, iki miktarı inceliyor: P = tüm sayıların çarpımı, K = 1'den büyük olan sayıların sayısı. Her adımda, eğer gcd(m,n) = d > 1 ise, yeni iki sayının çarpımı mn/d olur ve bu orijinalinden küçüktür, böylece genel çarpım P kesinlikle azalır. Eğer d = 1 ise, P değişmez, ancak K bir azalır.

(P, K) ikilisi sözlük sıralamasında katı şekilde azalıyor: ya P küçülüyor ya da P sabit kalıyor ama K küçülüyor. Pozitif tam sayıların sözlük sıralaması sonsuz azalamaz. Sonlanıyor.

Axiom Math

Aynı sorunun (a) kısmına iki tamamen farklı yol ile çözüldü.

(b) kısmına gelindiğinde, üç model de aynı sonuca varır: her p asal sayısı için, tahtadaki tüm sayıların p ile bölünme sayılarının en büyük ortak böleninin işlem sırasında değişmediğini gösterir. Son formül de tamamen aynıdır—

Axiom Math

Örnek kontrolüne geri dönelim: 12 ve 18. p=2 için, v₂(12) = 2, v₂(18) = 1, gcd = 1, katkı 2¹. p=3 için, v₃(12) = 1, v₃(18) = 2, gcd = 1, katkı 3¹. M = 2 × 3 = 6, el ile hesaplanan sonuçla tamamen uyumlu.

Tüm alanda en ucuz beyaz kağıt

P6 sayısı teorisi sorusu, Gün 2'nin son sorusudur ve yinelemeli dizinin nihayetinde periyodik olacağını kanıtlamayı gerektirir.

Geçen yıl IMO 2025'te dünya çapında sadece 6 insan P6'yı çözdü.

Claude Fable: 26 dakika, iki tur, maksimum puan. GPT-5.6 Sol: 60 dakika, iki tur, maksimum puan. Kimi K3: 381 dakika, dört tur, maksimum puan.

Grok 4.5, P6 üzerinde sadece 7053 token çıkartarak son sırada yer aldı. Gönderilen dosyada açıkça şu cümle yer alıyor: Full proof: (Not yet complete.)

0,18 $, tüm alanda en ucuz beyaz kağıt.

Grok'un sorunları burada bitmiyor. Tüm test boyunca, "kanıt dosyaya yazıldı" diye kategorik olarak iddia edip arka planda yazma aracına bile dokunmadığı garip bir halüsinasyona düşüyor.

Bu matematiksel yetenek sorunu değil, agent yeteneği sorunu. Modelin dosya yazması gerektiğini biliyor ve yazdığını iddia ediyor, ancak araç çağrısı düzeyinde hiçbir şey yapmıyor.

Üç yıl içinde üç adım atma

Silikon tabanlı zekânın korkutucu evrimi

2024 yılında DeepMind'in AlphaProof, ilk kez IMO seviyesinde gümüş madalya sınırına ulaştı.

2025 yılında, OpenAI ve DeepMind aynı anda harekete geçti. OpenAI, modelini kamuoyuna açıklamadan 5 soruyu çözerek 35 puanlık gümüş madalya kazandı, Gemini Deep Think aynı seviyeye ulaştı.

2026 yılında, üç genel büyük model doğrudan mükemmel puan aldı. Bu sefer, hiçbir özel matematik eğitimi almadılar ve herkes bunları kullanabiliyor. Hatta biri açık kaynaklı.

Axiom Math

Makine savaş mektubunu yazan

Tüm testin başlangıcı, Axiom Math adlı bir şirkettir.

Onlar, IMO 2026'nın tüm altı sorusunu, makine tarafından anlaşılabilir Lean 4 formel soru metinlerine harf harf çevirdi.

Bu makine tarafından okunabilir sorularla, AI doğrudan Lean kanıtı çıkarabilecek ve derleyici otomatik olarak puanlayabilecek, insan hakemlerin sınavı kontrol etmesine gerek kalmayacak.

Soruyu aldıktan sonra Deedy Das, tamamen otomatikleştirilmiş bir test çerçevesi kurdu. Tüm büyük modeller pistte kendi hızlarıyla ilerleyerek altı tüm engeli tamamladı. AxiomProver de ayrı olarak tam puan kazandı.

Dikkat edilmesi gereken nokta, Axiom Math'in kurucusu Hong Letong'un yalnızca 25 yaşında olmasıdır. Guangzhou'da doğan o, sadece üç yıl içinde MIT'de matematik ve fizik çift diplomasını kazanmış ve Morgan Ödülü'nün sahibidir.

Geçen yılın sonunda, onun geliştirdiği AxiomProver, Putnam Matematik Yarışması'nda mükemmel puan aldı. Bu, yarışmanın 98 yıllık tarihindeki altıncı mükemmel puan başarıydı.

Bu yıl Mart'ta, şirket 200 milyon dolarlık A serisi finansman turunu tamamladı. Değeri 1,6 milyar dolara ulaştı.

Axiom Math

Ortak insanların yaşamı nasıl yeniden yapılandırılacak

4229 satır kesin ispatla yazılmış bir model yazabilmek, sadece matematik sorularını çözebilmek yeteneğiyle sınırlı değildir.

Gerçekten kontrol ettiği, uzun zincirli mantıksal çıkarımdır; her adım atlanamaz, hatalı olamaz ve belirsiz olamaz.

Sözleşme şartlarında boşluk var mı, sigorta tazminatı koşulları karşılanıyor mu, vergi planı yasal mı, yüzeyi soyununca hepsi aynı türden bir soru: Cevap “yaklaşık doğru” olamaz.

Bu tür tek tek doğrulamalar önce sadece profesyoneller tarafından yapılabiliyor ve saatlik ücretlendiriliyordu.

Şimdi bu yetenek tüketici ürünlerine entegre edildiğinden, zorlu sorunlarla karşılaştığınızda sadece telefonunuzu açmanız yeterli.

Kaynaklar:

https://x.com/deedydas/status/2079409461874332066

Bu yazı WeChat hesabından "Yeni Zihin" tarafından paylaşılmıştır, yazar: ASI Vahiyleri, editör: Musa

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.