GPT-6 Astra, Son Sınır Matematik Seviye 4 Sorusunu Çözdü

icon MarsBit
Paylaş
AI summary iconÖzet
AI + kripto haberi: GPT-6 Astra, FrontierMath Tier 4'teki son sorunu çözdü ve ileri seviye benchmark'taki tüm zorlukları tamamladı. Epoch AI tarafından 60'tan fazla matematikçiyle geliştirilen Astra, %97,6 doğruluk oranı ile çözülememiş son soruyu çözdü. Proje, açık araştırmaya ve resmileştirilmiş zorluklara geçerek AI ilerlemesinde önemli bir duyuru yapmıştır.

Just now, the final FrontierMath Tier 4 challenge was solved by GPT-6 Astra.

Bu, bir zamanlar büyük modellerin matematiksel kabusu olarak kabul edilen araştırma düzeyindeki testin tüm soruları en az bir kez AI tarafından başarıyla çözülmüştür.

Epoch AI, FrontierMath Tier 4'ü de resmen doygun olarak ilan etti.

FrontierMath

Yukarıdaki grafikten görüldüğü gibi, Astra henüz %100'e doğrudan ulaşmadı; OpenAI'nin kendi açıkladığı sonuç %97,6.

Ancak Epoch algoritmasına göre, "tümü çözüldü" ifadesi, farklı modellerin ve farklı zamanlardaki denemelerin birikimi sonucunda Tier 4'teki her sorunun en az bir kez başarıyla çözüldüğü anlamına gelir.

Astra, daha önce AI tarafından ele geçirilmemiş olan tek engeli ortadan kaldırdı.

Basitçe ifade edersek, Astra belki bir testte hata yapmış, ancak doğru cevapladığı soru daha önce çözülmemişti.

FrontierMath

Dürüst olmak gerekirse, bu gelişme hızı oldukça şaşırtıcı.

Model değerlendirme konusunda takip ediyorsanız, 11 Temmuz 2025'te Tier 4 ilk kez çıkarıldığında, listedeki en yüksek başarı oranının yaklaşık %5 olduğunu biliyorsunuz.

Şimdi tam bir yıl ve iki ay geçti, eski “yüksek duvar” artık bir “basamak” haline geldi ve AI’nın kolay yollarla atlayamadığı son engel de aşıldı.

Marquette Üniversitesi Matematik Öğretim Üyesi Jay Pantone, önceki AI'ların sayısal kısayollar aradığını, ancak bu sefer AI'nın çözümünün kendi çözümüne oldukça yakın olduğunu belirtti.

FrontierMath

Ancak yakın zamanda GPT-6 Astra, matematik dünyasına yoğun bir şekilde saldırdı ve üç günde iki kez Milenyum Sorunlarını çözdü; Pantone ise artık şaşırmanın çok zor olduğunu belirtti!

Matematik, Astra'nın son zamanlarda en çok dikkat çeken alanlarından biri haline gelmiştir.

%2'nin altında olanlardan, özel olarak bir "araştırma seviyesi savunma" eklenmesine kadar

FrontierMath, 7 Kasım 2024'te ilk kez yayınlandı ve amacı, matematik Benchmark'ının AI tarafından hızla aşılmasıydı.

GSM8K, MATH gibi geleneksel matematik benchmark'ları artık öncü modeller arasındaki farkları ayırt etmek için giderek daha zor hale gelmeye başladığında, Epoch AI 60'tan fazla matematikçiyle birlikte daha önce hiçbir zaman yayınlanmamış orijinal sorular oluşturdu.

Bu kişiler arasında Terence Tao, Timothy Gowers, Richard Borcherds gibi Fields Ödülü sahipleri yer alıyor.

Terence Tao, bazı araştırma düzeyindeki soruları inceledikten sonra bunların "aşırı zor" olduğunu açıkça belirtti ve en zor Tier 3 sorularının AI'nın birkaç yıl daha takılı kalmasına neden olabileceğini düşündü.

FrontierMath

İlk tur sonucunda, beklenenin aksine, öncü modelin doğruluk oranı %2'nin altında kaldı.

Başlangıçta FrontierMath'in temel soru bankası 300 sorudan oluşuyor ve zorluk seviyelerine göre Tier 1, Tier 2 ve Tier 3 olmak üzere üç seviyeye ayrılıyor.

FrontierMath

Tier 1, yüksek zorluktaki lisans düzeyi sorularına ve matematik olimpiyatlarına yaklaşık olarak denk gelir, ancak daha ileri araçların kullanılmasına izin verir; Tier 2, ileri sınıf yüksek lisans düzeyine ulaşır; Tier 3 ise doktora öğrencilerinin erken aşamada karşılaştığı keşif temelli araştırma sorularına daha yakındır.

Ancak çıkarım modellerinin ortaya çıkmasıyla birlikte bu ilk üç katman da giderek yetersiz kalınca, 2025 yılında Epoch, Tier 4 katmanını ekledi.

Tier 4, çoğunlukla matematik profesörleri ve postdoktora öğrencileri tarafından tasarlanır; her biri kendi araştırma yönü etrafında yaklaşık birkaç hafta süren kısa bir araştırma yapar ve sonuçlarını otomatik olarak doğrulanabilir bir soruya sıkıştırır.

FrontierMath

İlk olarak, Tier 4 toplamda 50 soru içermektedir. Bunlar analiz, sayılar teorisi, kombinatorik, topoloji, cebirsel geometri gibi alanları kapsamaktadır...

Yayınlanma anında, tüm modellerin önceki tüm testlerinde sadece üç soru çözülmüş ve bu çözümler doğru ancak yeterince kanıtlanmamış varsayımlara dayanmıştı.

Buna göre, web sitesindeki açık örnek sorular sayfasında Epoch, bazı soruların onlarca yıl boyunca AI tarafından çözülemeyeceğini yazdı.

FrontierMath

Bu cümle artık sürekli olarak tekrar tekrar vuruluyor

Ancak model giderek daha güçlü hale geldikçe, başka bir sorun da ortaya çıktı: soru bankası kendisi de AI'nın "testlerine" dayanamaz hale geldi.

OpenAI, test sürecinde FrontierMath'te beklenden daha fazla hata tespit etti.

Daha sonra Epoch, bağımsız bir denetim başlatır, önce GPT-5.5 ve Claude Opus 4.7 ile şüpheli noktalar taranır, ardından matematikçiler tarafından her soru ayrı ayrı kontrol edilir. Sonuç olarak 2026 yılının Haziran ayında v2 sürümü piyasaya sürülür; bu sürümde Tier 4, 12 soru düzeltildi, 7 soru kaldırıldı ve 43 soru bırakıldı.

Düzenlendikten sonra modelin performansı hâlâ yükselişte.

GPT-5.6 %83,0'a, Claude Fable 5 %90,2'ye ulaştı, GPT-6 Astra ile bu oran %97,6'ya çıktı.

FrontierMath

Daha da önemlisi, Astra daha önce hiç AI tarafından çözülmemiş olan tek soruyu da tamamladı.

FrontierMath

Bu noktada, Tier 4'teki her soru en az bir kez AI tarafından başarıyla aşılmıştır. En güçlü modeller için özel olarak oluşturulan bu araştırma düzeyi savunma sistemi nihayet aşılıp geçilmiştir.

Ancak bu, "matematik zaten AI tarafından çözüldü" anlamına gelmez. Tam tersine, FrontierMath kendisi zaten bir sonraki aşamaya geçmeye başlamıştır.

Şu anda proje, Tiers 1-4 dışında gerçek Open Problems'leri ve FrontierMath Erdős ile Erdős açık problemlerini Lean'e formalize etmeyi de eklemiştir.

FrontierMath

İlki, matematik dünyası tarafından henüz çözülmemiş araştırma sorularını doğrudan modele sormaktadır; ikincisi, AI'nın formel doğrulama geçebilecek tam bir kanıt yazmasını gerektirir.

Bu sefer Astra, FrontierMath Erdős'ün 68 sorusundan sadece 2'sini çözdü.

Hikâye devam ediyor~

Bu yazı, WeChat hesabından "Quantum Bits" tarafından yazılmıştır, yazar: henry

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.