Claude, bu sefer AI programlama sıralamasını kesin bir farkla öne çıkardı!
Just updated MirrorCode leaderboard, Claude Fable 5 %64 mutlak başarı oranı ile tekrar birinci oldu.
Arkasından gelen GPT-5.6 Sol, puanı sadece onun üçte biri!
Dördüncü sırada yer alan GPT-5.5 daha da kötü durumda. Puanı sadece %10 ve hatta kendi öncüsü GPT-5.4 tarafından yere sürüklendi.

Daha da şaşırtıcı olan, Fable 5'in yüksek kaynak tüketen Go gibi dillerde çözülme oranı %64 iken, nadir kullanılan Ada diliyle bile %61'e ulaşmasıdır.
Açık kaynak dünyasında, Python corpus'u yaklaşık olarak Ada'nın 230 katıdır.
Ancak Fable 5'te başarı oranı sadece %3 düştü.

Bu ilginç oldu.
Eğer model, popüler dillerin dil bilgisi ve yaygın yazım biçimlerini hatırlamaya dayanıyorsa, Ada'ya geçildikten sonra performansın düşmesi gerekirdi.
Ancak şu anki sonuç, başka bir olasılığa işaret ediyor—
En güçlü model, artık belirli veri kümelerinin etkisinden kurtulmuş ve sıfırdan tam bir yazılım projesi oluşturma becerisini öğrenmeye başlamıştır.
%100 geçiş çizgisinde donma, 10 milyar Token sınır testi
Daha spesifik olarak, tam MirrorCode, Unix araçları, yorumlayıcılar, veri sorgulama, biyoenformatik, kriptografi ve sıkıştırma araçları alanlarını kapsayan 25 hedef programdan oluşur.
Burada model, internete erişimi olmayan, orijinal proje kaynak kodunu göremeyen ve üçüncü taraf bağımlılıkları indiremeyen bir izole ortama yerleştirilir. Modelin elinde yalnızca üst düzey belgeler, bazı görünür testler ve tekrar tekrar çağrılabilen orijinal program bulunur.
Sonra, iç mantığı tahmin etmek için sürekli olarak orijinal programa veri girmeli ve çıktıları gözlemlemelidir. Nokta Nokta Yeni bir davranış tutarlı program yazın.
En son sıralamadan 15 adet Medium ve Large hedef seçilir. Her hedef, iki farklı uygulama diliyle gerçekleştirilir ve her dil üç kez çalıştırılır.
Ayrıca, görünür testlerin ve gizli testlerin tamamlanma oranı %100 olmalıdır; %99,9 yeterli değildir.
Bir kenar durumu bile kaçırılırsa, tüm çalışma başarısız olarak hesaplanır.

Modelin son birkaç boşluğu da doldurması için MirrorCode, tek seferlik bütçeyi 10 milyar Token'a çıkardı ve en fazla 7 gün sürekli çalışmasına izin verdi.
Makaledeki en maliyetli görev daha da çarpıcı: model 19 gün boyunca sürekli çalıştı ve tek bir seferde 2600 dolar harcandı.
Bu 19 gün içinde, model orijinal programı tekrar çalıştıracak, sonuçları karşılaştıracak, fonksiyonları tamamlayacak ve testleri yeniden çalıştıracaktır. Hata alındığında neden araştırılacak, çıktı uyumlu değilse varsayımlar değiştirilecek, yerel geçişler sağlandıktan sonra bir sonraki eksiklik takip edilecektir.
Tüm süreç, bir üretimi değil, birkaç gün süren bir hata ayıklama gibi görünüyor.

gotree örneği en doğrudur.
Bu biyoinformatik aracı orijinalde yaklaşık 16.000 satır Go kodu ve 40'tan fazla komuta sahipti.
Claude Opus 4.7, 14 saat ve 251 dolar harcayarak 2001 testin 2000'ini geçti ve %99,95 tamamlama oranı sağladı.
Bir haftalık iş yükünü onlarca saate indirmiş olsa da, MirrorCode'ın %100 tamamlama çizgisinde bir tarih notu işleme kenar durumu kaçırmıştı—
Epoch, AI kullanılmadığında insan mühendislerinin aynı görevi tamamlamak için en az 2 ila 17 hafta harcayacağını tahmin ediyor.
Bir dil veri çölünde, Fable 5 sadece 3 puan düşürdü.
MirrorCode makalesi, önceki olarak StarCoder'un açık eğitim karışımını referans olarak kullanmıştır.
Python yaklaşık %8'i temsil ederken, Ada yalnızca %0,034'tür; ilkisi ikincisinin yaklaşık 230 katıdır.

Elbette, kapalı kaynaklı modelin ne kadar Ada kodu gördüğünü bilemeyiz. Ancak açık ekosisteme referans alındığında, Ada'nın ne kadar nadir olduğu yeterince açık.
Bu dil chủ yếu出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。
Fable 5, açıkça Go kodunu Ada'ya satır satır çevirmiyor.
Daha çok, orijinal programın nasıl çalıştığını önceden anlayıp, aynı davranışı tekrar oluşturmak için başka bir dil kullanmaktır.

Karşılaştırıldığında, diğer modeller bu kadar kararlı değil.
GPT-5.6, %24'ten %19'a düştü, GPT-5.4, %21'den %12'ye düştü, GPT-5.5 ise %17'den %5'e düştü. Dil değiştirildiğinde fark hemen büyüdü.
Projeyi tamamen AI'ya bırakın
Şu anda Cursor, sıfırdan yaklaşık bir hafta boyunca yüzlerce Agent'in birlikte çalışmasını sağlayarak 1000 dosyaya yayılmış 1 milyondan fazla satır tarayıcı kodu yazdı.
Anthropic, 16 Claude Agent'i paralel olarak yaklaşık 2000 kez çalıştırdı ve sonunda 100.000 satır uzunluğunda, Linux 6.9 çekirdeğini derleyebilen bir C derleyicisi oluşturdu.
OpenAI, Mayıs itibarıyla Codex için paylaşılan bireysel kullanıcı örneğinde, kullanıcıların %70,2'sinin en az bir kez bir saatten fazla insan iş gücüne denk gelen bir görev gönderdiğini; %25,6'sının sekiz saatten fazla bir görev gönderdiğini ortaya koydu.
İnsanların AI'ya verdiği birimler, bir kod parçası veya bir hata yerine bir öğlen, bir hafta veya hatta tüm projeye dönüşüyor.
MirrorCode'in %64'ü, tam olarak bu "proje düzeyindeki vekalet"in nicelleştirilmesidir.
Bu, hedefler yeterince net olduğunda ve sonuçlar otomatik olarak doğrulanabiliyorsa, öncü modellerin zaten orta ve büyük ölçekli yazılımların bir kısmını bağımsız olarak tamamlayabildiğini açıklıyor.
AI'ye iş veren herkes için değişim artık yakındır—
Daha önce her satır kodu yazarken onu izlemek zorundaydınız, şimdi ise sadece kritik noktalarda yanlış yöne gitmediğinden emin olursunuz.
Kodlar giderek daha ucuz olacak.
Soruları açıkça anlatan ve sonuçları doğrulayan kişiler giderek daha değerli hale gelecektir.
Kaynaklar: https://epoch.ai/MirrorCode
Bu yazı, WeChat hesabından "Yeni Zihin" tarafından paylaşılmıştır; yazar: ASI Vahiyleri; editör: Musa
