Claude kali ini benar-benar menciptakan jarak besar dalam senarai pengaturcaraan AI!
Dalam peringkat MirrorCode yang baru saja dikemas semula, Claude Fable 5 kembali menduduki puncak dengan kejayaan mutlak sebanyak 64%.
GPT-5.6 Sol yang mengikut rapat hanya mempunyai tiga persepuluh skornya!
GPT-5.5 yang berada di tempat keempat lebih buruk lagi. Tidak hanya mendapat skor hanya 10%, tetapi juga dipermalukan oleh senior sendiri, GPT-5.4.

Yang lebih mengejutkan, semasa menggunakan bahasa sumber tinggi seperti Go, kadar penyelesaian Fable 5 ialah 64%; apabila ditukar kepada bahasa kurang popular seperti Ada, keputusan masih tinggi pada 61%.
Perlu diketahui, di dunia sumber terbuka, korpus Python kira-kira 230 kali ganda daripada Ada.
Namun, di Fable 5, pencapaian hanya turun 3 peratus.

Ini menjadi menarik.
Jika model terutama bergantung pada ingatan terhadap tatabahasa bahasa popular dan cara penulisan biasa, maka selepas bertukar kepada Ada, keputusan sepatutnya menurun.
Namun, hasil sekarang menunjukkan kemungkinan lain—
Model terkuat telah melepaskan diri daripada pengaruh korpus spesifik dan mulai belajar cara membina projek perisian lengkap dari awal.
Tersangkut pada garis lulus 100%, ujian ekstrem 10 bilion Token
Secara khusus, MirrorCode yang lengkap mengandungi 25 program sasaran, mencakupi alat Unix, interpreter, soalan data, bioinformatik, dan alat mampatan.
Di sini, model akan ditempatkan dalam persekitaran terpisah, tanpa internet, tidak dapat melihat kod sumber projek asal, dan tidak boleh memuat turun dependensi pihak ketiga. Ia hanya boleh mendapat dokumen peringkat tinggi, sebahagian ujian yang boleh dilihat, serta program asal yang boleh dipanggil berulang-ulang.
Seterusnya, ia perlu terus memasukkan data ke dalam program asal, memantau output untuk menebak logik dalaman, kemudian satu Titik-titik Tulis program baru yang bertindak secara konsisten.
Pilih 15 sasaran Medium dan Large daripada senarai terkini. Setiap sasaran menggunakan dua bahasa pelaksanaan, setiap bahasa dijalankan tiga kali.
Selain itu, kadar penyelesaian ujian kelihatan dan ujian tersembunyi mesti mencapai 100% untuk lulus; 99.9% tidak diterima.
Walaupun hanya melewatkan satu kes tepi, keseluruhan pelaksanaan masih dihitung sebagai kegagalan.

Untuk memaksa model mengisi kekurangan terakhir, MirrorCode meningkatkan anggaran sekali jalan kepada 10 miliar Token, dengan tempoh maksimum 7 hari berturut-turut.
Tugasan paling mahal dalam kertas ini lebih teruk lagi: model berjalan berterusan selama 19 hari, dengan kos sekali lari mencapai USD2,600.
Dalam 19 hari ini, model akan menjalankan semula program asal, membandingkan hasil, menambah fungsi, kemudian menjalankan semula ujian. Jika berlaku ralat, cari punca masalah; jika output tidak sepadan, tukar hipotesis; setelah bahagian tertentu lulus, teruskan mencari kekurangan seterusnya.
Proses keseluruhan lebih seperti penyesuaian yang berterusan selama beberapa hari, bukan sekadar penghasilan.

Contoh gotree paling intuitif.
Alat bioinformatik ini asalnya mempunyai sekitar 16,000 baris kod Go dan lebih daripada 40 arahan.
Claude Opus 4.7 menghabiskan 14 jam dan $251 untuk lulus 2000 daripada 2001 ujian, dengan keberhasilan 99.95%.
Walaupun terlepas satu batas langka dalam pemprosesan catatan tarikh dan terhenti di garis lulus 100% MirrorCode, ia telah mengurangkan jumlah kerja yang sebelumnya dihitung seminggu kepada hanya beberapa belas jam—
Epoch menganggarkan bahawa jika tidak menggunakan AI, jurutera manusia memerlukan sekurang-kurangnya 2 hingga 17 minggu untuk menyelesaikan tugas yang sama.
Dalam gurun korpus, Fable 5 hanya menjatuhkan 3 mata
Kertas kerja MirrorCode sebelum ini menggunakan campuran latihan awam StarCoder sebagai rujukan.
Python mewakili sekitar 8%, manakala Ada hanya 0.034%, dengan yang pertama kira-kira 230 kali ganda yang kedua.

Tentu, kita tidak tahu berapa banyak kod Ada yang telah dilihat model sumber tertutup. Tetapi dengan menjadikan ekosistem terbuka sebagai rujukan, seberapa jarangnya Ada sudah cukup jelas.
Bahasa ini terutama muncul dalam sistem aerospace, pertahanan, dan sistem kritikal keselamatan lainnya. Ia jauh ketinggalan berbanding Python, JavaScript, atau Go dari segi ukuran komuniti, bilangan tutorial, atau projek sumber terbuka.
Dan Fable 5 jelas bukan menterjemahkan kod Go secara per baris ke dalam Ada.
Ia lebih seperti memahami terlebih dahulu bagaimana program asal berfungsi, kemudian menukar ke bahasa lain dan membina semula perilaku yang sama.

Sebaliknya, model lain tidak sestabil ini.
GPT-5.6 turun dari 24% ke 19%, GPT-5.4 turun dari 21% ke 12%, dan GPT-5.5 pula turun dari 17% ke 5%. Apabila bahasa ditukar, jurang segera diperbesar.
Serahkan keseluruhan projek kepada AI
Sekarang, Cursor telah membolehkan ratusan Agent bekerjasama selama hampir seminggu, menulis lebih dari 1 juta baris kod browser dari awal, tersebar dalam 1,000 fail.
Anthropic menjalankan 16 agen Claude secara serentak selama hampir 2.000 sesi, dan akhirnya membina sebuah kompilator C sebanyak 100.000 baris yang mampu mengompilasi kernel Linux 6.9.
Dalam sampel pengguna peribadi Codex yang diungkapkan oleh OpenAI sehingga Mei, 70.2% sekurang-kurangnya menghantar satu tugas yang dijangka memerlukan lebih daripada satu jam kerja manusia; 25.6% menghantar tugas yang melebihi lapan jam.
Unit yang diberikan manusia kepada AI sedang berubah daripada satu kod, satu ralat, kepada satu petang, satu minggu, atau seluruh projek.
64% daripada MirrorCode merupakan kuantifikasi terhadap "penghantaran peringkat projek" ini.
Ia menjelaskan bahawa dengan tujuan yang jelas dan hasil yang boleh diterima secara automatik, model terkini sudah mampu menyelesaikan sebahagian daripada perisian sederhana hingga besar secara berdiri sendiri.
Bagi setiap orang yang menyerahkan pekerjaan kepada AI, perubahan sudah berada di ambang pintu—
Sebelum ini, anda perlu memantau setiap baris kod yang ditulis, tetapi seterusnya, anda lebih mungkin hanya memeriksa sama ada ia menyimpang pada titik-titik kunci.
Kod akan menjadi semakin murah.
Dan mereka yang mampu menjelaskan masalah dengan jelas dan memeriksa hasil dengan teliti akan menjadi semakin berharga.
Rujukan: https://epoch.ai/MirrorCode
Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: ASI Revelation; penyunting: Musa
