Claude Fable 5 Mendominasi Ujian Pengekodan AI dengan Kadar Kejayaan 64%

icon MarsBit
Kongsi
AI summary iconRingkasan
Claude Fable 5 memimpin ujian pengkodean AI dengan kadar kejayaan 64% pada MirrorCode, melampaui GPT-5.6 Sol dan GPT-5.5. Ia menangani kedua-dua bahasa utama dan niche seperti Go dan Ada, dengan penurunan prestasi hanya 3% untuk yang terakhir. MirrorCode memerlukan cakupan ujian 100% tanpa akses kod, membuktikan kemahiran rekonstruksi logik Fable 5. Semasa altcoin yang perlu diperhatikan mendapat perhatian, indeks ketakutan dan keserakahan tetap menjadi ukuran utama bagi pedagang yang memantau perasaan pasaran.

Claude kali ini benar-benar menciptakan jarak besar dalam senarai pengaturcaraan AI!

Dalam peringkat MirrorCode yang baru saja dikemas semula, Claude Fable 5 kembali menduduki puncak dengan kejayaan mutlak sebanyak 64%.

GPT-5.6 Sol yang mengikut rapat hanya mempunyai tiga persepuluh skornya!

GPT-5.5 yang berada di tempat keempat lebih buruk lagi. Tidak hanya mendapat skor hanya 10%, tetapi juga dipermalukan oleh senior sendiri, GPT-5.4.

Pengaturan AI

Yang lebih mengejutkan, semasa menggunakan bahasa sumber tinggi seperti Go, kadar penyelesaian Fable 5 ialah 64%; apabila ditukar kepada bahasa kurang popular seperti Ada, keputusan masih tinggi pada 61%.

Perlu diketahui, di dunia sumber terbuka, korpus Python kira-kira 230 kali ganda daripada Ada.

Namun, di Fable 5, pencapaian hanya turun 3 peratus.

Pengaturan AI

Ini menjadi menarik.

Jika model terutama bergantung pada ingatan terhadap tatabahasa bahasa popular dan cara penulisan biasa, maka selepas bertukar kepada Ada, keputusan sepatutnya menurun.

Namun, hasil sekarang menunjukkan kemungkinan lain—

Model terkuat telah melepaskan diri daripada pengaruh korpus spesifik dan mulai belajar cara membina projek perisian lengkap dari awal.

Tersangkut pada garis lulus 100%, ujian ekstrem 10 bilion Token

Secara khusus, MirrorCode yang lengkap mengandungi 25 program sasaran, mencakupi alat Unix, interpreter, soalan data, bioinformatik, dan alat mampatan.

Di sini, model akan ditempatkan dalam persekitaran terpisah, tanpa internet, tidak dapat melihat kod sumber projek asal, dan tidak boleh memuat turun dependensi pihak ketiga. Ia hanya boleh mendapat dokumen peringkat tinggi, sebahagian ujian yang boleh dilihat, serta program asal yang boleh dipanggil berulang-ulang.

Seterusnya, ia perlu terus memasukkan data ke dalam program asal, memantau output untuk menebak logik dalaman, kemudian satu Titik-titik Tulis program baru yang bertindak secara konsisten.

Pilih 15 sasaran Medium dan Large daripada senarai terkini. Setiap sasaran menggunakan dua bahasa pelaksanaan, setiap bahasa dijalankan tiga kali.

Selain itu, kadar penyelesaian ujian kelihatan dan ujian tersembunyi mesti mencapai 100% untuk lulus; 99.9% tidak diterima.

Walaupun hanya melewatkan satu kes tepi, keseluruhan pelaksanaan masih dihitung sebagai kegagalan.

Pengaturan AI

Untuk memaksa model mengisi kekurangan terakhir, MirrorCode meningkatkan anggaran sekali jalan kepada 10 miliar Token, dengan tempoh maksimum 7 hari berturut-turut.

Tugasan paling mahal dalam kertas ini lebih teruk lagi: model berjalan berterusan selama 19 hari, dengan kos sekali lari mencapai USD2,600.

Dalam 19 hari ini, model akan menjalankan semula program asal, membandingkan hasil, menambah fungsi, kemudian menjalankan semula ujian. Jika berlaku ralat, cari punca masalah; jika output tidak sepadan, tukar hipotesis; setelah bahagian tertentu lulus, teruskan mencari kekurangan seterusnya.

Proses keseluruhan lebih seperti penyesuaian yang berterusan selama beberapa hari, bukan sekadar penghasilan.

Pengaturan AI

Contoh gotree paling intuitif.

Alat bioinformatik ini asalnya mempunyai sekitar 16,000 baris kod Go dan lebih daripada 40 arahan.

Claude Opus 4.7 menghabiskan 14 jam dan $251 untuk lulus 2000 daripada 2001 ujian, dengan keberhasilan 99.95%.

Walaupun terlepas satu batas langka dalam pemprosesan catatan tarikh dan terhenti di garis lulus 100% MirrorCode, ia telah mengurangkan jumlah kerja yang sebelumnya dihitung seminggu kepada hanya beberapa belas jam—

Epoch menganggarkan bahawa jika tidak menggunakan AI, jurutera manusia memerlukan sekurang-kurangnya 2 hingga 17 minggu untuk menyelesaikan tugas yang sama.

Dalam gurun korpus, Fable 5 hanya menjatuhkan 3 mata

Kertas kerja MirrorCode sebelum ini menggunakan campuran latihan awam StarCoder sebagai rujukan.

Python mewakili sekitar 8%, manakala Ada hanya 0.034%, dengan yang pertama kira-kira 230 kali ganda yang kedua.

Pengaturan AI

Tentu, kita tidak tahu berapa banyak kod Ada yang telah dilihat model sumber tertutup. Tetapi dengan menjadikan ekosistem terbuka sebagai rujukan, seberapa jarangnya Ada sudah cukup jelas.

Bahasa ini terutama muncul dalam sistem aerospace, pertahanan, dan sistem kritikal keselamatan lainnya. Ia jauh ketinggalan berbanding Python, JavaScript, atau Go dari segi ukuran komuniti, bilangan tutorial, atau projek sumber terbuka.

Dan Fable 5 jelas bukan menterjemahkan kod Go secara per baris ke dalam Ada.

Ia lebih seperti memahami terlebih dahulu bagaimana program asal berfungsi, kemudian menukar ke bahasa lain dan membina semula perilaku yang sama.

Pengaturan AI

Sebaliknya, model lain tidak sestabil ini.

GPT-5.6 turun dari 24% ke 19%, GPT-5.4 turun dari 21% ke 12%, dan GPT-5.5 pula turun dari 17% ke 5%. Apabila bahasa ditukar, jurang segera diperbesar.

Serahkan keseluruhan projek kepada AI

Sekarang, Cursor telah membolehkan ratusan Agent bekerjasama selama hampir seminggu, menulis lebih dari 1 juta baris kod browser dari awal, tersebar dalam 1,000 fail.

Anthropic menjalankan 16 agen Claude secara serentak selama hampir 2.000 sesi, dan akhirnya membina sebuah kompilator C sebanyak 100.000 baris yang mampu mengompilasi kernel Linux 6.9.

Dalam sampel pengguna peribadi Codex yang diungkapkan oleh OpenAI sehingga Mei, 70.2% sekurang-kurangnya menghantar satu tugas yang dijangka memerlukan lebih daripada satu jam kerja manusia; 25.6% menghantar tugas yang melebihi lapan jam.

Unit yang diberikan manusia kepada AI sedang berubah daripada satu kod, satu ralat, kepada satu petang, satu minggu, atau seluruh projek.

64% daripada MirrorCode merupakan kuantifikasi terhadap "penghantaran peringkat projek" ini.

Ia menjelaskan bahawa dengan tujuan yang jelas dan hasil yang boleh diterima secara automatik, model terkini sudah mampu menyelesaikan sebahagian daripada perisian sederhana hingga besar secara berdiri sendiri.

Bagi setiap orang yang menyerahkan pekerjaan kepada AI, perubahan sudah berada di ambang pintu—

Sebelum ini, anda perlu memantau setiap baris kod yang ditulis, tetapi seterusnya, anda lebih mungkin hanya memeriksa sama ada ia menyimpang pada titik-titik kunci.

Kod akan menjadi semakin murah.

Dan mereka yang mampu menjelaskan masalah dengan jelas dan memeriksa hasil dengan teliti akan menjadi semakin berharga.

Rujukan: https://epoch.ai/MirrorCode

Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: ASI Revelation; penyunting: Musa

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.