Kod Muse Meta Kalah kepada Claude Opus 5 Anthropic dalam Ujian Pengekodan AI

iconBeInCrypto
Kongsi
AI summary iconRingkasan
Berita AI + kripto: Meta’s Muse Code, dilancarkan dalam versi beta pada 5 Ogos 2026, kalah kepada Claude Opus 5 milik Anthropic dalam keempat-empat tolok pengaturcaraan yang diterbitkan oleh Meta. Data bebas menunjukkan jurang yang lebih besar daripada yang dilaporkan. Meta menghilangkan GPT-5.6 Sol milik OpenAI, yang memimpin dalam ujian. Data inflasi masih menjadi faktor makro utama untuk pasaran kripto.

Mark Zuckerberg melancarkan Muse Code dalam versi beta pada Rabu, agen pengaturcaraan kecerdasan buatan (AI) pertama Meta. Claude Opus 5 daripada Anthropic mengalahkannya dalam keempat-empat perbandingan yang diterbitkan Meta pada pelancaran.

Meta telah menerbitkan grafik tersebut sama ada begitu. Syarikat tersebut menjual alat yang lebih murah, bukan yang lebih baik. Data ujian bebas menunjukkan jurangnya lebih luas daripada yang ditunjukkan oleh Meta.

Disponsori
Disponsori

Ikuti kami di X untuk mendapatkan berita terkini sebaiknya ia berlaku

Grafik Milik Meta Menang Atas Anthropic Setiap Pusingan

Muse Spark 1.2 adalah model di dalam Muse Code. Ia mendapat skor 82.9% pada Terminal-Bench 2.1.

Claude Opus 5 mendapat skor 86.7% pada ujian yang sama. Terminal-Bench datang dari Institut Laude dan penyelidik Stanford. Ia menetapkan 89 pekerjaan sebenar yang merangkumi pembaikan sistem, kerja data, dan keselamatan.

Tempat kedua adalah terhormat. Muse Code mengalahkan Codex OpenAI pada 81.8% dan Grok Build pada 81.6%.

Grafik perbandingan benchmark untuk Muse Spark 1.2
Grafik perbandingan benchmark untuk Muse Spark 1.2, Sumber: Zuckerberg

Graf seterusnya lebih kejam. DeepSWE 1.1 menetapkan 113 tugas pengaturan kod dengan akses internet dimatikan semasa penilaian. Muse Spark 1.2 jatuh ke tempat ketiga pada 59.3%.

Meta kemudian menerbitkan ujian yang dibina sendiri, diambil daripada 440 permintaan tarik nyata oleh jurutera sendiri. Muse Spark 1.2 mendapat 70.6% di sana, kira-kira sembilan mata di belakang Opus 5.

Disponsori
Disponsori
Muse Spark 1.2 menjalankan tugas pengoptimuman kernel selama 24 jam pada NVIDIA Hopper — lebih daripada 1,000 panggilan alat — dan terus menemukan peningkatan kelajuan selepas fasa eksplorasi awal.
Muse Spark 1.2 menjalankan tugas pengoptimuman kernel selama 24 jam pada NVIDIA Hopper — lebih daripada 1,000 panggilan alat — dan terus menemukan peningkatan kelajuan sejauh selepas fasa eksplorasi awal.

Skor itu berada hanya 2.3 mata di atas Muse Spark 1.1, model yang dilancarkan Meta pada Julai.

Model Meta Meninggalkan Carta Pengekodannya

Meta mengukur dirinya sendiri terhadap GPT-5.6 Terra. OpenAI menjual model yang lebih kuat bernama Sol, dan Meta mengeluarkannya dari ketiga-tiga carta pengkodean.

Sol memimpin papan pemimpin Terminal-Bench 2.1 leaderboard pada 89.5%. Opus 5 mengikuti pada 89.1%.

Kedua-dua angka itu melampaui 86.7% yang dilaporkan Meta untuk Opus 5. Meta memilih pengaturan yang lebih lemah bagi pesaing terkuatnya dan masih berada di belakangnya.

Menghadapi Sol, pemimpin sejati, Muse Spark 1.2 tertinggal 6.6 mata bukan 3.8.

Meta memang menyertakan Sol di satu tempat. Pada tugas kernel unit pemprosesan grafik (GPU) yang berjalan melebihi 1,000 panggilan alat, Sol meningkatkan asas sebanyak 71.2%. Muse Spark 1.2 mencapai 68.7% dan menempati tempat keempat daripada enam.

Satu peringatan memotong arah yang lain. Muse Spark 1.2 belum muncul di papan pemimpin awam itu, di mana hanya 26 daripada 183 model yang dipantau telah diuji. 82.9%nya masih merupakan angka Meta.

“Muse Spark 1.2 adalah langkah seterusnya kami semasa kami mendorong ke hadapan, dengan model yang lebih besar dan lebih cekap akan datang,” kata Zuckerberg said dalam satu pos.

Zuckerberg Mungkin Segera Menyelenggarakan Model yang Mengalahkan Dirinya Sendiri

Meta dilaporkan sedang berbincang untuk menyewa komputasi kepada Anthropic. Perjanjian ini boleh mencapai $10 bilion dalam tempoh dua tahun. Pusat data Meta kemudian akan membantu menjalankan model Claude yang Muse Code dibina untuk menggantikan.

Kepimpinan di sebalik Muse Code mahal. Zuckerberg membayar $14.3 bilion pada Jun 2025 untuk Scale AI dan pendirinya Alexandr Wang, yang kini memimpin Meta Superintelligence Labs.

Harga adalah tuas yang tinggal dimiliki Wang. Kadar sepadan dengan pelancaran API berbayar pertama Meta pada Julai dengan harga $1.25 setiap juta token input dan $4.25 setiap juta token output.

Tahap penyumbang berharga kurang daripada 10 kali ganda. Pembangun memenuhi syarat dengan membenarkan Meta melatih data berdasarkan kerja mereka. Wang menolak memberikan nombor pengambilan untuk siri Muse Spark.

Akaun Meta menjelaskan diskaun. Hasil meningkat 28% kepada $60.8 bilion pada kuartal lepas, tetapi keuntungan operasi turun 8% kepada $18.8 bilion.

Margin operasi turun kepada 31% daripada 43% pada tahun sebelumnya. Meta mengeluarkan $31.08 bilion untuk projek modal semasa kuartal ini sahaja, dan menggariskan sehingga $145 bilion untuk tahun ini.

Muse Code menawarkan kejuruteraan yang tidak dimiliki oleh Claude Code. Agen latar belakang menyimpan konteks sepanjang sesi. Agen sub bekerja dalam salinan terpisah dari repositori.

Meta telah membina pengaturcara terbaik kedua yang kukuh dan menetapkan harganya seperti pilihan bajet. Beta akan menunjukkan sama ada pembangun mempertukarkan beberapa titik ketepatan dengan bil yang kira-kira sepuluh kali lebih kecil.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.