Meta Melancarkan Muse Code, Agen Pemrograman Terminal Pertama dengan Agen Berjalan Panjang dan Pilihan Diskon 95%

iconMetaEra
Kongsi
AI summary iconRingkasan
Meta melancarkan Muse Code, agen pemrograman terminal pertamanya, yang dibina daripada MetaEra dan dipasangkan dengan model Muse Spark 1.2 yang ditingkatkan. Agen ini mampu menangani pangkalan kod yang besar, menyusun rancangan, menulis dan menguji kod, serta menjalankan agen latar belakang. Versi penyumbang menawarkan pengurangan kos sebanyak 95% sebagai pertukaran untuk akses data. Sistem ini menyokong tugas jangka panjang dan pemulihan apabila gagal. Meta menyatakan bahawa Muse Spark 1.2 hampir setara dengan model teratas, tetapi belum lagi mengalahkan pesaing dalam semua ujian. Berita kerosakan pasaran dan data inflasi mungkin mempengaruhi pengambilan.
Pada 5 Ogos 2026, Meta melancarkan agen pemrograman terminal pertamanya—Muse Code—dan secara serentak memperkenalkan model Muse Spark 1.2 yang dioptimaskan khas untuk pemrograman. Muse Code mampu membaca perpustakaan kod besar, merancang rancangan pengubahsuaian, menulis kod, menjalankan ujian, dan mengesahkan keputusan, serta membenarkan beberapa agen latar belakang berjalan secara berterusan sepanjang sesi, tanpa perlu memahami semula projek setiap kali menerima tugas. Meta juga merekabentuk log peristiwa tempatan yang hanya boleh ditambah, tidak boleh menimpa, supaya walaupun program gagal, sistem boleh pulih dengan tepat ke kedudukan yang terputus. Yang menarik perhatian pembangun ialah harga: versi standard berharga $1.25 dan $4.25 setiap juta token input dan output; jika pengguna membenarkan Meta menggunakan input dan output untuk memperbaiki produk, “versi penyumbang” akan turun kepada $0.10 dan $0.20. Syarat pertukaran di sebalik harga rendah bukan promosi biasa, tetapi kod dan data penggunaan. Ulasan rasmi menunjukkan Muse Spark 1.2 hampir setara dengan model pemrograman teratas, tetapi belum unggul sepenuhnya, dan sebahagian keputusan belum disahkan semula secara bebas. Isyarat yang dikeluarkan oleh Meta kali ini ialah: unit persaingan dalam pemrograman AI sedang berubah daripada model tunggal kepada sistem lengkap yang terdiri daripada model, kerangka operasi agen, status jangka panjang, dan gelung data.

Penulis artikel, sumber: Meta AI Research

Meta akhirnya memiliki "Claude Code" sendiri

Muse Code ialah Agen pemrograman terminal pertama yang dilancarkan oleh Meta, kini tersedia dalam versi ujian untuk macOS dan Linux. Ia bukan bertujuan untuk melengkapkan kod, tetapi tugas kejuruteraan perisian penuh: memasuki gudang kod besar, memahami struktur sedia ada, merancang penyelesaian, mengubah banyak fail, menjalankan arahan dan ujian, kemudian menyesuaikan berdasarkan keputusan.

Ini membawa Muse Code masuk ke pasaran yang sedang diperebutkan oleh produk seperti Claude Code, Codex, dan Gemini CLI. Model tidak lagi hanya menjawab “Bagaimana cara menulis kod ini?”, tetapi mendapat akses kepada terminal, sistem fail, dan alat pembangunan, serta dapat menjalankan tugas secara berterusan dengan sedikit campur tangan manusia.

Meta dalam artikelnya memperkenalkan Muse Code dan Muse Spark 1.2 sebagai satu sistem, bukan dua produk yang boleh dipisahkan secara sewenang-wenang. Muse Spark 1.2 bertanggung jawab atas pemahaman, penalaran, dan penghasilan, manakala Muse Code bertanggung jawab atas pengorganisasian konteks, penjadualan sub-Agent, pemanggilan alat, penyimpanan status, dan pengesahan hasil. Kedua-duanya juga telah dioptimalkan secara bersama semasa peringkat latihan, bermakna model yang sama jika dipindahkan ke kerangka Agent lain mungkin tidak dapat mereplikasi pencapaian yang ditunjukkan oleh Meta.

Multi-Agent bukan sekadar mengumpulkan grup sementara, tetapi menetap secara berterusan

Reka bentuk paling berbeza Muse Code ialah satu set Agent latar belakang yang berjalan secara asinkron.

Sistem agen ganda yang biasa akan menciptakan seorang pembantu sementara apabila perlu melaksanakan tugas anak, contohnya untuk mencari fail yang berkaitan, menganalisis kegagalan ujian, atau menyelidiki satu ketergantungan. Selepas tugas selesai, konteks pembantu ini sering kali hilang; apabila menghadapi masalah serupa seterusnya, sistem mungkin sekali lagi memindai kod yang sama, mengumpul maklumat yang sama secara berulang.

Agen latar belakang Muse Code akan tetap aktif sepanjang sesi. Mereka boleh terus mengumpulkan pemahaman terhadap repositori kod, menggerakkan langkah seterusnya secara sendiri, dan memilih masa untuk melaporkan hasil kepada Agen utama. Agen utama bertanggungjawab mengkoordinasikan objektif, manakala agen latar belakang boleh menyelidiki modul yang berbeza, memeriksa ujian, mencari hubungan panggilan, atau mengesahkan pelaksanaan.

Reka bentuk ini cuba menyelesaikan pembaziran biasa dalam tugas panjang: Agen terus lupa apa yang telah dilihatnya sebelumnya. Selagi status latar belakang Agen dapat dikekalkan dengan boleh dipercayai, ia tidak perlu membaca semula struktur item pada setiap langkah, dan manusia tidak perlu terus mengingatkan ia bahawa “fail ini telah diperiksa sebelumnya”.

Namun, beberapa agen yang mengubah kod secara serentak juga membawa masalah konflik, keizinan, dan kos. Artikel terbuka Meta tidak mengungkap sepenuhnya bagaimana tugas dibahagikan, bagaimana perubahan kod digabungkan, dan bagaimana agen latar belakang lain mengelakkan mewarisi kesimpulan yang salah apabila satu agen latar belakang mengalami ralat. Oleh itu, agen berterusan adalah arah seni bina yang patut diperhatikan, tetapi pada masa ini tidak mungkin hanya berdasarkan demo rasmi untuk menilai kestabilannya dalam projek pasukan sebenar.

Selepas kegagalan, tidak perlu bermula semula

Agen pemrograman yang berjalan jangka panjang menghadapi masalah yang sangat nyata: semakin lama tugas, semakin besar kemungkinan mengalami gangguan jaringan, ralat alat, kegagalan proses, atau melebihi hadiah konteks. Jika sistem hanya menyimpan keadaan semasa dalam perbualan model, satu kegagalan sahaja boleh menyebabkan kerja eksplorasi berjam-jam hilang seluruhnya.

Muse Code telah membuat log peristiwa tempatan untuk ini. Setiap panggilan model, pelaksanaan alat, persetujuan pengguna, dan pengubahsuaian fail ditulis secara tambahan ke dalam log, dan sejarah yang telah berlaku tidak akan ditimpa secara langsung oleh keadaan seterusnya.

Meta menyebut mekanisme ini sebagai "boleh diputar semula dengan tepat" dan "selamat daripada kegagalan semula". Apabila Agent gagal di tengah jalan, sistem boleh memulihkan kerja berdasarkan rekod peristiwa, bukan menebak semula apa yang telah berlaku sebelumnya. Ini sebenarnya mengubah Agent pemrograman daripada satu perbualan sementara kepada proses kejuruteraan yang lebih mirip berstatus.

Muse Code juga dilengkapi beberapa kemahiran yang boleh dipanggil:/planterlebih dahulu menghasilkan pelaksanaan rancangan yang memerlukan persetujuan pengguna;/grillsecara khusus menyerang dan mempertanyakan rancangan ini untuk mengenal pasti kekurangan, risiko, dan andaian yang salah;/goalmembuat Agent terus melaksanakan berdasarkan matlamat yang ditentukan sehingga syarat penyelesaian tercapai.

Gagasan di sebalik ciri-ciri ini jelas: jika AI perlu menjalankan kerja-kerja kejuruteraan perisian selama berjam-jam, perkara penting bukan sahaja sama ada kod yang dihasilkan pada setiap langkah itu cantik, tetapi juga sama ada ia mampu menyimpan kemajuan, menerima semakan, mengesan kelemahan dalam pelan, dan meneruskan pelaksanaan selepas kegagalan.

Muse Spark 1.2 ialah model, juga "enjin khas" untuk kerangka Agent

Muse Spark 1.2 ialah versi pengoptimuman pengaturcaraan yang dilancarkan kurang daripada sebulan selepas pelancaran versi 1.1. Meta menyatakan bahawa ia menambah kepelbagaian daya komputasi dan persekitaran latihan untuk tugas pengaturcaraan, dengan fokus pada peningkatan penghasilan kod, penyelesaian masalah yang kompleks, pemahaman perpustakaan kod, dan aliran pembangunan end-to-end.

Ruang latihan tidak hanya merangkumi pembaikan fail tunggal, tetapi juga mencakup penghasilan repositori kod penuh, projek end-to-end berskala besar, dan tugas penyelidikan automatik. Model akan menggunakan pelan untuk menyusun langkah-langkah kerja, mengekalkan arah melalui syarat matlamat, dan mengkompres semasa konteks terus bertambah, dengan mengekalkan maklumat yang benar-benar diperlukan untuk kerja seterusnya.

Meta juga melibatkan Muse Spark 1.1 dalam pelatihan model generasi seterusnya. Model lama bertanggungjawab menghasilkan persekitaran pemrograman yang lebih sukar dan templat pengikutan arahan, kemudian memberi skor kepada penyelesaian kandidat untuk menentukan sama ada ia memenuhi keperluan, dengan tujuan menghasilkan data secara berjumlah untuk dipelajari oleh versi 1.2.

“Peningkatan diri” yang disebutkan di sini masih bukan bererti model mengubah bobotnya sendiri selepas melepaskan kawalan manusia. Lebih tepatnya, model generasi sebelumnya digunakan sebagai penghasil data dan penilai, membantu pasukan memperluaskan data latihan generasi seterusnya. Aliran data, pengrunan latihan, dan pelepasan model akhir masih dikawal oleh Meta.

Lebih penting lagi, Meta tidak melatih model "yang boleh menulis kod" secara berasingan, tetapi memasukkan alat Muse Code, pengurusan objektif, pemampatan konteks, dan trajektori Sub-Agent ke dalam latihan. Kemampuan model pengaturcaraan masa depan mungkin semakin bergantung pada sejauh mana ia sudah mengenali kerangka Agent semasa peringkat latihan.

Fokus pameran ini ialah menjalankan selama 24 jam dan memanggil alat lebih daripada 1000 kali

Satu kes yang disediakan oleh Meta ialah membenarkan Muse Spark 1.2 mengoptimumkan kernel KDA dan MLA di atas GPU NVIDIA Hopper dalam persekitaran Muse Code. Sistem perlu menulis kod sendiri, mengompilasi, menganalisis prestasi, kemudian mengubah suai berulang kali berdasarkan keputusan.

Ujian keseluruhan berlangsung sehingga 24 jam, dengan lebih daripada 1000 panggilan alat. Penyelidik melarang model mengimport terus pustaka kernel pihak ketiga yang sudah ada, dan menuntut ia mengimplementasikan algoritma dalam Triton serta mencari peningkatan prestasi sebenar, bukan hanya membungkus implementasi sedia ada sebagai hasilnya.

Dalam tugas KDA, model menggabungkan kernel persiapan dalam blok secara selari dengan pengimbasan antar blok secara berurutan, serta menambahkan pengoptimuman khas untuk peleburan terkunci. Dalam tugas MLA, ia mereka aliran Triton yang terdiri daripada dua kernel dan mencuba memanfaatkan semula representasi laten KV yang dikongsi.

Kepentingan kes-kes semacam ini bukan terletak pada nombor akselerasi sekali jalan, tetapi pada sama ada Agent mampu mempertahankan matlamat, memahami data analisis prestasi, dan menghasilkan eksperimen seterusnya selepas mengalami ratusan kegagalan dan keputusan sementara. Jika sistem hanya mampu berfungsi dengan stabil selama beberapa minit, maka ia lebih menyerupai alat pelengkap canggih; baru apabila ia mampu meneruskan selama 24 jam, ia mulai mendekati Agent yang boleh dipercayakan untuk penyelidikan kejuruteraan.

Penilaian mendekati teratas, tetapi belum "mengalahkan Claude dan Codex"

Penilaian Meta merangkumi Terminal-Bench 2.1, DeepSWE 1.1, GDPVal-AA v2, MCP Atlas, dan ujian pemrograman dalaman. Di antaranya, Terminal-Bench 2.1 mengandungi 89 tugas yang perlu diselesaikan dalam persekitaran terminal; DeepSWE 1.1 mengandungi 113 tugas daripada 91 repositori kod yang meliputi lima bahasa pemrograman.

Berdasarkan grafik yang diterbitkan oleh Meta, Muse Spark 1.2 dengan Muse Code mencapai 82.9% pada Terminal-Bench 2.1, lebih rendah daripada 86.7% Claude Opus 5, tetapi lebih tinggi daripada Codex dan Grok Build dalam penilaian mereka. Pada DeepSWE 1.1, Muse Spark 1.2 mendapat 59.3%, tidak mencapai tempat pertama. Dalam 440 tugas kejuruteraan sebenar di dalam Meta, ia mendapat 70.6%, juga ketinggalan daripada Opus 5.

Hasil-hasil ini menunjukkan bahawa Muse Code telah memasuki lingkungan persaingan agen pengaturcaraan teratas, tetapi tidak menyokong kesimpulan bahawa "Meta secara menyeluruh mengalahkan Claude Code dan Codex".

ResmiFail kaedah penilaianJuga menyatakan bahawa setiap model dipasangkan dengan produk Agent masing-masing: Muse Spark menggunakan Muse Code, Claude menggunakan Claude Code, GPT menggunakan Codex, Gemini menggunakan Antigravity, dan Kimi menggunakan Kimi Code. Perbandingan seperti ini lebih mendekati pertandingan produk penuh, tetapi tidak dapat membezakan sama ada pencapaian tersebut datang daripada model atau kerangka Agent.

Meta juga mengakui bahawa persekitaran penilaian dalaman dan petunjuknya mungkin tidak dioptimumkan secara terbaik untuk model tertutup pihak ketiga. Keputusan Muse Spark 1.2 di Terminal-Bench masih belum masuk ke dalam senarai pengesahan bebas. Oleh itu, pernyataan paling selamat pada peringkat ini ialah: pengujian sendiri oleh Meta menunjukkan ia hampir mencapai tahap terkini, tetapi pengulangan bebas masih belum ada.

Versi paling murah, perlu ditukar dengan kod dan perbualan

Muse Spark 1.2 Edisi Standard dikenakan bayaran $1.25 setiap juta Token input, $0.15 untuk input cache, dan $4.25 untuk output. Input dan output versi ini tidak akan digunakan untuk memperbaiki produk Meta.

Model lain yang dikenal sebagaimuse-spark-1.2-contributor. Harga setiap juta token input hanya $0.10, cache input $0.002, dan output $0.20. Berbanding versi standard, input lebih murah 92% dan output lebih murah sekitar 95%.

Harga ialah petunjuk dan output model versi penyumbang boleh digunakan oleh Meta untuk memperbaiki produk. Untuk projek sumber terbuka, eksperimen peribadi, atau kerja yang tidak mengandungi maklumat sensitif, ini mungkin merupakan perjanjian yang sangat menarik; tetapi untuk kod perniagaan sulit, produk yang belum dilancarkan, data pelanggan, konfigurasi kunci, dan projek yang terikat oleh perjanjian kerahsiaan, ia adalah masalah tatacara data terlebih dahulu, bukan masalah harga.

Perusahaan tidak boleh hanya melihat harga token dan menganggap sesuai untuk menyerahkan keseluruhan kod kepada versi penyumbang. Pembenaran penggunaan data untuk latihan perlu dinilai berdasarkan syarat dan ketentuan khusus Meta, kepemilikan kod, kontrak pelanggan, dan dasar keselamatan dalaman. Versi standard dan versi penyumbang menggunakan kemampuan yang serupa, tetapi berkaitan dengan dua hubungan data yang sama sekali berbeza.

Ini juga mengungkap strategi persaingan sebenar Meta: ia tidak hanya ingin menarik pembangun dengan harga rendah, tetapi juga ingin membina kitaran data latihan pemrograman baru melalui tugas, pengubah, maklum balas, dan hasil yang dihasilkan apabila pembangun menggunakan Muse Code. Pembangun mendapat panggilan Agent yang hampir percuma, manakala Meta mungkin memperoleh data yang lebih berharga daripada kod GitHub awam—bagaimana tugas sebenar dipecahkan, diubah, dan disahkan.

Pembangunan AI memasuki peringkat "latihan bersama model dan kerangka kerja"

Dahulu, orang menilai AI pemrograman dengan membandingkan berapa banyak soal yang boleh diselesaikan oleh model. Muse Code menunjukkan logik persaingan yang berbeza: model hanyalah sebahagian sistem, sama ada Agent latar belakang mengekalkan keadaan, panggilan alat boleh dipercayai, tugas boleh dipulihkan, konteks dikekang dengan betul, dan sama ada ia boleh terus beriterasi selepas kegagalan, semuanya mungkin lebih penting daripada kemampuan menghasilkan kod sekali sahaja.

Meta juga secara jelas menyatakan bahawa model yang lebih besar dan lebih banyak fungsi kerangka Agent akan dikeluarkan pada masa depan. Ini bermakna Muse Spark 1.2 bukanlah produk unggul terakhir, tetapi lebih seperti infrastruktur lengkap pertama Meta untuk memasuki pasaran Agent pemrograman.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.