Meta Meluncurkan Muse Spark 1.3, Melampaui Pesaing dalam Benchmark AI

icon MarsBit
Bagikan
AI summary iconRingkasan
Meta telah meluncurkan Muse Spark 1.3, model AI yang mengungguli Gemini 3.8 Flash dan GPT-5.6 Sol dalam berbagai tolok ukur utama. Dikembangkan oleh Super Intelligence Lab Meta, model ini mendapat skor 75.4 pada DeepSWE v1.1, dengan penggunaan token dan harga yang lebih rendah. Alexandr Wang, Chief AI Officer Meta, menyebutnya sebagai langkah penting menuju agen AI 24/7. Pembaruan berita AI + kripto ini menyoroti potensi listing token baru karena peningkatan efisiensi mendorong adopsi.

Terlalu kompetitif.

Hanya baru 3 hari berlalu di bulan September, sudah ada lima model canggih yang dirilis!

Fable 5.1 dan Mythos 5.1 dari Anthropic, Gemini 3.8 Flash dan Cyber dari Google, serta Muse Spark1.3 dari Meta... RSI, pasti sudah tiba.

Tadi malam, baru saja Gemini 3.8 Flash dari Google menjadi raja ringan, dan Meta langsung datang menantang.

Zuckerberg secara resmi mengumumkan di X: Muse Spark 1.3 secara resmi dirilis hari ini, membawa pengalaman hampir seharga nol berkat performa mutakhir. Ini adalah lompatan terbesar yang pernah kami capai dalam pemrograman dan pekerjaan agen!

Agen

Alexandr Wang, pemimpin Meta Superintelligence Lab, juga mengunggah tiga postingan X secara berturut-turut untuk mengungkap senjata utama dari "pukulan dahsyat" ini.

Dia menyatakan bahwa dibandingkan dengan Muse Spark 1.2, Muse Spark 1.3 mengurangi putaran tidak valid, mengurangi jumlah pemanggilan alat sekitar 20%, mengurangi konsumsi token sekitar 25%, dan mampu mempertahankan kebutuhan lebih baik dalam tugas jangka panjang, "pengguna akan secara jelas merasakan lompatan ini."

Agen

Setelah Muse Spark 1.3 dirilis, Gemini 3.8 Flash yang baru dirilis kemarin malam terasa agak ketinggalan.

The performance metrics show that this improvement for Muse Spark 1.3 is greater.

Ini tidak hanya melewati GPT-5.6 Sol dan Fable 5 dalam skor, tetapi indeks kecerdasan Artificial Analysis pada kekuatan inferensi Max telah mencapai 62 poin, masuk dengan mantap ke kelompok teratas saat ini.

Agen

Dalam lima bulan, Meta telah secara diam-diam mengembangkan 4 versi Muse Spark.

Alexander mengolok-olok Google, "mengejar asap buatan model lain"

Baru-baru ini, kelompok teratas AI sangat padat. GPT-5.6 memegang takhta, Fable 5.1 menyusul dari belakang, dan Gemini 3.8 Flash sedang mendahului di tikungan.

Kehadiran Muse Spark 1.3 langsung mengacaukan semua orang.

Dalam benchmark DeepSWE v1.1 yang paling mencerminkan kemampuan pemrograman jangka panjang sejati dari model, Muse Spark 1.3 langsung mengungguli Opus 5 dan GPT-5.6 Sol, serta meninggalkan Gemini 3.8 Flash yang baru dirilis, meraih skor tertinggi saat ini.

Muse Spark 1.3: 75.4 poin

Claude Opus 5: 74,0 poin

GPT-5.6 Sol: 73.0 poin

Agen

Selain itu, Muse Spark 1.3 juga menunjukkan kinerja yang signifikan dalam beberapa indikator pengembang kunci lainnya.

Di SWEAtlas CodeBase QnA, ia mendapatkan skor 59,4, melebihi GPT-5.6 Sol dan Opus 5.

Di Terminal-Bench 2.1, ia mendapatkan skor 88.8.

Pada MRCR 512K-1M, ia mendapatkan skor menakjubkan 98,1! (Sebagai perbandingan, GPT-5.6 Sol hanya mendapatkan 73,8 pada hal ini, benar-benar mengungguli).

Agen

Dalam kemampuan Agent, ia hampir menyamai tingkat terdepan, dengan selisih hanya beberapa persen saja dari Opus 5 dalam pengujian seperti JobBench dan OSWorld.

Agen

Di Artificial Analysis, Muse Spark 1.3 jauh meninggalkan Gemini 3.8 Flash.

Pada indeks cerdas, ia mendapatkan skor 62, sejajar dengan Claude Fable 5, masuk ke jajaran teratas.

Agen

Dalam hal biaya yang paling diperhatikan oleh pengembang, biaya input Muse 8 kali lebih rendah daripada Fable 5, dan biaya output 12 kali lebih rendah, memberikan rasio harga-kinerja terbaik.

Menghadapi rekor yang begitu cemerlang, kepala AI Meta, Alexandr Wang, langsung berkata sinis: "Di indeks cerdas Artificial Analysis, Gemini tidak berarti apa-apa, hanya bisa menghirup knalpot model lain."

Google benar-benar jatuh dari kejayaannya.

Agen

Ada yang bercanda: “Google bekerja keras selama empat bulan dan meluncurkan 4 versi Gemini Flash, sementara Meta dalam lima bulan secara berturut-turut mengembangkan 4 versi Muse Spark⁺. Tapi baru beberapa jam setelah Google memimpin, Meta sudah menyusul—alur ceritanya sangat menarik.”

Agen

Less is More: Mesin performa 1 dolar selama 2 jam

Performa tinggi memang hebat, tetapi di dunia AI saat ini, yang selalu membuat para pengembang bersemangat adalah kemudahan penggunaan dan harga terjangkau.

Muse Spark 1.3 disebut raja nilai karena tidak hanya cepat, tetapi juga sangat hemat biaya.

Seperti yang dikatakan Alexandr Wang, Muse Spark 1.3 「sehingga murahnya tidak signifikan», 「kinerja terdepan, biayanya hanya sebagian kecil».

Agen

Agen

Ia menempuh jalan yang sama sekali berbeda dari pendekatan besar model sebelumnya yang mengandalkan “kekuatan besar menghasilkan keajaiban, menumpuk parameter secara liar”—melakukan pengurangan.

Muse Spark 1.3 dilatih khusus untuk pemrograman jangka panjang dan kemampuan mengikuti perintah yang lebih baik, sehingga mengurangi siklus interaksi yang tidak perlu dan membuat output lebih ringkas.

Agen

It becomes smarter and cleaner, with more refined code and less fluff.

Dan konsekuensi langsung dari pengurangan ini adalah penurunan biaya yang drastis.

Berikut adalah contoh nyata yang sangat mengesankan.

Developer @SPAC89 membandingkan Muse Spark 1.3 Ultra Contributor mode dengan Fable 5.1 xHigh.

Agen

Prompt yang diberikannya mencakup satu aturan ketat "perbaikan diri": jika skor dari juri independen di bawah 9,5/10, agen harus terus memperbaiki kode dan mencoba lagi.

Kedua model tersebut berjalan selama sekitar 2 jam, dengan hasil yang menakjubkan.

Muse Spark 1.3 benar-benar seperti pekerja super yang tak kenal lelah, tidak pernah berhenti dan melakukan 20 siklus peningkatan mandiri, setiap kali memulai 3 agen—setara dengan menjalankan agen lebih dari 60 kali dalam 2 jam.

Namun, biaya total untuk menyelesaikan tugas penalaran jangka panjang yang sangat besar dan kompleks ini ternyata kurang dari 1 dolar!

Agen

Developer ini terkejut: "Ini sama sekali di luar harapan saya, ini benar-benar sebuah karya seni!"

Dalam penetapan harga makro, Meta menunjukkan keseriusan yang besar. Model baru menambah kapasitas tanpa menaikkan harga, tetap mempertahankan harga $1,25 per juta token input dan $4,25 per juta token output.

Agen

Dalam hal penetapan harga, versi kontributor dari Muse Spark 1.3, "muse-spark-1.3-contributor", bahkan menjadi harga terendah untuk model-model luar negeri. (Konsekuensinya, data harus digunakan untuk meningkatkan produk Meta.)

Agen

Pendiri dan pengembang Codedamn, Mehul Mohan, langsung mengatakan:

Harga lapisan kontributor untuk Muse Spark 1.3 benar-benar tidak masuk akal, ini adalah ' DeepSeek Waktu penetapan harga.

Agen

Dalam statistik Artificial Analysis, di antara model dengan tingkat kecerdasan setara (skor di atas 59), biaya tugas tunggal Muse Spark 1.3 hanya $0,55, menjadikannya solusi terbaik mutlak.

Sebagai perbandingan, Grok 4.6 dengan kecerdasan setara (61 poin) biayanya 0,94 dolar, GPT-5.6 Sol memerlukan 0,95 dolar, sedangkan Claude Opus 5 bahkan mencapai 1,23 dolar.

Bahkan, pengembang Kartik menunjukkan bahwa Muse Spark 1.3 tampaknya memiliki kemampuan penalaran "kedalaman siklik" serupa dengan Sol dan Fable.

Ini tidak menghasilkan jawaban dalam satu langkah, tetapi mampu melakukan penalaran logis secara internal, sehingga efisiensi token-nya luar biasa tinggi.

Agen

Lompatan Alexandr Wang, Ambisi Terakhir Zuck

Kehadiran Muse Spark 1.3 tidak terlepas dari para pengendali di baliknya.

Pada Juli tahun ini, Meta merilis Muse Spark 1.1, yang menonjolkan konteks panjang 1M dan operasi komputer.

Dalam waktu kurang dari dua bulan, versi 1.3 telah mendorong kemampuan encoding jangka panjang hingga setara dengan GPT-5.6.

Iterasi secepat ini adalah hasil dari Alexandr Wang mengambil alih Laboratorium Superintelligence Meta.

Apa tujuan akhir mereka? Seperti yang selalu ditekankan oleh Zuck dan Alexandr Wang, dua kata tersebut: "agen" dan "sehingga harganya bisa diabaikan".

Artinya, Meta melihat peluang berikutnya di ASI — "Rekayasa Agen".

Alexandr Wang, kepala Meta AI, secara jelas menyatakan dalam wawancara dengan Axios bahwa semua peningkatan ketersediaan bertujuan untuk mewujudkan visi besar yang sering disebutkan oleh Zuck—membangun agen pribadi yang tersedia 7×24 jam.

Agen

Untuk membuat agen yang dapat menangani email, menulis kode, dan menganalisis data selama 24 jam, ia harus memenuhi dua syarat.

1. Sangat cerdas dan stabil: Harus mampu menahan thread percakapan yang sangat panjang dan memproses beberapa alur kerja secara paralel.

Ketika perintah ambigu, ia harus mampu secara aktif bertanya; ketika menghadapi hambatan, ia harus mampu meminta bantuan manusia; sebelum menjalankan operasi penting, ia harus mampu mengonfirmasi. Yang paling penting, jangan menciptakan ilusi.

2. Sangat murah: Jika biaya menjalankan agen pribadi selama satu hari bisa mencapai puluhan dolar, maka ia akan selamanya hanya menjadi mainan segelintir orang.

Kehadiran Muse Spark 1.3 pada dasarnya membuka jalan bagi agen pribadi 7×24 jam.

Ia seperti seorang insinyur berpengalaman yang matang; Anda memberikan tujuan, dan ia akan merencanakan sendiri, memperbaiki kesalahan sendiri, serta menyerahkan hasilnya.

Untuk ini, Sun Zhiqing, alumni Peking University dan peneliti Meta, mengungkap bahwa tim Meta telah melakukan pelatihan ulang terhadap model avokad sebelumnya, mencapai penskalaan pengujian yang lebih baik.

Agen

Di balik perayaan: Apakah kita tertipu oleh "manipulasi peringkat"?

Namun, Muse Spark 1.3 juga mendapat pertanyaan.

Lembaga AI terkenal BridgeMind mengungkapkan sebuah kalimat yang memikat:

Gemini 3.8 Flash dan Muse Spark 1.3 dirilis bersamaan hari ini. Keduanya tampak sangat unggul dalam pengujian benchmark.

Muse Spark 1.3 saat ini sejajar dengan Fable 5 di indeks cerdas... Saya ingin merasa bersemangat. Tapi saya tidak.

Karena, rilisan AI bulan ini sama saja, skor melonjak, tetapi pengalaman di dunia nyata tidak ada kemajuan.

Ini sangat melemahkan. Kepercayaan saya terhadap benchmark setiap minggu semakin berkurang, dan kepercayaan saya terhadap laboratorium yang memanipulasi benchmark hampir habis.

Agen

Kalimat ini secara akurat menyentuh titik lemah industri model besar saat ini.

Seorang pengguna internet melakukan uji tekanan terhadap Muse Spark 1.3 dan Gemini Flash 3.8z di bawah batasan 3D tingkat backend, dan hasilnya mengungkap kelemahan sejati kedua model tersebut:

Muse Spark 1.4 tidak sebaik itu, sementara Gemini Flash 3.5 hanya bersaing di peringkat.

Agen

Sekarang, berbagai laboratorium terjebak dalam lingkaran setan "melatih demi skor". Setiap kali model dirilis, selalu disertai beberapa tangkapan layar grafik radar dan peringkat yang mengalahkan pesaing.

DeepSWE, Tau3-Bench, GPQA, menjadi target pengerjaan soal yang gila-gilaan oleh berbagai pihak.

Sementara itu, Muse Spark 1.3 juga menunjukkan kelemahannya.

Dalam laporan mendalam dari Artificial Analysis, kami juga melihat sedikit kemunduran darinya.

Misalnya, dalam pengujian AA-Omniscience, versi xhigh dan max mengalami penurunan. Alasannya adalah tingkat abstain-nya meningkat—ketika tidak yakin, ia lebih memilih tidak menjawab daripada membuat-buat.

Ini menurunkan tingkat ilusi, tetapi juga secara tidak langsung menunjukkan bahwa pengetahuan absolutnya tidak meningkat sebesar yang ditunjukkan oleh peningkatan skor.

Agen

Di babak kedua model besar, apa yang sebenarnya dibandingkan?

Hari ini, peluncuran Muse Spark 1.3 dan Gemini 3.8 Flash memungkinkan kita untuk menarik beberapa kesimpulan.

Pertama, "keuntungan parameter" dari model dasar sedang mencapai puncaknya.

Jalur meningkatkan kecerdasan hanya dengan memperbesar ukuran parameter telah semakin menurun manfaatnya.

Di masa depan, siapa pun yang dapat memperkenalkan mekanisme inferensi serupa 'kedalaman siklus' dalam arsitektur sistem, serta melakukan 'pengurangan' ekstrem dalam pemanggilan alat, seperti Muse Spark 1.3, akan mendapatkan lonjakan pengalaman yang sejati.

Selain itu, "agent engineering" adalah kunci kemenangan.

Perang model besar telah beralih dari "siapa yang lebih pandai berbicara" menjadi "siapa yang lebih mampu bekerja".

Hambatan inti masa depan bukanlah skor tunggal, melainkan kemampuan untuk mewujudkan tugas jangka panjang dengan biaya sangat rendah.

Model seperti Muse Spark 1.3, yang dapat menjalankan 60 siklus percobaan dengan biaya kurang dari 1 dolar, akan sepenuhnya mengubah model bisnis.

Referensi:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.