Terlalu sengit.
Hanya 3 hari telah berlalu di bulan September, dan lima model terkini telah dilancarkan!
Fable 5.1 dan Mythos 5.1 daripada Anthropic, Gemini 3.8 Flash dan Cyber daripada Google, serta Muse Spark1.3 daripada Meta... RSI, pasti sudah tiba.
Tadi malam, selepas Gemini 3.8 Flash milik Google menjadi penguasa ringan, Meta pun datang menantang.
Zuckerberg secara resmi mengumumkan di X: Muse Spark 1.3 secara resmi diluncurkan hari ini, membawa pengalaman yang hampir murah hingga tidak perlu diukur, dengan kinerja mutakhir. Ini adalah lompatan terbesar yang kami capai hingga kini dalam pemrograman dan pekerjaan agen!

Pengendali Meta Superintelligence Laboratory, Alexandr Wang, juga mengeluarkan tiga pos X, mengungkap senjata utama dalam "pukulan mematikan" ini.
Beliau menyatakan bahawa Muse Spark 1.3 mengurangkan pusingan tidak sah berbanding Muse Spark 1.2, mengurangkan bilangan panggilan alat sebanyak ~20%, mengurangkan penggunaan token sebanyak ~25%, dan mampu mengekalkan keperluan dengan lebih baik dalam tugas jangka panjang, "pengguna akan merasakan lompatan ini dengan jelas".

Selepas Muse Spark 1.3 dilancarkan, Gemini 3.8 Flash yang dilancarkan semalam kelihatan agak ketinggalan.
Paparan runmen menunjukkan peningkatan yang lebih besar untuk Muse Spark 1.3.
Ia tidak hanya melepasi GPT-5.6 Sol dan Fable 5 dalam ujian prestasi, tetapi indeks kecerdasan Artificial Analysis di bawah kekuatan inferensi Max telah mencapai 62, dengan pasti memasuki kumpulan teratas semasa ini.

Dalam lima bulan, Meta telah secara tidak sengaja mengembangkan 4 versi Muse Spark.
Alexander Wang mengejek Google, "mengejar asap model orang lain"
Baru-baru ini, kumpulan teratas AI sangat sesak. GPT-5.6 memegang takhta, Fable 5.1 mengejar dari belakang, dan Gemini 3.8 Flash sedang melebihi dari luar.
Kehadiran Muse Spark 1.3 secara langsung mengacaukan semua orang.
Dalam ujian rujukan DeepSWE v1.1 yang paling mencerminkan kemampuan pemrograman jangka panjang sebenar model, Muse Spark 1.3 secara langsung mengatasi Opus 5 dan GPT-5.6 Sol, serta meninggalkan Gemini 3.8 Flash yang baru dilancarkan, memperoleh skor tertinggi semasa ini.
Muse Spark 1.3: 75.4 mark
Claude Opus 5: 74.0 mark
GPT-5.6 Sol: 73.0 markah

Selain itu, Muse Spark 1.3 juga menunjukkan prestasi yang tidak boleh diabaikan dalam beberapa indikator pembangun utama lainnya.
Dalam SWEAtlas CodeBase QnA, ia memperoleh 59.4 poin, melebihi GPT-5.6 Sol dan Opus 5.
Ia mendapat 88.8 poin di Terminal-Bench 2.1.
Pada MRCR 512K-1M, ia mendapat skor menakjubkan 98.1! (Sebagai perbandingan, GPT-5.6 Sol hanya mendapat 73.8, benar-benar menghancurkan.)

Dalam kemampuan Agen, ia hampir menyamai tahap terkini, dengan perbezaan hanya beberapa peratus sahaja berbanding Opus 5 dalam ujian seperti JobBench dan OSWorld.

Di Artificial Analysis, Muse Spark 1.3 jelas meninggalkan Gemini 3.8 Flash di belakang.
Pada indeks pintar, ia memperoleh skor 62, sejajar dengan Claude Fable 5, dan masuk ke kalangan teratas.

Dalam segi kos yang paling diperhatikan oleh pembangun, kos input Muse 8 kali lebih rendah berbanding Fable 5, dan kos output 12 kali lebih rendah, memberikan nilai terbaik.
Menghadapi rekod yang begitu cemerlang, ketua AI Meta, Alexandr Wang, secara langsung berkata: “Di indeks pintar Artificial Analysis, Gemini tidak bererti apa-apa, hanya mampu mengejar asap sisa model lain.”
Google benar-benar jatuh dari kejayaan.

Ada yang bercanda: “Google bekerja keras selama empat bulan untuk melancarkan 4 versi Gemini Flash, manakala Meta dalam masa lima bulan telah mengemaskini 4 versi Muse Spark⁺. Tetapi selepas Google memimpin selama beberapa jam sahaja, ia disalip oleh Meta—skenario ini sangat menarik.”

Kurang itu Lebih Banyak: Mesin berprestasi dengan harga $1 selama 2 jam
Memang hebat jika memiliki peringkat tinggi, tetapi di kalangan AI semasa ini, yang selalu membuat para pembangun bersemangat ialah kemudahan dan harga yang murah.
Muse Spark 1.3 dipanggil raja nilai untuk wang kerana ia tidak hanya berjalan pantas, tetapi juga sangat berjimat.
Seperti yang dikatakan Alexandr Wang, Muse Spark 1.3「murah hingga tidak bermakna」「prestasi terkini, kos hanya sebahagian kecil».


Ia mengambil jalan yang berbeza sepenuhnya daripada pendekatan besar model sebelumnya yang "mengandalkan kuasa dan menambahkan parameter secara gila-gilaan" — ia melakukan pengurangan.
Muse Spark 1.3 dilatih secara khusus untuk pengaturan jangka panjang dan kemampuan mengikuti arahan yang lebih baik, untuk mengurangi bilangan putaran interaksi yang tidak perlu dan menghasilkan output yang lebih ringkas.

Ia menjadi lebih pintar dan ringkas, gaya kod lebih bersih, dan lebih sedikit perkataan yang tidak perlu.
Dan akibat langsung daripada pengurangan ini ialah penurunan tajam dalam kos.
Berikut adalah kesan nyata yang sangat mengesankan.
Pembangun @SPAC89 menggunakan modus Muse Spark 1.3 Ultra Contributor dan membandingkannya dengan Fable 5.1 xHigh.

Prompt yang diberikannya mengandungi satu peraturan "peningkatan diri" yang ketat: jika markah daripada penilai bebas kurang daripada 9.5/10, agen mesti terus memperbaiki kod dan mencuba semula.
Kedua-dua model telah berjalan selama kira-kira 2 jam, dan hasilnya menakjubkan.
Muse Spark 1.3 seolah-olah seperti pekerja super yang tidak pernah lelah, ia tidak pernah berhenti dan menjalani 20 putaran peningkatan diri, setiap kali memulakan 3 agen—setara dengan menjalankan agen lebih daripada 60 kali dalam masa 2 jam.
Namun, jumlah kos keseluruhan untuk menyelesaikan tugas penalaran jangka panjang yang sangat besar dan kompleks ini kurang daripada 1 dolar!

Pembangun ini terkesan: "Ini benar-benar melampaui jangkaan saya, ini benar-benar sebuah karya seni!"
Dalam penetapan harga makro, Meta menunjukkan niat baik yang besar. Model baharu menambah kuantiti tanpa menaikkan harga, dengan mempertahankan harga pada $1.25 per juta token input dan $4.25 per juta token output.

Dalam hal penentuan harga, versi penyumbang Muse Spark 1.3, "muse-spark-1.3-contributor", merupakan harga terendah bagi model luar negara. (Imbalannya ialah data tersebut perlu digunakan untuk memperbaiki produk Meta.)

Pendiri dan pembangun Codedamn, Mehul Mohan secara langsung mengatakan:
Harga lapisan kontributor untuk Muse Spark 1.3 benar-benar tidak masuk akal, ini adalah ' DeepSeek Masa penetapan harga.

Dalam statistik Artificial Analysis, di kalangan model dengan tahap kecerdasan yang sama (skor lebih daripada 59), kos tugas tunggal Muse Spark 1.3 hanyalah $0.55, menjadikannya penyelesaian paling optimum.
Sebagai perbandingan, Grok 4.6 dengan kecerdasan setara (61 poin) berharga $0.94, GPT-5.6 Sol memerlukan $0.95, sedangkan Claude Opus 5 jauh lebih tinggi pada $1.23.
Bahkan, pembangun Kartik menunjukkan bahawa Muse Spark 1.3 kelihatan memiliki kemampuan penalaran "kedalaman berputar" yang serupa dengan Sol dan Fable.
Ia tidak menghasilkan jawapan dalam sekelip mata, tetapi mampu melakukan penarikan logik secara dalaman, yang menjadikan kecekapan token-nya sangat menakjubkan.

Pengejaran gila Alexandr Wang, ambisi terakhir Zuck
Kehadiran Muse Spark 1.3 tidak lepas daripada pengendali di belakangnya.
Pada Julai tahun ini, Meta melancarkan Muse Spark 1.1, yang menonjolkan konteks panjang 1M dan operasi komputer.
Dalam masa kurang daripada dua bulan, versi 1.3 telah mendorong kemampuan pengkodan jangka panjang ke tahap GPT-5.6.
Iterasi secepat ini adalah hasil yang dibawa oleh Alexandr Wang selepas mengambil alih Laboratorium Superintelligence Meta.
Apakah matlamat akhir mereka? Seperti dua perkataan yang ditekankan berulang-ulang oleh Xiao Zha dan Alexandr Wang: “agen” dan “murah hingga diabaikan”.
Dengan kata lain, Meta melihat peluang ASI berikutnya — "Kejuruteraan Agen".
Alexandr Wang, ketua Meta AI, dengan jelas menyatakan dalam temu bual dengan Axios bahawa semua peningkatan ketersediaan bertujuan untuk mewujudkan visi besar yang kerap disebut oleh Zuck—mencipta agen peribadi yang tersedia 24×7.

Untuk membolehkan agen mengurus e-mel, menulis kod, dan menganalisis data selama 24 jam, ia mesti memenuhi dua syarat.
1. Sangat cerdas dan stabil: Ia perlu menangani rantai perbualan yang sangat panjang (long-context), dan mampu mengendalikan beberapa alur kerja secara serentak.
Apabila arahan kabur, ia perlu secara aktif bertanya; apabila menghadapi halangan, ia perlu meminta bantuan manusia; sebelum melaksanakan operasi penting, ia perlu mengesahkan. Yang paling penting, jangan menghasilkan ilusi.
2. Sangat murah: Jika kos menjalankan agen peribadi selama sehari sehingga mencapai puluhan dolar, ia akan selamanya menjadi mainan sedikit orang.
Kehadiran Muse Spark 1.3 pada dasarnya membuka jalan bagi agen peribadi 7×24 jam.
Ia seperti seorang jurutera berpengalaman yang matang; anda berikan satu sasaran, ia akan merancang sendiri, memperbaiki kesilapan sendiri, dan menghantar hasilnya sendiri.
Untuk tujuan ini, Sun Zhiqing, seorang alumni Universitas Peking dan penyelidik Meta, mengungkapkan bahawa pasukan Meta telah melakukan pelatihan semula terhadap model avocado sebelum ini, mencapai penskalaan ujian yang lebih baik.

Di sebalik perayaan: Adakah kita ditipu oleh “penipuan daftar teratas”?
Namun, Muse Spark 1.3 juga mendapat keraguan.
Institut AI terkenal BridgeMind telah mengeluarkan satu perkataan yang memikat:
Gemini 3.8 Flash dan Muse Spark 1.3 dilancarkan serentak hari ini. Kedua-duanya kelihatan sangat cemerlang dalam ujian piawai.
Muse Spark 1.3 kini sejajar dengan Fable 5 di indeks pintar… Saya ingin merasa bersemangat. Tapi saya tidak.
Kerana, pelancaran AI bulan ini serupa, skor meningkat tajam, tetapi pengalaman di dunia nyata tidak ada kemajuan.
Ini sangat menyusahkan. Kepercayaan saya terhadap ujian rujukan setiap minggu semakin berkurang, dan kepercayaan saya terhadap makmal-makmal yang memanipulasi ujian rujukan hampir tiada.

Pernyataan ini secara tepat menyentuh titik kesukaran dalam industri model besar semasa ini.
Seorang pengguna internet melakukan ujian tekanan terhadap Muse Spark 1.3 dan Gemini Flash 3.8z di bawah batasan 3D peringkat belakang, dan hasilnya mengungkap kelemahan sebenar kedua-dua model tersebut:
Muse Spark 1.4 tidak sebaik itu, sedangkan Gemini Flash 3.5 semata-mata sedang memanipulasi peringkat.

Sekarang, berbagai laboratorium telah terperangkap dalam lingkaran setan "melatih demi skor". Setiap model yang dilancarkan pasti disertai dengan beberapa tangkapan layar grafik radar dan peringkat yang mengalahkan pesaing.
DeepSWE, Tau3-Bench, GPQA, menjadi sasaran paling diminati oleh semua pihak untuk "berlatih soalan".
Namun, Muse Spark 1.3 juga menunjukkan tanda-tandanya.
Dalam laporan mendalam Artificial Analysis, kita juga dapat melihat sedikit kemundurannya.
Sebagai contoh, dalam ujian AA-Omniscience, versi xhigh dan max mengalami penurunan. Ini disebabkan oleh peningkatan " kadar abstain" — apabila ia tidak pasti, ia lebih memilih untuk tidak menjawab daripada membuat-buat jawapan.
Ini mengurangkan kadar ilusi, tetapi juga secara tidak langsung menunjukkan bahawa simpanan pengetahuan mutlaknya tidak meningkat sebegitu ketara seperti peningkatan skor.

Di babak kedua model besar, apa yang sebenarnya dibandingkan?
Hari ini, dengan pelancaran Muse Spark 1.3 dan Gemini 3.8 Flash, kita boleh membuat beberapa kesimpulan.
Pertama, "keuntungan parameter" model dasar sedang mencapai puncaknya.
Jalan untuk meningkatkan kecerdasan hanya dengan memperbesar ukuran parameter telah menjadi semakin kurang berkesan.
Di masa depan, siapa sahaja yang mampu memperkenalkan mekanisme inferensi serupa «kedalaman berulang» dalam arsitekture sistem, serta melakukan «pengurangan» ekstrem dalam pemanggilan alat, akan mendapat lompatan pengalaman sejati.
Selain itu, kejuruteraan agen ialah kunci kemenangan.
Pertandingan model besar telah berpindah dari "siapa yang lebih pandai berbicara" kepada "siapa yang lebih mampu bekerja".
Hambatan utama masa depan bukanlah skor tunggal, tetapi kemampuan untuk melaksanakan tugas jangka panjang dengan kos yang sangat rendah.
Model seperti Muse Spark 1.3, yang mampu menjalankan 60 kitaran percubaan dengan kos kurang daripada 1 dolar, akan mengubah secara drastik model perniagaan.
Rujukan:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan", penulis: Apokalips ASI
