Sobrang kompetisyon.
Bago pa lang umabot sa ika-3 araw ng Setyembre, limang avant-garde na modelong inilabas na!
Ang Fable 5.1 at Mythos 5.1 ng Anthropic, ang Gemini 3.8 Flash at Cyber ng Google, at ang Muse Spark1.3 ng Meta… ang RSI, siguradong nandito na.
Noong kahapon gabi, agad naging pangunahin sa lightweight ang Gemini 3.8 Flash ng Google, at agad sumulpot ang Meta.
Si Zuckerberg ay opisyal na inanunsyo sa X: Ang Muse Spark 1.3 ay ipinapakilala ngayon, na nagdadala ng karanasan na halos libreng sukatin sa pamamagitan ng nakakahanga na performance. Ito ang pinakamalaking paglilipat na aming natamo sa pag-program at sa mga agent!

Ang tagapag-ugnay ng Meta Superintelligence Laboratory, si Alexandr Wang, ay nag-post din ng tatlong X upang mabuksan ang pangunahing pana ng "game-changer" na ito.
Sinabi niya na ang Muse Spark 1.3 ay nagbawas ng mga walang kwentang round kumpara sa Muse Spark 1.2, nagbawas ng ~20% sa bilang ng mga pagtawag sa tool, ~25% sa pagkawala ng token, at mas mabuting pagpapanatili ng pangangailangan sa mahabang panahon na gawain, “makikita ng mga user ang malaking paglilipat na ito.”

Agad na naging kahinaan ng Gemini 3.8 Flash, na itinampok kahapon, pagkatapos ng paglabas ng Muse Spark 1.3.
Ipapakita ng performance metrics na mas malaki ang pagpapabuti sa Muse Spark 1.3 na ito.
Hindi lamang ito ang nagsagawa ng pagpapalabas sa GPT-5.6 Sol at Fable 5, ang Artificial Analysis Intelligence Index sa maximum inference strength ay umabot na sa 62 puntos, ligtas na nasa unang grupo ngayon.

Sa loob ng limang buwan, nag-iterate na ang Meta sa apat na bersyon ng Muse Spark nang walang kamalayan.
Iniray ng Alexander ang Google, “nag-iiyak sa tailpipe ng ibang model.”
Kahit saan, ang unang tier ng AI ay napakasikip ngayon. Ang GPT-5.6 ay nananatili sa trono, ang Fable 5.1 ay sumusulong nang mabilis, at ang Gemini 3.8 Flash ay nagpapalipad sa likod.
Ang pagkakaroon ng Muse Spark 1.3 ay direktang nagkagulo sa lahat.
Sa DeepSWE v1.1 benchmark na pinakamainam na nagpapakita ng totoong malawak na programming capability ng model, tinapos ng Muse Spark 1.3 ang Opus 5 at GPT-5.6 Sol, at pinasobraan ang bagong ipinakilala na Gemini 3.8 Flash, at nakakuha ng pinakamataas na score sa kasalukuyan.
Muse Spark 1.3: 75.4 puntos
Claude Opus 5: 74.0 puntos
GPT-5.6 Sol: 73.0 puntos

Hindi lang iyon, ipinakita rin ng Muse Spark 1.3 ang isang malakas na performance sa iba pang mahahalagang developer metrics.
Sa SWEAtlas CodeBase QnA, ito ay nakakuha ng 59.4 puntos, na lumampas sa GPT-5.6 Sol at Opus 5.
Nakakuha ito ng 88.8 puntos sa Terminal-Bench 2.1.
Sa MRCR 512K-1M, nakakuha ito ng nakakagulat na 98.1 puntos! (bilang pagkukumpara, mayroon lang ang GPT-5.6 Sol na 73.8 puntos, napakalaking pagkakatumbas).

Sa kakayahan nito, halos naka-ayos na ito sa pinakamataas na antas, mayroon lamang ilang porsyento ang pagkakaiba sa mga pagsusulit tulad ng JobBench at OSWorld kumpara sa Opus 5.

Sa Artificial Analysis, sinunod ng Muse Spark 1.3 ang Gemini 3.8 Flash.
Sa smart index, nakuha nito ang markang 62, na nagkakapareho sa Claude Fable 5 at nasa pinakamataas na antas.

Sa pinakamalaking gastos na pinapansin ng mga developer, mas mababa ang input cost ng Muse ng 8 beses kaysa sa Fable 5, at mas mababa ang output cost nito ng halos 12 beses, nagtataglay ng pinakamataas na halaga.
Sa harap ng ganitong nakakaimpluwensya na rekord, direktang sinabi ni Alexandr Wang, ang Chief AI Officer ng Meta: “Sa Artificial Analysis Intelligence Index, wala lang ang Gemini, kailangan lang magsalita sa likod ng ibang mga modelo.”
Totoo nang napakalaking pagbaba ng kapangyarihan ng Google.

May nagtatawa: "Ginawa ng Google ang apat na bersyon ng Gemini Flash sa loob ng apat na buwan, samantalang ang Meta ay nag-iterate ng apat na Muse Spark⁺ sa loob ng limang buwan. Pero nang magsimula lang ang Google sa paglead, sinundan na sila ng Meta—sobrang kakaibang kuwento."

Mas marami ang mas kaunti: Isang dolyar para sa dalawang oras na performance monster
Mahusay ang mataas na performance, ngunit sa kasalukuyang AI community, ang tunay na nagpapaligaya sa mga developer ay ang pagiging user-friendly at murang solusyon.
Dahil sa mabilis na pagganap at kakayahang mag-save ng pera, tinatawag na pinakamahusay na halaga ang Muse Spark 1.3.
Ayon kay Alexandr Wang, ang Muse Spark 1.3 ay «masyadong mura upang maalala», «nangungunang performance, ang gastos ay kailanman lamang».


Nagsagawa ito ng isang iba’t ibang landas kumpara sa mga dating malalaking modelo na “nagpapalakas ng lakas at pagsisikap na magdagdag ng mga parameter”—nagawa nito ang pagbabawas.
Para sa mas mahabang pagsasagawa ng programa at mas mahusay na pagsumbong sa mga utos, tinuruan ang Muse Spark 1.3 upang mabawasan ang hindi kailangang mga pagkakataon sa interaksyon at gawing mas maikli ang mga output.

Mas matalino at mas maayos ito, mas malinis ang estilo ng code, at mas kaunti ang mga walang kwentang salita.
At ang direkta epekto ng pagbabawas na ito ay ang biglaang pagbaba ng gastos.
Narito ang isang napakalaking totoong tes na kaso.
Ginamit ng developer @SPAC89 ang Muse Spark 1.3 Ultra Contributor mode para i-compare sa Fable 5.1 xHigh.

Ang prompt na ibinigay niya ay naglalaman ng isang mahigpit na “patakarang pagpapabuti sa sarili”: kung ang skor ng mga independiyenteng hurado ay mas mababa sa 9.5/10, ang intelligent agent ay dapat patuloy na pagbutihin ang code at subukan muli.
Nag-run ang parehong modelo nang halos 2 oras, at ang resulta ay nakakapanaginip.
Ang Muse Spark 1.3 ay parang isang super worker na hindi nagtatapos—hindi ito makapagpahinga, at nagagawa nito ang 20 rounds ng self-improvement cycle, na nagpapatakbo ng 3 agents bawat pag-start—katumbas ng higit sa 60 na pagpapatakbo ng agent sa loob ng 2 oras.
At ang kabuuang gastos para sa napakalaking, napakakomplikadong mahabang pag-iisip na gawain ay mas mababa sa $1!

Nakasigaw ang developer: “Labis na hihigit sa aking inaasahan, ang ganda nito!”,
Sa macro pricing, ipinakita ng Meta ang malaking pagkakaroon ng seriosidad. Ang bagong modelo ay nagdaragdag ng dami nang hindi nagpapataas ng presyo, at patuloy na nagpapanatili ng presyo ng $1.25 bawat milyong token sa input at $4.25 sa output.

Sa pricing, ang contributor version ng Muse Spark 1.3, na "muse-spark-1.3-contributor", ay ang pinakamababang presyo sa foreign models. (Ang gastos ay ang paggamit ng data para sa pagpapabuti ng mga produkto ni Meta.)

Direkt ng founder at developer ng Codedamn, Mehul Mohan:
Ang pricing ng contributor tier ng Muse Spark 1.3 ay sobrang hindi totoo, ito ang ' DeepSeek Oras ng pagtatakda ng presyo.

Sa mga estadistika ng Artificial Analysis, sa mga modelo na may parehong antas ng inteligensya (iskor na 59 at higit pa), ang single-task cost ng Muse Spark 1.3 ay tanging $0.55, ang pinakamahusay na solusyon.
Para sa paghahambing, ang parehong antas ng kakayahan (61 puntos) ng Grok 4.6 ay nagkakahalaga ng $0.94, ang GPT-5.6 Sol ay nangangailangan ng $0.95, habang ang Claude Opus 5 ay mas mataas pa sa $1.23.
Kahit na, ang developer na si Kartik ay nagtukoy na ang Muse Spark 1.3 ay may kakayahang mag-isip na parang ang Sol at Fable.
Hindi ito nagpapagawa ng sagot sa isang sandali, kundi nakakaintindi ng lohikal na pagdededeksiyon sa loob, na nagpapakita ng nakakagulat na mataas na efficiency ng token.

Ang pag-angat ni Alexandr Wang, ang huling hangarin ni Little Zha
Ang paglunsad ng Muse Spark 1.3 ay hindi magiging posible nang walang mga tagapag-ugnay sa likod nito.
Noong Hulyo ng taong ito, inilabas ng Meta ang Muse Spark 1.1, na may pangunahing tampok ang 1M na sobrang habang konteksto at pagpapatakbo ng kompyuter.
Sa loob ng hindi kumpleto na dalawang buwan, ang bersyon 1.3 ay nagsampa na ng kakayahan sa pag-encode ng malayong distansya hanggang sa antas ng GPT-5.6.
Ang ganitong mabilis na pag-iterate ay ang resulta ng pagkuha ni Alexandr Wang sa Superintelligence Lab ng Meta.
Ano ang kanilang panghuling layunin? Tulad ng paulit-ulit na binanggit ni Zuckerman at Alexandr Wang: “agent” at “masyadong mura upang maabot”.
Ibig sabihin, tinutukoy ng Meta ang susunod na风口 ng ASI—“Agent Engineering.”
Ang head ng Meta AI, Alexandr Wang, ay nagpaliwanag sa isang pagtatapos kay Axios na ang lahat ng mga pagpapabuti sa availability ay para sa malaking plano na paulit-ulit na binanggit ni Zuckerberg—ang pagbuo ng isang personal na agent na available 7×24 oras.

Upang makapagbigay ng 24 oras na pagtrato sa email, pagsusulat ng code, at pagsusuri ng data ng isang agent, kailangan nito ng dalawang kondisyon.
1. Sobrang matalino at matatag: Kailangan nito na magtagal sa napakahabang mga serye ng pag-uusap (long-context), at makapag-parallel process ng maraming workflow.
Kapag ang utos ay malabo, dapat itong magtanong nang aktibo; kapag nakakatagpo ng hadlang, dapat itong humingi ng tulong mula sa tao; bago isagawa ang mga mahahalagang aksyon, dapat itong kumpirmahin. Ang pinakamahalaga, huwag maglikha ng mga halusinasyon.
2. Sobrang mura: Kung ang gastos sa pagpapatakbo ng isang pribadong agent ay maaaring umabot sa ilang sampu ng dolyar araw-araw, mananatili itong isang laruan lamang para sa kaunting tao.
Ang pagkakaroon ng Muse Spark 1.3 ay naglalayong maghanda para sa 7×24 na personal na intelligent agents.
Ito ay parang isang karanasan na inhinyero; ibinibigay mo ang layunin, at ito ay makakapagplano, makakakorekta ng sarili, at makakapagbigay ng sarili.
Para sa layuning ito, si Sun Zhiqing, isang alumni ng Peking University at researcher sa Meta, ay inihayag na ang koponan ng Meta ay nag-retrain muli ang dating avocado model upang makamit ang mas mabuting pag-scallng sa pagsubok.

Sa likod ng pagdiriwang: Nagsisiwala ba tayo sa “pagpapalit ng listahan”?
Gayunpaman, ang Muse Spark 1.3 ay nakaranas din ng pagkakasala.
Ang kilalang AI na institusyon na BridgeMind ay nag-post ng isang malalim na pahayag:
Ang Gemini 3.8 Flash at Muse Spark 1.3 ay ipinakilala ngayon nang sabay-sabay. Pareho ay tila napakagaling sa mga benchmark.
Nakapila ang Muse Spark 1.3 sa kasalukuyan sa smart index kasama ang Fable 5... Gusto kong maramdaman ang pagkagalak. Pero hindi ako nagkakaroon.
Dahil ang mga paglalabas ng AI sa buwang ito ay magkakatulad, tumataas ang mga marka, ngunit walang pag-unlad sa tunay na karanasan.
Nakakasawa. Bawat linggo ay bumababa ang aking tiwala sa benchmark, at mas kaunti pa ang aking tiwala sa mga laboratorio na naglalaro sa benchmark.

Tumutukoy ang pahayag na ito nang tumpak sa pangunahing hamon ng industriya ng malalaking modelo.
May nagkaroon ng user na nag-putok ng stress test sa Muse Spark 1.3 at Gemini Flash 3.8z sa ilalim ng backend-level 3D constraints, at natuklasan ng dalawang model na ang kanilang mga lihim:
Hindi gaanong maganda ang Muse Spark 1.4, at ang Gemini Flash 3.5 ay pure na pagpapalit sa listahan.

Ngayon, ang mga laboratorio ay nasa isang siklo ng “pagtuturo para sa performance score.” Bawat paglabas ng isang modelo, kasama ang mga screenshot ng radar chart at leaderboard na nagpapakita ng pagpapalabas sa mga kalaban.
DeepSWE, Tau3-Bench, GPQA, naging mga layunin ng pagsisikap na "mag-aral" ng mga kompanya.
At ang Muse Spark 1.3 ay nagpalabas din ng kanyang mga lihim.
Sa deep dive report ng Artificial Analysis, makikita rin natin ang isang maliit na pagbagsak nito.
Halimbawa, sa pagsusulit na AA-Omniscience, bumaba ang mga bersyon na xhigh at max. Dahil tumaas ang kanilang «rate ng pagpapahintulot»—kapag hindi sigurado, mas pipili silang huwag sumagot kaysa magmaliw.
Nabawasan ang rate ng hallucination, ngunit ipinapakita nito rin na ang absolute na kaalaman nito ay hindi ganun karaming pagtaas kaysa sa pagtaas ng performance score.

Ano ang ipinapaglaban sa pangalawang kalahati ng malalaking modelo?
Ngayon, ang paglunsad ng Muse Spark 1.3 at Gemini 3.8 Flash ay nagbibigay sa atin ng ilang mga pagtataya.
Una, ang "parameter dividend" ng base model ay nasa tuktok na.
Ang path na batay lamang sa pagpapalawak ng laki ng parameter para sa pagpapabuti ng katalinuhan ay may patuloy na bumababa na marginal benefit.
Sa hinaharap, sino man ang makakapagdala ng isang mekanismo ng pag-iisip na katulad ng “cyclic depth” sa arkitektura ng sistema, at magagawa ang ekstremong “pagbabawas” sa pagtawag ng mga kasangkapan, ay makakamit ng tunay na pagtaas ng karanasan.
Sa parehong pagkakataon, ang "Agent Engineering" ang susi sa tagumpay.
Ang labanan ng malalaking modelo ay nagsilip mula sa “sino ang mas marunong magsalita” patungo sa “sino ang mas kayang gumawa.”
Ang hinaharap na pangunahing hadlang ay hindi ang isang solong performance score, kundi ang tunay na kakayahang maisagawa ang mga mahabang gawain sa napakababang gastos.
Ang mga modelo tulad ng Muse Spark 1.3, na nakapagpapatakbo ng 60 mga pagsubok sa loob ng higit sa isang dolyar, ay magpapabago nang lubos sa mga negosyong modelo.
Mga sanggunian:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Ang artikulong ito ay galing sa WeChat public account na “New Intelligence Yuan”, may-akda: ASI Revelation
