Ipinakilala ni Meta ang Muse Code, ang unang terminal programming agent na may malawak na pagpapatakbo at opsyon ng 95% discount

iconMetaEra
I-share
AI summary iconSummary
Ipinakilala ni Meta ang Muse Code, ang kanilang unang terminal programming agent, na binuo mula sa MetaEra at kasama ang upgraded na Muse Spark 1.2 model. Ang agent ay makakahandle ng malalaking codebases, magpaplanong magdraf, sumulat at subukan ang code, at patakbuhin ang background agents. Ang contributor version ay nag-aalok ng 95% pagbawas sa gastos sa pamamagitan ng pagpapalit sa pag-access sa data. Ang sistema ay sumusuporta sa mahabang pagpapatakbo ng mga gawain at crash recovery. Sabi ni Meta, ang Muse Spark 1.2 ay malapit na sa mga pinakamataas na model, ngunit hindi pa nakalampas sa mga kalaban sa lahat ng pagsubok. Ang balita tungkol sa market crash at data sa inflation ay maaaring makaapekto sa pagtatangkilik.
No translation provided.

May-akda at pinagmulan: Meta AI Research

Meta ay may sarili nang “Claude Code”

Ang Muse Code ay ang unang terminal-based AI agent na inilabas ng Meta, at kasalukuyang available sa test version para sa macOS at Linux. Hindi ito nakatuon sa code completion, kundi sa buong software engineering tasks: pagsali sa isang malaking code repository, pag-unawa sa umiiral na istruktura, pagbuo ng plano, pagbabago sa maraming file, pagpapatakbo ng mga command at pagsubok, at pagpapatuloy sa pagpapabuti batay sa mga resulta.

Ito ay direktang pumapasok sa merkado na pinaglalaban ng Claude Code, Codex, Gemini CLI, at iba pang mga produkto. Ang mga modelo ay hindi na lamang sumasagot sa “Paano isusulat ang code na ito?”, kundi nakakakuha ng pag-access sa terminal, file system, at mga development tool upang magpatuloy na magpapatupad ng mga gawain nang may kaunting tulong mula sa tao.

Inilah ng Meta ang Muse Code at Muse Spark 1.2 bilang isang sistema, hindi bilang dalawang produkto na maaaring hiwalayin nang arbitrarily. Ang Muse Spark 1.2 ay responsable sa pag-unawa, pag-iisip, at pagbuo, habang ang Muse Code ay nagtatrabaho sa pag-organisa ng konteksto, pag-schedule ng mga sub-Agent, pagtawag ng mga tool, pag-save ng estado, at pag-verify ng mga resulta. Ang parehong sistema ay pinagsama sa pagtuturo, kaya ang isang parehong modelo na ililipat sa ibang Agent framework ay maaaring hindi makapagpapakita ng parehong resulta na ipinakita ng Meta.

Hindi ang multi-agent isang pansamantalang grupo, kundi isang pangmatagalang pagpapalakas

Ang pinakadifferentiating na disenyo ng Muse Code ay isang grupo ng mga background Agent na tumatakbo nang asynkrono.

Ang karaniwang multi-agent system ay bumubuo ng isang assistant nang pansamantala kapag kailangan ng isang subtask, halimbawa upang hanapin ang mga kaugnay na file, analisahin ang pagkabigo ng pagsubok, o pag-aralan ang isang dependency. Pagkatapos ng task, maaaring mawala ang konteksto ng assistant; kapag makakasalubong muli ang katulad na problema, maaaring muli itong i-scan ang parehong set ng code at ulitin ang pagkolekta ng parehong impormasyon.

Ang mga backend agent ng Muse Code ay magpapatuloy na aktibo sa buong sesyon. Maaari nilang tuloy-tuloy na makalap ng pag-unawa sa codebase, mag-advance sa susunod na hakbang, at piliin kung kailan ipapasa ang resulta sa pangunahing agent. Ang pangunahing agent ang responsable sa pagkoordinasyon ng mga layunin, habang ang mga backend agent ay maaaring mag-aral nang hiwalay sa iba’t ibang module, suriin ang mga pagsubok, hanapin ang mga ugnayang pagtawag, o patunayan ang mga solusyon.

Ang disenyo na ito ay nagtatangkang lutasin ang karaniwang pagkawala sa mahabang gawain: ang Agent ay paulit-ulit na nakakalimot kung ano na ang napapanood nito. Kung ang estado ng background Agent ay maaaring mapanatili nang maaasahan, hindi ito kailangang muling basahin ang istruktura ng bawat hakbang, at hindi kailangang paalalahanan ng tao ang ito nang paulit-ulit na “nabasa na ang file na ito.”

Gayunpaman, ang pagbabago ng code ng maraming Agent nang sabay-sabay ay maaaring magdulot ng mga konflikto, pagsasakop, at mga gastos. Ang pampublikong artikulo ni Meta ay hindi naglalathala ng buong detalye kung paano nahahati ang mga gawain, kung paano isinasama ang mga pagbabago sa code, at kung paano maiiwasan ng iba pang mga Agent ang pagtanggap ng maling konklusyon kung may mali sa isang background Agent. Kaya ang Continuous Agent ay isang napapanatiling direksyon sa arkitektura, ngunit sa kasalukuyan ay hindi pa maaaring masuri ang kanyang katatagan sa tunay na mga proyekto ng tim based lamang sa mga demo ng opisyal.

Pagkatapos ng pagbagsak, hindi na muling magsisimula mula sa simula

Ang mga habang nagpapatakbo na programming agent ay nakakaranas ng isang malaking praktikal na problema: mas mahaba ang task, mas malaki ang posibilidad na makakatagpo ng pagkabigo sa network, error sa tool, pagkabagsak ng proseso, o pag-over ng konteksto. Kung ang sistema ay nag-iimbak lamang ng kasalukuyang estado sa loob ng usapan ng model, isang pagkabigo ay maaaring magdulot ng pagkawala ng ilang oras ng pag-aaral.

Nilikha ng Muse Code ang isang lokal na log ng pangyayari. Ang bawat pagtawag sa modelo, pagpapatupad ng kasangkapan, pagpapahintulot ng user, at pagbabago ng file ay isinusulat sa paraang append, at ang nakaraang kasaysayan ay hindi diretso na nababago ng susunod na estado.

Tinatawag ng Meta ang mekanismong ito bilang “precisely reproducible” at “restart-safe”. Kapag bumagsak ang Agent sa gitna, maaaring mabawi ng sistema ang trabaho batay sa mga rekord ng event, hindi na kailangang muli nang hulaan kung ano ang nangyari bago. Sa katotohanan, ipinapalit nito ang pag-program ng Agent mula sa isang pansamantalang usapan patungo sa isang mas malapit na proseso ng inhenyeriya na may estado.

Muse Code ay may ilang mga kasanayan na maaaring i-call:/planuna ay lumikha ng isang plano ng pagpapatupad na kailangan ng pahintulot ng user;/grilllumalaban at nagtatanong sa plano na ito upang hanapin ang mga nawawalang detalye, panganib, at maling aksiyon;/goalpinapahintulutan ang Agent na magpatuloy sa pagpapatupad batay sa tinukoy na layunin hanggang sa matupad ang mga kondisyon.

Ang ideya sa likod ng mga tampok na ito ay malinaw: kung ang AI ay gagawin ang mga oras ng software engineering, mahalaga hindi lamang kung ang code na ginawa sa bawat hakbang ay maganda, kundi kung makakapag-save ito ng progreso, makakatanggap ng pagsusuri, makakahanap ng mga butas sa plano, at makakapagpatuloy sa pagpapatupad pagkatapos ng pagkabigo.

Ang Muse Spark 1.2 ay ang modelo at ang "dedikadong engine" ng Agent framework.

Ang Muse Spark 1.2 ay isang programang pinapalakas na inilabas sa loob ng isang buwan pagkatapos ng bersyon 1.1. Sinasabi ng Meta na idinagdag nito ang diversidad sa computing power at training environment para sa programming tasks, na nakatuon sa pagpapabuti ng code generation, kompleks na debugging, pag-unawa sa codebase, at end-to-end development workflow.

Ang sakop ng pagsasanay ay hindi lamang kasama ang pag-aayos ng isang file, kundi kasama rin ang pagbuo ng buong code repository, malalaking end-to-end na proyekto, at awtomatikong mga gawain sa pag-aaral. Gamit ang plano, ang modelo ay magkakaroon ng pagkakasunod-sunod ng mga hakbang, magpapanatili ng direksyon sa pamamagitan ng mga kondisyon ng layunin, at magkakaroon ng pag-compress habang tumataas ang konteksto, upang panatilihin ang impormasyon na kailangan para sa susunod na mga gawain.

Kinikilala pa ni Meta ang Muse Spark 1.1 sa pagtratrabaho sa susunod na bersyon ng modelo. Ang lumang modelo ay responsable sa pagbuo ng mas mahirap na programming environment at template ng pagpapatupad ng utos, at sa pag-scor ng mga kandidatong solusyon kung ito ay sumasapat sa mga kinakailangan, upang makalikha ng malaking halaga ng data para sa pag-aaral ng bersyon 1.2.

Ang “pagpapabuti ng sarili” na binabanggit dito ay hindi pa rin nangangahulugan na ang modelo ay nagbabago ng mga timbang nito nang walang kontrol ng tao. Mas tumpak na sabihin, ginamit ang nakaraang henerasyon ng modelo bilang generator at tagapagsuri ng data upang tulungan ang team na palawakin ang training data ng susunod na henerasyon. Ang mga proseso ng data, pagpapatakbo ng pagtatrabaho, at paglalabas ng huling modelo ay patuloy na pinagmamalaki ng Meta.

Mas mahalaga pa, hindi pinag-aralan ng Meta ang isang hiwalay na “model na nakakasulat ng code,” kundi isinama ng Meta ang mga kasangkapan, pamamahala ng layunin, pag-compress ng konteksto, at mga takip ng sub-Agent ng Muse Code sa pagtuturo. Ang kakayahan ng mga model sa pag-program sa hinaharap ay maaaring lalong magdepende sa pagkakilala nito sa isang partikular na Agent framework mula sa panahon ng pagtuturo.

Ang pagpapatakbo ng 24 oras at ang paggamit ng mga kasangkapan nang higit sa 1,000 beses ang pangunahing teksto sa pagpapakita na ito.

Isang kaso na ibinigay ni Meta ay ang pag-optimize ng mga kernel ng KDA at MLA sa NVIDIA Hopper GPU gamit ang Muse Code environment. Kailangan ng sistema na sarili nitong isulat ang code, i-compile, i-analyze ang performance, at muli itong baguhin batay sa mga resulta.

Ang pinakamahabang panahon ng pagsubok ay 24 oras, at ang pagtawag sa mga kasangkapan ay hihigit sa 1000 beses. Pinigilan ng mga siyentipiko ang modelo na direktang i-import ang mga umiiral na third-party kernel library, at hinihingi nila na i-implement ng modelo ang algorithm sa Triton at hanapin ang totoong pagpapabuti sa performance, hindi lang isang pagpapakita ng umiiral na implementation bilang sarili nitong resulta.

Sa KDA task, ang modelo ay nagkombina ng parallel na block-internal preparation kernels at sequential na cross-block scan, at nagdagdag ng espesyal na optimisasyon para sa gated accumulated decay. Sa MLA task, itinayo nito ang Triton pipeline na binubuo ng dalawang kernels at sinubukan ang pagpapakita muli ng shared KV latent representation.

Hindi ang kahalagahan ng mga halimbawang ito ay nasa isang pagtaas ng bilang, kundi kung kayang ng Agent na panatilihin ang layunin, unawain ang mga datos ng pagsusuri ng performance, at maglikha ng susunod na eksperimento pagkatapos ng mga daan-daang pagkabigo at intermediate resulta. Kung ang sistema ay kayang magtrabaho nang tama lamang sa ilang minuto, mas mukhang ito ay isang advanced completion tool; kung kayang ituloy ang 24 oras, magsisimula itong maging malapit sa isang Agent na maaaring ipagkatiwala ang isang engineering research.

Nakakapag-isa sa mga lider, ngunit hindi pa nakalabas sa Claude at Codex

Ang pagtataya ni Meta ay kumakapal sa Terminal-Bench 2.1, DeepSWE 1.1, GDPVal-AA v2, MCP Atlas, at mga panloob na pagsubok sa pagprograma. Ang Terminal-Bench 2.1 ay naglalaman ng 89 mga gawain na kailangang tapusin sa terminal environment; ang DeepSWE 1.1 ay naglalaman ng 113 mga gawain mula sa 91 code repositories na nakakapalibot sa limang mga wika sa pagprograma.

Batay sa mga grapikong ipinakita ng Meta, ang Muse Spark 1.2 kasama ang Muse Code ay nakakuha ng 82.9% sa Terminal-Bench 2.1, na mas mababa kaysa sa 86.7% ng Claude Opus 5, ngunit mas mataas kaysa sa Codex at Grok Build sa kanilang pagtataya. Sa DeepSWE 1.1, ang Muse Spark 1.2 ay nakakuha ng 59.3%, at hindi naging numero uno. Sa 440 na totoong inhinyeriyang gawain sa loob ng Meta, ito ay nakakuha ng 70.6%, at patuloy na nasa likod ng Opus 5.

Ang mga resultang ito ay nagpapakita na ang Muse Code ay nasa loob na ng kompetisyon ng mga pangunahing programming agent, ngunit hindi sumusuporta sa konklusyon na ang “Meta ay lubos na nalalampasan ang Claude Code at Codex.”

OpisyalAng dokumento ng paraan ng pagsusuriay naglalaman din na iba’t ibang modelo ay kasama ang kanilang sariling Agent produkto: ang Muse Spark ay gumagamit ng Muse Code, ang Claude ay gumagamit ng Claude Code, ang GPT ay gumagamit ng Codex, ang Gemini ay gumagamit ng Antigravity, at ang Kimi ay gumagamit ng Kimi Code. Ang ganitong paghahambing ay mas malapit sa isang buong produkto na pagtatagpo, ngunit hindi makakadistingguho kung ang mga resulta ay galing sa modelo o sa Agent framework.

Kinikilala rin ni Meta na ang kanilang loob na pagsubok na kapaligiran at mga prompt ay hindi kinakailangang pinakamahusay na pinag-optimiza para sa mga third-party closed-source model. Ang resulta ni Muse Spark 1.2 sa Terminal-Bench ay kasalukuyang hindi pa nakalista sa mga independiyenteng verification list. Kaya, ang pinakamaligtas na pahayag sa kasalukuyan ay: Ayon sa pagsusuri ni Meta, ito ay malapit sa frontier level, ngunit ang independiyenteng pagpapakita ay kulang pa.

Ang pinakamura bersyon, kailangan ng code at dialogo para palitan

Ang Muse Spark 1.2 Standard Edition ay nagkakahalaga ng $1.25 bawat milyong input token, $0.15 para sa cached input, at $4.25 para sa output. Ang input at output sa bersyon na ito ay hindi gagamitin para sa pagpapabuti ng mga produkto ng Meta.

Ang isang iba pang modelo ay idinisenyo bilangmuse-spark-1.2-contributor. Ang bawat milyong input token ay nagkakahalaga ng $0.10, ang cache input ay $0.002, at ang output ay $0.20. Kumpara sa standard version, mas mura ang input ng 92% at ang output ay mas mura ng halos 95%.

Ang presyo ay ang pagkakaroon ng mga paalala at output ng modelo mula sa mga contributor na maaaring gamitin ng Meta para mapabuti ang kanilang produkto. Para sa mga open-source project, personal na eksperimento, o mga gawain na walang sensitibong impormasyon, maaaring isang napakalaking negosyo ito; ngunit para sa mga pribadong code ng negosyo, mga produkto na hindi pa ipinapakita, mga datos ng kliyente, mga key configuration, at mga proyekto na pinaglalaban ng confidentiality agreement, ito ay una at huli ay isang isyu ng data governance, hindi isyu ng presyo.

Hindi sapat na batay sa presyo ng Token upang ipalagay na ang buong codebase ay dapat ibigay sa bersyon ng contributor. Kung pinapayagan ang paggamit ng data para sa pagtatrabaho, kailangang suriin ang mga partikular na termino at kondisyon ng Meta, ang pagkakaroon ng karapatan sa code, ang mga kontrata ng kliyente, at ang mga patakaran sa loob na seguridad. Ang standard at contributor versions ay gumagamit ng magkakaparehong kakayahan, ngunit may dalawang ganap na iba’t ibang ugnayan sa data.

Ito ay nagpapakita rin ng totoong kompetitibong estratehiya ni Meta: hindi lamang nais nito makipag-competensya sa pamamagitan ng mababang presyo, kundi higit pa rito, sa pamamagitan ng mga gawain, pagbabago, feedback, at resulta na ginagawa ng mga developer habang gumagamit ng Muse Code, upang buuin ang isang bagong loop ng training data para sa pagprograma. Nakakakuha ang mga developer ng halos libreng paggamit ng Agent, samantalang posibleng makakuha si Meta ng data na mas may halaga kaysa sa mga publikong code sa GitHub—totoong paano hinahati, binabago, at binibigyang-katotohanan ang mga gawain.

Ang AI programming ay pumasok sa yugto ng “joint training ng model at scaffolding”

Noong nakaraan, ang pagtataya sa mga AI na programado ay pangunahing nakabatay sa kung gaano karaming tanong ang kayang sagutin ng modelo. Ipapakita ng Muse Code ang isang iba’t ibang logika sa kompetisyon: ang modelo ay kalahati lamang ng sistema, at ang pagpapanatili ng estado ng backend Agent, ang pagkakatiyak ng pagtawag sa mga kasangkapan, ang kakayahang muling makuha ang gawain, ang tamang pag-compress ng konteksto, at ang kakayahang magpatuloy sa iterasyon pagkatapos ng pagkabigo, ay maaaring mas mahalaga kaysa sa isang beses na kakayahan sa paggawa ng code.

Nilinaw din ng Meta na daragdagan pa nila ang mas malalaking modelo at higit pang mga tampok ng Agent framework. Ibig sabihin nito na ang Muse Spark 1.2 ay hindi ang huling flagship product, kundi mas katulad ng unang buong imprastruktura ng Meta sa merkado ng programming Agent.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.