Meta 推出 Muse Code,首款具長期運行代理功能的終端程式設計代理,並提供 95% 折扣選項

iconMetaEra
分享
AI summary icon精華摘要
Meta 發布了 Muse Code,這是其首款終端程式設計代理,基於 MetaEra 構建,並搭配升級後的 Muse Spark 1.2 模型。該代理可處理大型代碼庫、擬定計劃、編寫和測試代碼,並運行後台代理。貢獻者版本提供 95% 的成本降低,以換取數據訪問權限。該系統支援長時間運行任務和崩潰恢復。Meta 表示,Muse Spark 1.2 已接近頂級模型,但尚未在所有測試中超越競爭對手。市場崩盤新聞和通脹數據可能影響其採用率。
2026年8月5日,Meta發布首款終端編程Agent——Muse Code,並同步推出專為編程優化的Muse Spark 1.2模型。Muse Code能夠讀取大型代碼庫、製訂修改計劃、編寫代碼、運行測試並驗證結果,還允許多個後台Agent在整個會話中持續運行,不必每接到一項任務就重新理解項目。Meta同時為系統設計了只能追加、不能覆蓋的本地事件日誌,即使程序崩潰,也可以準確恢復到中斷位置。真正引起開發者討論的還有價格:標準版每百萬輸入、輸出Token分別為1.25美元和4.25美元;如果用戶允許Meta使用輸入與輸出改進產品,“貢獻者版本”會降至0.10美元和0.20美元。低價背後的交換條件不是普通促銷,而是代碼與使用數據。官方評測顯示Muse Spark 1.2已接近頭部編程模型,但尚未全面領先,部分成績也未得到獨立複現。Meta這次釋放的信號是:AI編程的競爭單位正在從單個模型,轉向模型、Agent運行框架、長期狀態和數據閉環組成的完整系統。

文章作者、來源:Meta AI Research

Meta 終於擁有自己的 “Claude Code”

Muse Code 是 Meta 推出的首款終端編程 Agent,目前以測試版形式向 macOS 和 Linux 開放。它針對的並非程式碼補全,而是完整的軟體工程任務:進入大型程式碼倉庫,理解現有架構,制定方案,修改多個檔案,執行命令與測試,並根據結果進一步修正。

這讓 Muse Code 直接進入 Claude Code、Codex、Gemini CLI 等產品正在爭奪的市場。模型不再只是回答「這段代碼應該怎麼寫」,而是獲得終端、檔案系統和開發工具的使用權,在較少的人類干預下持續執行任務。

Meta 在發布的文章中將 Muse Code 與 Muse Spark 1.2 作為一套系統來介紹,而非兩個可隨意拆分的產品。Muse Spark 1.2 負責理解、推理和生成,Muse Code 則負責組織上下文、調度子 Agent、調用工具、保存狀態和驗證結果。兩者在訓練階段還進行了聯合優化,意味著同一個模型換到其他 Agent 框架中,未必能複現 Meta 展示的成績。

多Agent 不是臨時拉群,而是長期駐場

Muse Code 最具差異化的設計,是一組異步運行的後台 Agent。

常見的多 Agent 系統在需要執行子任務時會臨時創建一個助手,例如讓它查找相關文件、分析測試失敗或研究某個依賴項。任務結束後,這個助手的上下文往往隨之消失;下一次遇到類似問題,系統可能再次掃描同一批代碼、重複收集相同資訊。

Muse Code 的後台 Agent 會在整個會話期間保持活躍。它們可以持續累積對代碼庫的理解,自行推進下一步,並選擇何時將結果回報給主 Agent。主 Agent 負責協調目標,後台 Agent 則可分別研究不同模組、檢查測試、尋找調用關係或驗證實現方案。

這種設計試圖解決長任務中的一個常見浪費:Agent 反覆忘記自己已經看過什麼。只要後台 Agent 的狀態能夠可靠保留,它就不必在每一步重新閱讀項目結構,人類也不需要不斷提醒它“剛才已經檢查過這個文件”。

不過,多個 Agent 同時修改代碼也會帶來衝突、權限和成本問題。Meta 的公開文章並未完整披露任務如何分區、代碼修改如何合併,以及當一個後台 Agent 出現錯誤時,其他 Agent 如何避免繼承錯誤結論。因此,持續 Agent 是一個值得關注的架構方向,但目前還不能僅憑官方演示判斷它在真實團隊項目中的穩定性。

崩潰之後,不再從頭開始

長期運行的編程 Agent 面臨一個現實的問題:任務越長,越容易遇到網路中斷、工具報錯、進程崩潰或上下文超限。如果系統僅將當前狀態保存在模型對話中,一次故障就可能導致數小時的探索工作全部丟失。

Muse Code 為此建立了一份本地事件日誌。每次模型調用、工具執行、用戶批准和文件修改都會以追加方式寫入日誌,已經發生的歷史不會被後續狀態直接覆蓋。

Meta 將這種機制稱為「可精確重放」和「重啟安全」。當 Agent 中途崩潰時,系統可根據事件記錄恢復工作,而非重新猜測此前發生過什麼。這實際上將編程 Agent 從一段臨時對話,轉變為更接近有狀態的工程流程。

Muse Code 還內置了幾項可調用技能:/plan先生成需要用戶批准的執行計劃;/grill專門攻擊和質疑這份計劃,尋找遺漏、風險及錯誤假設;/goal則讓 Agent 圍繞指定目標持續執行,直到滿足完成條件。

這些功能背後的思路很明確:如果 AI 要承擔數小時的軟體工程工作,關鍵不僅在於每一步生成的代碼是否漂亮,還包括它能否保存進度、接受審查、發現計劃漏洞,並在故障之後繼續執行。

Muse Spark 1.2 是模型,也是 Agent 框架的「專用發動機」

Muse Spark 1.2 是在 1.1 版本發布不到一個月後推出的程式設計強化版本。Meta 表示,其增加了程式設計任務的訓練算力與訓練環境的多樣性,重點改善代碼生成、複雜故障排查、代碼庫理解以及端到端開發流程。

訓練範圍不僅包括單檔案修復,還涵蓋完整程式碼倉庫生成、大型端到端專案和自動研究任務。模型會使用計畫來排列工作步驟,透過目標條件保持方向,並在上下文不斷增長時進行壓縮,保留後續工作真正需要的資訊。

Meta 還讓 Muse Spark 1.1 參與訓練下一代模型。舊模型負責生成更困難的程式設計環境和指令遵循模板,並對候選解法是否符合要求進行評分,從而批量產生供 1.2 版本學習的資料。

這裡所說的「自我改進」仍不是模型在脫離人類控制後自行修改權重。更準確的說法是,前一代模型被用作數據生成器和評測器,幫助團隊擴大下一代訓練數據。數據流程、訓練運行和最終模型發布仍由 Meta 控制。

更重要的是,Meta 沒有單獨訓練一個「會寫代碼的模型」,而是把 Muse Code 的工具、目標管理、上下文壓縮和子 Agent 軌跡納入訓練。未來編程模型的能力,可能越來越依賴它從訓練階段就熟悉哪一種 Agent 框架。

跑24小時、調用工具1000多次,才是這次展示的重點

Meta 提供的一個案例,是讓 Muse Spark 1.2 在 Muse Code 環境中優化 NVIDIA Hopper GPU 上的 KDA 和 MLA 內核。系統需要自行編寫代碼、編譯、分析性能,再根據結果反覆修改。

整個測試最長運行 24 小時,工具調用超過 1000 次。研究人員禁止模型直接導入現成的第三方核心庫,要求它在 Triton 中實現算法並尋找真正的性能改進,而不是將已有實現包裝成自己的結果。

在 KDA 任務中,模型組合了並行的塊內準備核心與順序的跨塊掃描,並加入針對門控累計衰減的專門優化。在 MLA 任務中,它設計了由兩個核心組成的 Triton 流水線,並嘗試複用共享的 KV 潛在表示。

這類案例的重要性不在於單次加速的數字,而在於 Agent 是否能在經歷數百次失敗和中間結果後,持續維持目標、理解性能分析數據,並產生下一轮實驗。如果系統只能穩定運行十幾分鐘,那麼它更像一款高級補全工具;能夠推進 24 小時,才開始接近可委託工程研究的 Agent。

評測接近頭部,但還沒有「擊敗 Claude 和 Codex」

Meta 的評測涵蓋 Terminal-Bench 2.1、DeepSWE 1.1、GDPVal-AA v2、MCP Atlas 以及內部編程測試。其中,Terminal-Bench 2.1 包含 89 項需要在終端環境完成的任務;DeepSWE 1.1 包含來自 91 個代碼倉庫、覆蓋五種編程語言的 113 項任務。

根據 Meta 公布的圖表,Muse Spark 1.2 搭配 Muse Code 在 Terminal-Bench 2.1 上獲得 82.9%,低於 Claude Opus 5 的 86.7%,但高於其評測中的 Codex 和 Grok Build。在 DeepSWE 1.1 上,Muse Spark 1.2 獲得 59.3%,未取得第一。Meta 內部的 440 項真實工程任務中,它獲得 70.6%,同樣落後於 Opus 5。

這些結果說明 Muse Code 已經進入頭部編程 Agent 的競爭範圍,但不支持「Meta 全面擊敗 Claude Code 和 Codex」的結論。

官方評測方法文件還說明,不同模型搭配了各自的 Agent 產品:Muse Spark 使用 Muse Code,Claude 使用 Claude Code,GPT 使用 Codex,Gemini 使用 Antigravity,Kimi 使用 Kimi Code。這樣的比較更接近完整產品對決,卻無法區分成績究竟來自模型還是 Agent 框架。

Meta 也承認,其內部評測環境和提示詞未必針對第三方閉源模型進行最佳優化。Muse Spark 1.2 在 Terminal-Bench 上的成績目前也尚未進入獨立驗證榜單。因此,现阶段最穩妥的表述是:Meta 自測顯示它接近前沿水平,獨立複現仍然缺失。

最便宜的版本,需用代碼和對話交換

Muse Spark 1.2 標準版每百萬輸入 Token 收費 1.25 美元,緩存輸入 0.15 美元,輸出 4.25 美元。這個版本的輸入和輸出不會被用於改進 Meta 產品。

另一款模型標識為muse-spark-1.2-contributor。它的每百萬輸入 Token 價格僅為 0.10 美元,緩存輸入 0.002 美元,輸出 0.20 美元。相較標準版,輸入便宜 92%,輸出便宜約 95%。

代價是貢獻者版本的提示和模型輸出可被 Meta 用於改進產品。對於開源項目、個人實驗或不含敏感資訊的工作,這可能是一筆非常有吸引力的交易;但對於企業私有代碼、尚未發布的產品、客戶資料、密鑰配置和受保密協議約束的項目,這首先是資料治理問題,而非價格問題。

企業不能僅因 Token 價格就假設將整個程式碼庫交給貢獻者版本是合適的。是否允許數據用於訓練,需根據 Meta 的具體服務條款、代碼歸屬、客戶合約和內部安全政策來判斷。標準版與貢獻者版本雖使用相似能力,卻對應兩種完全不同的數據關係。

這也揭示了 Meta 真正的競爭策略:它不僅希望靠低價爭取開發者,還希望透過開發者使用 Muse Code 時產生的任務、修改、反饋與結果,建立新的編程訓練數據閉環。開發者獲得近乎免費的 Agent 調用,Meta 則可能獲得比公開 GitHub 代碼更有價值的數據——真實任務是如何被拆解、修改和驗證的。

AI 編程進入「模型與腳手架共同訓練」的階段

過去,人們評估程式設計 AI 時主要比較模型能解多少題。Muse Code 展示的是另一套競爭邏輯:模型只是系統的一部分,後台 Agent 是否保持狀態、工具調用是否可靠、任務能否恢復、上下文是否會被正確壓縮,以及失敗後能否繼續迭代,都可能比單次程式碼生成能力更重要。

Meta 也明確表示,未來將推出更大的模型和更多 Agent 框架功能。這意味著 Muse Spark 1.2 並非最終的旗艦產品,而更像 Meta 進入編程 Agent 市場的第一套完整基礎設施。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露