馬克·祖克伯於週三推出 Muse Code 的測試版,這是 Meta 首個 AI 編碼代理。Anthropic 的 Claude Opus 5 在 Meta 發布的四項比較中均勝出。
Meta 仍發布了這些圖表。該公司銷售的是較便宜的工具,而非更優質的工具。獨立測試數據顯示,實際差距比 Meta 所展示的更大。
在 X 上關注我們 以即時獲取最新資訊
Meta 的自有圖表每輪都勝過 Anthropic
Muse Spark 1.2 是 Muse Code 內的模型,其在 Terminal-Bench 2.1 上獲得了 82.9% 的分數。
Claude Opus 5 在同一測試中獲得了 86.7% 的分數。Terminal-Bench 由 Laude 研究所和史丹佛大學的研究人員開發,涵蓋了 89 個真實工作任務,包括系統維修、數據處理和安全領域。
第二名令人敬佩。Muse Code 以 81.8% 的成績超越 OpenAI 的 Codex 和 Grok Build 的 81.6%。

下一張圖表更為嚴峻。DeepSWE 1.1 在評分期間關閉互聯網訪問,設置了 113 個編程任務,Muse Spark 1.2 則跌至第三名,得分为 59.3%。
Meta 隨後發布了其自行構建的測試,該測試基於其工程師提供的 440 個真實的拉取請求。Muse Spark 1.2 在該測試中得分為 70.6%,約比 Opus 5 低九個百分點。

該分數僅比 Muse Spark 1.1 高出 2.3 分,後者是 Meta 於七月推出的模型。
Model Meta 將其編碼圖表遺留
Meta 將自身與 GPT-5.6 Terra 進行比較。OpenAI 推出了一款更強大的模型 Sol,而 Meta 將其排除在所有三張編程圖表之外。
Sol 在獨立的 Terminal-Bench 2.1 leaderboard 上以 89.5% 的成績位居第一,Opus 5 以 89.1% 緊隨其後。
這兩個數字均超越了 Meta 報告的 Opus 5 的 86.7%。Meta 選擇了其最強勁對手的較弱設定,但仍落後於對方。
對抗 Sol,真正的領先者,Muse Spark 1.2 落後 6.6 分,而非 3.8 分。
Meta 確實在一個地方包含了 Sol。在一個運行超過 1,000 次工具調用的圖形處理單元(GPU)核心任務中,Sol 比基線提升了 71.2%。Muse Spark 1.2 達到了 68.7%,在六個項目中排名第四。
一個相反的注意事項是:Muse Spark 1.2 尚未出現在該公開排行榜上,目前僅有 183 個追蹤模型中的 26 個經過測試。其 82.9% 的數據仍為 Meta 的數據。
「Muse Spark 1.2 是我們邁向前沿的下一步,更大、更強大的模型即將推出,」祖克柏 said 在一篇貼文中表示。
扎克伯格可能很快將主持擊敗他自己的模型
據報導,Meta 正與 Anthropic 談判 租用其計算資源。這筆交易兩年內可能達 100 億美元。Meta 的數據中心將協助運行 Claude 模型,而這些模型正是 Muse Code 計劃取代的對象。
Muse Code 的領導團隊成本高昂。祖克伯於 2025 年 6 月以 143 億美元收購了 Scale AI 及其創始人亞歷山大·王,後者現任 Meta 超級智慧實驗室負責人。
價格是王維所剩的槓桿。費率與 Meta 首個付費 API 於七月上線時的收費一致,每百萬輸入代幣為 $1.25,每百萬輸出代幣為 $4.25。
貢獻者等級的費用低於10倍。開發者可透過允許Meta訓練其作品來符合資格。王拒絕提供Muse Spark系列的採用數字。
Meta 的帳戶解釋了折扣。上個季度收入增長 28% 至 608 億美元,但營運利潤下降 8% 至 188 億美元。
營業利潤率從一年前的 43% 下滑至 31%。Meta 在該季度單獨於資本項目上花費了 310.8 億美元,並預計全年將高達 1450 億美元。
Muse Code 提供了 Claude Code 所缺乏的工程功能。背景代理可在整個會話中保持上下文。子代理在儲存庫的獨立副本中運行。
Meta 建立了一名堅實的第二佳程式碼員,並以預算型價格定價。測試版將顯示開發者是否願意為一份約為十分之一大小的帳單,犧牲幾點準確度。
