Meta 發布 Muse Spark 1.3,在 AI 基準測試中表現優於競爭對手

icon MarsBit
分享
AI summary icon精華摘要
Meta 已推出 Muse Spark 1.3,這款 AI 模型在關鍵基準測試中表現優於 Gemini 3.8 Flash 和 GPT-5.6 Sol。該模型由 Meta 超級智能實驗室開發,在 DeepSWE v1.1 上取得 75.4 分,並具有更低的 token 使用量和定價。Meta 首席 AI 官 Alexandr Wang 視其為邁向 24/7 AI 代理的關鍵一步。此項 AI 與加密貨幣新聞更新突顯了因效率提升而推動的採用,可能帶來新的代幣上線機會。

太卷了。

僅過去3天,九月就已發布五個前沿模型!

Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark1.3……RSI,肯定已經到來了。

就在昨晚,谷歌的 Gemini 3.8 Flash 剛成為輕量霸主,Meta 就來踢館了。

小扎在 X 上霸氣官宣:Muse Spark 1.3 今日正式發布,它以前沿性能,帶來幾乎便宜到無需計量的體驗。這是我們在編程和智能體工作方面迄今實現的最大飛躍!

智能體

Meta 超級智能實驗室的掌舵人 Alexandr Wang 也連發三條 X,揭祕了這次「王炸」的核心殺手鐧。

他表示,與 Muse Spark 1.2 相比,Muse Spark 1.3 減少了無效輪次,工具調用次數減少 ~20%,token 消耗減少 ~25%,並且在長週期任務中能更好地保持需求,「用戶會明顯感受到這次飛躍」。

智能體

Muse Spark 1.3 發布後,昨晚剛發布的 Gemini 3.8 Flash 顯得有些尷尬。

跑分顯示,這次 Muse Spark 1.3 的提升更大。

它不僅在跑分上反超了 GPT-5.6 Sol 和 Fable 5,在 Max 推理強度下的 Artificial Analysis 智力指數已達到 62 分,穩居當前第一梯隊。

智能體

在五個月裡,Meta 已經不知不覺迭代了 4 個 Muse Spark 版本了。

亞歷山大王嘲諷谷歌:「吸別家模型尾氣」

最近,AI 第一梯隊可是非常擁擠。GPT-5.6 把持著王座,Fable 5.1 後來居上,Gemini 3.8 Flash 正彎道超車。

The emergence of Muse Spark 1.3 has thrown everyone into disarray.

在最能體現模型真實長程程式設計能力的 DeepSWE v1.1 基準測試中,Muse Spark 1.3 直接超越 Opus 5 和 GPT-5.6 Sol,還把剛發布的 Gemini 3.8 Flash 甩在身後,拿下了當前的最高分。

Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分

智能體

In addition, Muse Spark 1.3 also demonstrated impressive performance in several other key developer metrics.

在 SWEAtlas CodeBase QnA 中,它獲得 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。

在 Terminal-Bench 2.1 中,它獲得了 88.8 分。

在 MRCR 512K-1M 上,它竟獲得驚人的 98.1 分!(作為對比,GPT-5.6 Sol 在此項僅有 73.8 分,簡直是碾壓)。

智能體

In terms of agent capabilities, it has nearly caught up with the cutting-edge level, trailing Opus 5 by only a few percentage points in tests such as JobBench and OSWorld.

智能體

在 Artificial Analysis 上,Muse Spark 1.3 明顯超越 Gemini 3.8 Flash。

On the Smart Index, it scored 62, tying with Claude Fable 5 and entering the top tier.

智能體

而在最受開發者關注的成本方面,Muse 的輸入成本比 Fable 5 低 8 倍,輸出成本低近 12 倍,性價比拉滿。

面對如此亮眼的戰績,Meta 的首席 AI 官 Alexandr Wang 直接諷刺道:「在 Artificial Analysis 智能指數上,Gemini 什麼也不是,只能吃別家模型的汽車尾氣。」

Google 真是虎落平陽。

智能體

有人戲稱:「谷歌辛辛苦苦四個月發了 4 個 Gemini Flash 版本,Meta 這邊五個月裡一口氣迭代了 4 個 Muse Spark⁺。但谷歌剛領跑幾個小時,就被 Meta 超車了,這劇情太精彩了。」

智能體

少即是多:1 美元運行 2 小時的性能怪獸

跑分高固然厲害,但在如今的 AI 圈,真正讓開發者興奮的,永遠是好用且便宜。

Muse Spark 1.3 被稱為性價比之王,是因為它不僅跑得快,還特別會省錢。

正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零頭」。

智能體

智能體

它走了一條與以往大模型「大力出奇蹟、瘋狂堆疊參數」完全不同的路——做減法。

Muse Spark 1.3 針對長週期編程和更優的指令遵循能力進行了專門訓練,以減少不必要的互動輪次,並讓輸出更加簡潔。

智能體

它變得更聰明利落,代碼風格更乾淨,廢話更少。

而這種減法帶來的直接後果,就是成本的斷崖式下跌。

以下是一個非常震撼的真實實測案例。

開發者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,與 Fable 5.1 xHigh 進行了對比。

智能體

他提供的 Prompt 中包含一條嚴苛的「自我改進規則」:如果獨立評委的評分低於 9.5/10,智能體必須繼續改進代碼並重新嘗試。

這兩個模型都運行了大約 2 個小時,結果令人驚嘆。

Muse Spark 1.3 簡直像一個不知疲倦的超級打工人,它根本停不下來,足足進行了 20 輪自我改進循環,每次啟動 3 個智能體——相當於在 2 小時內跑了 60 多次智能體運行。

而完成這項極其龐大、複雜的長程推理任務,總成本竟不到 1 美元!

智能體

The developer exclaimed: "This completely exceeded my expectations, this thing is literally a work of art!"

在宏觀定價上,Meta 展現出了極大的誠意。新模型加量不加價,維持了每百萬 token 輸入 1.25 美元、輸出 4.25 美元的定價。

智能體

在定價上,Muse Spark 1.3 的貢獻者版「muse-spark-1.3-contributor」更是國外模型定價的地板。(代價,就是要把數據用於改進 Meta 的產品。)

智能體

Codedamn 創辦人兼開發者 Mehul Mohan 直呼:

Muse Spark 1.3 的貢獻者層定價簡直離譜得不真實,這就是美國 AI 實驗室的「 DeepSeek 定價時刻」。

智能體

在 Artificial Analysis 的統計中,在同等智力水平(得分 59 以上)的模型裡,Muse Spark 1.3 的單任務成本僅為 0.55 美元,是絕對的最優解。

作為對比,同等智力(61分)的 Grok 4.6 成本為 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高達 1.23 美元。

甚至,開發者 Kartik 指出,Muse Spark 1.3 似乎具備了類似於 Sol 和 Fable 的「循環深度」推理能力。

它並非瞬間生成答案,而是能在內部進行邏輯推演,這使得其 token 效率驚人地高。

智能體

Alexandr Wang 的狂飆,小扎的終極野心

The emergence of Muse Spark 1.3 would not have been possible without the traders behind it.

今年 7 月,Meta 發布 Muse Spark 1.1,主打的是 1M 超長上下文和電腦操作。

短短不到兩個月,1.3 版本已將長程編碼能力提升至 GPT-5.6 的水準。

如此快速的迭代,正是 Alexandr Wang 接手 Meta 超級智能實驗室後帶來的成果。

他們的最終目標是什麼?正如小扎和 Alexandr Wang 反覆強調的兩個詞:「智能體」和「便宜到忽略不計」。

In other words, Meta is looking at the next ASI opportunity—“Agent Engineering”.

Meta AI 負責人 Alexandr Wang 在接受 Axios 採訪時明確表示,所有可用性改進都是為了實現小扎多次提及的宏偉藍圖——打造 7×24 小時在線的個人智能體。

智能體

要讓一個智能體 24 小時幫你處理郵件、寫代碼、分析數據,它必須具備兩個條件。

1. 極度聰明且穩定:它需要應對極長的對話線程(長線程),並能並行處理多個工作流程。

當指令模糊時,它要主動提問;當遇到阻礙時,它要向人類求助;在執行關鍵操作前,它要確認。最重要的是,不產生幻覺。

2. 極度便宜:如果個人智能體運行一天的成本高達幾十美元,那它永遠只能是少數人的玩具。

The emergence of Muse Spark 1.3 is essentially paving the way for 7×24 personal agents.

它就像一位成熟的資深工程師,你給它一個目標,它就能自行規劃、自行糾錯、自行交付。

為此,北大校友、Meta研究員孫之清透露,Meta團隊對此前的牛油果 avocado 模型再次進行後訓練,實現了更好的測試 scaling。

智能體

背後的狂歡:我們被「刷榜」騙了嗎?

不過,Muse Spark 1.3 同樣受到了質疑。

知名 AI 機構 BridgeMind 發了一段引人深思的話:

Gemini 3.8 Flash 和 Muse Spark 1.3 今天同時發布。兩者在基準測試上看起來都很出色。

Muse Spark 1.3 目前在智能指數上與 Fable 5 並列……我想感到興奮。但我沒有。

因為這個月的 AI 發布如出一轍,分數飙升,但真實世界的體驗卻毫無長進。

這令人沮喪。我對基準測試的信任每週都在減少,而對那些操縱基準的實驗室,我的信任更是所剩無幾。

智能體

This statement precisely hits the current pain points of the large model industry.

有網友對 Muse Spark 1.3、Gemini Flash 3.8z 在後端級 3D 約束下做了壓力測試,結果兩個模型的老底都被揭穿了:

Muse Spark 1.4 并沒有那麼好,而 Gemini Flash 3.5 純純在刷榜。

智能體

如今,各大實驗室已陷入「為跑分而訓練」的怪圈。一個模型發布,必定伴隨著幾張吊打對手的雷達圖和排行榜截圖。

DeepSWE、Tau3-Bench、GPQA 已成為各家瘋狂「刷題」的目標。

而 Muse Spark 1.3 也露出了馬腳。

在 Artificial Analysis 的深度報告中,我們也能看到它的一絲退步。

例如,在 AA-Omniscience 測試中,xhigh 和 max 版本的表現均有所下降,原因是其「棄權率」升高——當不確定時,它更傾向於不回答,而非虛構答案。

這降低了幻覺率,但也側面說明,它的絕對知識儲備並沒有像跑分提升得那麼誇張。

智能體

大模型的下半場,到底比什麼?

今天 Muse Spark 1.3 和 Gemini 3.8 Flash 的發布,可以讓我們得出以下幾個判斷。

首先,基座模型的「參數紅利」正在見頂。

單純依靠擴大參數規模來提升智力的路徑,邊際效益已越來越低。

未來,誰能像 Muse Spark 1.3 一樣,在系統架構上引入類似「循環深度」的推理機制,在工具調用上做極致的「減法」,誰就能獲得真正的體驗躍升。

此外,「智能體工程」才是致勝關鍵。

大模型的競爭,已從「誰更會說話」轉向「誰更能幹活」。

未來的核心壁壘不是單一跑分,而是在極低成本下,長程任務的真實落地能力。

像 Muse Spark 1.3 這樣,用不到 1 美元跑完 60 次試錯迴圈的模型,將徹底重塑商業模式。

參考資料:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

本文來自微信公眾號「新智元」,作者:ASI啟示錄

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露