太卷了。
僅過去3天,九月就已發布五個前沿模型!
Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark1.3……RSI,肯定已經到來了。
就在昨晚,谷歌的 Gemini 3.8 Flash 剛成為輕量霸主,Meta 就來踢館了。
小扎在 X 上霸氣官宣:Muse Spark 1.3 今日正式發布,它以前沿性能,帶來幾乎便宜到無需計量的體驗。這是我們在編程和智能體工作方面迄今實現的最大飛躍!

Meta 超級智能實驗室的掌舵人 Alexandr Wang 也連發三條 X,揭祕了這次「王炸」的核心殺手鐧。
他表示,與 Muse Spark 1.2 相比,Muse Spark 1.3 減少了無效輪次,工具調用次數減少 ~20%,token 消耗減少 ~25%,並且在長週期任務中能更好地保持需求,「用戶會明顯感受到這次飛躍」。

Muse Spark 1.3 發布後,昨晚剛發布的 Gemini 3.8 Flash 顯得有些尷尬。
跑分顯示,這次 Muse Spark 1.3 的提升更大。
它不僅在跑分上反超了 GPT-5.6 Sol 和 Fable 5,在 Max 推理強度下的 Artificial Analysis 智力指數已達到 62 分,穩居當前第一梯隊。

在五個月裡,Meta 已經不知不覺迭代了 4 個 Muse Spark 版本了。
亞歷山大王嘲諷谷歌:「吸別家模型尾氣」
最近,AI 第一梯隊可是非常擁擠。GPT-5.6 把持著王座,Fable 5.1 後來居上,Gemini 3.8 Flash 正彎道超車。
The emergence of Muse Spark 1.3 has thrown everyone into disarray.
在最能體現模型真實長程程式設計能力的 DeepSWE v1.1 基準測試中,Muse Spark 1.3 直接超越 Opus 5 和 GPT-5.6 Sol,還把剛發布的 Gemini 3.8 Flash 甩在身後,拿下了當前的最高分。
Muse Spark 1.3:75.4 分
Claude Opus 5:74.0 分
GPT-5.6 Sol:73.0 分

In addition, Muse Spark 1.3 also demonstrated impressive performance in several other key developer metrics.
在 SWEAtlas CodeBase QnA 中,它獲得 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。
在 Terminal-Bench 2.1 中,它獲得了 88.8 分。
在 MRCR 512K-1M 上,它竟獲得驚人的 98.1 分!(作為對比,GPT-5.6 Sol 在此項僅有 73.8 分,簡直是碾壓)。

In terms of agent capabilities, it has nearly caught up with the cutting-edge level, trailing Opus 5 by only a few percentage points in tests such as JobBench and OSWorld.

在 Artificial Analysis 上,Muse Spark 1.3 明顯超越 Gemini 3.8 Flash。
On the Smart Index, it scored 62, tying with Claude Fable 5 and entering the top tier.

而在最受開發者關注的成本方面,Muse 的輸入成本比 Fable 5 低 8 倍,輸出成本低近 12 倍,性價比拉滿。
面對如此亮眼的戰績,Meta 的首席 AI 官 Alexandr Wang 直接諷刺道:「在 Artificial Analysis 智能指數上,Gemini 什麼也不是,只能吃別家模型的汽車尾氣。」
Google 真是虎落平陽。

有人戲稱:「谷歌辛辛苦苦四個月發了 4 個 Gemini Flash 版本,Meta 這邊五個月裡一口氣迭代了 4 個 Muse Spark⁺。但谷歌剛領跑幾個小時,就被 Meta 超車了,這劇情太精彩了。」

少即是多:1 美元運行 2 小時的性能怪獸
跑分高固然厲害,但在如今的 AI 圈,真正讓開發者興奮的,永遠是好用且便宜。
Muse Spark 1.3 被稱為性價比之王,是因為它不僅跑得快,還特別會省錢。
正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零頭」。


它走了一條與以往大模型「大力出奇蹟、瘋狂堆疊參數」完全不同的路——做減法。
Muse Spark 1.3 針對長週期編程和更優的指令遵循能力進行了專門訓練,以減少不必要的互動輪次,並讓輸出更加簡潔。

它變得更聰明利落,代碼風格更乾淨,廢話更少。
而這種減法帶來的直接後果,就是成本的斷崖式下跌。
以下是一個非常震撼的真實實測案例。
開發者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,與 Fable 5.1 xHigh 進行了對比。

他提供的 Prompt 中包含一條嚴苛的「自我改進規則」:如果獨立評委的評分低於 9.5/10,智能體必須繼續改進代碼並重新嘗試。
這兩個模型都運行了大約 2 個小時,結果令人驚嘆。
Muse Spark 1.3 簡直像一個不知疲倦的超級打工人,它根本停不下來,足足進行了 20 輪自我改進循環,每次啟動 3 個智能體——相當於在 2 小時內跑了 60 多次智能體運行。
而完成這項極其龐大、複雜的長程推理任務,總成本竟不到 1 美元!

The developer exclaimed: "This completely exceeded my expectations, this thing is literally a work of art!"
在宏觀定價上,Meta 展現出了極大的誠意。新模型加量不加價,維持了每百萬 token 輸入 1.25 美元、輸出 4.25 美元的定價。

在定價上,Muse Spark 1.3 的貢獻者版「muse-spark-1.3-contributor」更是國外模型定價的地板。(代價,就是要把數據用於改進 Meta 的產品。)

Codedamn 創辦人兼開發者 Mehul Mohan 直呼:
Muse Spark 1.3 的貢獻者層定價簡直離譜得不真實,這就是美國 AI 實驗室的「 DeepSeek 定價時刻」。

在 Artificial Analysis 的統計中,在同等智力水平(得分 59 以上)的模型裡,Muse Spark 1.3 的單任務成本僅為 0.55 美元,是絕對的最優解。
作為對比,同等智力(61分)的 Grok 4.6 成本為 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高達 1.23 美元。
甚至,開發者 Kartik 指出,Muse Spark 1.3 似乎具備了類似於 Sol 和 Fable 的「循環深度」推理能力。
它並非瞬間生成答案,而是能在內部進行邏輯推演,這使得其 token 效率驚人地高。

Alexandr Wang 的狂飆,小扎的終極野心
The emergence of Muse Spark 1.3 would not have been possible without the traders behind it.
今年 7 月,Meta 發布 Muse Spark 1.1,主打的是 1M 超長上下文和電腦操作。
短短不到兩個月,1.3 版本已將長程編碼能力提升至 GPT-5.6 的水準。
如此快速的迭代,正是 Alexandr Wang 接手 Meta 超級智能實驗室後帶來的成果。
他們的最終目標是什麼?正如小扎和 Alexandr Wang 反覆強調的兩個詞:「智能體」和「便宜到忽略不計」。
In other words, Meta is looking at the next ASI opportunity—“Agent Engineering”.
Meta AI 負責人 Alexandr Wang 在接受 Axios 採訪時明確表示,所有可用性改進都是為了實現小扎多次提及的宏偉藍圖——打造 7×24 小時在線的個人智能體。

要讓一個智能體 24 小時幫你處理郵件、寫代碼、分析數據,它必須具備兩個條件。
1. 極度聰明且穩定:它需要應對極長的對話線程(長線程),並能並行處理多個工作流程。
當指令模糊時,它要主動提問;當遇到阻礙時,它要向人類求助;在執行關鍵操作前,它要確認。最重要的是,不產生幻覺。
2. 極度便宜:如果個人智能體運行一天的成本高達幾十美元,那它永遠只能是少數人的玩具。
The emergence of Muse Spark 1.3 is essentially paving the way for 7×24 personal agents.
它就像一位成熟的資深工程師,你給它一個目標,它就能自行規劃、自行糾錯、自行交付。
為此,北大校友、Meta研究員孫之清透露,Meta團隊對此前的牛油果 avocado 模型再次進行後訓練,實現了更好的測試 scaling。

背後的狂歡:我們被「刷榜」騙了嗎?
不過,Muse Spark 1.3 同樣受到了質疑。
知名 AI 機構 BridgeMind 發了一段引人深思的話:
Gemini 3.8 Flash 和 Muse Spark 1.3 今天同時發布。兩者在基準測試上看起來都很出色。
Muse Spark 1.3 目前在智能指數上與 Fable 5 並列……我想感到興奮。但我沒有。
因為這個月的 AI 發布如出一轍,分數飙升,但真實世界的體驗卻毫無長進。
這令人沮喪。我對基準測試的信任每週都在減少,而對那些操縱基準的實驗室,我的信任更是所剩無幾。

This statement precisely hits the current pain points of the large model industry.
有網友對 Muse Spark 1.3、Gemini Flash 3.8z 在後端級 3D 約束下做了壓力測試,結果兩個模型的老底都被揭穿了:
Muse Spark 1.4 并沒有那麼好,而 Gemini Flash 3.5 純純在刷榜。

如今,各大實驗室已陷入「為跑分而訓練」的怪圈。一個模型發布,必定伴隨著幾張吊打對手的雷達圖和排行榜截圖。
DeepSWE、Tau3-Bench、GPQA 已成為各家瘋狂「刷題」的目標。
而 Muse Spark 1.3 也露出了馬腳。
在 Artificial Analysis 的深度報告中,我們也能看到它的一絲退步。
例如,在 AA-Omniscience 測試中,xhigh 和 max 版本的表現均有所下降,原因是其「棄權率」升高——當不確定時,它更傾向於不回答,而非虛構答案。
這降低了幻覺率,但也側面說明,它的絕對知識儲備並沒有像跑分提升得那麼誇張。

大模型的下半場,到底比什麼?
今天 Muse Spark 1.3 和 Gemini 3.8 Flash 的發布,可以讓我們得出以下幾個判斷。
首先,基座模型的「參數紅利」正在見頂。
單純依靠擴大參數規模來提升智力的路徑,邊際效益已越來越低。
未來,誰能像 Muse Spark 1.3 一樣,在系統架構上引入類似「循環深度」的推理機制,在工具調用上做極致的「減法」,誰就能獲得真正的體驗躍升。
此外,「智能體工程」才是致勝關鍵。
大模型的競爭,已從「誰更會說話」轉向「誰更能幹活」。
未來的核心壁壘不是單一跑分,而是在極低成本下,長程任務的真實落地能力。
像 Muse Spark 1.3 這樣,用不到 1 美元跑完 60 次試錯迴圈的模型,將徹底重塑商業模式。
參考資料:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
本文來自微信公眾號「新智元」,作者:ASI啟示錄
