あまりにも大規模です。
9月はまだ3日しか経っていませんが、すでに5つの先進モデルがリリースされました!
AnthropicのFable 5.1とMythos 5.1、GoogleのGemini 3.8 FlashとCyber、そしてMetaのMuse Spark1.3……RSIは、すでに来ている。
昨夜、GoogleのGemini 3.8 Flashが軽量霸主となった直後に、Metaが挑戦してきた。
小扎がX上で堂々と発表:Muse Spark 1.3が本日正式リリース。最先端のパフォーマンスで、ほぼ計測不能なほど安価な体験を実現しました。これは、プログラミングとエージェント作業においてこれまでに達成した最大の飛躍です!

メタの超知能ラボを率いるアレクサンドル・ワンもXに3つの投稿を連続して掲載し、今回の「王炸」の核心的な強力な武器を明かした。
彼は、Muse Spark 1.2 と比較して、Muse Spark 1.3 では無効ラウンドが削減され、ツール呼び出し回数が約20%減少し、トークン消費が約25%削減されたと述べ、長期間タスクにおいても要件をより良く維持できるとし、「ユーザーはこの飛躍を明確に実感するでしょう」と述べました。

Muse Spark 1.3がリリースされ、昨夜リリースされたばかりのGemini 3.8 Flashがやや見劣りした。
ランニング表示によると、今回のMuse Spark 1.3の改善はより大きいです。
それはパフォーマンススコアでGPT-5.6 SolとFable 5を上回り、Max推論強度下的なArtificial Analysis知性指数は62点に達し、確実に現在の最上位グループ入りを果たしました。

5か月の間に、Metaは気づかないうちにMuse Sparkを4回更新しました。
アレクサンダー王はGoogleを嘲笑し、「他社のモデルの排気ガスを吸っている」と述べた。
最近、AIのトップグループは非常に混雑しています。GPT-5.6が王座を占め、Fable 5.1が後から追い上げ、Gemini 3.8 Flashがコーナーを駆け抜けています。
Muse Spark 1.3 の登場により、すべての人の計画が乱された。
DeepSWE v1.1ベンチマークにおいて、Muse Spark 1.3はOpus 5とGPT-5.6 Solを直接上回り、新たにリリースされたGemini 3.8 Flashをも追い越し、現在の最高得点を記録しました。
Muse Spark 1.3:75.4点
Claude Opus 5:74.0点
GPT-5.6 Sol:73.0 点

さらに、他の複数の重要な開発者指標においても、Muse Spark 1.3 は無視できないパフォーマンスを発揮しています。
SWEAtlas CodeBase QnAでは59.4点を獲得し、GPT-5.6 SolとOpus 5を上回りました。
Terminal-Bench 2.1では88.8点を獲得しました。
MRCR 512K-1Mでは、驚異的な98.1点を獲得!(対照的に、GPT-5.6 Solは73.8点にとどまり、圧倒的です)。

エージェントの能力においても、JobBenchやOSWorldなどのテストでOpus 5とわずか数パーセントの差しかなく、ほぼ最前線の水準に追いついています。

Artificial Analysisでは、Muse Spark 1.3がGemini 3.8 Flashを明確に上回っています。
スマートインデックスでは62点を獲得し、Claude Fable 5と並んでトップクラスにランクインしました。

開発者が最も注目するコスト面では、Museの入力コストはFable 5より8倍低く、出力コストは約12倍低いです。コストパフォーマンスが最高です。
このような目覚ましい成績を受けて、Metaの最高AI責任者であるAlexandr Wangは皮肉を込めてこう語った:「Artificial Analysisインテリジェント指数において、Geminiは何の意味も持たず、他のモデルの排気ガスを吸うしかない。」
グーグルは本当に落ちぶれたものだ。

誰かが冗談で言った:「グーグルは4か月で4つのGemini Flashバージョンをリリースしたが、メタは5か月の間に4つのMuse Spark⁺を一気にアップデートした。しかし、グーグルがわずか数時間リードしただけで、メタに追い越されてしまった。この展開はあまりにも見ごたえがある。」

少ないほど多い:1ドルで2時間、パフォーマンスの怪物
パフォーマンスが高くても確かに素晴らしいが、現在のAI業界では、開発者を本当に興奮させるのは、使いやすくかつ安価なことだ。
Muse Spark 1.3 がコスパの王と呼ばれるのは、スピードが速いだけでなく、節約にも優れているからです。
アレクサンダー・ワンの言葉を借りれば、Muse Spark 1.3は「価格が無視できるほど安い」、「最先端のパフォーマンスで、コストはごくわずか」である。


それは、従来の大規模モデルが「力技で奇跡を起こし、パラメーターを過剰に積み上げる」という道とは完全に異なる道、つまり「減法」を取った。
Muse Spark 1.3は、長期的なプログラミングとより優れた指示遵守能力のために特別にトレーニングされ、不要なインタラクションラウンドを削減し、出力をより簡潔にしています。

より賢く、洗練され、コードスタイルがクリーンになり、無駄な言葉が減りました。
そして、この減算がもたらす直接的な結果は、コストの急激な低下です。
以下は非常に衝撃的な実際のテストケースです。
開発者 @SPAC89 が Muse Spark 1.3 Ultra Contributor モードを使用し、Fable 5.1 xHigh と比較しました。

他の提示には、独立した審査員の評価が9.5/10未満の場合、エージェントはコードを継続的に改善し、再試行しなければならないという厳格な「自己改善ルール」が含まれている。
これらの2つのモデルはそれぞれ約2時間動作し、結果は驚異的でした。
Muse Spark 1.3 はまるで休むことを知らない超人間労働者のようで、まったく止まることなく、20ラウンドの自己改善サイクルを実行し、毎回3つのエージェントを起動しました。これは2時間以内に60回以上エージェントを実行したことに相当します。
しかし、この膨大で複雑な長距離推論タスクを完了する総コストは、たった1ドル以下でした!

この開発者は叫んだ。「これは私の予想をはるかに超えている、これはまさに芸術品だ!」
マクロな価格設定において、Metaは大きな誠意を示しました。新モデルは量を増やしても価格を据え置き、1百万トークンの入力につき1.25ドル、出力につき4.25ドルの価格を維持しています。

価格面で、Muse Spark 1.3のコントリビュータ版「muse-spark-1.3-contributor」は、海外モデルの価格の下限となっています。(代償として、データはMetaの製品改善に使用されます。)

Codedamnの創設者で開発者であるMehul Mohanは次のように述べています:
Muse Spark 1.3 のコントリビューターレベルの価格設定は、現実離れしすぎていて、これがアメリカのAIラボの「 DeepSeek 価格決定時刻。

Artificial Analysisの統計によると、同等の知能レベル(スコア59以上)のモデルの中で、Muse Spark 1.3の単一タスクコストは0.55ドルと、圧倒的な最適解です。
対照的に、同等の知能スコア(61点)を持つGrok 4.6のコストは0.94ドル、GPT-5.6 Solは0.95ドル、Claude Opus 5はさらに1.23ドルに達する。
さらに、開発者のKartikは、Muse Spark 1.3がSolやFableと同様の「循環的深層」推論能力を備えているようだと指摘した。
それは即座に答えを生成するのではなく、内部で論理的な推論を行うため、トークン効率が驚異的に高いです。

アレクサンダー・ワンの急成長、ザッカーバーグの究極の野望
Muse Spark 1.3 の登場には、その背後にいるトレーダーが不可欠です。
今年7月、MetaはMuse Spark 1.1をリリースし、1Mの超長コンテキストとコンピュータ操作を主な特徴としています。
たった2か月足らずで、バージョン1.3は長期エンコード能力をGPT-5.6レベルまで引き上げました。
これは、アレクサンダー・ワンがMeta超知能ラボを引き継いだ後にもたらされた成果である。
彼らの最終的な目標とは何か?ザッカーバーグとアレクサンドル・ワンが繰り返し強調する二つの言葉は、「エージェント」と「無視できるほど安い」である。
つまり、メタは次なるASIの潮流である「エージェントエンジニアリング」に注目している。
メタAIの責任者であるアレクサンダー・ワンは、Axiosのインタビューで、すべての可用性の改善は、ザッカーバーグが繰り返し言及してきた壮大なビジョン——7×24時間オンラインのパーソナルエージェントの構築——に役立つことを明確に述べた。

24時間あなたのためにメールを処理し、コードを書き、データを分析させるには、エージェントに2つの条件が必要です。
1. 非常に賢く、安定している:長時間の対話スレッドを処理でき、複数のワークフローを並列で処理できる。
指示が曖昧な場合は、自発的に質問するべきである。障害に直面した場合は、人間の助けを求めるべきである。重要な操作を実行する前には、確認するべきである。何より、幻覚を生まないこと。
2. 非常に安価:個人のエージェントを1日運用するコストが数十ドルにもなる場合、それは永遠に一部の人のためのおもちゃにとどまるだろう。
Muse Spark 1.3の登場は、7×24時間のパーソナルエージェントを実現するための基盤を築くものです。
それはまるで熟練したベテランエンジンであり、目標を提示すれば、自ら計画を立て、エラーを修正し、成果を届けます。
そのために、北京大学のアルムナイでMetaの研究員である孫之清は、Metaチームが以前のアボカド(avocado)モデルを再学習させ、より良いテストスケーリングを実現したことを明らかにした。

祭りの裏側:私たちは「ランキング操作」に騙されたのか?
しかし、Muse Spark 1.3もまた疑問視されています。
有名なAI機関BridgeMindが、深く考えさせる一文を投稿しました:
Gemini 3.8 Flash と Muse Spark 1.3 が本日同時にリリースされました。両者ともベンチマークで非常に優れているように見えます。
Muse Spark 1.3 は現在、スマートインデックス上で Fable 5 と並んでいます……興奮したいのですが、そうできません。
なぜなら、今月のAIのリリースは一貫して得点が急上昇したが、現実世界での体験はまったく進歩していないからである。
これは苛立たしいことです。私は基准テストへの信頼を毎週失っており、基准を操作する実験室への信頼はほとんどありません。

この言葉は、現在の大規模モデル業界の課題を正確に突いている。
あるネットユーザーが、Muse Spark 1.3とGemini Flash 3.8zをバックエンドレベルの3D制約下でストレステストしたところ、両モデルの実力が露呈した:
Muse Spark 1.4はそれほど良くなく、Gemini Flash 3.5は単にランキングを操作しているだけだ。

現在、さまざまな研究室は「スコアを上げるために訓練する」という悪循環に陥っている。モデルが発表されるたびに、競合他社を圧倒するレーダーチャートやランキングのスクリーンショットが必ず付いてくる。
DeepSWE、Tau3-Bench、GPQAが、各社が熱心に「問題演習」する対象となった。
また、Muse Spark 1.3 も本性を現しました。
Artificial Analysisの詳細なレポートでも、そのわずかな後退が見られます。
たとえば、AA-Omniscienceテストでは、xhighおよびmaxバージョンのスコアが低下しました。これは、「棄権率」が上昇したためで、不確実な場合に無理に回答するのではなく、回答を見送る傾向が強まったからです。
これは幻覚率を低下させましたが、その絶対的な知識量がベンチマークの向上ほど劇的に増えていないことを示唆しています。

大規模モデルの後半戦では、一体何を競うのか?
今日のMuse Spark 1.3とGemini 3.8 Flashのリリースから、以下の判断を導くことができる。
まず、ベースモデルの「パラメーター・ボーナス」は頂点に達しつつあります。
パラメータ規模を単に拡大することで知性を向上させるアプローチの限界効用は、ますます低下している。
今後、システムアーキテクチャに「循環深度」のような推論メカニズムを導入し、ツール呼び出しにおいて極限の「簡素化」を実現できるのは誰か——その者が真の体験の飛躍を手にするだろう。
また、エージェントエンジニアリングが鍵である。
大規模モデルの競争は、「誰がより上手に話せるか」から「誰がよりよく働けるか」へと移行している。
将来の核心的な障壁は、単一のベンチマークではなく、極めて低コストで長期タスクを実際の運用に落とし込む能力である。
1ドル未満で60回の試行錯誤サイクルを実行できるMuse Spark 1.3のようなモデルは、ビジネスモデルを根本から変革するだろう。
参考資料:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
本文は微信公众号「新智元」より、著者:ASI启示録
