2026年8月5日、Metaは初のエンドツーエンドプログラミングエージェント「Muse Code」を発表し、同時にプログラミング最適化版のMuse Spark 1.2モデルをリリースしました。Muse Codeは大規模なコードベースを読み取り、変更計画を策定し、コードを記述し、テストを実行して結果を検証できます。また、複数のバックグラウンドエージェントがセッション全体にわたり継続的に実行され、毎回タスクごとにプロジェクトを再理解する必要がありません。Metaは、システムに追記専用で上書き不可なローカルイベントログを設計し、プログラムがクラッシュしても中断した位置に正確に復元できるようにしました。開発者たちの議論を本格的に引き起こしたのは価格です:標準版では、100万トークンあたりの入力が1.25ドル、出力が4.25ドルですが、ユーザーがMetaに入力と出力のデータを使用して製品改善に協力する場合、「コントリビューターバージョン」はそれぞれ0.10ドルと0.20ドルに低下します。この低価格の裏には通常のプロモーションではなく、コードと使用データの提供という交換条件があります。公式評価ではMuse Spark 1.2はトップレベルのプログラミングモデルに近づいていますが、まだ全体的にリードしておらず、一部の結果は独立して再現されていません。Metaが今回示したシグナルは、AIプログラミングの競争単位が単一モデルから、モデル、エージェント実行フレームワーク、長期状態、データ閉ループからなる完全なシステムへと移行しているということです。文章作者、来源:Meta AI Research
Metaがついに独自の「Claude Code」を手に入れた
Muse CodeはMetaが提供する最初のターミナル型プログラミングエージェントで、現在macOSとLinux向けにベータ版として公開されています。これはコード補完ではなく、完全なソフトウェアエンジニアリングタスクを対象としています:大規模なコードリポジトリにアクセスし、既存の構造を理解し、計画を立て、複数のファイルを変更し、コマンドを実行してテストを行い、その結果に基づいて継続的に修正します。
これにより、Muse CodeはClaude Code、Codex、Gemini CLIなどが競争する市場に直接参入します。モデルはもはや「このコードをどのように書くべきか」という質問に答えるだけでなく、ターミナル、ファイルシステム、開発ツールへのアクセスを獲得し、人間の介入を最小限に抑えながらタスクを継続的に実行できます。
Metaは記事でMuse CodeとMuse Spark 1.2を一連のシステムとして紹介しており、随意に分割可能な2つの製品ではないと明示している。Muse Spark 1.2は理解、推論、生成を担当し、Muse Codeはコンテキストの整理、サブエージェントのスケジューリング、ツールの呼び出し、状態の保存、結果の検証を担当する。両者はトレーニング段階で共同最適化されており、同じモデルを他のエージェントフレームワークに移すだけでは、Metaが提示した成果を再現できない可能性がある。
多Agentは一時的なグループ作成ではなく、長期的に常駐します
Muse Codeの最も差別化された設計は、非同期で動作するバックグラウンドAgentのセットです。
一般的マルチエージェントシステムでは、サブタスクを実行する際に一時的にアシスタントを作成し、関連ファイルの検索、テストの失敗分析、または特定の依存関係の調査などをさせます。タスクが終了すると、そのアシスタントのコンテキストは通常消去され、次に類似の問題が発生した場合、システムは同じコードを再スキャンし、同じ情報を再収集する可能性があります。
Muse Codeのバックグラウンドエージェントは、セッション全体にわたりアクティブな状態を維持します。これらはコードベースに対する理解を継続的に蓄積し、自ら次のステップを推進し、結果をメインエージェントに報告するタイミングを選択できます。メインエージェントは目標の調整を担当し、バックグラウンドエージェントはそれぞれ異なるモジュールの調査、テストの確認、呼び出し関係の検索、または実装案の検証を行います。
この設計は、長時間のタスクにおける一般的な無駄を解決しようとしています。つまり、エージェントがすでに確認した内容を繰り返し忘れてしまうことです。バックグラウンドのエージェントの状態が信頼性を持って保持されれば、エージェントは各ステップでプロジェクト構造を再読み取りする必要がなくなり、人間が「先ほどこのファイルは既に確認済みです」と繰り返し提醒する必要もありません。
ただし、複数のエージェントが同時にコードを変更すると、競合、権限、コストの問題が発生します。Metaの公開記事では、タスクがどのように分割され、コード変更がどのようにマージされるか、またバックグラウンドエージェントにエラーが発生した場合に他のエージェントがどのように誤った結論を引き継がないようにするかについて、完全には明示されていません。したがって、継続的エージェントは注目すべきアーキテクチャの方向性ですが、現在のところ公式デモのみでは、実際のチームプロジェクトにおける安定性を判断することはできません。
クラッシュ後、最初からやり直さない
長時間実行されるプログラミングエージェントは、現実的な問題に直面しています:タスクが長くなるほど、ネットワーク切断、ツールエラー、プロセスクラッシュ、コンテキスト制限を超えるリスクが高まります。システムが現在の状態をモデルの対話にのみ保存している場合、1回の障害で数時間にわたる探索作業がすべて失われる可能性があります。
Muse Codeは、ローカルイベントログをこのように構築しました。モデルの呼び出し、ツールの実行、ユーザーの承認、ファイルの変更の各イベントは、追加方式でログに書き込まれ、過去に発生した履歴は後続の状態によって直接上書きされることはありません。
メタはこのメカニズムを「正確なリプレイ可能」および「再起動安全」と呼びます。エージェントが途中でクラッシュした場合、システムはイベントログに基づいて作業を復元し、以前に何が起きたかを再び推測する必要がなくなります。これは、プログラミングエージェントを一時的な対話から、状態を持つエンジニアリングプロセスに近いものに変えます。
Muse Codeには、呼び出せる複数のスキルが組み込まれています:/planユーザーの承認を必要とする実行計画を生成します;/grillこの計画を徹底的に検証し、見落としやリスク、誤った前提を特定します;/goal指定された目標を達成するまで、Agentが継続的に実行します。
これらの機能の背後にある考え方は明確です。AIが数時間にわたるソフトウェアエンジニアリングの作業を担う場合、各ステップで生成されるコードが美しくあることだけでなく、進捗を保存し、レビューを受け入れ、計画の欠陥を発見し、障害発生後も実行を継続できることが重要です。
Muse Spark 1.2はモデルであり、Agentフレームワークの「専用エンジン」でもあります。
Muse Spark 1.2は、1.1版のリリースから1か月も経たないうちに発表された、プログラミング機能を強化したバージョンです。Metaは、このバージョンがプログラミングタスクのトレーニング計算能力とトレーニング環境の多様性を向上させ、コード生成、複雑なトラブルシューティング、コードベースの理解、エンドツーエンド開発フローの改善に重点を置いていると述べています。
訓練範囲は単一ファイルの修復にとどまらず、完全なコードリポジトリの生成、大規模なエンドツーエンドプロジェクト、および自動研究タスクもカバーします。モデルは計画を使用して作業ステップを整理し、目標条件を通じて方向性を維持し、コンテキストが増加する際に圧縮を行い、後続の作業に真正に必要な情報のみを保持します。
MetaはMuse Spark 1.1を次世代モデルのトレーニングにも参加させています。旧モデルは、より困難なプログラミング環境と指示従順テンプレートを生成し、候補解が要件を満たしているかをスコアリングすることで、1.2バージョンの学習用データを一括生成します。
ここで言う「自己改善」は、モデルが人間の制御から脱离して重みを自ら変更することを意味しません。より正確には、前世代のモデルがデータ生成器および評価器として使用され、チームが次世代のトレーニングデータを拡大するのを支援しています。データフロー、トレーニング実行、最終モデルのリリースはすべてMetaが制御しています。
さらに重要なのは、Metaが「コードを書けるモデル」を単独で訓練したのではなく、Muse Codeのツール、ターゲット管理、コンテキスト圧縮、サブエージェントのトラジェクトリーを訓練に組み込んだことです。今後のプログラミングモデルの能力は、訓練段階からどのエージェントフレームワークに精通しているかにますます依存するようになるでしょう。
24時間走行し、ツールを1000回以上呼び出したことが、今回のデモの重点です。
Metaが提供した事例では、Muse Spark 1.2がMuse Code環境内でNVIDIA Hopper GPU上のKDAおよびMLAカーネルを最適化しました。システムは自らコードを記述し、コンパイルしてパフォーマンスを分析した後、結果に基づいて繰り返し修正を行いました。
テストの最大実行時間は24時間で、ツールの呼び出しは1000回以上行われます。研究者は、モデルが既存のサードパーティカーネルライブラリを直接インポートすることを禁止し、アルゴリズムをTritonで実装して、既存の実装を包装して結果を偽るのではなく、真のパフォーマンス向上を追求するよう求めています。
KDAタスクでは、モデルは並列のブロック内準備カーネルと順次のブロック間スキャンを組み合わせ、ゲーテッド累積減衰向けに専用の最適化を追加しました。MLAタスクでは、2つのカーネルからなるTritonパイプラインを設計し、共有されるKV潜在表現の再利用を試みました。
このようなケースの重要性は、一度の加速数値にあるのではなく、Agentが数百回の失敗と中間結果を経験した後も、目標を維持し、性能分析データを理解し、次の実験を生成できるかどうかにあります。システムが安定して動作するのはわずか十数分だけであれば、それは高度な補完ツールに過ぎません。24時間動作し続けるようになって初めて、エンジニアリング研究を委託できるAgentに近づきます。
ランキングは上位に近いが、まだ「ClaudeとCodexを上回っていない」
Metaの評価はTerminal-Bench 2.1、DeepSWE 1.1、GDPVal-AA v2、MCP Atlas、および内部プログラミングテストをカバーしています。Terminal-Bench 2.1には、ターミナル環境で完了する89のタスクが含まれており、DeepSWE 1.1には、91のコードリポジトリから抽出され、5つのプログラミング言語をカバーする113のタスクが含まれています。
Metaが公開したチャートによると、Muse Spark 1.2はMuse Codeと組み合わせてTerminal-Bench 2.1で82.9%を記録し、Claude Opus 5の86.7%には及ばないが、評価中のCodexやGrok Buildを上回っている。DeepSWE 1.1ではMuse Spark 1.2は59.3%を獲得し、首位にはならなかった。Meta内部の440件の実際のエンジニアリングタスクでは、70.6%を記録し、やはりOpus 5に劣った。
これらの結果は、Muse Codeがトップレベルのプログラミングエージェントの競争範囲に入っていることを示しているが、「MetaがClaude CodeおよびCodexを包括的に打ち負かした」という結論を支持しない。
公式評価方法ファイルまた、異なるモデルにはそれぞれのAgent製品が組み合わされている:Muse SparkにはMuse Code、ClaudeにはClaude Code、GPTにはCodex、GeminiにはAntigravity、KimiにはKimi Codeが使用されている。このような比較は完全な製品対決に近いが、成績がモデルのものかAgentフレームワークのものかを区別することはできない。
Meta自身も、その内部評価環境やプロンプトがサードパーティのクローズドモデルに最適化されているとは限らないことを認めている。Muse Spark 1.2のTerminal-Benchでの成績は、現在のところ独立した検証ランキングには含まれていない。したがって、現段階で最も慎重な表現は、Metaの自己評価では最先端レベルに近いが、独立した再現はまだ欠けているということである。
最も安価なバージョンは、コードと会話で交換してください。
Muse Spark 1.2標準版は、100万トークンの入力につき1.25ドル、キャッシュされた入力につき0.15ドル、出力につき4.25ドルです。このバージョンの入力と出力は、Meta製品の改善には使用されません。
別のモデルはmuse-spark-1.2-contributorと識別され、入力トークン100万あたりの料金は0.10ドル、キャッシュ入力は0.002ドル、出力は0.20ドルです。標準版と比較して、入力は92%安くなり、出力は約95%安くなります。
代償として、貢献者バージョンのヒントとモデル出力はMetaによって製品の改善に使用される可能性があります。オープンソースプロジェクト、個人的な実験、または機密情報が含まれない作業にとっては、非常に魅力的な取引となるかもしれませんが、企業のプライベートコード、未発表製品、顧客データ、キー設定、および機密保持契約に基づくプロジェクトにとっては、価格の問題ではなく、まずデータガバナンスの問題です。
企業はTokenの単価だけを見て、全体のコードベースを貢献者バージョンに委ねることが適切だと仮定してはいけません。データをトレーニングに使用することを許可するかどうかは、Metaの具体的なサービス利用規約、コードの所有権、顧客契約、および内部セキュリティポリシーを総合的に判断する必要があります。スタンダードバージョンと貢献者バージョンは類似した機能を使用していますが、それぞれ異なるデータ関係を伴います。
これはまた、Metaの本当の競争戦略を明らかにしている:同社は単に低価格で開発者を奪うだけでなく、開発者がMuse Codeを使用して生成するタスク、修正、フィードバック、および結果を通じて、新しいプログラミングトレーニングデータの閉ループを構築することを目指している。開発者はほぼ無料でAgentを呼び出せる一方で、Metaは公開されたGitHubコードよりも価値の高いデータ——実際のタスクがどのように分解され、修正され、検証されるか——を得られる可能性がある。
AIプログラミングが「モデルと足場の共同学習」の段階に入りました
過去、プログラミングAIの評価は、モデルがどれだけ多くの問題を解けるかで比較されてきた。Muse Codeは、別の競争ロジックを提示している:モデルはシステムの一部に過ぎず、バックエンドエージェントが状態を維持できるか、ツール呼び出しが信頼できるか、タスクを復元できるか、コンテキストが正しく圧縮されるか、そして失敗後に繰り返し改善できるかが、単一のコード生成能力よりも重要である可能性がある。
Metaはまた、今後より大規模なモデルとより多くのAgentフレームワーク機能をリリースすると明言しています。これは、Muse Spark 1.2が最終的なフラグシップ製品ではなく、MetaがプログラミングAgent市場に参入するための最初の完全なインフラストラクチャーであることを示しています。
