5 августа 2026 года Meta выпустила свой первый терминальный программный агент — Muse Code, а также одновременно представила модель Muse Spark 1.2, оптимизированную специально для программирования. Muse Code может анализировать крупные кодовые базы, разрабатывать планы изменений, писать код, запускать тесты и проверять результаты, а также позволяет нескольким фоновым агентам работать непрерывно в течение всего сеанса, не требуя повторного понимания проекта при каждом новом задании. Meta также разработала для системы локальный журнал событий только для добавления, без возможности перезаписи, что позволяет точно восстановить состояние на месте прерывания даже при сбое программы. Особенно обсуждаемым среди разработчиков стала цена: стандартная версия стоит 1,25 доллара за миллион входных токенов и 4,25 доллара за миллион выходных токенов; если пользователь разрешит Meta использовать входные и выходные данные для улучшения продукта, «версия для участников» снижается до 0,10 доллара и 0,20 доллара соответственно. Условием такой низкой цены является не обычная акция, а передача кода и данных об использовании. Официальные тесты показывают, что Muse Spark 1.2 уже приблизилась к ведущим моделям программирования, но пока не превзошла их полностью, и некоторые результаты не были независимо воспроизведены. Сигнал, который Meta отправила на этот раз: единицей конкуренции в AI-программировании становится не отдельная модель, а целая система, включающая модель, фреймворк работы агентов, долгосрочное состояние и замкнутый цикл данных.Автор статьи, источник: Meta AI Research
Meta наконец получила свой собственный «Claude Code»
Muse Code — это первый терминальный агент для программирования, представленный Meta, который сейчас доступен в тестовой версии для macOS и Linux. Его цель — не дополнение кода, а выполнение полных задач программной инженерии: вход в крупный репозиторий кода, понимание существующей структуры, разработка плана, изменение нескольких файлов, выполнение команд и тестов, а затем корректировка на основе результатов.
Это позволяет Muse Code напрямую войти на рынок, который конкурируют такие продукты, как Claude Code, Codex и Gemini CLI. Модели больше не просто отвечают на вопрос «как написать этот код», а получают доступ к терминалу, файловой системе и инструментам разработки, чтобы непрерывно выполнять задачи с минимальным вмешательством человека.
Meta в своей статье представила Muse Code и Muse Spark 1.2 как единую систему, а не как два отдельных продукта, которые можно произвольно разделять. Muse Spark 1.2 отвечает за понимание, рассуждение и генерацию, а Muse Code — за организацию контекста, планирование подагентов, вызов инструментов, сохранение состояния и проверку результатов. Оба компонента были совместно оптимизированы на этапе обучения, что означает, что одна и та же модель, перенесённая в другую агентную систему, может не воспроизвести результаты, продемонстрированные Meta.
Многие агенты — это не временный чат, а постоянное присутствие
Наиболее отличительной особенностью Muse Code является набор фоновых агентов, работающих асинхронно.
В типичных многагентных системах при необходимости выполнения подзадачи временно создается помощник, например, для поиска соответствующих файлов, анализа неудачных тестов или изучения какой-либо зависимости. После завершения задачи контекст этого помощника часто исчезает; при следующем возникновении аналогичной проблемы система может снова сканировать тот же набор кода и повторно собирать ту же информацию.
Фоновые агенты Muse Code остаются активными в течение всей сессии. Они могут накапливать понимание кодовой базы, самостоятельно продвигаться к следующему шагу и выбирать, когда представлять результаты главному агенту. Главный агент отвечает за координацию целей, а фоновые агенты могут отдельно изучать различные модули, проверять тесты, искать связи вызовов или проверять реализации.
Этот дизайн стремится решить распространённую потерю времени при выполнении длинных задач: агент постоянно забывает, что уже просматривал. Если состояние фонового агента надёжно сохраняется, ему не нужно на каждом шаге заново читать структуру проекта, а человеку не нужно постоянно напоминать ему: «Этот файл уже проверялся».
Однако одновременное изменение кода несколькими агентами также может вызвать конфликты, проблемы с правами доступа и издержки. Публичная статья Meta не полностью раскрывает, как задачи распределяются по разделам, как объединяются изменения кода и как другие агенты избегают наследования ошибочных выводов при сбое одного фонового агента. Таким образом, непрерывный агент — это перспективное архитектурное направление, но на данный момент невозможно судить о его стабильности в реальных командных проектах только по официальным демонстрациям.
После сбоя не начинайте сначала
Долгосрочно работающие программные агенты сталкиваются с реальной проблемой: чем дольше задача, тем выше вероятность возникновения сбоев сети, ошибок инструментов, аварийных завершений процессов или превышения лимита контекста. Если система сохраняет текущее состояние только в диалоге модели, сбой может привести к потере нескольких часов исследовательской работы.
Muse Code создал локальный журнал событий. Каждый вызов модели, выполнение инструмента, одобрение пользователя и изменение файла записываются в журнал в режиме добавления, и предыдущие записи не перезаписываются напрямую последующими состояниями.
Meta называет этот механизм «точным воспроизведением» и «безопасной перезагрузкой». Когда агент аварийно завершает работу, система может восстановить процесс на основе записи событий, а не заново угадывать, что произошло ранее. Это фактически превращает программирование агента из временного диалога в более близкий к состоянию инженерный процесс.
Muse Code также включает несколько вызываемых навыков:/planсначала создает план выполнения, требующий одобрения пользователя; /grillспециально атакует и подвергает сомнению этот план, выявляя упущения, риски и ошибочные допущения; /goalзаставляет агента непрерывно выполнять действия, направленные на указанную цель, до тех пор, пока не будут выполнены условия завершения.
Идея, лежащая в основе этих функций, ясна: если ИИ должен выполнять несколько часов работы по программной инженерии, ключевым является не только то, насколько красивым является сгенерированный код на каждом этапе, но и способен ли он сохранять прогресс, проходить проверку, выявлять недостатки в плане и продолжать выполнение после сбоев.
Muse Spark 1.2 — это модель, а также «специализированный двигатель» для фреймворка Agent
Muse Spark 1.2 — это улучшенная версия, выпущенная менее чем через месяц после версии 1.1. Meta заявляет, что в нее добавлены вычислительные мощности и разнообразие сред для обучения программированию, с акцентом на улучшение генерации кода, сложного устранения неполадок, понимания кодовых баз и конвейеров разработки от начала до конца.
Область обучения включает не только исправление отдельных файлов, но также генерацию полных кодовых репозиториев, крупных энд-ту-энд проектов и автоматизированных исследовательских задач. Модель использует планы для упорядочивания шагов работы, поддерживает направление с помощью целевых условий и сжимает контекст при его росте, сохраняя информацию, необходимую для последующих задач.
Meta также привлекает Muse Spark 1.1 к обучению следующего поколения моделей. Старые модели генерируют более сложные среды программирования и шаблоны выполнения инструкций, а затем оценивают, соответствуют ли предлагаемые решения требованиям, что позволяет массово создавать данные для обучения версии 1.2.
Здесь под «самосовершенствованием» по-прежнему не подразумевается, что модель самостоятельно изменяет свои веса после выхода из-под контроля человека. Более точным будет сказать, что модель предыдущего поколения используется в качестве генератора и оценщика данных, помогая команде расширить обучающие данные для следующего поколения. Процессы сбора данных, тренировки и окончательного выпуска модели остаются под контролем Meta.
Более того, Meta не обучала отдельную модель, «умеющую писать код», а включила в обучение инструменты Muse Code, управление целями, сжатие контекста и траектории суб-агентов. Способности будущих моделей программирования, вероятно, все больше будут зависеть от того, с какой агентной рамкой они знакомы уже на этапе обучения.
Основной акцент этого демонстрационного мероприятия — работа в течение 24 часов и более 1000 вызовов инструментов.
Пример от Meta заключается в том, чтобы Muse Spark 1.2 оптимизировал ядра KDA и MLA на GPU NVIDIA Hopper в среде Muse Code. Системе необходимо самостоятельно написать код, скомпилировать его, проанализировать производительность и на основе результатов многократно вносить изменения.
Весь тест длится не более 24 часов, вызовы инструментов превышают 1000 раз. Исследователи запретили модели напрямую импортировать готовые сторонние ядерные библиотеки и потребовали, чтобы она реализовала алгоритмы в Triton и искала настоящие улучшения производительности, а не просто упаковывала существующие реализации в качестве собственных результатов.
В задаче KDA модель объединяет параллельные ядра подготовки внутри блока и последовательное сканирование между блоками, а также включает специальные оптимизации для затухания с воротами. В задаче MLA она разрабатывает конвейер Triton, состоящий из двух ядер, и пытается повторно использовать общие потенциальные представления KV.
Важность таких случаев заключается не в одном ускорении, а в способности агента сохранять цель, анализировать данные о производительности и генерировать следующий цикл экспериментов после сотен неудач и промежуточных результатов. Если система может стабильно работать только несколько десятков минут, она скорее похожа на продвинутый инструмент автодополнения; только способность работать в течение 24 часов начинает приближать её к агенту, которому можно поручить инженерные исследования.
Рейтинг близок к топовым, но еще не «обогнал Claude и Codex»
Оценка Meta охватывает Terminal-Bench 2.1, DeepSWE 1.1, GDPVal-AA v2, MCP Atlas и внутренние программные тесты. Terminal-Bench 2.1 включает 89 задач, требующих выполнения в терминальной среде; DeepSWE 1.1 включает 113 задач, взятых из 91 репозитория кода и охватывающих пять языков программирования.
Согласно графикам, опубликованным Meta, Muse Spark 1.2 в сочетании с Muse Code показал результат 82,9% на Terminal-Bench 2.1, что ниже 86,7% у Claude Opus 5, но выше Codex и Grok Build в их оценках. На DeepSWE 1.1 Muse Spark 1.2 набрал 59,3%, не заняв первое место. В рамках 440 реальных инженерных задач внутри Meta он показал результат 70,6%, также уступая Opus 5.
Эти результаты показывают, что Muse Code вошел в число ведущих программных агентов, но не подтверждают вывод о том, что Meta полностью превзошла Claude Code и Codex.
Официальныйметод оценкитакже указывает, что каждая модель была сопоставлена со своим собственным продуктом Agent: Muse Spark использовал Muse Code, Claude — Claude Code, GPT — Codex, Gemini — Antigravity, Kimi — Kimi Code. Такое сравнение более близко к полноценному соревнованию продуктов, но не позволяет определить, насколько результаты обусловлены самой моделью, а насколько — фреймворком Agent.
Meta также признает, что ее внутренняя среда оценки и промпты могут быть не оптимизированы для сторонних закрытых моделей. Результаты Muse Spark 1.2 на Terminal-Bench пока не вошли в независимые рейтинговые списки. Поэтому на данном этапе наиболее осторожным утверждением является: по собственным тестам Meta, он приближается к передовому уровню, однако независимая воспроизводимость отсутствует.
Самая дешевая версия — нужно обменять на код и диалоги
Muse Spark 1.2 Standard стоит 1,25 доллара за миллион входных токенов, 0,15 доллара за кэшированный ввод и 4,25 доллара за вывод. Ввод и вывод в этой версии не будут использоваться для улучшения продуктов Meta.
Другая модель обозначена какmuse-spark-1.2-contributor. Стоимость ее входных токенов составляет всего 0,10 доллара за миллион, кэшированные входы — 0,002 доллара, выходы — 0,20 доллара. По сравнению со стандартной версией, входы дешевле на 92%, а выходы — примерно на 95%.
Цена — это то, что подсказки и выводы модели от участников могут быть использованы Meta для улучшения продуктов. Для открытых проектов, личных экспериментов или работ, не содержащих конфиденциальную информацию, это может быть очень привлекательной сделкой; однако для корпоративного закрытого кода, нерелизированных продуктов, клиентских данных, ключевых конфигураций и проектов, регулируемых соглашениями о конфиденциальности, это в первую очередь вопрос управления данными, а не цены.
Компании не могут, исходя только из цены токена, предполагать, что весь кодовый репозиторий следует передать версии участников. Разрешение на использование данных для обучения должно определяться с учетом конкретных условий обслуживания Meta, прав на код, клиентских договоров и внутренней политики безопасности. Стандартная и версия участников используют схожие возможности, но соответствуют совершенно разным отношениям к данным.
Это также раскрывает настоящую конкурентную стратегию Meta: она стремится не только привлекать разработчиков за счет низких цен, но и создавать новую замкнутую цепочку обучающих данных для программирования через задачи, изменения, обратную связь и результаты, генерируемые разработчиками при использовании Muse Code. Разработчики получают практически бесплатный доступ к агентам, а Meta может получить данные, более ценные, чем открытый код на GitHub — как реальные задачи фактически разбиваются, изменяются и проверяются.
AI-программирование переходит в этап «совместного обучения модели и каркаса»
Раньше при оценке программных ИИ основное внимание уделялось тому, сколько задач модель может решить. Muse Code демонстрирует другую логику конкуренции: модель — лишь часть системы, и то, сохраняет ли бэкенд-агент состояние, надежны ли вызовы инструментов, можно ли восстановить задачу, корректно ли сжимается контекст и может ли система продолжать итерации после сбоя, может быть важнее, чем однократная способность генерировать код.
Meta также явно заявила, что в будущем выпустит более крупные модели и дополнительные функции для фреймворков Agent. Это означает, что Muse Spark 1.2 не является финальным флагманским продуктом, а скорее представляет собой первую полную инфраструктуру Meta для выхода на рынок программных Agent.
