Слишком сильно конкуренция.
Прошло всего три дня сентября, а уже выпущено пять передовых моделей!
Fable 5.1 и Mythos 5.1 от Anthropic, Gemini 3.8 Flash и Cyber от Google, а также Muse Spark1.3 от Meta… RSI, безусловно, уже наступил.
Вчера вечером, как только Gemini 3.8 Flash от Google стал легким чемпионом, пришел Meta с вызовом.
Зукерберг официально объявил на X: Muse Spark 1.3 сегодня официально запущен, предлагая опыт, почти настолько дешевый, что его не нужно измерять. Это наибольший прорыв, которого нам удалось достичь в программировании и работе агентов!

Александр Ван, руководитель сверхразумной лаборатории Meta, также опубликовал три сообщения в X, раскрыв ключевое оружие этого «суперудара».
Он отметил, что по сравнению с Muse Spark 1.2, Muse Spark 1.3 сократил количество неэффективных раундов, уменьшил количество вызовов инструментов на ~20% и снизил потребление токенов на ~25%, а также лучше сохраняет требования при выполнении долгосрочных задач: «Пользователи явно ощутят этот скачок».

С выходом Muse Spark 1.3 вчерашний выпуск Gemini 3.8 Flash выглядит несколько неловко.
Результаты тестирования показывают, что улучшения в Muse Spark 1.3 значительнее.
Он не только превзошел по баллам GPT-5.6 Sol и Fable 5, но и при максимальной интенсивности вывода Artificial Analysis интеллектуальный индекс достиг 62 баллов, уверенно войдя в текущую первую группу.

За пять месяцев Meta незаметно обновила четыре версии Muse Spark.
Александр Великий насмехается над Google: «выпивает выхлопные газы моделей других компаний»
В последнее время первый эшелон ИИ оказался очень переполненным. GPT-5.6 удерживает трон, Fable 5.1 стремительно догоняет, а Gemini 3.8 Flash обгоняет на повороте.
Появление Muse Spark 1.3 полностью нарушilo все планы.
В бенчмарке DeepSWE v1.1, наиболее точно оценивающем реальные длиннотрековые программные способности модели, Muse Spark 1.3 превзошёл Opus 5 и GPT-5.6 Sol, оставив позади только что выпущенный Gemini 3.8 Flash, и занял первое место с наивысшим результатом на данный момент.
Muse Spark 1.3: 75.4 балла
Claude Opus 5: 74.0 баллов
GPT-5.6 Sol: 73.0 баллов

不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。
В SWEAtlas CodeBase QnA он набрал 59,4 балла, обойдя GPT-5.6 Sol и Opus 5.
В Terminal-Bench 2.1 он набрал 88.8 балла.
На MRCR 512K-1M он набрал удивительные 98,1 балла! (Для сравнения, GPT-5.6 Sol набрал всего 73,8 балла — полное превосходство).

По возможностям агента он практически догнал передовые уровни, отставая от Opus 5 всего на несколько процентов в тестах JobBench и OSWorld.

На Artificial Analysis Muse Spark 1.3 значительно опережает Gemini 3.8 Flash.
На интеллектуальном индексе он набрал 62 балла, что совпадает с Claude Fable 5, и вошел в число лидеров.

В плане затрат, наиболее важных для разработчиков, стоимость ввода Muse в 8 раз ниже, чем у Fable 5, а стоимость вывода — почти в 12 раз ниже, что обеспечивает максимальную соотношение цены и качества.
面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」
Google действительно упал с пьедестала.

Некоторые шутят: «Google усердно выпустил четыре версии Gemini Flash за четыре месяца, а Meta за пять месяцев последовательно обновила четыре версии Muse Spark⁺. Но только что Google возглавил гонку, как его обогнала Meta — сюжет просто захватывающий».

Меньше — значит больше: производительность за 1 доллар на 2 часа
Высокие показатели производительности, конечно, впечатляют, но в современном мире ИИ настоящий энтузиазм у разработчиков вызывают инструменты, которые удобны и недороги.
Muse Spark 1.3 называют королем соотношения цены и качества, потому что он не только быстро работает, но и отлично экономит деньги.
Как сказал Александр Ван, Muse Spark 1.3 «настолько дешев, что это не имеет значения», «передовые характеристики, стоимость — лишь копейки».


Он пошёл совершенно другим путём, отличным от традиционного подхода крупных моделей — «силой и увеличением параметров» — он делает акцент на упрощении.
Muse Spark 1.3 специально обучен для работы с длинными циклами и лучшему соблюдению инструкций, что снижает количество ненужных циклов взаимодействия и делает выводы более лаконичными.

Он стал умнее и аккуратнее, стиль кода чище, лишнего текста меньше.
А прямым следствием этого вычитания стало резкое падение затрат.
Ниже приведен действительно впечатляющий реальный тестовый пример.
Разработчик @SPAC89 сравнил Muse Spark 1.3 Ultra Contributor Mode с Fable 5.1 xHigh.

В его запросе содержится строгое «правило самосовершенствования»: если оценка независимого судьи ниже 9,5/10, агент должен продолжать улучшать код и повторять попытку.
Обе модели работали около 2 часов, и результаты поразительны.
Muse Spark 1.3 ведет себя как неутомимый суперработник — он не останавливается, проведя целых 20 циклов самосовершенствования, запуская по 3 агента за раз — что эквивалентно более чем 60 запускам агентов за 2 часа.
И общая стоимость выполнения этой чрезвычайно масштабной и сложной задачи долгосрочного рассуждения составила менее 1 доллара!

Этот разработчик воскликнул: «Это полностью превзошло мои ожидания, это настоящее произведение искусства!»
В макроценовании Meta проявила большую искренность: новая модель получила увеличенный объем, но сохранила цену на уровне 1,25 доллара за миллион токенов на входе и 4,25 доллара на выходе.

В плане ценообразования версия для участников Muse Spark 1.3 «muse-spark-1.3-contributor» является нижней границей цен на зарубежные модели. (В обмен на это данные должны использоваться для улучшения продуктов Meta.)

Основатель и разработчик Codedamn Мехул Мохан сказал:
Ценообразование уровня участников для Muse Spark 1.3 просто нереально абсурдно — это то, что американские AI-лаборатории называют « DeepSeek Момент ценообразования.

В статистике Artificial Analysis среди моделей с одинаковым уровнем интеллекта (оценка выше 59) однозадачная стоимость Muse Spark 1.3 составляет всего 0,55 доллара США — это абсолютное оптимальное решение.
Для сравнения, аналогичный по интеллекту (61 балл) Grok 4.6 стоит 0,94 доллара, GPT-5.6 Sol — 0,95 доллара, а Claude Opus 5 — целых 1,23 доллара.
Более того, разработчик Kartik отметил, что Muse Spark 1.3, похоже, обладает «циклической глубиной» в рассуждениях, подобной Sol и Fable.
Он не генерирует ответ мгновенно, а способен выполнять логические рассуждения внутри себя, что обеспечивает поразительно высокую эффективность токенов.

Бурный рост Александра Ванга и окончательная амбиция Марка Цукерберга
Появление Muse Spark 1.3 невозможно без трейдеров, стоящих за ним.
В июле этого года Meta выпустила Muse Spark 1.1, основной особенностью которой являются сверхдлинные контексты в 1M и операции с компьютером.
За менее чем два месяца версия 1.3 подняла способности длиннотерминного кодирования до уровня GPT-5.6.
Такая быстрая итерация — это результат работы, начатой Александром Ваном после возглавления суперинтеллектуальной лаборатории Meta.
Какие у них конечные цели? Как Марк Цукерберг и Александер Ванг неоднократно подчеркивали: «агенты» и «дешево до незначительности».
То есть Meta смотрит на следующую волну ASI — «инженерию агентов».
Александр Ванг, руководитель Meta AI, четко заявил в интервью Axios, что все улучшения доступности направлены на реализацию масштабного плана, неоднократно упоминавшегося Зукербергом — создание персонального агента, доступного 7×24.

Чтобы агент мог круглосуточно обрабатывать для вас электронную почту, писать код и анализировать данные, он должен соответствовать двум условиям.
1. Чрезвычайно умный и стабильный: он должен удерживать очень длинные цепочки диалогов (длинные потоки) и способен параллельно обрабатывать несколько рабочих процессов.
Когда инструкция неясна, она должна уметь задавать уточняющие вопросы; когда возникают препятствия, она должна уметь обращаться за помощью к человеку; перед выполнением ключевых операций она должна уметь подтверждать. Самое главное — не создавать иллюзии.
2. Чрезвычайно дешево: если стоимость запуска персонального агента в день составляет десятки долларов, он никогда не станет чем-то, доступным для широких масс.
Появление Muse Spark 1.3 по сути прокладывает путь для персональных агентов 7×24.
Это как опытный инженер-ветеран: вы ставите цель, а он самостоятельно планирует, исправляет ошибки и доставляет результат.
Для этого бывший студент Пекинского университета и исследователь Meta Сунь Чжицин сообщил, что команда Meta повторно дообучила предыдущую модель avocado, добившись лучшего масштабирования при тестировании.

За праздничной суетой: нас обманули с помощью «фальшивой расстановки»?
Однако Muse Spark 1.3 также подвергся сомнению.
Известная ИИ-организация BridgeMind опубликовала глубокомысленное высказывание:
Gemini 3.8 Flash и Muse Spark 1.3 были выпущены сегодня одновременно. Оба показали отличные результаты на тестах.
Muse Spark 1.3 в настоящее время делит первое место с Fable 5 в интеллектуальном индексе… Я должен чувствовать волнение. Но я этого не чувствую.
Потому что выпуск ИИ в этом месяце был одинаковым: оценки резко выросли, но реальный опыт не улучшился.
Это разочаровывает. Моя доверие к бенчмаркам еженедельно снижается, а к лабораториям, манипулирующим бенчмарками, оно почти полностью исчезло.

Этот текст точно затрагивает ключевую проблему современной индустрии больших моделей.
Некоторые пользователи сети провели стресс-тесты Muse Spark 1.3 и Gemini Flash 3.8z при ограничениях на уровне бэкенда в 3D, и в результате были раскрыты слабые стороны обоих моделей:
Muse Spark 1.4 не так уж и хорош, а Gemini Flash 3.5 просто манипулирует рейтингами.

Сейчас лаборатории попали в порочный круг: «обучение ради достижения высоких показателей». Каждый выпуск модели сопровождается несколькими скриншотами радарных диаграмм и рейтингов, якобы превосходящих конкурентов.
DeepSWE, Tau3-Bench, GPQA стали целью ожесточенной «подготовки» со стороны всех компаний.
А Muse Spark 1.3 также выдал себя.
В глубоком отчете Artificial Analysis мы также можем увидеть его небольшой откат.
Например, в тесте AA-Omniscience версии xhigh и max показали снижение. Причина в повышении «коэффициента отказа» — когда модель не уверена, она предпочитает не отвечать, а не выдумывать ответ.
Это снизило уровень иллюзий, но также косвенно указывает на то, что его абсолютный объем знаний не увеличился так сильно, как показатели производительности.

Что именно сравнивается во второй половине эры больших моделей?
Сегодня, с выпуском Muse Spark 1.3 и Gemini 3.8 Flash, мы можем сделать следующие выводы.
Сначала «параметрическая прибыль» базовой модели достигает пика.
Путь повышения интеллекта исключительно за счет увеличения масштаба параметров становится все менее эффективным.
В будущем тот, кто, как Muse Spark 1.3, введет в архитектуру системы аналогичный механизм рассуждений «циклической глубины» и сделает экстремальный «отбор» при вызове инструментов, получит настоящий скачок в опыте.
Кроме того, именно инженерия агентов является ключевым фактором победы.
Борьба между крупными моделями перешла от «кто лучше говорит» к «кто лучше работает».
Основным барьером в будущем будет не однократный результат теста, а реальная способность выполнять долгосрочные задачи при крайне низких затратах.
Модели, такие как Muse Spark 1.3, способные выполнить 60 циклов проб и ошибок за менее чем 1 доллар, полностью изменят бизнес-модели.
Справочные материалы:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение
