Марк Цукерберг запустив Muse Code у бета-версії в середу — перший штучний інтелект (ШІ) агент для кодування від Meta. Claude Opus 5 від Anthropic перевершує його у всіх чотирьох порівняннях, опублікованих Meta при запуску.
Meta все одно опублікувала ці діаграми. Компанія продає більш дешевий інструмент, а не кращий. Дані незалежних тестів свідчать, що розрив ширший, ніж показала Meta.
Слідкуйте за нами в X, щоб отримувати останні новини відразу після їх публікації
Власні графіки Meta вибивають Anthropic у кожному раунді
Muse Spark 1.2 — це модель, що вбудована в Muse Code. Вона набрала 82,9% у Terminal-Bench 2.1.
Claude Opus 5 набрав 86,7% на тому ж тесті. Terminal-Bench розроблений дослідниками з інституту Laude та Стенфордського університету. Він включає 89 реальних завдань, що охоплюють ремонт систем, роботу з даними та безпеку.
Друге місце — це поважний результат. Muse Code переміг Codex від OpenAI з результатом 81,8% і Grok Build з результатом 81,6%.

Наступний графік був гіршим. DeepSWE 1.1 встановлює 113 завдань з кодуванням при вимкненому доступі до інтернету під час оцінювання. Muse Spark 1.2 впав на третє місце з результатом 59,3%.
Meta опублікувала тест, який створила сама, на основі 440 реальних запитів на влиття від своїх інженерів. Muse Spark 1.2 набрала 70,6%, що приблизно на дев’ять балів менше, ніж Opus 5.

Цей результат лише на 2,3 пункту вищий за Muse Spark 1.1, модель, яку Meta випустила в липні.
Модель Meta припинила свої кодові діаграми
Meta порівняла себе з GPT-5.6 Terra. OpenAI продає потужнішу модель під назвою Sol, і Meta виключила її з усіх трьох діаграм кодування.
Sol посідає перше місце в незалежному рейтингу Terminal-Bench 2.1 leaderboard з результатом 89,5%. Opus 5 йде другим з 89,1%.
Обидві цифри перевищили 86,7%, які Meta повідомила для Opus 5. Meta вибрала слабшу конфігурацію свого найсильнішого суперника, але все одно поступилася їй.
Проти Sol, справжнього лідера, Muse Spark 1.2 відстає на 6,6 бала, а не на 3,8.
Meta все ж включила Sol в одному місці. У завданні ядра графічного процесора (GPU), що виконувало понад 1 000 викликів інструментів, Sol покращила результати базової моделі на 71,2%. Muse Spark 1.2 показала 68,7% і посіла четверте місце з шести.
Одна оговорка працює в іншому напрямку. Muse Spark 1.2 ще не з’явився в тому публічному рейтингу, де було протестовано лише 26 із 183 відстежуваних моделей. Його 82,9% залишається цифрою Meta.
«Muse Spark 1.2 — це наш наступний крок у напрямку до меж, оскільки на горизонті з’являються більш великі та потужні моделі», — сказав Цукерберг у пості.
Цукерберг може скоро провести модель, яка переможе його власну
Meta, як повідомляється, переговорює про оренду обчислювальних ресурсів для Anthropic. Угода може досягти $10 млрд протягом двох років. Дані центри Meta будуть допомагати запускати моделі Claude, які Muse Code було створено, щоб витіснити.
Лідерство за Muse Code було дорогим. Цукерберг заплатив 14,3 мільярда доларів у червні 2025 року за Scale AI та його засновника Олександра Ванга, який зараз очолює Meta Superintelligence Labs.
Ціна — це єдиний важіль, який залишився у Вана. Тарифи відповідають запуску в липні першої платної API Meta за ціною $1,25 за мільйон вхідних токенів і $4,25 за мільйон вихідних токенів.
Вартість рівня учасника в 10 разів менша. Розробники кваліфікуються, дозволяючи Meta навчатися на їхній роботі. Ван відмовився наводити цифри адаптації лінійки Muse Spark.
Акаунти Meta пояснюють знижку. Доход збільшився на 28% до 60,8 млрд доларів у минулому кварталі, але операційний прибуток знизився на 8% до 18,8 млрд доларів.
Операційна маржа знизилася до 31% з 43% роком раніше. Meta витратила лише за цей квартал $31,08 млрд на капітальні проекти і прогнозує до $145 млрд за рік.
Muse Code надає інженерні можливості, яких не має Claude Code. Фонові агенти зберігають контекст протягом сесії. Підагенти працюють у ізольованих копіях репозиторію.
Meta створила міцного другого за кращим кодером і оцінила його як бюджетний варіант. Бета-версія покаже, чи згодні розробники пожертвувати кількома пунктами точності за рахунок рахунка, що майже в десять разів менший.
