Занадто багато конкуренції.
Пройшло лише 3 дні в вересні, а вже випущено п’ять передових моделей!
Fable 5.1 та Mythos 5.1 від Anthropic, Gemini 3.8 Flash та Cyber від Google, Muse Spark1.3 від Meta… RSI, безумовно, вже настав.
Ще вчора вночі, коли Gemini 3.8 Flash від Google став легковаговим чемпіоном, Meta прийшла викликати його на бій.
Закербург офіційно оголосив у X: Muse Spark 1.3 сьогодні офіційно запущений — з передовими характеристиками він надає досвід, майже занадто дешевий, щоб його вимірювати. Це найбільший стрибок, якого нам вдалося досягнути у програмуванні та роботі з агентами!

Александр Ван, керівник лабораторії суперінтелекту Meta, також опублікував три пости в X, розкривши ключову перевагу цього «військового заходу».
Він зазначив, що Muse Spark 1.3 порівняно з Muse Spark 1.2 зменшив кількість неефективних раундів, зменшив кількість викликів інструментів на ~20%, зменшив споживання tokenів на ~25% і краще зберігає потреби під час довготривалих завдань: «Користувачі відчувають цей стрибок».

Після запуску Muse Spark 1.3 вчора випущений Gemini 3.8 Flash виглядає трохи незручно.
Показники виконання свідчать, що покращення в Muse Spark 1.3 більш значні.
Він не лише обігнав GPT-5.6 Sol та Fable 5 за балами, але й індекс інтелекту Artificial Analysis при максимальній інференс-потужності досяг 62 балів, що безумовно вводить його до поточного топ-класу.

За п’ять місяців Meta вже непомітно оновила 4 версії Muse Spark.
Александр Великий насміхається над Google: «вдихає вихлопні гази моделей інших»
Останнім часом перший ешелон ШІ дуже переповнений. GPT-5.6 тримає трон, Fable 5.1 стрімко наздоганяє, а Gemini 3.8 Flash обганяє на повороті.
З’явлення Muse Spark 1.3 прямо збентежило всіх.
У найбільш відповідному для реального довготривалого програмування тесті DeepSWE v1.1, Muse Spark 1.3 безпосередньо перевершив Opus 5 та GPT-5.6 Sol, а також залишив позаду недавно випущений Gemini 3.8 Flash, набравши найвищий результат на даний момент.
Muse Spark 1.3: 75.4 бали
Claude Opus 5: 74.0 балів
GPT-5.6 Sol: 73.0 балів

Крім того, Muse Spark 1.3 продемонстрував значущу продуктивність за кількома ключовими розробницькими показниками.
У SWEAtlas CodeBase QnA він набрав 59,4 бала, обійшовши GPT-5.6 Sol і Opus 5.
У Terminal-Bench 2.1 він отримав 88,8 бала.
На MRCR 512K-1M він отримав вражаючі 98,1 бала! (у порівнянні, GPT-5.6 Sol показав лише 73,8 бала — це повна перевага).

Щодо здібностей агента, він майже наздогнав найсучасніший рівень, маючи лише кілька відсотків різниці з Opus 5 у тестах JobBench, OSWorld тощо.

На Artificial Analysis Muse Spark 1.3 значно обігнав Gemini 3.8 Flash.
На інтелектуальному індексі він отримав 62 бали, поступаючись Claude Fable 5, і потрапив у топ-клас.

Щодо витрат, які найбільше цікавлять розробників, витрати на введення Muse в 8 разів нижчі, ніж у Fable 5, а витрати на виведення — майже в 12 разів нижчі, що забезпечує максимальну співвідношення ціни та якості.
Зіткнувшись з такою вражаючою статистикою, головний офіцер з ШІ Meta Александр Ванг прямо сказав: «У індексі Artificial Analysis Gemini нічого не значить і може лише вдихати вихлопні гази моделей інших».
Google справді впав з висоти.

Хтось жартував: «Google наполегливо випустив 4 версії Gemini Flash за чотири місяці, а Meta за п’ять місяців послідовно оновила 4 версії Muse Spark⁺. Але Google навіть не встиг пролетіти кілька годин у лідерстві, як Meta його обігнала — цей сюжет надзвичайно захопливий».

Менше — це більше: потужний пристрій за 1 долар на 2 години
Високі бали — це, звичайно, добре, але в сьогоднішньому світі ШІ справжньо захоплюють розробників інструменти, які зручні та недорогі.
Muse Spark 1.3 називають королем співвідношення ціни та якості, бо він не лише швидкий, а й дуже економить кошти.
Як сказав Александер Ван, Muse Spark 1.3 «дешевий до незначності», «передові характеристики, витрати — лише дрібниця».


Він вибрав шлях, який повністю відрізняється від попередніх великих моделей, які «використовували велику кількість ресурсів та безумно збільшували параметри» — він робить зменшення.
Muse Spark 1.3 було спеціально навчено для довгострокового програмування та кращого виконання інструкцій, щоб зменшити непотрібні ітерації та зробити вивід більш стислим.

Він став розумнішим і чіткішим, стиль коду став чистішим, а зайвих слів — менше.
А безпосереднім наслідком цього зменшення є стрімке падіння витрат.
Ось дійсний приклад, який дуже вражає.
Розробник @SPAC89 використовував режим Muse Spark 1.3 Ultra Contributor для порівняння з Fable 5.1 xHigh.

У його запиті міститься суворе «правило самовдосконалення»: якщо оцінка незалежного судді нижча за 9,5/10, агент повинен продовжувати вдосконалювати код і намагатися знову.
Обидві моделі працювали близько 2 годин, і результати були дивовижними.
Muse Spark 1.3 веде себе наче невичерпний суперпрацівник — він просто не зупиняється, здійснивши 20 циклів самовдосконалення, запускаючи по 3 агенти за раз — що дорівнює більше ніж 60 запускам агентів за 2 години.
А загальна вартість виконання цієї надзвичайно великої та складної довготривалої логічної задачі склала менше 1 долара!

Цей розробник вигукнув: «Це повністю перевершило мої очікування, ця річ справді є твором мистецтва!»
У макроціноутворенні Meta продемонструвала велику відданість. Нова модель отримала більше обсягу без підвищення ціни, зберігаючи ціну на рівні 1,25 долара за мільйон токенів на вхід і 4,25 долара на вихід.

Щодо ціноутворення, версія для учасників Muse Spark 1.3 «muse-spark-1.3-contributor» є нижчою межею цін на зарубіжні моделі. (Ціною є використання даних для покращення продуктів Meta.)

Засновник і розробник Codedamn Мехул Моган прямо сказав:
Ціни на рівні внесків Muse Spark 1.3 просто нереальні — ось що таке «американська AI-лабораторія DeepSeek Момент ціноутворення.

У статистиці Artificial Analysis, серед моделей з однаковим рівнем інтелекту (бал 59 і вище), однозадачна вартість Muse Spark 1.3 становить лише 0,55 долара, що робить її абсолютно оптимальним рішенням.
Для порівняння, вартість Grok 4.6 з тим самим рівнем інтелекту (61 бал) становить 0,94 долара, GPT-5.6 Sol — 0,95 долара, а Claude Opus 5 — навіть 1,23 долара.
Навіть розробник Kartik зазначив, що Muse Spark 1.3, схоже, має здатність «циклічного глибинного» міркування, подібну до Sol і Fable.
Він не генерує відповідь миттєво, а здатний виконувати логічні міркування всередині, що робить його ефективність використання токенів дивовижно високою.

Бурхливий розвиток Александра Ванга, остаточна амбіція Марка Цукерберга
Виникнення Muse Spark 1.3 неможливе без його архітекторів.
У липні цього року Meta випустила Muse Spark 1.1, яка підкреслює надовгий контекст у 1M та операції з комп’ютером.
За менше ніж два місяці версія 1.3 підняла здатність до довготривалого кодування до рівня GPT-5.6.
Така швидка ітерація — це результат, який приніс Александер Ванг після того, як взяв на себе керівництво лабораторією суперінтелекту Meta.
Яка їхня кінцева мета? Як Марк Цукерберг і Александер Ванг неодноразово підкреслювали: «агенти» та «дешеві до незначності».
Тобто Meta дивиться на наступну хвильову можливість ASI — «інженерію агентів».
Генеральний директор Meta AI Александр Ванг у інтерв’ю Axios чітко зазначив, що всі покращення доступності спрямовані на реалізацію величезного плану, який неодноразово згадував Цукерберг — створення персонального агента, доступного 24/7.

Щоб інтелектуальний агент міг 24 години на добу обробляти вашу пошту, писати код та аналізувати дані, він повинен відповідати двом умовам.
1. Надзвичайно розумний і стабільний: він повинен підтримувати дуже довгі діалогові ланцюжки (довгі ланцюжки) та здатний паралельно обробляти кілька робочих потоків.
Коли інструкція нечітка, вона має вміти активно запитувати; коли зустрічає перешкоди, вона має вміти звертатися за допомогою до людини; перед виконанням критичних дій вона має вміти підтверджувати. Найважливіше — не створювати галюцинації.
2. Неймовірно дешево: якщо витрати на запуск особистого агента за день сягають десятків доларів, він завжди залишиться іграшкою для небагатьох.
Виникнення Muse Spark 1.3 суттєво прокладає шлях для персональних агентів 7×24.
Це як досвідчений інженер-професіонал: ви вказуєте мету, а він сам планує, виправляє помилки та виконує завдання.
Для цього синь Цзічін, випускник Пекінського університету та дослідник Meta, розкрив, що команда Meta повторно навчила модель avocado, що призвело до кращого масштабування на тестах.

За кулисами святкування: нас обманули «фальшивими рейтингами»?
Однак Muse Spark 1.3 також піддався критиці.
Відома AI-організація BridgeMind опублікувала глибоке твердження:
Gemini 3.8 Flash і Muse Spark 1.3 випущені сьогодні одночасно. Обидва показали чудові результати на тестах.
Muse Spark 1.3 зараз посідає спільне перше місце з Fable 5 у розрахунку інтелектуального індексу… Я хотів би відчувати ентузіазм. Але я не відчуваю.
Тому що цього місяця випуски штучного інтелекту були однаковими: оцінки стрімко зросли, але реальний досвід не покращився.
Це розчаровує. Моя довіра до базових тестів щотижня зменшується, а довіра до лабораторій, які маніпулюють базовими показниками, майже зникла.

Цей текст точно відображає болісні точки сьогоднішньої індустрії великих моделей.
Користувачі онлайн-спільноти провели навантажувальні тести Muse Spark 1.3 та Gemini Flash 3.8z за умов постфактумних 3D-обмежень, і виявилося, що слабкі місця обох моделей були розкриті:
Muse Spark 1.4 не такий вже й хороший, а Gemini Flash 3.5 просто штучно піднімає рейтинг.

Зараз усі лабораторії потрапили у петлю «навчання для досягнення високих показників». Кожен випуск моделі супроводжується кількома скріншотами радарних діаграм і рейтингів, які перевершують конкурентів.
DeepSWE, Tau3-Bench, GPQA стали цілями для безперервної «підготовки» усіх.
А Muse Spark 1.3 також виявив свої слабкі місця.
У глибокому звіті Artificial Analysis ми також бачимо її невеликий відступ.
Наприклад, у тесті AA-Omniscience обидва варіанти — xhigh та max — показали зниження. Причина полягає у зростанні «рівня відмов» — коли він не впевнений, він вибирає не відповідати, а не вигадувати.
Це знизило рівень галюцинацій, але також непрямо свідчить про те, що її абсолютний обсяг знань не збільшився настільки ж драматично, як показники в тестах.

Що саме порівнюється в другій половині великих моделей?
Сьогодні з випуском Muse Spark 1.3 і Gemini 3.8 Flash ми можемо зробити кілька висновків.
Спочатку «параметричний бонус» базової моделі досягає свого піку.
Шлях підвищення інтелекту шляхом простої експансії розміру параметрів має все меншу граничну користь.
У майбутньому той, хто, як Muse Spark 1.3, введе в архітектуру системи механізм міркувань, подібний до «циклічної глибини», і зробить екстремальне «спрощення» у виклику інструментів, отримає справжній стрибок у досвіді.
Крім того, інженерія агентів — це ключ до перемоги.
Боротьба великих моделей перейшла від «хто краще говорить» до «хто краще працює».
Основним бар’єром майбутнього не буде окремий бал, а здатність реалізовувати довгострокові завдання при надзвичайно низьких витратах.
Моделі, такі як Muse Spark 1.3, які виконують 60 ітерацій за менше ніж 1 долар, повністю змінять бізнес-моделі.
Джерела:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Цей текст походить від іншого каналу WeChat «Новий розум», автор: АСІ Апокаліпсис
