Роботизовані руки мають добре задокументовану історію того, що дуже погано вміють піднімати речі. Claude Fable 5.1 від Anthropic, випущений 1 вересня 2026 року, зробив значний прорив у цій проблемі.
Модель досягає показника успішності 40% у завданнях роботизованого захоплення та розміщення, що на 5% вище, ніж у її попередника Claude Fable 5.
Що змінилося під капотом
Fable 5.1 розроблений для роботи з завданнями довгострокової агентності — категорії завдань, де модель повинна планувати, виконувати та відновлюватися через багато кроків без постійної людської допомоги. Цільовими областями є кодові конвеєри, наукові робочі процеси та складна бізнес-автоматизація.
Бенчмаркові показники відображають цей акцент. На Terminal-Bench-Science Fable 5.1 показує 52,6%, порівняно з 24,7% для Fable 5. Суворе завершення OSWorld 2.0 зростає з 36,1% до 41,7%. AutomationBench, який тестує багатокрокову автоматизацію програмного забезпечення, зростає з 17,1% до 31,4%.
Відгуки клієнтів після запуску підтвердили історію еталону. Корпоративні користувачі зокрема зазначили покращену надійність у проектах, які тривають години, а не хвилини, коли модель виконує ці завдання, використовуючи менше токенів, ніж попередні версії.
Математика ціноутворення цікавіша, ніж здається
Базова ціна для Fable 5.1 залишається на рівні $10 за мільйон вхідних токенів і $50 за мільйон вихідних токенів, як і у попередньої моделі.
Вартість читання з кешу знизилася на 75% до 0,25 долара за мільйон токенів. Anthropic оцінює, що зменшення кешу дає приблизно 25% заощаджень при типових навантаженнях. Для більш складних агентних конвеєрів заощадження можуть досягати 45%.
Модель доступна для користувачів Pro, Max, Team та Enterprise і доступна через API та основні хмарні ринки.
Чому число роботів заслуговує на окрему розмову
Покращення функції «захоплення та розміщення» є ключовим показником, але варто зрозуміти, чому саме цей показник має значення. «Захоплення та розміщення» є показником зв’язку з фізичним світом: чи може модель ШІ перетворювати абстрактні міркування на точні, реальні рухові команди? Завдання включає розпізнавання об’єктів, просторове міркування, планування захоплення та відновлення після помилок, коли щось йде не так.
5% показник успішності — це суттєво шум. 40% ще не достатньо добре для безнаглядного промислового впровадження, але це перевищує поріг, за яким технологія стає корисною як інструмент підтримки людини, а не цікавинка.
Конкурентний контекст
Незалежні експерти оцінили Claude Fable 5.1 на рівні або вище попередніх лідерів за індексами інтелекту вкороткий час після його випуску. Патерн покращень у Terminal-Bench-Science, OSWorld 2.0 та AutomationBench свідчить про те, що Anthropic спрямовується на корпоративних клієнтів, які виконують складні, багатоетапні, тривалі кілька годин робочі процеси, а не на споживачів, які ставлять швидкі запитання.
