Anthropic 22 вересня випустила Claude Opus 5.5 — першу модель у серії Claude 5.5. Основна пропозиція компанії дуже проста: на більшості завдань вона досягає рівня Claude Fable 5.1, а витрати на запуск на 40% нижчі, ніж у попередньої версії Opus 5. Але справжньою цікавістю цього випуску є не лише ціна та рейтинг, а те, що Anthropic зосередила тестування на довготривалих завданнях, незворотних операціях та захисті від ін'єкцій запитів.
Офіційно заявлено, що Opus 5.5 значно покращився у складному кодуванні, дослідженнях та роботі, що вимагає професійних знань. Серед ранніх тестувальників одна команда вдалося завершити міграцію приблизно 680 000 рядків коду за менше ніж добу; Anthropic також підкреслила, що модель здатна зберігати довші контексти та забезпечувати неперервність планування. Випадки демонструють межі можливостей, але не можуть розглядатися як середні терміни виконання для всіх проектів. Структура кодової бази, покриття тестами та ручний аудит впливають на результати.
Зниження витрат не означає «дешеву версію флагмана», а передбачає перерозподіл меж використання моделей
Раніше Opus зазвичай використовувався лише для найскладніших і найдорожчих завдань, а повсякденні роботи покладалися на швидші моделі. Якщо Opus 5.5 справді зможе наблизитися до рівня Fable 5.1 за нижчою вартістю, компанії можуть починати використовувати флагманські моделі для масового аналізу коду, документів і досліджень, а не лише для окремих високодоходних запитів.
Зниження витрат на 40% — це офіційне твердження Anthropic щодо Opus 5, але це не означає, що рахунки кожної компанії зменшаться саме на 40%. Фактичні витрати залежать від довжини вхідних та вихідних даних, кешування, кількості викликів інструментів та чи потрібні повторні спроби завдання. Більш потужні моделі можуть споживати більше загальних токенів через більш довгі завдання. Покупцям слід тестувати «загальну вартість виконання завдання» за допомогою власних навантажень, а не просто порівнювати ціну за одиницю.
Здатність виконувати довгі завдання також має вимірюватися якістю результату. Один великий перенесення коду може породити велику кількість здається обґрунтованих змін, але справжні витрати включають регресійне тестування, конфлікти залежностей, розгортання та відкат. Якщо моделі потрібно кілька днів інженерів для виправлення крайових випадків, перевага швидкості зменшується. Найбільш цінною оцінкою є та, яка одночасно фіксує успішність, кількість втручань людини та незворотні помилки, а не лише кількість згенерованого коду.
Anthropic повідомила, що Opus 5.5 пройшов попередні тести від зовнішніх оцінювачів, таких як Frontier Design і METR. Залучення зовнішніх учасників підвищує довіру, але не означає, що всі звіти, вихідні дані та середовища тестування повністю оприлюднені. Користувачам слід розрізняти результати, заявлені компанією, результати незалежних оцінок та результати, отримані в їхньому власному середовищі.
Тестування безпеки почало зосереджуватися на реальних сценаріях інцидентів, а не лише на частоті відмов від відповідей на короткі запитання.
Anthropic повідомляє, що Opus 5.5 показав найкращий результат у своїх автоматизованих аудитах поведінки. Тестування охоплює тисячі симульованих сценаріїв, з акцентом на те, чи здатна модель виконувати незворотні дії, чи перевищує вона межі, встановлені користувачем, та чи зберігає вона початкове завдання під час впровадження інструкцій. Компанія також додала до оцінки неможливі завдання, завдання з більш довгим терміном виконання та сценарії, засновані на реальних інцидентах.
Це урок, який обов’язково потрібно пройти після виведення агентних ШІ у виробництво. Традиційне тестування безпеки часто ставить питання, чи відповідає модель на певні чутливі запити, але агент, який може переглядати веб-сторінки, викликати термінал та змінювати файли, несе більші ризики через ланцюжки дій: він може продовжувати виконувати дії на основі неправильних передумов або сприймати зловмисний текст із веб-сторінки як команду. Одна помилкова дія або розширення прав важче виправити, ніж неправильна відповідь.
«Менше порушень» все ще не означає «відсутність порушень». Anthropic відкрито визнає обмеження моделі. Під час розгортання в корпоративному середовищі необхідно застосовувати мінімальні права, підтвердження дій, налагоджений журнал, ізоляцію в пісочниці та механізми відкату. Зокрема, зміни в продуктивних базах даних, платежах та інфраструктурі не повинні виключати людське схвалення лише через підвищення оцінки безпеки моделі.
Це перша модель, опублікована після того, як Anthropic запропонувала «зповільнити темпи розвитку». Компанія намагається передати сигнал: продовжувати підвищувати здатності, одночасно включаючи зовнішні оцінки та більш реалістичні тести безпеки у процес випуску. Однак, чи виконується це зобов’язання, визначатиметься не одним випуском із найвищим балом, а постійним розкриттям випадків невдач, методів тестування та ефективності виправлень.
Для користувачів найважливіше в Opus 5.5 — не те, чи відповіді стають красивішими, а чи він здатний зберігати обмеження під час тривалих, багатоінструментальних, багатокрокових завдань і зупинятися, коли інформації недостатньо. Конкуренція на ринку моделей переходить від «хто відповідає розумніше» до «хто зможе виконати складні завдання з контролюваною вартістю». Зниження цін робить можливим більше спроб, а безпека та інженерна дисципліна вирішують, чи зможуть ці спроби реально потрапити у виробництво.
Під час пробного періоду компанія може створити простий, але строгий порівняльний тест: використовуючи той самий набір реальних завдань, порівняти Opus 5, Opus 5.5 та менш витратні моделі, фіксуючи час виконання, загальні витрати, відсоток успішного проходження тестів, кількість ручних змін та кількість дій високого ризику. Оновлення має бізнесовий сенс лише тоді, коли всі ці показники одночасно покращуються. Демонстрація на день випуску підходить для виявлення можливостей, а тривалий внутрішній тест протягом кількох тижнів — для вирішення питань повноважень та бюджету.
