Anthropic запускає Claude Sonnet 5.5 зі швидкістю виведення на 30% вищою та зниженням витрат

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Anthropic оголосила про запуск Claude Sonnet 5.5 — нового токен-проекту, оптимізованого для завдань з високою частотою. Модель забезпечує виведення на 30% швидше та до 30% нижчу вартість за завдання порівняно з Sonnet 5. На ланцюгових новинах вона отримала 70,6% на Terminal-Bench 4.0, перевершивши Sonnet 5 та Opus 5.5. Однак при максимальному міркуванні вона використовує більше токенів і коштує до 50% дорожче. Anthropic рекомендує Sonnet 5.5 для чітко визначених завдань, тоді як Opus підходить для складних робіт.
Anthropic випустила Claude Sonnet 5.5, намагаючись втиснути здатності, близькі до флагманського Opus 5.5, у модель з нижчою ціною, призначenu для частого використання як звичайний Agent. Ціна за API залишається на рівні 2 долари США та 10 доларів США за мільйон вхідних/вихідних токенів, але офіційно повідомляється, що швидкість виведення збільшилася більше ніж на 30%, а кількість токенів, необхідних для виконання типових завдань, зменшилася, що дозволяє знизити вартість окремого завдання максимум на 30%. У офіційних тестах він показав результат 70,6% у Terminal‑Bench 4.0, що вище за 10,3% у Sonnet 5 та 66,4% у Opus 5.5; у професійних завданнях GDPval‑AA він досяг 1844 Elo, що майже дорівнює 1846 у Opus. Однак «Opus за половину ціни» — не повний висновок: Artificial Analysis виявила, що Sonnet 5.5 у режимі максимальної інференц-навантаженості генерує в середньому близько 193 000 вихідних токенів на запит — це найбільш токен-витратна конфігурація з усіх, які вони тестували, і вартість одного запиту насправді на 50% вища, ніж у Sonnet 5; реальні тести CodeRabbit на перевірку коду також показали, що хоча Sonnet 5.5 працює приблизно вдвічі швидше за попередню версію, він все ще пропускає складні проблеми, які Opus здатний виявити. Тому він більше схожий на нову основну модель для чітко визначених, повторюваних завдань, ніж на повну заміну Opus.

Автор статті, джерело: Anthropic

Anthropic переорієнтує Sonnet на роль основного агента для щоденного використання

Sonnet 5.5 — це друга модель у серії Claude 5.5. На відміну від Opus 5.5, яку було запущено тиждень тому для складних відкритих завдань, Anthropic позиціонує її як інструмент для вирішення добре визначених, інтенсивних щоденних завдань: виправлення помилок у коді, перевірки коду, дослідження даних, а також генерації документів, презентацій і електронних таблиць.

Модель підтримує введення тексту та зображень, надає контекст у 1 мільйон токенів і може використовуватися на веб-сайті та мобільному додатку Claude, а також через API Anthropic, AWS, Google Cloud і Microsoft Azure. Назва API:claude-sonnet-5-5. Anthropic не розголошила кількість параметрів, архітектуру моделі, дані для навчання та обчислювальні ресурси, використані для навчання, тому неможливо визначити, чи підвищення продуктивності походить від базового навчання, післянавчання, стратегій виведення чи оптимізації інструментального ланцюжка агента.

Різниця між ним і Opus полягає не лише в «меншій здатності та нижчій ціні». Anthropic бажає сформувати нове розподілення моделей: Opus відповідає за складні завдання з неповним визначенням проблеми, що вимагають постійного аналізу; Sonnet швидко виконує вже чітко визначені завдання та дозволяє збільшити кількість викликів за нижчою вартістю.

70,6% до 10,3% — це найбільш помітні та найбільш потребують обережного тлумачення дані

Sonnet 5.5 показав 70,6% у тесті Terminal‑Bench 4.0, опублікованому Anthropic, тоді як Sonnet 5 — лише 10,3%, що навіть вище, ніж у Opus 5.5 з 66,4%. Цей бенчмарк вимагає від агента виконання багатокрокових професійних завдань у середовищі командного рядка, що відображає взаємодію між написанням коду, роботою з терміналом та використанням інструментів.

Підвищення інших проектів не було настільки вражаючим, але все ж помітним. CursorBench 4.0 зрос з 34,1% у Sonnet 5 до 55,5%, що на два відсоткових пункти менше, ніж у Opus 5.5 — 57,8%; Humanity’s Last Exam з інструментами підвищився з 54,9% до 64,5%; OSWorld 2.1 — операції з комп’ютером — зросли з 57,0% до 80,1%, наблизившись до 81,8% у Opus.

У завданні з професійних знань GDPval-AA Sonnet 5.5 отримав 1844 Elo, Opus 5.5 — 1846; у тесті на довготривалі знання AA-Briefcase — 1811 і 1822 відповідно. Anthropic вважає, що деякі чітко визначені професійні завдання більше не потребують за замовчуванням використання флагманської моделі.

Проте ці цифри не можна просто об’єднати в “Sonnet перевершив Opus”. Різні проекти використовують різну інтенсивність виведення, і Anthropic чітко зазначила, що Opus залишається значно сильнішим у завданнях, що вимагають тривалого зберігання суджень та обробки відкритих цілей.

Цікавим контрприкладом є FrontierCode. Sonnet 5.5 показав 52,1% при інтенсивності висновків Xhigh, але після підвищення до Max цей показник знизився до 46,2%. Anthropic пояснив, що в режимі Max модель частіше запускає кілька підагентів для перевірки коду, двічі через це вийшла за межі терміну виконання або змінила код поза межами завдання, що призвело до невдачі у тестуванні.

Цей результат показує, що більше міркувань і більше агентів не обов’язково призводять до кращої відповіді. Модель може втратити бали через надмірну перевірку, розширення сфери завдання або вичерпання часового бюджету.

Чому офіційно заявлено, що вартість завдань нижча на 30%, якщо ціна кожного токена не знизилася?

Публічна ціна Sonnet 5.5 така ж, як і у Sonnet 5: 2 долари за мільйон вхідних токенів, 10 доларів за мільйон вихідних токенів, 2,5 долара за запис у кеш, 0,2 долара за читання з кешу — це вдвічі менше, ніж відповідні ціни Opus 5.5.

Те, що Anthropic називає «до 30% дешевше за одне завдання», не означає зниження цін у ціновому списку API, а те, що модель виконує ту саму роботу з меншою кількістю кроків і токенів. Офіційно заявлено, що швидкість генерації збільшилася більше ніж на 30%; у внутрішніх тестах Slack зафіксовано зменшення вихідних токенів приблизно на 14%, Atlassian повідомила про прискорення агента до 30%, а Lovable зазначила зменшення викликів інструментів приблизно на третину та зменшення кількості виконань Shell майже наполовину.

Під час тестування на 2441 завданні з фінансових запитань та відповідей, витягування, аналізу та прогнозування, Sonnet 5.5 у середньому використовував близько 121 000 токенів на завдання, тоді як Sonnet 5 — близько 497 000. Оскільки це приватні тести партнерів, зовнішній світ не може перевірити складність завдань, підказки та повні вихідні дані, але результати разом вказують на зміну: нова модель менше здійснює повторні пошуки, не перечитує матеріали та не проводить надто довгих внутрішніх міркувань.

Це особливо важливо для агента. У традиційному чаті одночасний вивід кількох сотень токенів має обмежений вплив; однак довгостроковий агент повторно читає контекст, викликає інструменти та коригує результати, і одна зайва дія може через десятки циклів збільшитися до значної різниці у часі та витратах.

Найвища інференційна потужність розкриває іншу правду про витрати

Незалежне тестування Artificial Analysis присудило Sonnet 5.5 з найвищою конфігурацією для висновків 56 балів, що лише на 2 бали менше, ніж у Opus 5.5 з 58 балами.

Але цей результат має високу ціну: Sonnet 5.5 у середньому генерує приблизно 193 000 вихідних токенів на тест, що є найвищим рівнем, виміряним цією організацією — на 60% вище, ніж у Opus 5.5 Max і Sonnet 5 Max, і майже в сім разів більше, ніж у GPT‑6 Astra Max. Оцінена вартість за завданням досягає 7,60 долара США, що на 50% вище, ніж у Sonnet 5.

Це не суперечить твердженням Anthropic про те, що вартість завдань зменшується до 30%. Офіційні висновки стосуються типових навантажень та нижчого рівня висновування; Artificial Analysis вимірює ситуації, коли ввімкнено Max для досягнення межі здатностей.

Обидва набори результатів разом показують, що інтенсивність виведення стала частиною продукту моделі. Sonnet 5.5 у режимах Low або Medium може запропонувати чудове співвідношення ціни та якості; якщо ж щоб наздогнати Opus, інтенсивність виведення підняти до Max, вона, хоча й дешевша за токен, може втратити перевагу в витратах через надмірну кількість згенерованих даних.

Artificial Analysis також виявив, що точність фактів Sonnet 5.5 становить приблизно 54%, що нижче за 66% у Opus; у проектах наукового міркування вона також відстає приблизно на шість відсотків. Твердження про «близькість до Opus» в основному базується на операціях агента та деяких знаннєвих завданнях і не може поширюватися на всі здібності.

У реальних перевірках коду перевага у швидкості є дійсною, а розрив між флагманськими моделями також залишається

CodeRabbit провів серію тестів у день випуску, використовуючи відомі помилки з реальних відкритих проектів.

У 13 складних випадках перевірки коду Sonnet 5.5 з увімкненим міркуванням виявив 6 проблем, більше, ніж Sonnet 5 з 4; точність ефективних коментарів становила відповідно 41,2% і 40,0%. Однак у стандартному режимі Opus 5.5 виявив 8, а в режимі Max — 10, що свідчить про те, що розрив у складних завданнях перевірки залишається значним.

У іншому тесті, що охоплював 44 реальні Pull Request, Sonnet 5.5 в середньому витрачав 6 хвилин 33 секунди на кожну перевірку, тоді як Sonnet 5 — 13 хвилин 31 секунду. Перший генерує на 24% менше коментарів і має лише приблизно третину незначних зауважень порівняно з попереднім поколінням; за публічними цінами середня вартість виклику основної моделі становить близько 0,46 долара, тоді як для Sonnet 5 — 1,16 долара.

Проте повний рейтинг покриття помилок для цієї групи з 44 PR не був завершений на момент публікації статті, тому наразі можна підтвердити лише те, що він швидший і генерує менше виводів, але не можна впевнено сказати, чи пропущені коментарі з меншим обсягом приховують більше реальних проблем. Вибірка з 13 складних випадків дуже мала; CodeRabbit сама наголошує, що цього достатньо, щоб спостерігати напрямок, але недостатньо, щоб визначити загальні рейтингові позиції.

Більш раціональне розподілення обов’язків моделей: Sonnet 5.5 відповідає за швидкий стандартний огляд кожного PR; зміни, що стосуються безпеки, основної архітектури або мають високу вартість пропущених помилок, передаються на розгляд Opus або людським експертам.

Візуальний дизайн починає ставати конкурентною перевагою загальної робочої моделі

Anthropic особо підкреслила здатність Sonnet 5.5 до візуального дизайну. У офіційному демонстраційному прикладі Sonnet 5 і 5.5 створили окремі HTML-файли з 400 скворців, що літають зграєю, піщаними дюнами, сформованими вітром, і великими годинниками, складеними з 24 маленьких дзвінків. Нова модель генерує швидше, а анімація, шари та завершеність інтерфейсу вищі.

Він також може генерувати презентації на основі шаблонів. Під час внутрішнього тестування Anthropic надала матеріали щодо квартальної звітності публічної компанії, транскрипцію телефонної конференції та шаблон з десятьма слайдами; два експерти вважали, що першу версію Sonnet 5.5 можна відправити без змін.

Це все ще приклади, вибрані виробником, і вони не означають, що модель може стабільно розуміти кожен корпоративний шаблон. Точність даних складних діаграм, брендові стандарти та джерела цитувань все ще потребують ручної перевірки, але вони відображають новий напрямок конкуренції моделей: не лише генерувати правильний контент, а й намагатися надавати інтерфейси та документи, які майже готові до використання.

Підвищення безпеки також означає, що деякі запити будуть оброблятися старою моделлю

Sonnet 5.5 — це перша модель Sonnet, яка при запуску використовує флагманський захист мережевої безпеки. Anthropic повідомляє, що її мережева безпека наблизилася до Opus 5, тому звичайні виправлення вразливостей продовжують працювати, але запити з вищим рівнем ризику прозоро передаються Sonnet 5.

Компанія також протестувала ці поведінки — введення користувачів в оману, порушення інтересів користувачів, допомога у використанні з високим ризиком та подолання меж середовища — у приблизно 1850 сценаріях. За словами офіційних осіб, нова модель показує такі самі або кращі результати за більшістю показників порівняно з Sonnet 5 і є найменш активною серед усіх моделей Claude у спробах перевірити межі контейнера.

Однак це в основному внутрішні автоматизовані оцінки Anthropic, які не можуть вважатися повним доказом ризиків у реальних умовах. Сама компанія погоджується, що жоден набір тестів не може виявити всі можливі режими відмови.

Sonnet 5.5 є першим Sonnet, який додав класифікатор проти витікання, а також розширив механізм «збереження контексту міркувань», щоб запобігти перенесенню контексту міркувань між різними обліковими записами. Вплив на звичайних розробників обмежений, але деякі робочі процеси, що передбачають перенесення діалогів Claude Code між обліковими записами, потребують коригування.

Справжні зміни — це не перше місце в рейтингу, а те, що «достатньо потужні моделі» стають вибором за замовчуванням

Sonnet 5.5 не оголошив нової архітектури моделі, а також не перевершив Opus у всіх аспектах. Його більш важливе значення полягає в тому, що велику кількість робіт, які раніше вимагали флагманських моделей, тепер перенесено на більш швидкі та з подвоєною знижкою ціни за токен середні моделі.

Для систем, які виконують тисячі запитів щодня — служби підтримки, перевірка коду, дослідження інформації та виробництво документів — рішення про те, чи впроваджувати їх, зазвичай не залежить від найвищого балу за окремим критерієм, а від того, скільки кроків потрібно для кожної задачі, скільки токенів витрачається, як довго чекати та чи можна підвищити рівень обробки помилок. Саме ці показники є сильними сторонами Sonnet 5.5.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.