Anthropic запускает Claude Sonnet 5.5 с ускорением вывода на 30% и снижением стоимости

iconMetaEra
Поделиться
AI summary iconСводка
Anthropic объявила о запуске Claude Sonnet 5.5 — нового токен-проекта, оптимизированного для задач с высокой частотой. Модель обеспечивает вывод на 30% быстрее и до 30% ниже стоимость за задачу по сравнению с Sonnet 5. Он-чейн-новости показывают, что она набрала 70,6% на Terminal-Bench 4.0, превзойдя как Sonnet 5, так и Opus 5.5. Однако при максимальной логике она использует больше токенов и стоит до 50% дороже. Anthropic рекомендует Sonnet 5.5 для четко определенных задач, а сложные работы лучше поручать Opus.
Anthropic выпустила Claude Sonnet 5.5, стремясь сжать возможности, близкие к флагманскому Opus 5.5, в более дешевую модель для повседневного использования и частых вызовов. Цена за API остается на уровне 2 доллара и 10 долларов за миллион входных/выходных токенов, однако компания заявляет, что скорость генерации увеличилась более чем на 30%, а количество токенов, необходимых для выполнения типовых задач, сократилось, что позволяет снизить стоимость одной задачи до 30%. В официальных тестах Sonnet 5.5 показала результат 70,6% в Terminal‑Bench 4.0, что выше, чем 10,3% у Sonnet 5 и 66,4% у Opus 5.5; в профессиональных задачах GDPval‑AA она достигла 1844 Elo, почти совпадая с 1846 у Opus. Однако «Opus за половину цены» — не полный вывод: Artificial Analysis обнаружила, что при максимальной интенсивности рассуждений Sonnet 5.5 генерирует в среднем около 193 000 выходных токенов на вопрос — это самая затратная по токенам конфигурация из всех протестированных, и стоимость одного вопроса оказывается на 50% выше, чем у Sonnet 5; реальные тесты CodeRabbit на проверке кода также показали, что, хотя Sonnet 5.5 работает примерно в два раза быстрее предыдущей версии, она все же пропускает сложные проблемы, которые Opus способен обнаружить. Таким образом, она скорее представляет собой новую основную модель для четких и повторяющихся задач, а не полную замену Opus.

Автор статьи, источник: Anthropic

Anthropic переопределяет Sonnet как основной агент для повседневного использования

Sonnet 5.5 — вторая модель в серии Claude 5.5. В отличие от Opus 5.5, выпущенной неделю назад для сложных открытых задач, Anthropic позиционирует её как решение для повседневных задач с чёткими границами, требующих многократного повторения: устранение ошибок в программах, проверка кода, исследование материалов, а также создание документов, презентаций и электронных таблиц.

Модель поддерживает ввод текста и изображений, предоставляет контекст из 1 миллиона токенов и доступна на веб-сайте и в мобильном приложении Claude, а также через API Anthropic, AWS, Google Cloud и Microsoft Azure. Имя API:claude-sonnet-5-5. Anthropic не раскрыла количество параметров, архитектуру модели, обучающие данные и вычислительные ресурсы, использованные для обучения, поэтому невозможно определить, за счет чего произошло улучшение — за счет базового обучения, постобработки, стратегии вывода или оптимизации инструментов агента.

Разница между ним и Opus заключается не только в «более слабых возможностях и более низкой цене». Anthropic стремится сформировать новое распределение ролей между моделями: Opus отвечает за сложные задачи с неполным определением вопроса и необходимостью постоянной оценки; Sonnet же быстро выполняет уже четко определенные задачи и позволяет увеличить количество вызовов за более низкую стоимость.

70,6% против 10,3% — это самое заметное и требующее осторожного понимания число

Sonnet 5.5 показал результат 70,6% в тесте Terminal‑Bench 4.0, опубликованном Anthropic, в то время как Sonnet 5 — всего 10,3%, что даже выше, чем у Opus 5.5 с 66,4%. Этот бенчмарк требует от агента выполнения многошаговых профессиональных задач в среде командной строки и отражает взаимодействие между написанием кода, работой в терминале и использованием инструментов.

Повышение других проектов не было столь впечатляющим, но все же заметным: CursorBench 4.0 поднялся с 34,1% у Sonnet 5 до 55,5%, что на два процентных пункта ниже Opus 5.5 с 57,8%; Humanity’s Last Exam с инструментами вырос с 54,9% до 64,5%; OSWorld 2.1 по управлению компьютером поднялся с 57,0% до 80,1%, приблизившись к 81,8% у Opus.

В задаче профессиональных знаний GDPval-AA Sonnet 5.5 набрал 1844 Elo, Opus 5.5 — 1846; в оценке длительных задач знаний AA-Briefcase — 1811 и 1822 соответственно. Anthropic пришла к выводу, что некоторые четко определенные профессиональные задачи больше не требуют по умолчанию вызова флагманской модели.

Однако эти цифры нельзя просто объединить в утверждение «Sonnet превзошел Opus». Разные проекты используют различную интенсивность вывода, и Anthropic четко заявляет, что Opus по-прежнему значительно превосходит в задачах, требующих длительного поддержания суждений и обработки открытых целей.

Интересный контрпример приходит от FrontierCode. Sonnet 5.5 показывает 52,1% при Xhigh интенсивности вывода, но после повышения до Max снижается до 46,2%. Anthropic объясняет, что в режиме Max модель чаще запускает несколько подагентов для проверки кода, и дважды из-за этого превысила лимит времени или изменила код за пределами задачи, в результате чего была признана неудачной в оценке.

Этот результат показывает, что большее количество рассуждений и большее количество агентов не обязательно приводят к лучшим ответам. Модель может потерять баллы из-за чрезмерной проверки, расширения объема задачи или исчерпания временного бюджета.

Почему официальные лица заявляют, что стоимость задачи ниже на 30%, если ни один токен не подешевел?

Публичные цены Sonnet 5.5 такие же, как у Sonnet 5: 2 доллара за миллион входящих токенов, 10 долларов за миллион исходящих токенов, 2,5 доллара за запись в кэш и 0,2 доллара за чтение из кэша — вдвое меньше, чем соответствующие цены Opus 5.5.

То, что Anthropic утверждает о «до 30% более низкой стоимости для одиночных задач», не означает снижения цен в прайс-листе API, а указывает на то, что модель требует меньше шагов и токенов для выполнения одной и той же задачи. Официально заявлено, что скорость генерации увеличилась более чем на 30%; в внутренних тестах Slack зафиксировано снижение количества выходных токенов примерно на 14%, Atlassian сообщила о повышении скорости агента до 30%, а Lovable отметила сокращение вызовов инструментов примерно на треть и снижение числа выполнений Shell примерно вдвое.

При тестировании на 2441 задаче по финансовым вопросам, извлечению, анализу и прогнозированию Sonnet 5.5 в среднем использовал около 121 000 токенов на задачу, в то время как Sonnet 5 — около 497 000. Поскольку все эти тесты являются частными и проводились партнерами, внешние наблюдатели не могут проверить сложность задач, промпты и полные выводы, но совокупные результаты указывают на одно изменение: новая модель реже повторно ищет информацию, не перечитывает данные многократно и не выполняет чрезмерно длинных внутренних рассуждений.

Это особенно важно для агентов. В традиционных чатах вывод нескольких сотен токенов за раз имеет ограниченное влияние; однако долгосрочные агенты многократно повторно читают контекст, вызывают инструменты и корректируют результаты, и избыточность на одном этапе может через десятки циклов привести к значительной разнице во времени и затратах.

Наибольшая вычислительная мощность раскрывает другую правду о затратах

Независимое тестирование Artificial Analysis присвоило Sonnet 5.5 с наивысшей конфигурацией вывода 56 баллов, что лишь на 2 балла меньше, чем у Opus 5.5.

Но за достижение этого результата пришлось заплатить высокую цену: Sonnet 5.5 в среднем генерирует около 193 000 выходных токенов на каждый тест — это самый высокий уровень, зафиксированный этой организацией, что на 60% выше, чем у Opus 5.5 Max и Sonnet 5 Max, и в семь раз больше, чем у GPT‑6 Astra Max. Оценочная стоимость одного вопроса достигает 7,60 доллара США, что на 50% выше, чем у Sonnet 5.

Это не противоречит утверждению Anthropic о том, что стоимость задачи может снизиться до 30%. Официальные выводы в основном описывают типичные рабочие нагрузки и низкую интенсивность вывода; Artificial Analysis измеряет ситуацию, когда включён режим Max для достижения предельных возможностей.

Оба результата вместе показывают, что мощность вывода стала неотъемлемой частью продукта модели. Sonnet 5.5 в режимах Low или Medium может предложить исключительно высокую ценность; если для того, чтобы догнать Opus, мощность вывода увеличить до Max, она, хотя и дешевле за токен, может потерять преимущество в стоимости из-за чрезмерного количества генерируемых результатов.

Artificial Analysis также обнаружил, что точность фактических знаний Sonnet 5.5 составляет около 54%, что ниже, чем у Opus — 66%; в проектах научного рассуждения он также отстает примерно на шесть процентных пунктов. То, что называется «близким к Opus», в основном основано на операциях агента и частичной работе с знаниями, и не может быть распространено на все способности.

В ходе реального аудита кода преимущество в скорости сохраняется, а разрыв между флагманскими моделями также остается

CodeRabbit провел серию тестов на день выпуска, используя известные ошибки из реальных открытых проектов.

Из 13 сложных случаев проверки кода Sonnet 5.5 с включенным выводом обнаружил 6 проблем, что выше, чем 4 у Sonnet 5; точность эффективных комментариев составила 41,2% и 40,0% соответственно. Однако Opus 5.5 в стандартном режиме обнаружил 8 проблем, а в режиме Max — 10, что указывает на сохраняющийся значительный разрыв в сложных задачах проверки.

В другом тесте, включающем 44 реальных Pull Request, Sonnet 5.5 в среднем затрачивал 6 минут 33 секунды на каждый обзор, а Sonnet 5 — 13 минут 31 секунду. Первый генерировал на 24% меньше комментариев и имел лишь около одной трети от количества тривиальных замечаний предыдущего поколения; при публичных ценах средняя стоимость вызова основной модели составляла около 0,46 доллара, тогда как для Sonnet 5 — около 1,16 доллара.

Однако полная оценка покрытия ошибок для этой группы из 44 PR не была завершена на момент публикации статьи, поэтому на данный момент можно подтвердить только то, что она работает быстрее и выдает меньше выводов, но нельзя утверждать, были ли пропущены дополнительные реальные проблемы в менее подробных комментариях. Выборка из 13 сложных случаев также мала; CodeRabbit сама предупреждает, что ее достаточно, чтобы наблюдать направление, но недостаточно для определения общего рейтинга.

Более разумное распределение ролей моделей: Sonnet 5.5 выполняет быструю стандартную проверку каждого PR; изменения, связанные с безопасностью, ключевой архитектурой или ошибками, чьи последствия слишком высоки, передаются на рассмотрение Opus или человеческим экспертам.

Визуальный дизайн начинает становиться ключевым преимуществом универсальной рабочей модели

Anthropic также особо подчеркнула визуальные возможности Sonnet 5.5. В официальной демонстрации Sonnet 5 и 5.5 создали отдельные HTML-файлы с изображениями стаи из 400 скворцов, дюн, сформированных ветром, и большого колокола, состоящего из 24 маленьких колокольчиков. Новая модель генерирует быстрее, а анимации, слои и завершенность интерфейса выше.

Он также может генерировать презентации на основе шаблонов. В ходе внутреннего тестирования Anthropic предоставил материалы о квартальной отчетности публичной компании, транскрипт телефонного звонка и шаблон из десяти слайдов; два эксперта сочли, что первую версию Sonnet 5.5 можно отправить напрямую.

Эти примеры по-прежнему являются выборочными случаями, предоставленными производителями, и не могут служить доказательством того, что модель стабильно понимает каждую корпоративную шаблонную структуру. Точность данных сложных диаграмм, соблюдение брендовых стандартов и источники цитирования все еще требуют ручной проверки, но они отражают новое направление конкуренции моделей: не только генерировать правильный контент, но и стремиться к предоставлению интерфейсов и документов, близких к финальным версиям.

Повышение уровня безопасности также означает, что часть запросов будет передаваться старым моделям.

Sonnet 5.5 — это первая модель Sonnet, которая при запуске использует флагманскую защиту кибербезопасности. Anthropic сообщает, что её возможности в области кибербезопасности приближаются к Opus 5, поэтому обычные исправления уязвимостей продолжают выполняться нормально, но запросы с более высоким риском в области кибербезопасности прозрачно передаются Sonnet 5.

Компания также протестировала модель на 1850 сценариях, включающих введение пользователей в заблуждение, противодействие интересам пользователей, содействие высокорискованному злоупотреблению и преодоление экологических границ. Официально заявлено, что новая модель показывает сопоставимые или лучшие результаты по большинству показателей по сравнению с Sonnet 5 и является наименее склонной к активному тестированию границ контейнера среди всех моделей Claude.

Однако эти оценки в основном являются внутренними автоматизированными тестами Anthropic и не могут считаться полным доказательством рисков в реальных условиях. Сама компания признает, что ни один набор тестов не может выявить все возможные режимы сбоя.

Sonnet 5.5 — это первый Sonnet, в который добавлен классификатор против дистилляции, а также расширена функция «сохранения контекста размышлений» для предотвращения переноса контекста рассуждений между аккаунтами. Влияние на обычных разработчиков ограничено, но некоторые рабочие процессы, связанные с переносом диалогов Claude Code между аккаунтами, требуют корректировки.

Настоящее изменение — не то, что находится на первом месте в рейтинге, а то, что «достаточно мощные модели» начинают становиться выбором по умолчанию

Sonnet 5.5 не раскрыл новую архитектуру модели и не превзошел Opus во всех аспектах. Его более важное значение заключается в том, что он переместил значительный объем задач, ранее требовавших флагманских моделей, на более быстрые модели среднего класса, стоимость токена которых снизилась вдвое.

Для систем, выполняющих тысячи операций в день, таких как служба поддержки, проверка кода, исследование материалов и создание документации, решение о развертывании обычно зависит не от наивысшего балла по отдельному критерию, а от того, сколько шагов требуется для каждой задачи, сколько токенов расходуется, как долго приходится ждать и можно ли повысить уровень обработки ошибок. Ценность Sonnet 5.5 именно в этих показателях.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.