Anthropic запускает Claude Opus 5.5 с снижением стоимости на 40% и акцентом на надежность при выполнении длительных задач

icon币界网
Поделиться
AI summary iconСводка
Anthropic запустила Claude Opus 5.5 22 сентября 2026 года с снижением стоимости на 40% по сравнению с предыдущей версией. Модель поддерживает долгосрочные инвестиции, повышая надежность при выполнении длительных задач. Она справляется со сложным программированием и исследовательскими задачами, включая миграцию кода объемом 680 000 строк менее чем за день. Обновление добавляет защиту от инъекций запросов и сосредоточено на тестировании безопасности в реальных условиях. Экономия затрат варьируется в зависимости от сложности задачи и использования инструментов.
CoinDesk сообщает:

Anthropic выпустила Claude Opus 5.5 22 сентября — первую модель серии Claude 5.5. Основной маркетинговый посыл компании был прост: уровень производительности по большинству задач соответствует Claude Fable 5.1, при этом стоимость эксплуатации по сравнению с предыдущим поколением Opus 5 снижена на 40%. Однако то, что действительно стоит обратить внимание в этом выпуске, — это не только цена и рейтинги, а то, что Anthropic сместила акцент тестирования в сторону длительных задач, необратимых операций и защиты от инъекций подсказок.

Официально заявлено, что Opus 5.5 значительно улучшил производительность в сложных задачах кодирования, исследований и работы, требующей экспертных знаний. Среди ранних тестировщиков одна команда смогла переместить около 680 000 строк кода менее чем за сутки; Anthropic также подчеркнула, что модель способна поддерживать более длинный контекст и непрерывность планирования. Примеры демонстрируют потенциал модели, но не могут рассматриваться как среднее время доставки для всех проектов. Результаты зависят от структуры кодовой базы, покрытия тестами и человеческого контроля.

Снижение затрат не означает «дешевую версию флагмана», а предполагает пересмотр границ использования моделей

Раньше Opus обычно использовался только для самых сложных и дорогих задач, а повседневные задачи поручались более быстрым моделям. Если Opus 5.5 действительно сможет приблизиться к уровню Fable 5.1 при более низкой стоимости, компании могут начать использовать флагманские модели для массового анализа кода, документации и исследовательских процессов, а не только для редких высокоценных запросов.

Снижение стоимости на 40% — это официальное заявление Anthropic по сравнению с Opus 5, но это не означает, что счета каждой компании снизятся на 40%. Фактические расходы зависят от длины ввода и вывода, кэширования, количества вызовов инструментов и необходимости повторного выполнения задач. Более мощные модели могут потреблять больше общего количества токенов из-за выполнения более длинных задач. Покупателям необходимо тестировать «общую стоимость выполнения задачи» на своих рабочих нагрузках, а не сравнивать только цену за единицу.

Способность выполнять длинные задачи также должна оцениваться по качеству результата. Большой миграционный проект кода может породить множество кажущихся обоснованных изменений, но настоящая стоимость включает регрессионное тестирование, конфликты зависимостей, развертывание и откат. Если модели требуется несколько дней инженерного времени для устранения граничных проблем, преимущество скорости сокращается. Наиболее ценной оценкой является запись успешности, количества случаев передачи управления человеку и необратимых ошибок, а не только количество сгенерированного кода.

Anthropic сообщает, что Opus 5.5 прошел предварительное тестирование внешними оценщиками, такими как Frontier Design и METR. Вовлечение внешних сторон повышает доверие, но не означает, что все отчеты, исходные данные и тестовые среды полностью опубликованы. Пользователям все еще следует различать результаты, предоставленные компанией, результаты независимых оценок и результаты воспроизведения в собственной среде.

Сecurity testing now focuses on real incident patterns, not just short-answer refusal rates.

Anthropic сообщает, что Opus 5.5 показал лучший результат среди всех ранее проведённых автоматизированных аудитов поведения компании. Тестирование охватило тысячи симулированных сценариев, с акцентом на то, будет ли модель предпринимать труднообратимые действия, пересекать заданные пользователем границы и сохранять исходную задачу при попытках внедрения подсказок. Компания также включила в оценку невозможные задачи, задачи с более длительной продолжительностью и сценарии, основанные на реальных инцидентах.

Это урок, который необходимо пройти после вывода агентных ИИ в производственную среду. Традиционные тесты безопасности часто спрашивают, будет ли модель отвечать на определенные чувствительные вопросы, но агенты, способные просматривать веб-страницы, вызывать терминал и изменять файлы, представляют большую опасность из-за цепочек действий: они могут продолжать выполнение на основе неверных предпосылок или воспринимать вредоносный текст с веб-страницы как команду. Один неверный клик или расширение прав доступа труднее исправить, чем неуместный ответ.

«Меньше нарушений» все еще не означает «отсутствие нарушений». Anthropic открыто признает ограничения модели. При развертывании в корпоративной среде необходимо сохранять принцип минимальных прав, подтверждение операций, отслеживаемые журналы, песочницы и механизмы отката. Особенно изменения в производственных базах данных, платежах и инфраструктуре не должны лишаться человеческого одобрения только потому, что показатели безопасности модели улучшились.

Это первая модель, выпущенная после того, как Anthropic предложила «замедлить темпы передового развития». Компания стремится передать сигнал: продолжать повышать возможности, одновременно включая во внешнюю оценку и более реалистичные тесты безопасности в процесс выпуска. Однако, чтобы оценить, выполнит ли эта обязанность свои обещания, необходимо наблюдать за постоянным раскрытием случаев неудач, методов тестирования и эффективности устранения проблем, а не за единственным максимальным результатом в одном выпуске.

Для пользователей наиболее важным тестом Opus 5.5 является не то, насколько красивее становятся ответы в чате, а способен ли он сохранять контроль в течение нескольких часов, при использовании множества инструментов и этапов, и остановиться при недостатке информации. Конкуренция на рынке моделей смещается с вопроса «кто отвечает умнее» на вопрос «кто может завершить сложные задачи с контролируемыми затратами». Снижение цен открывает возможность попробовать больше людей, а безопасность и инженерная дисциплина определяют, смогут ли эти попытки действительно перейти в производство.

Во время пробного периода компания может создать простой, но строгий набор контрольных показателей: сравнить Opus 5, Opus 5.5 и более дешевые модели на одном и том же наборе реальных задач, записав время выполнения, общую стоимость, процент прохождения тестов, объем ручной корректировки и количество высокорискованных действий. Обновление имеет коммерческий смысл только в том случае, если все эти показатели одновременно улучшаются. Демонстрация в день выпуска подходит для выявления возможностей, но только непрерывная внутренняя оценка в течение нескольких недель позволяет принять решение о полномочиях и бюджете.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.