Anthropic недавно столкнулась с рядом технических проблем в модели Claude. Генерация кода снизила гибкость из-за ограничений, связанных с встраиванием водяных знаков; адаптивный механизм мышления Sonnet 5 позволяет регулировать вычислительные ресурсы одной и той же модели, размывая границы возможностей линейки продуктов; хотя контекст в 1 млн токенов кажется достаточным, в длинных сессиях агента модель фактически может эффективно использовать только около 20–30%, после чего возникает путаница состояний и упущения; при сжатии контекста сложно определить, какая информация остается актуальной, а временные предположения могут быть ошибочно восприняты как факты; после того как агент активно изменяет среду, модель начинает анализировать новые ошибки, созданные ею самой, а не исходную проблему. В статье отмечается, что надежность длинных агентов все больше зависит от ясности состояния, проверяемости действий и возможности отката ошибок, а не от одиночной производительности модели.Автор статьи, источник: Leiphone
Что сложнее, чем падение рейтинга модели, так это то, что модель всё ещё находится в процессе обновления, а пользователи начинают чувствовать, что она становится всё менее удобной.
Anthropic недавно немного напоминал это.
В последние дни в X была опубликована запись, объединившая несколько типичных жалоб на Claude: тексты и код начали помечать машинно-читаемыми метками, реальный опыт работы с Sonnet 5 не поспевает за шумихой вокруг обновлений модели, Fable 5 продается дороже, но трудно заметить, где именно он превосходит Opus 5; также есть более яркая жалоба: контекст Fable 5 используется лишь на 20–30%, после чего его способности начинают падать.

Эти четыре вещи на первый взгляд не связаны между собой: одна похожа на проблему механизма генерации, другая — на проблему способностей модели, третья — на проблему ценообразования, а четвертая, похоже, связана с сбоем в длинном контексте.
Но с точки зрения текущего стека технологий Claude, они фактически застревают в пяти очень конкретных местах: как модель генерирует выводы, сколько вычислений она готова потратить при выводе, почему разные модели становятся все труднее иерархизировать, почему длинный контекст перестает работать еще до заполнения, и почему способности, демонстрируемые в экспериментах, часто снижаются при реальных задачах агента.
Таким образом, недавние проблемы Anthropic, возможно, не являются простым «уменьшением производительности модели». Скорее, после того как Claude стал сильнее, генерация, вычисления, контекст и выполнение агентов начали мешать друг другу.

01
Первый грех: уничтожение пространства для генерации кода
Машинно-читаемые метки размещаются в обычном тексте; техническая сложность заключается в том, чтобы сохранить стабильный сигнал, не снижая при этом качество генерации. В коде эта проблема становится явно сложнее, поскольку распределение токенов в естественном языке и в коде различается.

Статья: https://arxiv.org/pdf/2301.10226
Естественный язык часто содержит несколько семантически близких вариантов. Одно и то же значение можно выразить разными словами или изменить порядок слов, и модель имеет определённую избыточность генерации на многих позициях. Один из распространённых подходов к водяным знакам текста заключается в использовании этой избыточности путём незначительного изменения вероятностей выборки между несколькими приемлемыми токенами, что при достаточной длине создаёт статистические закономерности.
Код содержит множество низкоэнтропийных позиций. После объявления переменной последующие ссылки практически всегда должны использовать то же самое имя; поля JSON, кавычки и скобки строго ограничены структурой; параметры функций должны соответствовать интерфейсу; в путях, регулярных выражениях, SQL и командных строках изменение одного токена может напрямую изменить поведение.
С точки зрения распределения вероятностей, эти позиции часто очень острые. Правильный токен занимает высокую вероятность, а другие кандидаты — не просто альтернативные формулировки, а могут быть просто ошибками. Таким образом, основным ограничением для водяных знаков кода является фактически емкость кодирования.
Если позиция имеет только один разумный вывод, у неё почти нет места для дополнительных сигналов; если система вставляет метки только в позиции с высокой энтропией, возникают проблемы с короткими кодами, высоким процентом структурированных токенов и недостатком доступных позиций.
Таким образом, возникает прямой компромисс между обнаруживаемой силой, качеством генерации и устойчивостью к изменению: слишком слабый сигнал трудно обнаружить, чрезмерно сильные ограничения могут повлиять на корректную генерацию, а сохранение обнаруживаемости после форматирования или локального переформулирования требует большей избыточности сигнала.

Anthropic не раскрыла, как именно изменяется выборка текста Claude, поэтому нельзя напрямую связать изменения в качестве Claude Code с конкретным алгоритмом водяного знака.
Однозначно можно сказать, что еще одно изменение заключается в том, что генерация кода одновременно несет все больше ограничений. Помимо семантической и исполнительной корректности, он может также должен соблюдать протоколы инструментов, структурированные форматы, правила безопасности и маркеры источников, при этом сам код имеет гораздо меньшую свободу для усвоения этих дополнительных ограничений по сравнению с естественным языком.

02
Второй грех: уровни модели превращаются в кривую расчета
Изменения, вызванные адаптивным мышлением Sonnet 5, выходят за рамки простого увеличения времени размышления модели.
Раньше, говоря о Sonnet, Opus, Fable, было легко воспринимать их как несколько фиксированных характеристик. Теперь, с добавлением effort, одна и та же модель может попадать в разные интервалы вычислительных ресурсов во время тестирования, и сама модель уже не может полностью отражать, сколько вычислительных ресурсов было затрачено на один запрос.

Ссылка для справки: https://platform.claude.com/docs/en/build-with-claude/effort
Эти изменения особенно заметны в Coding Agent. Когда Claude сталкивается с ошибкой, ему нужно не только генерировать решение, но и решать, какие файлы читать, какую цепочку вызовов отслеживать, сколько гипотез сохранять, запускать ли тесты, продолжать ли проверку зависимостей и когда считать, что доказательств достаточно.
Эти действия можно рассматривать как дерево поиска. Меньшие вычислительные затраты означают более раннее отсечение ветвей и более быстрое принятие решений; большие затраты позволяют модели продолжать поиск и проверку, снижая вероятность выполнения действий при недостатке доказательств.

Ссылка для справки: https://platform.claude.com/docs/en/build-with-claude/effort
Таким образом effort регулирует не просто длину мышления, а масштаб поиска, разрешённый для одной задачи Agent. Это напрямую изменит иерархию модели Anthropic.
Если обычную задачу по программированию для Opus уже не сложно, то после повышения effort Opus, скорее всего, быстро войдет в зону производительностного плато. Даже обладая более мощной базовой моделью, Fable не имеет большого остаточного уровня сложности, который можно было бы превратить в заметную разницу в опыте.
Пользователь должен оплачивать разницу в цене между моделями с момента начала запроса. Поэтому Fable легче демонстрирует свою ценность в задачах, таких как работа с незнакомыми кодовыми базами, многоэтапное планирование, взаимодействие между инструментами, длительное автономное выполнение и восстановление после возникновения ошибок, а не в обычной интерпретации кода, небольшой рефакторинге или стандартной отладке.

Ссылка для справки: https://www.anthropic.com/news/claude-opus-5
Это означает, что то, что продают продвинутые модели, меняется. Они больше не продают просто «более сильный ответ на этот раунд», а дополнительную надежность в более сложной траектории.
Проблема в том, что такое преимущество требует достаточно длинных задач, чтобы проявиться, а как только задачи удлиняются, способности модели перестают быть единственным определяющим фактором, и контекстное состояние начинает занимать центральное положение.

03
Третий грех: может хранить огромный объем истории, но не может разобраться с текущим состоянием
Увидев контекст в 1 М, легко воспринять его как огромную рабочую память, поэтому когда Claude начинает пропускать, повторять или терять стабильность состояния, используя всего 200K или 300K токенов, это кажется крайне нелогичным.
Но окно контекста измеряет емкость, а не согласованность состояния. Длительная сессия агента — это не статический документ, а постоянно пополняемая история выполнения.

Ссылка для справки: https://platform.claude.com/docs/en/build-with-claude/context-windows
Файл может быть изменен несколько раз подряд; изначально баг был определен как проблема кэша, но позже выяснилось, что он возникает из-за конкурентности; тест может сначала завершиться неудачей, затем пройти, а после новых изменений снова завершиться неудачей. Старые данные не удаляются автоматически при изменении состояния — новые данные просто добавляются в конец.
Проблема здесь выходит за рамки просто извлечения. Модель должна не только находить информацию, связанную с текущей задачей, но и определять, актуальна ли эта информация на данный момент.
Старые и новые функции очень похожи, старые и новые тестовые логи содержат множество одинаковых токенов, а ранее опровергнутый анализ также может быть семантически сильно связан с текущей проблемой. Attention несложно найти эти материалы, сложно определить отношения покрытия между ними.
Базы данных могут поддерживать текущее состояние с помощью номеров версий, времени обновления, транзакций и явных полей; естественный язык, как правило, не имеет такой структуры. Он ближе к логу только для добавления, и модель должна самостоятельно восстановить текущее состояние мира из последовательности событий.

Ссылка для справки: https://platform.claude.com/docs/en/build-with-claude/context-windows
Таким образом, сложность длинного контекста не просто соответствует доле занятых токенов. Статический документ из 250 000 токенов может быть намного проще обработать, чем история агента из 250 000 токенов, поскольку последняя содержит множество изменённых объектов, промежуточных суждений, результатов инструментов и уже устаревших состояний.
История мышления еще больше увеличит эту сложность. В сессии сохраняется не только «что произошло», но и «почему тогда было сделано такое суждение». Если ранние рассуждения основывались на предположении, которое позже было опровергнуто, этот фрагмент рассуждений все еще может участвовать в последующих суждениях, поскольку он сильно связан с текущей проблемой.
Таким образом, истинное ограничение в 1M контекста заключается не только в количестве информации, которое можно поместить, но и в том, сможет ли модель стабильно восстанавливать текущую версию, когда один и тот же объект имеет все больше и больше исторических версий.

04
Четвёртый грех: сжимается история, воссоздаётся состояние
По мере роста контекста компактизация выглядит как естественный способ: сжать старую историю и продолжить выполнение. Однако компактизация в сценариях агента — это не то же самое, что обычное резюме.
При кратком изложении статьи пропуск одного примера влияет лишь на полноту информации; при сжатии траектории агента пропуск одного по-прежнему действующего ограничения может полностью изменить последующий путь выполнения.

Ссылка для справки: https://platform.claude.com/cookbook/tool-use-context-engineering-context-engineering-tools
Так как компактизация должна решать не вопрос «что важно», а «что сейчас актуально». В истории могут одновременно присутствовать завершенные задачи, позже отмененные суждения, текущие ограничения интерфейсов, устаревшие результаты тестов и временные обходные пути. Компактизатору необходимо переупорядочить эти временные состояния в представление, пригодное для дальнейшей работы.
Если «в настоящее время подозревается, что проблема возникла из-за кэша» сокращается до «проблема возникла из-за кэша», временная гипотеза превращается в факт; если устаревший вариант все еще попадает в сводку, последующие агенты могут снова следовать по старому пути; если какое-либо ключевое ограничение не попадает в сводку, модель может больше его не видеть.
Таким образом, ключевым показателем компактизации является не коэффициент сжатия, а сохранение состояния. Именно поэтому Git, тесты, файлы задач, память и структурированный передача данных становятся все более важными в долгосрочных агентах.
Они не просто увеличивают объем информации, доступной модели, а переводят некоторые состояния, требующие долгосрочного соблюдения, из исторических натуральных языковых данных во внешние системы. Git фиксирует текущую версию кода, тесты предоставляют проверяемые результаты, файлы задач отслеживают выполнение, а структурированное состояние разделяет текущие выводы и исторические попытки.
Контекст может сохранять богатую историю, но не может долгосрочно нести всю ответственность за управление состоянием.

Ссылка для справки: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

05
Пятый грех: модель исправляет баги, которые сама создала, и ошибки становятся всё больше
Предыдущие несколько вопросов по-прежнему можно понять как то, как модель обрабатывает входные данные. Агент шагает дальше, поскольку он активно изменяет среду.
В обычном чате ошибка модели обычно остается в выходном тексте. Агент может изменять код, выполнять команды, устанавливать зависимости, настраивать конфигурацию и затем считывать новые результаты, возникающие в результате этих действий.
Таким образом, ошибка перестаёт быть просто ошибкой в суждении и превращается в изменение среды. Предположим, Claude неправильно определил баг как проблему кэширования и изменил логику кэширования, механизм повторных попыток и несколько точек вызова. В результате тестов появились новые исключения.
Эти аномалии реальны, но они не являются естественным следствием исходного бага, а возникли в результате предыдущих изменений. Это заставляет агента попасть в особый режим сбоя: модель начинает анализировать распределение данных, которые она сама создала.

Ссылка для справки: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
Если он может распознать, что «эти новые ошибки возникли после предыдущего изменения», он может откатиться и повторно проверить исходные предположения; если эта причинно-следственная связь не установлена, новые ошибки могут продолжать восприниматься как независимые проблемы, которые устраняются по одной.
В этот момент каждое локальное действие может быть обосновано, но вся траектория задачи уже отклонилась от исходной проблемы. Поэтому надежность длинного агента не может оцениваться только по точности отдельных шагов. Более важным является то, сможет ли система обнаружить, определить причину и восстановиться после попадания ошибки в среду.
Git diff может сообщить модели, какие изменения произошли недавно, тесты могут проверить, не была ли нарушена какая-либо функция, checkpoint и rollback могут ограничить распространение ошибок, а независимый evaluator может предоставить дополнительную проверку помимо собственных объяснений модели.
Суть этих компонентов заключается в предоставлении агенту способности к замкнутому циклу исправления ошибок.

Ссылка для справки: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

06
Заключение: Benchmark не хватает надежности траектории
Многие тесты на базовых показателях измеряют следующее: может ли модель завершить задачу при заданной начальной среде. У реального агента возникает дополнительная сложность: среда постоянно меняется в ответ на действия самой модели. Поэтому модели с похожими итоговыми показателями успешного завершения могут обеспечивать совершенно разный реальный опыт.
Одна модель может сначала делать точные прогнозы, но, сделав ошибку, продолжает исправлять её по неверному пути; другая модель на каждом отдельном шаге может не быть явно сильнее, но быстрее обнаруживает, что какое-то изменение создало новую проблему, и откатывается, чтобы выбрать другой путь.
Глядя только на конечную точку, сложно различить эти два поведения. Если задача агента становится длиннее, более значимыми показателями станут: сколько ключевых состояний сохранилось после компактизации, можно ли найти шаг, приведший к ошибке после ее внесения, сохраняется ли согласованность внутреннего состояния задачи с реальной средой по мере увеличения вызовов инструментов, и какую цену необходимо заплатить для возвращения на правильный путь после отклонения.
Эти показатели измеряют не то, насколько умна одна реакция, а способна ли траектория оставаться управляемой.
В совокупности недавно выявленные проблемы Anthropic затрагивают различные уровни. После их концентрации технологические ограничения Claude也开始发生变化.
Раньше вопрос был скорее в том, может ли модель решить определенную задачу, а теперь сложнее другое: после нескольких часов выполнения задачи, десятков вызовов инструментов, нескольких сжатий состояний и многочисленных изменений кода, сможет ли система сохранить достоверную текущую картину мира.
Мощность модели продолжает расти, и это может только повысить верхний предел каждого шага принятия решений. Способность длинных агентов стабильно работать все больше зависит от другого набора способностей: четкость состояния, проверяемость действий и возможность отката ошибок.
