Великая эпоха дистилляции подходит к концу!
2 сентября Anthropic нанесла мощный удар, полностью изменив правила API и перекрыв путь для оберток крупных моделей и методов дистилляции.

Раньше множество компаний выбирали использование API для извлечения процесса вывода ведущих моделей, чтобы избежать огромных затрат на вычислительные мощности и длительного времени обучения, а затем использовали эти данные для обучения своих собственных «малых моделей».
Но после сегодняшнего дня эта возможность больше не существует.
Claude Fable 5.1 блокирует изменение «блоков мышления»
Anthropic выпустила Fable 5.1 с самой строгой в истории системой против дистилляции.
Основное действие — надежно заблокировать «блок мышления».
Что такое «мысленный блок»?
Проще говоря, это процесс CoT, который ИИ проходит в уме перед тем, как дать вам окончательный ответ.

Claude при выполнении устных вычислений использует сложные, параллельные пути мышления
В вызовах API Claude возвращает эти шаги рассуждений пользователю в виде «блоков мышления».
В обычном многоэтапном диалоге разработчики отправляют эти блоки размышлений вместе с системными подсказками, инструментами и историческими сообщениями обратно Claude, чтобы модель могла запомнить контекст и поддерживать связность диалога.
Но именно этот механизм стал возможностью для дистилляторов.
Они обнаружили огромную уязвимость: достаточно незаметно изменять контекст до и после блока мышления в ходе многократного диалога (например, подменять ранние системные подсказки или исторические сообщения), чтобы сломать защитные механизмы Claude и даже заставить его раскрыть свои скрытые базовые логические процессы!


В ответ на этот хаос Anthropic в Fable 5.1 ввела новое правило «проверки согласованности контекста».
1. Вернитесь по тому же пути, без изменений: API теперь будет строго проверять, совпадают ли «блоки мышления», возвращенные клиентом, с первоначальными системными подсказками, инструментами и историческими сообщениями, которые их породили.
2. Подделка? Прямая ошибка! Если система обнаружит, что контекст был изменен, даже на одну Нажмите Все будут неудачно сопоставлены, и API сразу вернет сообщение об ошибке, отклонив запрос.
Кроме того, чтобы поддержать легальных разработчиков, которым действительно необходимо изменить контекст (например, для сжатия длины контекста с целью экономии средств), Anthropic предоставляет «нестрогий режим».
В этом режиме ваш запрос будет принят, но система полностью удалит «блоки размышлений»! Модель будет вынуждена ответить, не видя предыдущих рассуждений.
Этот прием можно назвать устранением причины проблемы.

Когда Клоду задали более простой и более сложный вопросы, примеры достоверных рассуждений и мотивированных (недостоверных) рассуждений
Насколько безумна промышленная перегонка?
Почему Anthropic так злится и устанавливает такие строгие ограничения?
Ответ: что касается, и крайне необходимо.
Из-за текущей незаконной перегонки это уже переросло в промышленный масштаб.
За последний год команда безопасности Anthropic зафиксировала шокирующие случаи злоупотребления.
Эти профессиональные «дистилляторы-хакеры» не используют один аккаунт для задания нескольких вопросов в день, а применяют тысячи фальшивых аккаунтов и автоматизированные скрипты, чтобы круглосуточно эксплуатировать API.

Их методы работы обладают высокой степенью скрытности и агрессивности.
Как уже упоминалось ранее, хотя Anthropic давно зашифровала ключевые блоки мышления Claude, хакеры использовали технологии «внедрения контекста» и «переписывания диалога».
Это похоже на «гипноз» Клауда, заставляющий его в условиях логического хаоса самостоятельно расшифровать и вывести свой зашифрованный процесс рассуждений.
Поэтому многие небольшие модели не проходили процесс накопления вычислительных мощностей и алгоритмических инноваций с нуля, а просто запомнили подходы к решению задач от ведущих ИИ-моделей и достигли сопоставимой производительности.
Еще более страшно то, что такой подход напрямую пересекает красную черту, приводя к краху системы безопасности.
Главная опасность потери контроля над ИИ
Если потеря коммерческих интересов вызвала у Anthropic лишь дискомфорт, то «разрыв между способностями и безопасностью» вызывает страх у всего сообщества по безопасности ИИ.
Это также является ключевой мотивацией для Anthropic принять решительные меры.
Как известно, такие крупные модели, как Claude и GPT-4, помимо чрезвычайно высокого интеллекта, прошли строгую «настройку ценностей» и безопасностную подготовку. Они знают, что не могут учить людей изготавливать бомбы, писать вредоносное программное обеспечение для вымогательства или распространять ненавистнические высказывания.
Эта двойная привязка «способности + безопасные барьеры» была создана крупными ИИ-компаниями за миллионы долларов, затраченных на RLHF и красно-синие противостояния.

Однако дистиллированная модель идеально обходит эту систему безопасности!
Когда дистилляторы пытаются принудительно извлечь «блоки мышления» Claude, изменяя контекст, они извлекают только часть высокого интеллекта — «способность к рассуждению», но полностью не могут унаследовать базовую систему безопасности.
Как зловещая организация, сконировавшая интеллект Эйнштейна, но не его моральные принципы и эмпатию.
Системы, обученные с использованием таких незаконных методов дистилляции, случайным образом приобретают продвинутую логику и навыки кодирования, которых изначально не должны были иметь.
Но поскольку сами по себе они являются базовой моделью с «низкой защитой и слабыми барьерами», они без колебаний выполняют запросы хакеров, генерируя сценарии кибератак или помогая в разработке биологического оружия.
Разрыв между способностями и безопасностью — это наибольший риск современного ИИ.
Новые правила вступили в силу: кто затронут?
Повлияет ли это ударение на серьезных разработчиков?
Не волнуйтесь, Anthropic применила точную стратегию «поэтапного внедрения», чтобы минимизировать побочные эффекты.
Прежде всего, «новый аккаунт».
Согласно официальным документам, это ограничение впервые применяется к новым аккаунтам, где наблюдается наибольшее количество злоупотреблений. Для модели Fable 5.1 это обновление применяется только к новым API-аккаунтам, созданным после 31 августа 2026 года, 12:00:00 AM UTC.
Следующие пользователи могут быть полностью спокойны — вы никак не затронуты.
1. Существующие API-аккаунты: существующие старые аккаунты на Fable 5.1 временно не затронуты. Это предоставляет законным разработчикам достаточное время для внесения изменений.
2. Конечные пользователи: если вы используете веб-версию Claude.ai, Claude Code, Claude Cowork или другие официальные продукты, либо нормально общаетесь через сторонние продукты с оберткой, вы не столкнетесь с какими-либо помехами.

Что должны учитывать разработчики API, затронутые этим изменением?
Если в вашей предыдущей интеграции приложения использовалась технология «перезаписи ранних раундов посреди диалога» (например, для экономии средств путем сжатия контекста или принудительной инъекции новых системных напоминаний посреди диалога), вам необходимо немедленно начать корректировать логику вашего кода.

В ответ на это изменение Anthropic предоставила подробное руководство по миграции. У разработчиков есть два варианта.
Выберите вариант один: сохранить абсолютную согласованность контекста. Вернуть исходный блок размышлений, системное указание и инструменты без изменений.
Вариант 2: Выберите «режим ненестрогости» в API-запросе. В этом режиме, даже если вы измените контекст, API не выдаст ошибку и не прервется, а автоматически и незаметно удалит затронутые блоки размышлений из запроса.
Хотя это заставит модель «забыть» предыдущие конкретные рассуждения в последующих диалогах, по крайней мере, это гарантирует, что ваш диалог или задача не будут прерваны.
Следует отметить: хотя в настоящее время существует период освобождения от этого правила, Anthropic четко заявила, что механизм «сохранения мышления» будет применяться ко всем аккаунтам в будущих версиях моделей!
Существующий временной буфер также ограничен.
Неожиданная радость: польза для честных людей
Кроме того, после введения новых правил скрывается еще одно преимущество для легальных разработчиков — значительное снижение затрат и резкое ускорение времени отклика.
Как это сделано?
Суть в «контекстной согласованности».
Раньше из-за того, что разработчики могли произвольно изменять контекст, модель получала каждый запрос как «новый». Это не только потребляло огромные вычислительные ресурсы, но и значительно замедляло работу.
Сейчас новые правила обязывают всех сохранять «блок мышления» и связанные с ним системные подсказки, а также исторические сообщения в точности без каких-либо изменений.
Это технически создает идеальные условия: кэш подсказок может достигать чрезвычайно высокой частоты попаданий!
Теперь API-сервер может легко кэшировать предыдущий контекст диалога. При поступлении следующего запроса на диалог система мгновенно извлекает данные из кэша и выполняет сопоставление.
В результате время отклика API значительно сократилось, задержка резко уменьшилась, а стоимость вызовов API для разработчиков также значительно снизилась!
Этот подход «случайно помог», по сути, обеспечил реальную финансовую поддержку честным разработчикам.
В целом, эти новые правила, несомненно, являются переломным моментом для всей индустрии ИИ.
Историй о том, как небольшие параметры разрушают крупные модели, станет меньше.
После отлива кто плавает голый?
Справочные материалы:
https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F
Редактирование: Aeneas
Эта статья взята из официального аккаунта WeChat «Синьчжэюань» (ID: AI_era), автор: АСИ, Откровение
