Велика епоха дистиляції підходить до кінця!
2 вересня Anthropic нанесла потужний удар, прямо змінивши правила API і повністю перерізавши шляхи для обгорток великих моделей та дистиляторів.

Раніше безліч компаній вибирали використання API для отримання висновків від лідируючих моделей, щоб уникнути великих витрат на обчислювальну потужність та тривалих часів навчання, а потім використовували ці дані для навчання своїх «малих моделей».
Але після сьогодні ця можливість більше не існує.
Claude Fable 5.1 забороняє зміну «блоків міркувань»
Anthropic цього разу випустила Fable 5.1 з найстрогішим на сьогодні механізмом проти дистиляції.
Основна дія — це щільно заблокувати «блок мислення».
Що таке «думка-блок»?
Простими словами, це процес CoT, який AI проходить у своїй голові перед тим, як надати вам остаточну відповідь.

Клауд під час усного розрахунку має складні, паралельні шляхи мислення
У викликах API Claude повертає ці кроки міркувань користувачеві у вигляді «блоків міркувань».
У звичайній багатокроковій діалозі розробники надсилають ці блоки міркувань разом із системними підказками, інструментами та історичними повідомленнями назад Claude, щоб модель могла пам’ятати контекст і зберігати послідовність діалогу.
Але саме цей механізм став можливістю для дистиляторів.
Вони виявили величезну вразливість: достатньо під час багатокрокової діалогу таємно змінювати контекст перед і після блоків міркувань (наприклад, змінювати ранні системні підказки або історичні повідомлення), щоб зламати захист Claude і навіть спонукати його розкрити свої приховані базові логічні міркування!


У відповідь на цей хаос Anthropic у Fable 5.1 безпощадно впроваджує нове правило «перевірки контекстної послідовності».
1. Поверніться назад по тому самому шляху, без жодного символу: API тепер строго перевірятиме, чи «блок міркувань», надісланий клієнтом, повністю збігається з початковим системним повідомленням, інструментами та історією повідомлень, які його породили.
2. Підмінено? Пряма помилка! Якщо система виявить, що контекст було змінено, навіть на одну Клікніть Усі спроби зіставлення будуть невдалими, і API безпосередньо поверне повідомлення про помилку, відмовляючи у послузі.
Крім того, Anthropic надає «нестрогий режим» для легітимних розробників, яким дійсно потрібно змінити контекст (наприклад, щоб скоротити довжину контексту і зекономити кошти).
У цьому режимі ваш запит буде прийнято, але система автоматично видалить усі «блоки міркувань»! Модель відповість, повністю не бачачи попередніх міркувань.
Цей хід є відсіканням підстави.

Коли Клода запитали про простіше та складніше запитання, приклади вірного міркування та мотивованого (невірного) міркування
Наскільки диким є промислове відстоювання?
Чому Anthropic так розсердилася і встановила такі строгі обмеження?
Відповідь: щодо, і дуже необхідно.
Оскільки незаконна перегонка наразі перетворилася на промисловий масштаб.
За останній рік команда з безпеки Anthropic зафіксувала тривожні випадки зловживання.
Ці професійні «дистиляційні хакери» не використовують один акаунт, щоб щодня задавати кілька запитань, а замість цього застосовують тисячі фальшивих акаунтів та автоматизовані скрипти, щоб неперервно експлуатувати API.

Їхні методи дій надзвичайно приховані та агресивні.
Вище зазначалося, що, хоча Anthropic ще здавна зашифрувала ключові блоки міркувань Claude, хакери використали технології «впровадження контексту» та «переписування діалогу».
Цей підхід схожий на «гіпноз» Клауда, під час якого він у стані логічного хаосу самостійно розшифровує та виводить свій зашифрований процес міркування.
Тому багато малих моделей не проходили процесу накопичення обчислювальних ресурсів та інновацій у алгоритмах з нуля, а просто запам’ятали підходи до вирішення завдань від лідерів у галузі ШІ, що дозволило їм досягти подібної продуктивності.
Ще більш тривожно те, що така практика безпосередньо порушує межі, що призводить до руйнування безпеки.
Найбільша загроза втрати контролю над ШІ
Якщо втрата комерційних інтересів лише «боліла» Anthropic, то «розрив між здатністю та безпекою» викликає страх у всьому співтоваристві з безпеки ШІ.
Це також є ключовою мотивацією для Anthropic вжити радикальних заходів.
Відомо, що такі великі моделі, як Claude та GPT-4, крім високого рівня інтелекту, пройшли надзвичайно строге навчання щодо «узгодження цінностей» та безпеки. Вони знають, що не можуть навчати людей виготовляти бомби, писати шкідливий рансом-софт або публікувати ненависні висловлювання.
Це подвійне зв’язування «здатність + безпекові бар’єри» було створене великими AI-компаніями за мільйони доларів, витрачені на RLHF та червонo-сині зіткнення.

Але дистиляційна модель ідеально уникнула цієї системи безпеки!
Коли дистилятори намагаються шляхом зміни контексту витягнути «блок міркувань» Claude, вони отримують лише ту частину високого інтелекту — «здатність міркувати», але повністю не можуть успадкувати базові механізми безпеки.
Як зловісна організація, яка клонувала інтелект Ейнштейна, але не клонувала його моральних цінностей та емпатію.
Системи, навчені за допомогою цих незаконних методів дистиляції, дивним чином набувають високорівневої логіки та кодових здібностей, яких їм не належить.
Оскільки вони самі є базовою моделлю з «низьким рівнем захисту та слабкими бар’єрами», вони без жодних застережень виконуватимуть запити хакерів, генеруючи сценарії кібератак або допомагаючи у розробці біологічної зброї.
Відмінність між здатністю та безпекою — це найбільший ризик сьогоднішнього ШІ.
Нові правила вступили в силу: хто це стосується?
Чи пошкодить ця атака серйозних розробників?
Не хвилюйтеся, Anthropic застосувала точну стратегію «виконання етапами», щоб мінімізувати побічні наслідки.
Першим із усіх — «новий обліковий запис».
Згідно з офіційними документами, ці обмеження спочатку стосуються нових облікових записів, які найбільше зловживають. Для моделі Fable 5.1 це оновлення застосовується лише до нових API-облікових записів, створених після 31 серпня 2026 року о 12:00:00 AM UTC.
Наступні люди можуть повністю спокійно — вони повністю не стосуються цього.
1. Існуючий API-обліковий запис: існуючі старі облікові записи не впливаються на Fable 5.1. Це надає законним розробникам достатньо часу для налаштування.
2. Звичайні користувачі на стороні споживача: якщо ви використовуєте лише веб-версію Claude.ai, Claude Code, Claude Cowork або інші офіційні продукти, або нормально спілкуєтесь через сторонні продукти з обгорткою, ви не отримаєте жодних перешкод.

Які аспекти слід врахувати розробникам API, які постраждали?
Якщо в вашій попередній інтеграції застосовувалася технологія «переписування ранніх раундів посеред діалогу» (наприклад, для економії витрат шляхом стиснення контексту або примусового введення нових системних нагадувань посеред діалогу), вам слід негайно почати коригувати свою логіку коду.

Щоб впоратися з цією зміною, Anthropic надає детальний посібник з міграції. Розробники мають два варіанти.
Виберіть варіант один: зберігати абсолютну відповідність контексту. Поверніть оригінальні блоки міркувань, системні підказки та інструменти без змін.
Варіант 2: У API-запиті виберіть увімкнення «режиму нестрогого режиму». У цьому режимі навіть якщо ви зміните контекст, API не видасть помилку і не зупиниться, а автоматично і тихо видалить впливані блоки міркувань із запиту.
Хоча це змусить модель «забути» попередній конкретний процес міркувань у наступних діалогах, хоча б забезпечить, щоб ваш діалог або завдання не були перервані.
Варто нагадати: хоча зараз існує період винятку, Anthropic вже чітко заявила — механізм «збереження міркувань» буде застосовуватися до всіх облікових записів у майбутніх версіях моделей!
Існуючий буферний період також обмежений.
Неочікуваний сюрприз: на користь чесних людей
Крім того, після цих нових правил приховано перевага для легальних розробників — значне зниження витрат і стрімке збільшення швидкості реагування.
Як це зроблено?
Суть полягає в «контекстній послідовності».
Раніше через те, що розробники могли довільно змінювати контекст, модель отримувала кожен запит як «новий». Це не тільки витрачало обчислювальні ресурси, але й було надзвичайно повільно.
Зараз нові правила вимагають, щоб усі зберігали «блок міркувань» та супутні системні підказки, історичні повідомлення повністю незмінними.
Це технічно створює ідеальні умови: кеш запитів може досягати надзвичайно високої частоти спрацьовування!
Зараз API-сервер може легко кешувати попередній контекст діалогу. Коли надходить наступний запит діалогу, система миттєво отримує дані з кешу для зіставлення.
Як результат: час відповіді API значно скорочено, затримка різко знизилася, а витрати розробників на виклики API також значно зменшаться!
Цей підхід «без наміру» можна назвати реальним фінансовим підтриманням чесних розробників.
Загалом, ці нові правила, безумовно, є переломним моментом для всієї галузі ШІ.
Історій про те, як малий параметр зруйнував велику модель, буде менше.
Після відпливу хто плаває голий?
Джерела:
https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F
Редагування: Aeneas
Цей матеріал зі сторінки WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис
