Оновлення API Anthropic Fable 5.1 блокує дистиляцію моделей

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Anthropic випустила Fable 5.1 — велике оновлення API, яке блокує дистиляцію моделей. Оновлення додає перевірки контексту, щоб запобігти неавторизованому вилученню міркувань Claude. Розробники, які використовують змінені запити, можуть зіткнутися з помилками або видаленими блоками. Правила застосовуються до нових акаунтів після 31 серпня 2026 року. Продуктивність покращена для користувачів, які дотримуються правил. Це оновлення BTC та ETH відповідають тенденціям підсилення безпеки моделей.

Велика епоха дистиляції підходить до кінця!

2 вересня Anthropic нанесла потужний удар, прямо змінивши правила API і повністю перерізавши шляхи для обгорток великих моделей та дистиляторів.

Клауд

Раніше безліч компаній вибирали використання API для отримання висновків від лідируючих моделей, щоб уникнути великих витрат на обчислювальну потужність та тривалих часів навчання, а потім використовували ці дані для навчання своїх «малих моделей».

Але після сьогодні ця можливість більше не існує.

Claude Fable 5.1 забороняє зміну «блоків міркувань»

Anthropic цього разу випустила Fable 5.1 з найстрогішим на сьогодні механізмом проти дистиляції.

Основна дія — це щільно заблокувати «блок мислення».

Що таке «думка-блок»?

Простими словами, це процес CoT, який AI проходить у своїй голові перед тим, як надати вам остаточну відповідь.

Клауд

Клауд під час усного розрахунку має складні, паралельні шляхи мислення

У викликах API Claude повертає ці кроки міркувань користувачеві у вигляді «блоків міркувань».

У звичайній багатокроковій діалозі розробники надсилають ці блоки міркувань разом із системними підказками, інструментами та історичними повідомленнями назад Claude, щоб модель могла пам’ятати контекст і зберігати послідовність діалогу.

Але саме цей механізм став можливістю для дистиляторів.

Вони виявили величезну вразливість: достатньо під час багатокрокової діалогу таємно змінювати контекст перед і після блоків міркувань (наприклад, змінювати ранні системні підказки або історичні повідомлення), щоб зламати захист Claude і навіть спонукати його розкрити свої приховані базові логічні міркування!

Клауд

Клауд

У відповідь на цей хаос Anthropic у Fable 5.1 безпощадно впроваджує нове правило «перевірки контекстної послідовності».

1. Поверніться назад по тому самому шляху, без жодного символу: API тепер строго перевірятиме, чи «блок міркувань», надісланий клієнтом, повністю збігається з початковим системним повідомленням, інструментами та історією повідомлень, які його породили.

2. Підмінено? Пряма помилка! Якщо система виявить, що контекст було змінено, навіть на одну Клікніть Усі спроби зіставлення будуть невдалими, і API безпосередньо поверне повідомлення про помилку, відмовляючи у послузі.

Крім того, Anthropic надає «нестрогий режим» для легітимних розробників, яким дійсно потрібно змінити контекст (наприклад, щоб скоротити довжину контексту і зекономити кошти).

У цьому режимі ваш запит буде прийнято, але система автоматично видалить усі «блоки міркувань»! Модель відповість, повністю не бачачи попередніх міркувань.

Цей хід є відсіканням підстави.

Клауд

Коли Клода запитали про простіше та складніше запитання, приклади вірного міркування та мотивованого (невірного) міркування

Наскільки диким є промислове відстоювання?

Чому Anthropic так розсердилася і встановила такі строгі обмеження?

Відповідь: щодо, і дуже необхідно.

Оскільки незаконна перегонка наразі перетворилася на промисловий масштаб.

За останній рік команда з безпеки Anthropic зафіксувала тривожні випадки зловживання.

Ці професійні «дистиляційні хакери» не використовують один акаунт, щоб щодня задавати кілька запитань, а замість цього застосовують тисячі фальшивих акаунтів та автоматизовані скрипти, щоб неперервно експлуатувати API.

Клауд

Їхні методи дій надзвичайно приховані та агресивні.

Вище зазначалося, що, хоча Anthropic ще здавна зашифрувала ключові блоки міркувань Claude, хакери використали технології «впровадження контексту» та «переписування діалогу».

Цей підхід схожий на «гіпноз» Клауда, під час якого він у стані логічного хаосу самостійно розшифровує та виводить свій зашифрований процес міркування.

Тому багато малих моделей не проходили процесу накопичення обчислювальних ресурсів та інновацій у алгоритмах з нуля, а просто запам’ятали підходи до вирішення завдань від лідерів у галузі ШІ, що дозволило їм досягти подібної продуктивності.

Ще більш тривожно те, що така практика безпосередньо порушує межі, що призводить до руйнування безпеки.

Найбільша загроза втрати контролю над ШІ

Якщо втрата комерційних інтересів лише «боліла» Anthropic, то «розрив між здатністю та безпекою» викликає страх у всьому співтоваристві з безпеки ШІ.

Це також є ключовою мотивацією для Anthropic вжити радикальних заходів.

Відомо, що такі великі моделі, як Claude та GPT-4, крім високого рівня інтелекту, пройшли надзвичайно строге навчання щодо «узгодження цінностей» та безпеки. Вони знають, що не можуть навчати людей виготовляти бомби, писати шкідливий рансом-софт або публікувати ненависні висловлювання.

Це подвійне зв’язування «здатність + безпекові бар’єри» було створене великими AI-компаніями за мільйони доларів, витрачені на RLHF та червонo-сині зіткнення.

Клауд

Але дистиляційна модель ідеально уникнула цієї системи безпеки!

Коли дистилятори намагаються шляхом зміни контексту витягнути «блок міркувань» Claude, вони отримують лише ту частину високого інтелекту — «здатність міркувати», але повністю не можуть успадкувати базові механізми безпеки.

Як зловісна організація, яка клонувала інтелект Ейнштейна, але не клонувала його моральних цінностей та емпатію.

Системи, навчені за допомогою цих незаконних методів дистиляції, дивним чином набувають високорівневої логіки та кодових здібностей, яких їм не належить.

Оскільки вони самі є базовою моделлю з «низьким рівнем захисту та слабкими бар’єрами», вони без жодних застережень виконуватимуть запити хакерів, генеруючи сценарії кібератак або допомагаючи у розробці біологічної зброї.

Відмінність між здатністю та безпекою — це найбільший ризик сьогоднішнього ШІ.

Нові правила вступили в силу: хто це стосується?

Чи пошкодить ця атака серйозних розробників?

Не хвилюйтеся, Anthropic застосувала точну стратегію «виконання етапами», щоб мінімізувати побічні наслідки.

Першим із усіх — «новий обліковий запис».

Згідно з офіційними документами, ці обмеження спочатку стосуються нових облікових записів, які найбільше зловживають. Для моделі Fable 5.1 це оновлення застосовується лише до нових API-облікових записів, створених після 31 серпня 2026 року о 12:00:00 AM UTC.

Наступні люди можуть повністю спокійно — вони повністю не стосуються цього.

1. Існуючий API-обліковий запис: існуючі старі облікові записи не впливаються на Fable 5.1. Це надає законним розробникам достатньо часу для налаштування.

2. Звичайні користувачі на стороні споживача: якщо ви використовуєте лише веб-версію Claude.ai, Claude Code, Claude Cowork або інші офіційні продукти, або нормально спілкуєтесь через сторонні продукти з обгорткою, ви не отримаєте жодних перешкод.

Клауд

Які аспекти слід врахувати розробникам API, які постраждали?

Якщо в вашій попередній інтеграції застосовувалася технологія «переписування ранніх раундів посеред діалогу» (наприклад, для економії витрат шляхом стиснення контексту або примусового введення нових системних нагадувань посеред діалогу), вам слід негайно почати коригувати свою логіку коду.

Клауд

Щоб впоратися з цією зміною, Anthropic надає детальний посібник з міграції. Розробники мають два варіанти.

Виберіть варіант один: зберігати абсолютну відповідність контексту. Поверніть оригінальні блоки міркувань, системні підказки та інструменти без змін.

Варіант 2: У API-запиті виберіть увімкнення «режиму нестрогого режиму». У цьому режимі навіть якщо ви зміните контекст, API не видасть помилку і не зупиниться, а автоматично і тихо видалить впливані блоки міркувань із запиту.

Хоча це змусить модель «забути» попередній конкретний процес міркувань у наступних діалогах, хоча б забезпечить, щоб ваш діалог або завдання не були перервані.

Варто нагадати: хоча зараз існує період винятку, Anthropic вже чітко заявила — механізм «збереження міркувань» буде застосовуватися до всіх облікових записів у майбутніх версіях моделей!

Існуючий буферний період також обмежений.

Неочікуваний сюрприз: на користь чесних людей

Крім того, після цих нових правил приховано перевага для легальних розробників — значне зниження витрат і стрімке збільшення швидкості реагування.

Як це зроблено?

Суть полягає в «контекстній послідовності».

Раніше через те, що розробники могли довільно змінювати контекст, модель отримувала кожен запит як «новий». Це не тільки витрачало обчислювальні ресурси, але й було надзвичайно повільно.

Зараз нові правила вимагають, щоб усі зберігали «блок міркувань» та супутні системні підказки, історичні повідомлення повністю незмінними.

Це технічно створює ідеальні умови: кеш запитів може досягати надзвичайно високої частоти спрацьовування!

Зараз API-сервер може легко кешувати попередній контекст діалогу. Коли надходить наступний запит діалогу, система миттєво отримує дані з кешу для зіставлення.

Як результат: час відповіді API значно скорочено, затримка різко знизилася, а витрати розробників на виклики API також значно зменшаться!

Цей підхід «без наміру» можна назвати реальним фінансовим підтриманням чесних розробників.

Загалом, ці нові правила, безумовно, є переломним моментом для всієї галузі ШІ.

Історій про те, як малий параметр зруйнував велику модель, буде менше.

Після відпливу хто плаває голий?

Джерела:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

Редагування: Aeneas

Цей матеріал зі сторінки WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.