source avatarsleepy.md

Поділитися

Цей «інноваційний» підхід OpenAI Astra насправді вже був опублікований ByteDance минулого року. Цей напрямок називається recurrent depth. Просто кажучи, замість того, щоб просто генерувати довші CoT, щоб «подумати трохи довше», він дозволяє одній і тій же групі Transformer block повторно циклічно працювати зі схованим станом, щоб втиснути більше обчислень у латентний простір. Складні завдання проходять кілька циклів, прості — виходять раніше. Параметри не повинні збільшуватися разом із глибиною міркувань, а обчислення під час тестування можна розподіляти більш гнучко. У жовтні минулого року ByteDance Seed вже опублікував та відкрив код Ouro — це був Looped Language Model. Ouro-1.4B і 2.6B безпосередньо включили ітеративне латентне міркування на етапі попереднього навчання; 2.6B за замовчуванням виконує кілька циклів recurrent обчислень, одночасно підтримуючи адаптивний вихід, що дозволяє різним запитам самостійно вирішувати, скільки циклів їм потрібно. Тоді це була лише невелика гілка, яку ByteDance використовувала для перевірки на малих моделях; зараз OpenAI впровадив її у найсучасніші моделі. Це означає, що recurrent depth, ймовірно, більше не є лише «цікавою» академічною ідеєю — вона починає ставати справжньою інженерною дорогою наступного покоління великих моделей. Але проблеми, які вона створює, складніші за benchmark. Раніше, коли reasoning моделі розширювали свої здібності, багато обчислень були закодовані в CoT. Чим довше модель міркувала, тим більше reasoning tokens вона видавала. Хоча CoT і не дорівнює повному внутрішньому стану моделі, вона принаймні надавала безпечне вікно для моніторингу. Recurrent depth продовжує переносити обчислення всередину латентного простору. Одна й та ж група параметрів може багаторазово циклічно працювати з прихованим станом — модель вже виконала величезну кількість обчислень всередині, а на виході залишається лише короткий текст. Тож виникає дуже практичне питання: Місце, де модель фактично завершує міркування, поступово виходить за межі природної мови. Саме це є найбільшою стурбованістю дослідників щодо Astra. OpenAI раніше дуже цінувала моніторинг Chain-of-Thought, бо якщо модель планувала шахрайство, хакування нагороди або обхід правил — часто це спочатку проявлялося в CoT. Але якщо все більше reasoning відбувається всередині латентного стану — на що тоді можна моніторити? Згідно з повідомленнями, OpenAI навмисно обмежує ступінь використання recurrent depth у Astra, щоб зберегти більше читабельних CoT і додатково впровадити моніторинг внутрішнього стану та поведінки. Це дуже цікаво. Протягом останніх років шлях розширення reasoning у великих моделях був зрозумілим: дайте їй більше token — нехай говорить більше. Наступним кроком може стати надання їй більшого внутрішнього циклу — але без необхідності повідомляти вам про цей процес.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.