Стаття Google DeepMind розкриває, що метод рекулькуляції підвищує продуктивність Transformer

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
Google DeepMind опублікувала нову статтю з представленням методу під назвою «recirculation» для покращення моделей transformer. Цей метод направляє активації глибших шарів назад до раніших шарів під час висновку, що підвищує продуктивність без необхідності переосвіти. Згідно з новинами на блокчейні, метод зменшив перплексію на 23% і покращив точність міркувань на 21% на тестовому наборі GSM8K. Однак він збільшує початкові витрати на обробку. Криптовалютні видання звертають увагу на потенціал підвищення ефективності ШІ у застосуваннях блокчейн.

Google DeepMind недавно опублікувала статтю, яка може тихо змінити те, як мовні моделі обробляють текст. Техніка, яка називається «рециркуляція», бере активації з глибших шарів трансформера і змішує їх назад у поверхневі шари під час висновку. Стаття, написана спільно з дослідниками з Університету Техасу в Остіні, демонструє, що це легке рекурентне з’єднання забезпечує підвищення продуктивності, яке конкурує з повним доналаштуванням і в деяких випадках навіть перевершує його. Не потрібно навчання знову. Не потрібно великої архітектурної операції.

Що насправді робить рециркуляція

Рециркуляція порушує односторонній потік обробки трансформера. Доля активацій, обчислених у глибших шарах моделі, повертається назад до поверхневих шарів під час генерації токенів. Модель отримує другий прохід для розуміння власних внутрішніх представлень, що дозволяє їй уточнити те, що у статті називається її «станами переконань» на кількох кроках.

Ключова відмінність від існуючих підходів, таких як підказка ланцюжком міркувань або циклічні архітектури трансформерів, полягає в тому, що рекіркуляція не вимагає додаткових токенів міркування чи збільшення архітектурної глибини. Це додаткова зміна до способу виконання висновків, а не переробка самої моделі.

Реклама

Ці цифри важко ігнорувати

Команда DeepMind протестувала рекулькуляцію на всіх моделях сімейства Gemma3, включаючи варіанти з 1B, 4B та 12B параметрами. Базова рекулькуляція забезпечила приблизно 8,5% зменшення перплексії на дев’яти наборах даних для мовного моделювання без додавання затримки під час генерації.

Адаптивне рециркулювання було далі вдосконалено, що призвело до середнього зниження перплексії на 23% на тих самих дев’яти наборах даних. Для порівняння, повна доналаштування досягла лише 21,6% зниження. У завданнях міркуваньbenchmark GSM8K показав 21% відносне збільшення точності за допомогою адаптивного рециркулювання.

Існує компроміс. Обробка передзаповнення, етап, на якому модель опрацьовує початковий запит, стає послідовною під час рециркуляції, що збільшує початкову вартість обробки запиту.

Чому спільнота ШІ звертає увагу

Папір, вказаний як arXiv:2608.17981, вже був незалежно відтворений. Реалізації на GitHub підтвердили зростання на моделях поза сімейством Gemma, включаючи Llama 3.2 1B. Обговорення поширилися серед наукових спільнот на X та китайських платформах технічних ЗМІ.

Рециркуляція працює на рівні активації, нижче поверхні генерації токенів, що робить її доповнювальною, а не конкурентною до технік просування, таких як міркування ланцюгом, які витрачають токени виводу і додають затримку.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.