Недавно NVIDIA опублікувала офіційний посібник з висновків великих моделей, але, листуючи його, виходить, що це майже збірка статей китайських команд.
Ситуація така.
2 вересня на технічному блозі NVIDIA з’явилася довга стаття «Декодування спільного проектування моделей ШІ за допомогою спекуляцій».
Суть статті — це таблиця вибору, яка відображає шість найпопулярніших рішень для прискорення висновків, детально розкриваючи вартість навчання та сценарії застосування.

Його значущість полягає в тому, що лідер чіпів надзвичайно рідко офіційно зафіксував у вигляді нормативу, як моделі слід проектувати, щоб максимально використовувати фізичні межі апаратного забезпечення.
А коли вони озираються, шукаючи оптимальні рішення, які вміють танцювати на межі можливостей кремнієвих чипів, основні рішення, включені до путівника, майже всі керуються китайськими командами.
Це вже виходить за межі звичайного огляду алгоритмів. Що саме розкриває ця таблиця? Розберемо її рядок за рядком.
Майже чистий прибуток: що робить Speculation Decode
Щоб зрозуміти цю таблицю, спочатку потрібно зрозуміти, що таке «спекулятивне розшифровування».
Великі моделі вимовляють слова по одному. Кожне слово вимагає повного проходження через пам’ять відеокарти з усіма сотнями гігабайтів параметрів. Насправді, більшу частину часу обчислювальні ресурси просто чекають, поки пам’ять перенесе дані.
Розв’язок «Спекулятивного декодування» дуже простий і грубий —
Спочатку використовуйте легкий малий моделю для попереднього прогнозу, щоб одразу вгадати 7 символів; потім велика модель одночасно перевіряє ці 7 символів.
Перевірка 7 символів займає майже стільки ж часу, що й написання власного 1 символу, оскільки вагу все одно доведеться перенести.
Той, хто вгадав, просто отримує, той, хто помилився, починає знову з точки зупинки. Оскільки велика модель приймає лише ті символи, які сама вміє писати, остаточний вивід не потребує жодних змін у розділових знаках. Це й називається «безвтратне прискорення».

У цій грі всі витиснення обчислювальної потужності засновані на одній основній математичній формулі очікування:
Speedup = 𝔼[L] × TtargetTdraft + Tverify
Чисельник — це дохід 𝔼[L], який позначає очікувану довжину прийняття (середня кількість символів, які велика модель вибирає за один цикл).
Знаменник — це додаткові витрати, які ви зробили: час, необхідний малим моделям для прогнозування (Tdraft), плюс час, необхідний великим моделям для остаточної перевірки (Tverify).
Щоб розігнати коефіцієнт прискорення (Speedup), є лише два шляхи: або збільшити чисельник (точніше передбачати), або максимально скоротити знаменник (швидше передбачати).
Крокуючи плечима до конкурентів, досягаємо четвертої еволюції
Проглядаючи цю таблицю NVIDIA згори донизу, ви побачите чітку основну лінію боротьби.
Перший рядок — це найстаріша «зовнішня моделі чернетки», для неї потрібно окремо навчати невелику модель-помічника.
NVIDIA прямо показала надзвичайно високу вартість: навчання з нуля вимагає від 1T до 10T токенів, що має дуже високу ціну.
Але він все ще залишається у таблиці, тому що NVIDIA визначила для нього конкретну долю — вони витратили 20 мільярдів доларів США на придбання чіпа Groq (LPU).
Останній рядок — це метод пошуку за таблицею n-грам без навчання, який просто шукає повторювані фрагменти з попереднього тексту і копіює їх безпосередньо; він підходить лише для жорстких сценаріїв, де потрібно копіювати та вставляти великі обсяги тексту.
Справжнім втіленням технологічного розвитку є ці чотири рядки посередині.

Другий рядок: EAGLE-3.
Команда з Пекінського університету, Юхуей Лі, Університету Ватерлоо, Хоньяна Чжана та інших.
Від ICML та EMNLP до NeurIPS — три роки поспіль три покоління, вивівши цей послідовний підхід «відгадування по одному слову» до фізичних меж.
Він колись був абсолютним лідером у цій галузі, але в новій таблиці NVIDIA його витіснили на «додаткове місце» з надзвичайно короткою причиною: довжина прийняття вже була перевищена наступним хвилею.
Третій рядок: MTP (багатотокенне прогнозування).
Хоча ідея була вперше запроваджена Meta у 2024 році, саме вона була перетворена на стандарт для висновків великих моделей DeepSeek -V3.
NVIDIA отримала високу оцінку — найкращий вибір для великих моделей на GPU. Суть полягає в тому, що цей підхід повинен навчатися разом з основною моделлю на етапі попереднього навчання.
Четвертий рядок: DFlash. Гравець, що отримав 6-кратне безвтратне прискорення.
Три автори: Цзянь Чен, Єшэн Лян, Чжіцзянь Лю. Він повністю відмовився від послідовного підходу EAGLE і MTP, де «відгадується по одному символу за раз», і замість цього запозичив ідеї з дифузійних моделей, щоб за один прямий прохід одночасно згенерувати послідовність з 7 токенів, зводячи до мінімуму знаменник (час).
Додамо, що керівник Чжіцзянь Лю є доцентом UCSD, але також є дослідником у науково-дослідному інституті NVIDIA.
П’ятий рядок: DSpark. Розроблено командою з 24 осіб у співпраці з DeepSeek та Пекінським університетом.
Хоча паралельна архітектура DFlash швидка, у неї є смертельний недолік: чим далі, тим менш точні припущення. Щоб штучно збільшити молекулу (довжину прийняття), DSpark додав до паралельної основи надзвичайно легкий послідовний модуль.
Реальні дані дуже наочні: довжина прийому на 30% вища, ніж у EAGLE-3, і на 18% вища, ніж у DFlash. У DeepSeek У виробничому середовищі V4 швидкість на 60–85% вища, ніж у MTP.
Hardware constants, reverse lock model architecture
Ці чотири покоління технологій зможуть вичавити обчислювальну потужність до такого ступеня не лише завдяки алгоритмічним хитрощам.
Багато хто вважає, що чим більше прогнозів у чернетці, тим більше прибутку, але це повністю ігнорує фізичні закони кристалів.
Коли механізм уваги займає більшу частину часу декодування, загальна кількість токенів, які потрібно обробити на етапі перевірки великої моделі, становить 1+D (1 реальний вхід + D чернеток-прогнозів).
Щоб передати ці дані на GPU, апаратне забезпечення на нижчому рівні групує заголовки запитів та KV, а розмір блоку уваги для кожної групи повинен строго відповідати фізичним межам матриці GPU (Tile Size, зазвичай 128 у поточній архітектурі).
Отримано базову формулу вирівнювання: G × (1 + D) ≤ 128
Трохи проаналізувавши, можна вивести остаточний постулат із путівника NVIDIA:
D = 128G − 1
Тут G — це кількість груп уваги (співвідношення головок запиту та KV).
Це означає, що те, як ваша модель спочатку групує увагу, безпосередньо визначає, скільки символів має вгадати чернетка, щоб ідеально заповнити блоки GPU.
Якщо G=8, можна вгадати рівно 15 чернеток; якщо G=32, можна вгадати лише 3. Апаратне забезпечення не може перетнути межу: навіть якщо ви використали лише півблоку останнього Tile, обчислювальна потужність все одно сплачується за цілий блок.
Раніше декодування для спекуляцій було додатковим прискорювачем, який інженерна команда намагалася додати після навчання моделі. Але зараз фундаментальні фізичні закони говорять вам: постійна величина апаратної матриці безпосередньо впливає на параметри архітектури моделі.
У нашій пам’яті рідко трапляється, щоб виробники чіпів так само включали рівняння обмежень нижчого рівня до проекту великої моделі.
Фінал
Фокус конкурсу щодо ефективності роботи моделей повністю змінився.
Ера простого накоплення величезної кількості параметрів залишається позаду; зараз вирішуючим фактором є те, хто краще розуміє фізичні межі того шматка кремнію під ногами.
На цьому новому полі битви, де гігант чіпів змінив правила гри, китайська команда стала очевидним рішенням для зламу ситуації.
Такий гігант обчислювальних потужностей, як NVIDIA, природньо не буде вимагати, які алгоритми розміщені на полиці.
Але хто саме розробив цей оптимальний розв’язок, що вичавлює максимум з вузлів, чітко написано чорним по білому.
Цей матеріал надійшов із офіційного каналу WeChat «Новий розум», автор: ASI Апокаліпсис
