NVIDIA публикует руководство по инференсу ИИ, 6-кратное ускорение без потерь достигнуто китайскими командами

icon MarsBit
Поделиться
AI summary iconСводка
NVIDIA выпустила руководство по инференсу ИИ 2 сентября, представив шесть методов ускорения. Китайские команды возглавили ключевые инновации, такие как спекулятивное декодирование и DFlash, обеспечивающие 6-кратное безпотерянное ускорение. Индекс страха и жадности остается на высоком уровне, поскольку альткоины на внимание набирают популярность. Ограничения оборудования, такие как размеры тайлов GPU, влияют на проектирование моделей. Метод MTP DeepSeek-V3 и другие технологии подчеркиваются за эффективность. В руководстве подробно описаны стоимость и сценарии использования каждого подхода.

Недавно NVIDIA опубликовала официальное руководство по выводу больших моделей, но, листая его, казалось, будто читаешь сборник статей китайской команды.

Так дело обстоит.

2 сентября на техническом блоге NVIDIA была опубликована подробная статья «Декодирование совместного проектирования моделей ИИ с помощью спекуляций».

Суть статьи — таблица сравнения, в которой представлены шесть самых популярных решений для ускорения вывода, причем полностью раскрыты такие аспекты, как стоимость обучения и подходящие сценарии применения.

DeepSeek

Его значимость заключается в том, что лидер в области чипов крайне редко официально оформил в виде стандарта, как следует проектировать модели, чтобы максимально использовать физические пределы оборудования.

Когда они оглядываются в поисках оптимальных решений, способных танцевать на пределе кремниевых чипов, ключевые решения, включенные в руководство, почти полностью разработаны командами из Китая.

Это уже выходит за рамки обычного обзора алгоритмов. Что именно раскрывает эта таблица? Разберем ее построчно.

Почти чистая прибыль: что делает Spooky Scary Skeletons

Чтобы понять эту таблицу, сначала нужно разобраться, что такое «спекулятивное декодирование».

Крупные модели произносят слова по одному. Каждое слово требует полного прохождения сотен гигабайт параметров через видеопамять. На самом деле, большую часть времени вычислительные ресурсы просто ожидают, пока память перенесёт данные.

Решение «Спекулятивного декодирования» очень простое и прямолинейное —

Сначала используйте легкую небольшую модель для предварительного прогноза и сразу угадайте 7 символов; затем крупная модель одновременно проверяет эти 7 символов.

Проверка семи символов и написание одного собственного символа занимают примерно одинаковое время, ведь вес всё равно придётся перенести.

Угадавшие — получают сразу, не угадавшие — начинают заново с точки останова. Поскольку крупная модель принимает только те символы, которые сама умеет писать, финальный вывод не требует никаких изменений даже в пунктуации. Это и есть то, что называется «безпотерянным ускорением».

DeepSeek

В этой игре вся добыча вычислительной мощности строится вокруг одной ключевой формулы математического ожидания:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

Числитель — это ожидаемая выгода 𝔼[L], представляющая ожидаемую длину принятого фрагмента (среднее количество символов, которые крупная модель выбирает за один цикл).

Знаменатель — это дополнительные затраты, которые вы несете: время, затраченное малой моделью на прогноз (Tdraft), плюс время окончательной проверки большой моделью (Tverify).

Чтобы добиться безумного роста ускорения, есть всего два пути: либо увеличить числитель (угадывать точнее), либо максимально сократить знаменатель (угадывать быстрее).

Ступая на плечах конкурентов, достигнув четвертого поколения эволюции

Прослеживая эту таблицу NVIDIA сверху вниз, вы увидите четкую основную линию борьбы.

Первая строка — это самая старая «внешняя модель черновика», для неё нужно отдельно обучить небольшую модель в качестве помощника.

NVIDIA сразу же представила огромный счет: обучение с нуля требует от 1T до 10T токенов, что сопряжено с очень высокими затратами.

Однако он остается в списке, потому что NVIDIA назначила ему конкретную судьбу — они потратили 20 миллиардов долларов на приобретение чипов Groq (LPU).

Последний метод — это поиск по таблице n-грамм без обучения, который просто копирует повторяющиеся фрагменты из предыдущего текста и подходит только для жестких сценариев, где требуется копирование и вставка больших объемов текста.

На самом деле, эволюция технологий представлена этими четырьмя строками посередине.

DeepSeek

Вторая строка: EAGLE-3.

Команда из Пекинского университета, Юхуи Ли, Университета Ватерлоо, Хоньяна Чжана и др.

Проходя от ICML и EMNLP до NeurIPS, за три года выпустил три поколения, доведя этот последовательный старый путь «угадывания по одному слову» до физического предела.

Он был абсолютным лидером в этой области, но в новой таблице NVIDIA его переместили на «позицию справочника» — причина кратка: длина приема уже превышена последующими волнами.

Третья строка: MTP (многотокенное прогнозирование).

Хотя идея была впервые представлена Meta в 2024 году, именно она превратила это в стандарт для вывода больших моделей DeepSeek -V3.

NVIDIA получает от него высокую оценку — лучший выбор для больших моделей на GPU. Суть в том, что эта схема должна обучаться совместно с основной моделью на этапе предварительного обучения.

Четвертая строка: DFlash. Сильная сторона с 6-кратным беспотерянным ускорением.

Три автора: Цзянь Чэнь, Ешэн Лян, Чжиджань Лю. Он полностью отказался от последовательного подхода EAGLE и MTP, основанного на угадывании по одному символу за раз, и вместо этого воспользовался идеей диффузионных моделей: за один прямой проход он сразу генерирует последовательность из 7 токенов, максимально сократив знаменатель (время).

Кстати, научный руководитель Чжиджянь Лю — ассистент-профессор UCSD, но он также является исследовательским ученым в лаборатории NVIDIA.

Пятая строка: DSpark. Разработано командой из 24 человек, объединившей DeepSeek и Пекинский университет.

Параллельная архитектура DFlash быстра, но у нее есть смертельный недостаток: чем дальше, тем менее точно угадываются результаты. Чтобы искусственно увеличить длину (длину приема), DSpark добавил к параллельной базе чрезвычайно легкий последовательный модуль.

Фактические данные очень наглядны: длина приема выше на近30% по сравнению с EAGLE-3 и на 18% по сравнению с DFlash. В DeepSeek В онлайн-продакшн-среде V4 скорость на 60–85% выше, чем у MTP.

Hardware constants, reverse lockout model architecture

Эти четыре поколения технологий смогли выжать вычислительную мощность до такого уровня не только благодаря изобретательности алгоритмов.

Многие считают, что чем больше загадок в черновике, тем больше прибыли, но это полностью игнорирует физические законы кремниевых пластин.

Когда механизм внимания занимает основную часть времени декодирования, общее количество токенов, которые необходимо обработать на этапе проверки большой модели, составляет 1+D (1 реальный вход + D предсказанных черновиков).

Чтобы передать эти данные на GPU, аппаратное обеспечение на низком уровне группирует заголовки запросов и заголовки KV, при этом размер блока внимания для каждой группы строго ограничен физическими границами матрицы GPU (Tile Size, обычно 128 в текущей архитектуре).

Теперь у вас есть базовая формула выравнивания: G × (1 + D) ≤ 128

Немного проанализировав, можно прийти к финальному постоянному принципу из руководства NVIDIA:

D = 128G − 1

В этом случае G — это количество групп внимания (соотношение голов запросов и голов KV).

Это означает, что то, как ваша модель изначально группирует внимание, напрямую определяет, сколько символов должен угадывать черновик, чтобы идеально заполнить блоки GPU.

Если G=8, то можно угадать ровно 15 черновиков; если G=32, то можно угадать только 3. Аппаратное обеспечение не может преодолеть границу: даже если вы использовали только половину последнего Tile, вы всё равно платите за целый блок вычислительной мощности.

Раньше декодирование с прогнозированием было дополнительным ускорителем, который инженерная команда добавляла после завершения обучения модели. Но теперь фундаментальные физические законы говорят вам: константа аппаратной матрицы напрямую обратно влияет на параметры архитектуры модели.

Мы привыкли, что производители чипов редко включают уравнения ограничений нижележащего оборудования прямо в проектные чертежи больших моделей.

Эпилог

Фокус конкуренции за эффективность работы моделей полностью изменился.

Эпоха простого накопления огромных параметров подходит к концу; сегодня решающее значение имеет то, кто лучше понимает физические пределы того самого кремниевого чипа.

На этой новой арене, где гиганты чипов перевернули правила, китайская команда стала очевидным решением для прорыва.

Такой гигант вычислительных мощностей, как NVIDIA, естественно, не будет придираться к тому, какие алгоритмы стоят на полке.

Но кто именно разработал этот оптимальный метод, максимально использующий возможности кремниевых пластин, четко указано на бумаге.

Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.