OpenAI, NVIDIA и Google расходятся в дизайне чипов для инференса LLM

iconMetaEra
Поделиться
AI summary iconСводка
AI и крипто-новости: ключевые игроки расходятся в дизайне чипов для инференса LLM. OpenAI’s Jalapeño ориентирован на инференс, NVIDIA сочетает GPU с LPU от Groq, а Google разделяет TPU 8t и 8i для обучения и инференса. Для инференса теперь требуются более высокая пропускная способность HBM, больший объем SRAM и более тесные сетевые пути. По мере того как чипы становятся более специализированными под конкретные задачи, стоимость токена становится все более важной наряду с FLOPS. Обновление стратегии проектирования сети переформировывает конкуренцию в области аппаратного обеспечения для ИИ.
Конкуренция на рынке чипов для ИИ претерпевает глубокие изменения. OpenAI выпустила чип Jalapeño, ориентированный на инференс LLM, NVIDIA объединила GPU с LPU Groq для гетерогенных вычислений, а Google разделила обучение и инференс на два отдельных чипа: TPU 8t и TPU 8i. Эти три подхода отражают разные требования к аппаратным ресурсам для обучения и инференса: обучение ориентировано на матричные вычисления и масштабную связность, в то время как инференс требует более высокой пропускной способности HBM, большего объема SRAM и более коротких сетевых путей. По мере увеличения различий в конфигурации чипов для этих двух типов рабочих нагрузок FLOPS перестает быть единственным критерием оценки, и стоимость токена становится новым ориентиром в конкуренции чипов для ИИ.

Автор статьи, источник: LeFeng.com

Стоимость токена становится новым ориентиром в конкуренции за аппаратное обеспечение для больших моделей

Embodied intelligence enters the greasy kitchen

Работа робота при миллионе просмотров

Бывший вице-президент Covariant AI, Чжоу Пу Шу Чжун, напрямую охарактеризовал роль LPU как заполнение пробела в области низкой задержки декодирования, связанного с Верой Рубин.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Чиповая архитектура Groq также почти полностью построена вокруг этого. Один стенд LPX содержит 256 LPU, в сумме имея всего 128 ГБ SRAM, объем которого нельзя сопоставить с HBM в GPU-стендах, но агрегированная пропускная способность SRAM может достигать 40 ПБ/с.

Этот дизайн ценит именно «близость». HBM может хранить много состояний модели, но находится дальше от вычислительных блоков; SRAM дорогой и сложно масштабируемый по объему, но данные находятся внутри чипа, обеспечивая чрезвычайно высокую пропускную способность и очень низкую задержку доступа.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Каждый шаг вычислений ограничен, и частый доступ к данным означает, что размещение данных ближе к АЛУ напрямую сократит время ожидания следующего токена.

Groq также дополнительно сократил динамическое управление оборудованием. LPU — это архитектура детерминированного выполнения, где планирование инструкций в основном выполняется программно заранее. Каждый чип одновременно выступает в роли процессора и маршрутизатора; компилятор совместно планирует вычислительные и сетевые ресурсы, даже отказываясь от таких механизмов, как традиционное аппаратное управление потоком и виртуальные каналы.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Это также имеет явные недостатки: такая архитектура менее универсальна, чем GPU, а встроенная SRAM не может вместить полное состояние крупной модели. Поэтому NVIDIA не заставила Groq 3 работать независимо со всей моделью, а создала более сложную гетерогенную систему.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Предзаполнение выполняется на GPU, большая часть декодирования переносится на LPU; внимание в декодировании может возвращаться обратно на GPU. GPU и LPU поддерживают собственные KV Cache, основной обмен происходит через черновые токены, а вычисления и коммуникация перекрываются с помощью микро-пакетов. Поскольку LPU является синхронной областью, а GPU и внешний KV Cache относятся к асинхронной системе, NVIDIA даже добавила FPGA в качестве асинхронного моста между ними.

Эта структура наглядно демонстрирует, насколько далеко зашла специализация AI-чипов. Она разделяет не только «чипы для обучения» и «чипы для вывода», но даже разные части одного процесса декодирования могут выполняться на разных архитектурах.

Однако данные, представленные NVIDIA, также показывают границы этого подхода: когда бизнес ориентирован исключительно на общую пропускную способность и может допустить более высокую задержку, Rubin GPU остается эффективным; по мере повышения требований к скорости обработки токенов для одного пользователя, LPX постепенно начинает проявлять свои преимущества, а при использовании большего количества LPU общая пропускная способность снижается.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Появление Groq 3 не означает, что GPU устарели для вывода. Это говорит о другом: одной и той же GPU сложно одновременно обеспечивать высокую пропускную способность и чрезвычайно низкую задержку; если разные аппаратные средства будут выполнять задачи в своих наиболее подходящих диапазонах, система сможет лучше развести кривую производительности.

Google же поместил этот разрез на более высоком уровне.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Обучение и вывод — две разные рецептуры чипов

Google на поколении TPU 8 одновременно создал TPU 8t и TPU 8i,t для обучения,i для вывода. Эта классификация отражена непосредственно в конфигурации памяти чипа.

На живой демонстрации Hot Chips TPU 8t использует 6 наборов HBM, а TPU 8i — 8. Google объясняет, что для вывода на единицу вычислений требуется больше HBM, а также более высокий процент SRAM, поэтому 8i выделяет больше ресурсов на SRAM, объем памяти и пропускную способность.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Эта разница заслуживает внимания. Если ИИ-чипы сравниваются только по производительности матричных вычислений, то версия для вывода не имеет смысла тратить столько площади чипа и ресурсов упаковки на память. Такая конструкция TPU 8i говорит о том, что Google видит узкое место уже в обеспечении данных.

При обучении большой размер пакета позволяет распределить стоимость чтения весов на множество токенов; при декодировании каждый раз генерируется мало токенов, но веса и KV-кэш по-прежнему часто доступны. Поэтому соотношение между количеством HBM-пропускной способности, необходимым на единицу FLOPS, различается для этих двух типов задач.

Google даже внедрила это различие в топологию сети. Ранее для TPU часто использовалась 3D Torus, которая лучше подходит для обучения и ориентирована на общую пропускную способность в крупных кластерах. TPU 8i поддерживает BoardFly, с более короткими сетевыми путями: максимальное количество прыжков в BoardFly составляет 7 hops, тогда как в 3D Torus — до 16 hops.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Для обучения после нескольких дополнительных сетевых прыжков обычно остается значительный объем матричных вычислений, поэтому время связи может быть амортизировано. Время вычислений на каждом шаге декодирования короткое, и задержки в сети в несколько прыжков легче попадают прямо в интервалы между токенами.

MoE еще больше делает эту проблему очевидной. MoE позволяет одному токену активировать только часть экспертов, что с точки зрения вычислительных затрат выгодно, но маршрутизатор отправляет токены различным экспертам. Как только эти эксперты расположены на разных чипах, вычисления уменьшаются, но увеличивается связь All-to-All.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Таким образом, TPU 8i также добавил Collective Acceleration Engine, который выполняет часть коллективных операций на I/O Die, расположенном рядом с сетевым интерфейсом. Данные не нужно сначала перемещать в Compute Die, а затем выполнять операции через HBM — это позволяет исключить часть внутренних перемещений данных в чипе.

Распределение ресурсов для тренировочной версии TPU 8t явно смещено в другую сторону. Тренировка требует огромного количества FLOPS, а также масштабируемой области для синхронизации параметров и градиентов. Superpod TPU 8t может масштабироваться до 9600 чипов, обладая примерно 2 ПБ общего разделяемого HBM и 121 EFLOPS FP4 агрегированной вычислительной мощностью; Google также внедрил для него сеть Virgo, создав специализированную архитектуру для соединения более масштабных тренировок.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Google также упомянул на месте очень практическую проблему проектирования чипов: dark silicon.

Площадь чипа и бюджет мощности ограничены. Если на одном и том же чипе одновременно разместить большое количество ресурсов для матричных вычислений, необходимых для обучения, а также дополнительные SRAM, HBM и низколатентные сети, требуемые для вывода, то при выполнении одной из рабочих нагрузок часть схем будет постоянно простаивать.

Jalapeño показал впечатляющие результаты, и путь GPU-вывода начал разделяться?

Поскольку обе задачи требуют разных соотношений ресурсов, проще сделать две отдельные чипы.

От FLOPS к токеномике

Поместив три маршрута вместе, различия становятся очевидными.

OpenAI делает Jalapeño, специализируя чипы на уровне вывода LLM, но сохраняя гибкое планирование Prefill и Decode на однородном оборудовании; NVIDIA продолжает разбивать дальше, распределяя разные этапы вывода между GPU и Groq LPU; Google разделяет сверху, превращая обучение и вывод в две отдельные TPU.

За этими направлениями не стоит никакого тайного нового вычислительного принципа — меняется лишь соотношение ресурсов. При обучении стремятся направить больше транзисторов на матричные вычисления и масштабную интерконнекцию, поскольку большой пакет позволяет распределить затраты на перемещение данных; для инференса с низкой задержкой требуется более высокая пропускная способность HBM, больший объем SRAM, лучшая локальность KV Cache и более короткие сетевые пути, поскольку много времени тратится на ожидание данных.

Когда требования двух типов нагрузок к «рецептуре чипа» все больше расходятся, использование одного универсального чипа для обслуживания обоих приводит к все более очевидным потерям эффективности.

Это также объясняет, почему ключевые цифры в этой волне аппаратной конкуренции меняются. FLOPS по-прежнему важны, но рядом начинают появляться Tokens/s/user, TBT, TTFT, Tokens/kW, пропускная способность HBM и сетевая задержка.

Они описывают на самом деле одно и то же: вычислительная мощность уже находится там, вопрос в том, сможет ли система постоянно подавать данные и как можно быстрее выводить сгенерированные токены.

У OpenAI, NVIDIA и Google сейчас разные представления о том, где должна проходить эта граница, и именно она, скорее всего, продолжит меняться в будущем.

Обучение и вывод можно разделить, Prefill и Decode можно разделить, а внутри Decode внимание и другие вычисления также можно дополнительно разделить. Чем тоньше разделение, тем легче повысить эффективность отдельных операций, но планирование ресурсов, перемещение KV Cache и межустройственные коммуникации становятся сложнее.

Таким образом, следующая стадия конкуренции в области ИИ-чипов, возможно, уже не сводится только к созданию более мощного чипа.

Сложнее всего решить: какие задачи стоит выделить в отдельный чип, а какие оставить в той же аппаратной платформе, чтобы снизить общую стоимость токенов системы.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.