Конкуренция на рынке чипов для ИИ претерпевает глубокие изменения. OpenAI выпустила чип Jalapeño, ориентированный на инференс LLM, NVIDIA объединила GPU с LPU Groq для гетерогенных вычислений, а Google разделила обучение и инференс на два отдельных чипа: TPU 8t и TPU 8i. Эти три подхода отражают разные требования к аппаратным ресурсам для обучения и инференса: обучение ориентировано на матричные вычисления и масштабную связность, в то время как инференс требует более высокой пропускной способности HBM, большего объема SRAM и более коротких сетевых путей. По мере увеличения различий в конфигурации чипов для этих двух типов рабочих нагрузок FLOPS перестает быть единственным критерием оценки, и стоимость токена становится новым ориентиром в конкуренции чипов для ИИ.Автор статьи, источник: LeFeng.com
Стоимость токена становится новым ориентиром в конкуренции за аппаратное обеспечение для больших моделей
Embodied intelligence enters the greasy kitchen
Работа робота при миллионе просмотров
Бывший вице-президент Covariant AI, Чжоу Пу Шу Чжун, напрямую охарактеризовал роль LPU как заполнение пробела в области низкой задержки декодирования, связанного с Верой Рубин.

Чиповая архитектура Groq также почти полностью построена вокруг этого. Один стенд LPX содержит 256 LPU, в сумме имея всего 128 ГБ SRAM, объем которого нельзя сопоставить с HBM в GPU-стендах, но агрегированная пропускная способность SRAM может достигать 40 ПБ/с.
Этот дизайн ценит именно «близость». HBM может хранить много состояний модели, но находится дальше от вычислительных блоков; SRAM дорогой и сложно масштабируемый по объему, но данные находятся внутри чипа, обеспечивая чрезвычайно высокую пропускную способность и очень низкую задержку доступа.

Каждый шаг вычислений ограничен, и частый доступ к данным означает, что размещение данных ближе к АЛУ напрямую сократит время ожидания следующего токена.
Groq также дополнительно сократил динамическое управление оборудованием. LPU — это архитектура детерминированного выполнения, где планирование инструкций в основном выполняется программно заранее. Каждый чип одновременно выступает в роли процессора и маршрутизатора; компилятор совместно планирует вычислительные и сетевые ресурсы, даже отказываясь от таких механизмов, как традиционное аппаратное управление потоком и виртуальные каналы.

Это также имеет явные недостатки: такая архитектура менее универсальна, чем GPU, а встроенная SRAM не может вместить полное состояние крупной модели. Поэтому NVIDIA не заставила Groq 3 работать независимо со всей моделью, а создала более сложную гетерогенную систему.

Предзаполнение выполняется на GPU, большая часть декодирования переносится на LPU; внимание в декодировании может возвращаться обратно на GPU. GPU и LPU поддерживают собственные KV Cache, основной обмен происходит через черновые токены, а вычисления и коммуникация перекрываются с помощью микро-пакетов. Поскольку LPU является синхронной областью, а GPU и внешний KV Cache относятся к асинхронной системе, NVIDIA даже добавила FPGA в качестве асинхронного моста между ними.
Эта структура наглядно демонстрирует, насколько далеко зашла специализация AI-чипов. Она разделяет не только «чипы для обучения» и «чипы для вывода», но даже разные части одного процесса декодирования могут выполняться на разных архитектурах.
Однако данные, представленные NVIDIA, также показывают границы этого подхода: когда бизнес ориентирован исключительно на общую пропускную способность и может допустить более высокую задержку, Rubin GPU остается эффективным; по мере повышения требований к скорости обработки токенов для одного пользователя, LPX постепенно начинает проявлять свои преимущества, а при использовании большего количества LPU общая пропускная способность снижается.

Появление Groq 3 не означает, что GPU устарели для вывода. Это говорит о другом: одной и той же GPU сложно одновременно обеспечивать высокую пропускную способность и чрезвычайно низкую задержку; если разные аппаратные средства будут выполнять задачи в своих наиболее подходящих диапазонах, система сможет лучше развести кривую производительности.
Google же поместил этот разрез на более высоком уровне.

Обучение и вывод — две разные рецептуры чипов
Google на поколении TPU 8 одновременно создал TPU 8t и TPU 8i,t для обучения,i для вывода. Эта классификация отражена непосредственно в конфигурации памяти чипа.
На живой демонстрации Hot Chips TPU 8t использует 6 наборов HBM, а TPU 8i — 8. Google объясняет, что для вывода на единицу вычислений требуется больше HBM, а также более высокий процент SRAM, поэтому 8i выделяет больше ресурсов на SRAM, объем памяти и пропускную способность.

Эта разница заслуживает внимания. Если ИИ-чипы сравниваются только по производительности матричных вычислений, то версия для вывода не имеет смысла тратить столько площади чипа и ресурсов упаковки на память. Такая конструкция TPU 8i говорит о том, что Google видит узкое место уже в обеспечении данных.
При обучении большой размер пакета позволяет распределить стоимость чтения весов на множество токенов; при декодировании каждый раз генерируется мало токенов, но веса и KV-кэш по-прежнему часто доступны. Поэтому соотношение между количеством HBM-пропускной способности, необходимым на единицу FLOPS, различается для этих двух типов задач.
Google даже внедрила это различие в топологию сети. Ранее для TPU часто использовалась 3D Torus, которая лучше подходит для обучения и ориентирована на общую пропускную способность в крупных кластерах. TPU 8i поддерживает BoardFly, с более короткими сетевыми путями: максимальное количество прыжков в BoardFly составляет 7 hops, тогда как в 3D Torus — до 16 hops.

Для обучения после нескольких дополнительных сетевых прыжков обычно остается значительный объем матричных вычислений, поэтому время связи может быть амортизировано. Время вычислений на каждом шаге декодирования короткое, и задержки в сети в несколько прыжков легче попадают прямо в интервалы между токенами.
MoE еще больше делает эту проблему очевидной. MoE позволяет одному токену активировать только часть экспертов, что с точки зрения вычислительных затрат выгодно, но маршрутизатор отправляет токены различным экспертам. Как только эти эксперты расположены на разных чипах, вычисления уменьшаются, но увеличивается связь All-to-All.

Таким образом, TPU 8i также добавил Collective Acceleration Engine, который выполняет часть коллективных операций на I/O Die, расположенном рядом с сетевым интерфейсом. Данные не нужно сначала перемещать в Compute Die, а затем выполнять операции через HBM — это позволяет исключить часть внутренних перемещений данных в чипе.
Распределение ресурсов для тренировочной версии TPU 8t явно смещено в другую сторону. Тренировка требует огромного количества FLOPS, а также масштабируемой области для синхронизации параметров и градиентов. Superpod TPU 8t может масштабироваться до 9600 чипов, обладая примерно 2 ПБ общего разделяемого HBM и 121 EFLOPS FP4 агрегированной вычислительной мощностью; Google также внедрил для него сеть Virgo, создав специализированную архитектуру для соединения более масштабных тренировок.

Google также упомянул на месте очень практическую проблему проектирования чипов: dark silicon.
Площадь чипа и бюджет мощности ограничены. Если на одном и том же чипе одновременно разместить большое количество ресурсов для матричных вычислений, необходимых для обучения, а также дополнительные SRAM, HBM и низколатентные сети, требуемые для вывода, то при выполнении одной из рабочих нагрузок часть схем будет постоянно простаивать.

Поскольку обе задачи требуют разных соотношений ресурсов, проще сделать две отдельные чипы.
От FLOPS к токеномике
Поместив три маршрута вместе, различия становятся очевидными.
OpenAI делает Jalapeño, специализируя чипы на уровне вывода LLM, но сохраняя гибкое планирование Prefill и Decode на однородном оборудовании; NVIDIA продолжает разбивать дальше, распределяя разные этапы вывода между GPU и Groq LPU; Google разделяет сверху, превращая обучение и вывод в две отдельные TPU.
За этими направлениями не стоит никакого тайного нового вычислительного принципа — меняется лишь соотношение ресурсов. При обучении стремятся направить больше транзисторов на матричные вычисления и масштабную интерконнекцию, поскольку большой пакет позволяет распределить затраты на перемещение данных; для инференса с низкой задержкой требуется более высокая пропускная способность HBM, больший объем SRAM, лучшая локальность KV Cache и более короткие сетевые пути, поскольку много времени тратится на ожидание данных.
Когда требования двух типов нагрузок к «рецептуре чипа» все больше расходятся, использование одного универсального чипа для обслуживания обоих приводит к все более очевидным потерям эффективности.
Это также объясняет, почему ключевые цифры в этой волне аппаратной конкуренции меняются. FLOPS по-прежнему важны, но рядом начинают появляться Tokens/s/user, TBT, TTFT, Tokens/kW, пропускная способность HBM и сетевая задержка.
Они описывают на самом деле одно и то же: вычислительная мощность уже находится там, вопрос в том, сможет ли система постоянно подавать данные и как можно быстрее выводить сгенерированные токены.
У OpenAI, NVIDIA и Google сейчас разные представления о том, где должна проходить эта граница, и именно она, скорее всего, продолжит меняться в будущем.
Обучение и вывод можно разделить, Prefill и Decode можно разделить, а внутри Decode внимание и другие вычисления также можно дополнительно разделить. Чем тоньше разделение, тем легче повысить эффективность отдельных операций, но планирование ресурсов, перемещение KV Cache и межустройственные коммуникации становятся сложнее.
Таким образом, следующая стадия конкуренции в области ИИ-чипов, возможно, уже не сводится только к созданию более мощного чипа.
Сложнее всего решить: какие задачи стоит выделить в отдельный чип, а какие оставить в той же аппаратной платформе, чтобы снизить общую стоимость токенов системы.
