Автор: SemiAnalysis
Перевод: Shenchao TechFlow
Обзор Shenchao: Раскрыты тестовые данные первого собственного процессора для вывода OpenAI — Jalapeño, чья энергоэффективность превосходит нынешний флагманский чип NVIDIA Blackwell и приближается к следующему поколению Rubin. Для компаний, страдающих от энергетических ограничений в центрах обработки данных, этот чип может изменить структуру рынка вычислительных мощностей. Однако остается вопросом, сможет ли первый поколение чипа по-настоящему подорвать экосистему CUDA NVIDIA.
Сравнение полной стоимости владения, пропускной способности на мегаватт и острых деталей между собственными ASIC и Rubin, Jalapeño
В течение последних двух лет OpenAI тайно разрабатывала процессор «Jalapeño», который только что был представлен на конференции Hot Chips. Слухи об успешном потоке чипа ходили уже некоторое время. Теперь у нас есть детали. OpenAI пригласила нас ознакомиться с чипом, посетить лабораторию для проверки его реальности и провести тестирование с помощью нашего набора InferenceX.
В июне этого года OpenAI объявила о проекте чипа в сотрудничестве с Broadcom, разработанного с нуля специально для инференса LLM. Работы по проектированию начались в середине 2024 года, и от первоначального найма команды до производства чипа прошло всего около 16 месяцев — это крайне быстрый цикл разработки ASIC.
Обычно чипы первого поколения не обладают конкурентоспособностью, но OpenAI пошла против тенденции: на нескольких ведущих открытых моделях она превзошла все чипы NVIDIA, AMD и Google, которые мы смогли протестировать, заняв лидирующие позиции в отрасли. OpenAI добилась этого благодаря исключительной совместной оптимизации программного и аппаратного обеспечения. Неожиданно, но OpenAI не сосредоточилась чрезмерно на каком-либо конкретном этапе вывода модели, а вместо этого разработала универсальный чип, обеспечивающий высокую производительность во всех сценариях.
В этой статье подробно рассматриваются архитектурные, программные детали и результаты производительности Jalapeño на InferenceX.

Универсальный чип для выводов
Все говорят, что чипы OpenAI созданы специально для моделей OpenAI, но это неверно: OpenAI разработала универсальный чип для AI-выводов.
Сроки безумны. Это подтверждает, что утверждение «ускорение проектирования чипов с помощью ИИ» действительно верно. Несмотря на быстрые сроки, OpenAI вложила огромные средства, приняла практичные проектные решения и обладает сильной командой, поэтому это не удивительно.
Просто по спецификациям он сразу становится серьезным конкурентом:

А использование HBM4 делает его достаточно мощным, чтобы конкурировать с флагманскими GPU от NVIDIA и AMD:

Многие СМИ следовали за случайными заявлениями OpenAI, утверждая, что этот чип будет оптимизирован для их моделей способами, недоступными другим чипам. Это неверно. Jalapeño — это универсальный чип для вывода, способный запускать различные модели и рабочие нагрузки, включая наш базовый тест InferenceX — мы запускали этот тест в лаборатории вместе с инженерами OpenAI. В шутку OpenAI даже показали нам, как на этом чипе запускается Doom — игра, перенесенная на их чип исключительно с помощью подсказок Codex.
Ниже представлены наши ключевые результаты по производительности на ватт: пропускная способность токенов на мегаватт общего энергопотребления. Jalapeño значительно превосходит все остальные чипы. При этом все эти результаты получены без использования многотокенной предикции (MTP), в то время как другие чипы на графике настроены на оптимальные параметры своих SKU и имеют включённую MTP.

Jalapeño во всех сценариях превосходит Blackwell по производительности на ватт, не будучи оптимизированным под конкретную точку на кривой. Он отлично справляется как с низкими задержками, так и с высокой пропускной способностью. Более справедливое сравнение — по одному токену на предсказание: Jalapeño значительно опережает каждого конкурента. При низкой параллельности Jalapeño демонстрирует удивительную интерактивность: на модели DeepSeek R1 при параллельности 1 он обеспечивает более 700 токенов на пользователя в секунду.
Неожиданно, что всё это достигнуто с помощью однотокенного прогнозирования (STP), без предсказательного декодирования и без разделения предзаполнения и декодирования. Помимо DeepSeek R1, мы также наблюдали другие модели, такие как Kimi-K2.5 и GPT-OSS, которые достигают примерно 1400 токенов на пользователя в секунду. Для всех моделей мы подтвердили, что результаты Jalapeño на GSM8k совпадают с результатами на чипах NVIDIA.
Вот несколько важных замечаний. Во-первых, все данные предоставлены OpenAI. Мы лично протестировали InferenceX в лаборатории, но не запускали полный набор тестов InferenceX и не видели результаты AgentX. AgentX — наш предпочтительный набор тестов для сравнения производительности чипов, поскольку его набор данных с сверхдлинными контекстами и многократными циклами отражает поведение кэша при реальных производственных нагрузках. Фреймворки, показывающие хорошие результаты на 8k1k, могут демонстрировать худшую производительность на AgentX, поскольку реальные производственные нагрузки нагружают такие компоненты, как маршрутизаторы, механизмы кэширования префиксов, управление кэшем и инфраструктура выгрузки. Однократный тест 8k1k не охватывает эти аспекты. Подробнее читайте в нашей статье об AgentX.
AgentX - InferenceXv3: Удержит ли CUDA-барьер в инференсе агентов?
Во-вторых, мы считаем, что сравнение с Blackwell несколько неполное и не совсем справедливое. Настоящим конкурентом Jalapeño являются чипы, такие как Rubin, также использующие HBM4. Система Vera Rubin уже начала поставки клиентам, тогда как Jalapeño от OpenAI пока имеет только инженерные образцы и еще не готов к серийному производству.
Поэтому производительность действительно должна сравниваться с Rubin, а не с Blackwell. С точки зрения логики, мы и ожидали, что такие специализированные чипы, как Jalapeño, превзойдут Blackwell. Производительность на ватт Vera Rubin NVL72 в 5,4 раза выше, чем у GB200 NVL72 — об этом мы писали в прошлом месяце в статье, анализирующей заявления NVIDIA и CoreWeave о производительности. Позже мы сравним Jalapeño с данными по производительности Vera Rubin за июль.
Vera Rubin NVL72 против GB200 NVL72? Анализ TCO и архитектуры
В-третьих, модель, протестированная в этом исследовании, не является самой передовой в открытых источниках. NVIDIA и AMD уже опубликовали результаты для более крупных моделей, таких как DeepSeek V4 Pro и Kimi K3, с использованием AgentX. Чем больше модель и чем новее её выпуск, тем сложнее её запустить на новых чипах. Тем не менее, модель, запущенная OpenAI на Jalapeño, также не является небольшой.
Performance analysis
Целью проектирования OpenAI является производительность на ватт. Причина проста: OpenAI в настоящее время ограничена электропитанием центров обработки данных, а не бюджетом или площадью серверных помещений, поэтому количество токенов на мегаватт имеет решающее значение. На Computex 2026 Хуан Ренсюнь заявил, что производительность на ватт, надежность и долгий срок службы являются ключевыми характеристиками будущих GPU. Он сказал дословно: «Если у вас есть один гигаватт электроэнергии, то пропускная способность на ватт — это доход». Он также отметил, что нет смысла выбирать неправильную архитектуру только потому, что чип дешевле.

NVIDIA также подчеркнула это в выступлении Vera на Hot Chips 2026, представив ту же диаграмму доходов: «Сегодня центры обработки данных ограничены электропитанием». Электропитание имеет решающее значение и определяет доходы.
Поставщики услуг не могут легко получить дополнительные мегаватты. Временные рамки увеличения мощности GPU и расширения емкости электросети сильно различаются. Пределы электропитания центров обработки данных ограничены множеством факторов, таких как подключение к энергосистеме, инфраструктура, возможности охлаждения и проектные решения для ИБП/резервных генераторов. Задержки в подключении к электросети часто превышают сроки разработки оборудования и строительства, что порождает спрос на мощность за пределами счетчика. То есть строительство газовых турбин и локальных генераторов непосредственно на территории центра обработки данных. Эти мощности расположены за пределами счетчика энергоснабжающей компании и не зависят от общественной электросети. Это позволяет операторам обеспечивать питание объектов, не дожидаясь подключения к электросети и модернизации инфраструктуры энергокомпаний. Именно поэтому Colossus 2 xAI сильно полагается на мощность за пределами счетчика, в то время как его фактическое подключение к электросети значительно отстает. Более подробную информацию см. в нашей энергетической модели.
Как мы написали в посте в X, tok/s/MW можно упростить до количества токенов на джоуль. Поскольку ватт — это джоуль в секунду, tok/s/MW обозначает эффективность системы и способность преобразовывать энергию в токены.

В этом отношении Jalapeño превосходит даже Rubin. Токен-пропускная способность OpenAI Jalapeño на мегаватт STP превышает результаты Vera Rubin по MTP. Этот результат был опубликован NVIDIA и CoreWeave в июле. Он также значительно превосходит результаты GB200 за 2025 год. Как мы упоминали в статье о Vera Rubin, сравнение VR с результатами GB200 за 2025 год обусловлено тем, что оба находятся на схожей ранней стадии запуска. Одновременно сравнение с GB200 за 2025 год позволяет сохранить одинаковый уровень зрелости программного обеспечения. В соответствии с этой логикой мы сравниваем три результата: последний результат Vera Rubin за июль 2026 года, результат GB200 за 2025 год и текущий результат Jalapeño. Это сравнение крайне обоснованно, поскольку эти данные являются лучшими доступными публичными данными по Rubin. Кроме того, OpenAI выпустила собственный чип после Rubin. И OpenAI, и Rubin пока находятся на нестадийной стадии, поэтому их производительность будет продолжать расти.

По производительности и полной стоимости владения (TCO) Vera Rubin и Jalapeño равны: на каждый доллар расходов они генерируют почти одинаковое количество выходных токенов. Однако, как уже упоминалось, результаты Jalapeño не используют предсказательное декодирование, в то время как результаты Vera Rubin — используют. Предсказательное декодирование позволяет снизить стоимость на токен примерно в 3–5 раз. После внедрения предсказательного декодирования Jalapeño станет еще более выгодным с точки зрения стоимости предоставления токенов. Конечно, часть преимуществ по TCO обусловлена отказом от высокой маржи NVIDIA в пользу более низкой (но все еще высокой) маржи Broadcom. Однако это не единственная причина. Например, проекты AI ASIC от Meta и Microsoft, несмотря на более длительные инвестиции, так и не были успешно реализованы. Это указывает на то, что стоимость — лишь одна из составляющих уравнения. Полный разбор TCO для Jalapeño см. в модели SemiAnalysis AI Cloud TCO.

В архитектуре OpenAI было принято решение не разделять предзаполнение (prefill) и декодирование (decode) на разные пулы чипов. Черновая модель и основная модель используют одни и те же чипы и структуры межсоединений. Этот подход жертвует частью теоретической эффективности ради практической удобства эксплуатации. Мотивация заключается в том, что структура рабочей нагрузки со временем меняется. Например, соотношение между вводом, записью кэша, чтением кэша и выводом токенов значительно изменилось. Это изменение произошло после прохождения трех эпох моделей: знаний, рассуждений и агентов, как обсуждалось в наших недавних статьях. Следовательно, фиксированное выделение разнородных чипов для предзаполнения и декодирования со временем привело бы к снижению эффективности. OpenAI в данной архитектуре выбрала гомогенный пул и стремится обеспечить высокую производительность чипов при выполнении всех задач.
И это действительно так. На Kimi K2.5 (основанном на модели Cursor Composer 2.5) Jalapeño достигает почти 700 tok/s/user. Эта скорость более чем в 9 раз превышает показатель второго по эффективности чипа — 100 tok/s/user.

На GPT-OSS снова полное превосходство. Энергоэффективность Jalapeño по объему взаимодействий на мегаватт почти вдвое превышает максимальную пропускную способность GB200 и более чем в 50 раз превышает пропускную способность GB200 при параллельности 1. Для более высокой параллельности Jalapeño использует EP8.

Эти результаты впечатляют! Однако мы должны быть требовательны: это всего лишь 8k1k, с гораздо более низкой сложностью тонкой настройки и без данных выполнения AgentX. Как мы упоминали в статье о AgentX, многократные и длинные контекстные рабочие нагрузки создают большую нагрузку на многие аспекты стека вывода, например, на маршрутизаторы и кэши префиксов. Для отличной производительности при рабочих нагрузках агента требуется еще больше оптимизации. Подробнее читайте в статье о AgentX.
AgentX - InferenceXv3: Может ли CUDA-ровень сохраниться в инференсе агентов?
Подробные спецификации и архитектура
Все эти результаты получены на A0-итерации Jalapeño, всего через 9 месяцев после запуска проекта. Однако B0-итерация уже находится на производстве! Оптимизации B0 обеспечивают примерно на 25% более высокую производительность на ватт по сравнению с ранними A0-чипами. Конкретно, B0-итерация достигает 13,4 PFLOPs MXFP4 на одном чипе с размером маски. Этот чип изготовлен по технологии TSMC N3P. Для сравнения, один чип Rubin в аналогичных размерах и на том же узле достигает 17,5 PFLOPs плотного Rubin NVFP4.
Учитывая, что TDP Jalapeño составляет всего 700 Вт, в то время как у Rubin каждый вычислительный чип потребляет 900–1150 Вт, эта производительность выглядит еще более впечатляющей. Поскольку Jalapeño ориентирован на вывод, а не на обучение, OpenAI не нуждается в повышении TDP для максимизации FLOPs. Это понятно. Однако, тем не менее, приведенные выше результаты показывают, что Jalapeño обеспечивает значительные пиковые теоретические FLOPs.
При прямом сравнении с другими ускорителями Jalapeño обладает наивысшей пропускной способностью HBM на ватт и наивысшей производительностью в FLOPs на ватт, что сопоставимо с конфигурацией Rubin Max-Q мощностью 1800 Вт.

Jalapeño будет оснащен HBM4 и станет одним из первых чипов, использующих эту технологию, опередив даже существующие проекты TPU и Trainium. Одним из ключевых архитектурных принципов Jalapeño является максимальное использование пропускной способности HBM, поэтому использование не самых передовых решений HBM противоречило бы этой цели. Это обеспечивает пропускную способность памяти на уровне 15,4 ТБ/с на упаковку, что превышает все другие доступные ускорители, использующие HBM3E. Пропускная способность 15,4 ТБ/с указывает на то, что HBM4 достигает скорости вывода 10 Гбит/с, что немного выше, чем 9,6 Гбит/с у HBM4 в Rubin от Nvidia. HBM, скорее всего, поставляется Samsung.

OpenAI завершила поток Jalapeño в ноябре 2025 года, точнее — поток CoWoS, а не только верхний чип. За 9 месяцев после потока в ноябре 2025 года и всего лишь 3 месяца отладки на реальном кремнии OpenAI уже получила отличные результаты с Jalapeño. Это еще более впечатляет, учитывая, что команда начала с нуля в разработке программного стека.
В то же время, поток CoWoS от Rubin был завершен в октябре 2025 года, на месяц раньше, но единственные ранние результаты, которые мы сейчас видим, поступают от инженерных образцов CoreWeave. Nvidia не позволила нам тестировать и публиковать результаты бенчмарков, как это сделала OpenAI, что указывает на то, что программное обеспечение их чипов все еще несовершенно. Учитывая, что OpenAI так быстро запустила новые модели на собственных чипах, защитный барьер CUDA, возможно, исчез.
Они все еще далеки от оптимизации, и мы видим, что в целом Jalapeño предоставил лучшие данные. Мы не считаем, что оборудование Nvidia хуже, а скорее то, что программная отладка Jalapeño продвигается быстрее, чем у Nvidia. Это демонстрирует мощь совместного проектирования аппаратного и программного обеспечения — именно в этой области команды ASIC в ведущих лабораториях могут превзойти более зрелых коммерческих производителей чипов. Противоречащая интуиции мысль заключается в том, что начало с нуля также может принести пользу OpenAI, поскольку она может принимать совершенно новые архитектурные решения, не будучи ограниченной обратной совместимостью или старыми версиями программного обеспечения.
Хотя у OpenAI уже есть инженерный образец Jalapeño, серийное производство планируется постепенно наращивать в 2027 году, большая часть выпуска запланирована на конец следующего года. Более подробную информацию о количестве единиц и средней цене продажи см. в модели SemiAnalysis Accelerator.
Можно сказать, что OpenAI Jalapeno — это настоящий масштабный ASIC.
В сравнении с временной шкалой Rubin, скорость Jalapeño поразительна. Как уже показано, несмотря на то, что Rubin начал раньше, результаты Jalapeño превосходят результаты Rubin.

Архитектура Jalapeño
С точки зрения архитектуры, матричный движок этого чипа использует формат чисел MXFP и пульсирующий массив для хранения весов, аналогично TPU. Однако, в отличие от прямого сравнения с TPU, он поддерживает более мелкие формы/измерения, что означает отсутствие странных падений производительности, характерных для матричных умножений с несовпадающими формами на более крупных пульсирующих массивах.
Он также оснащен 64-битным скалярным ядром и векторными ядрами FP32/INT32. OpenAI также внедрила избыточность на уровне подложки и встроила восстановление выходного качества на уровне ядер и каналов. Они утверждают, что использование ИИ при проектировании чипа позволило сократить площадь SIMD на 8% и площадь матричного движка на 10%. Хотя они не указали конкретные условия PVT (технология/напряжение/температура), они отметили, что модуль с ИИ-помощью улучшил тайминги и энергопотребление по сравнению с первоначальным модулем.
Архитектура Jalapeño направлена на устранение перемещения памяти KVCache и весов, а также на фиксированную задержку и накладные расходы, чтобы приближаться к исходной пиковой производительности/пропускной способности даже при малых пакетах или малых форматах по сравнению с другими ускорителями.
Ядра и HBM разделены на несколько сегментов, каждое ядро имеет низколатентный локальный доступ к своему собственному сегменту HBM. Синхронизация между сегментами осуществляется через высокополосную специализированную коллекционную сеть. Такая минимальная иерархия памяти предоставляет Jalapeño значительный потенциальный преимущества по сравнению с GPU, поскольку доступ к памяти в GPU должен проходить через сложную систему памяти, создавая большую задержку, которую необходимо распределить или скрыть на больших размерах.
Этот подход возможен, потому что синхронизация между ядрами может быть ограничена ограниченным и известным объемом высокополосной связи, например, передачей тензоров, которая может перекрываться с вычислениями.

Кроме того, существует дополнительный универсальный NoC для общих коммуникаций и доступа к расширенной сети. В целом, OpenAI достигла значительного повышения производительности и снижения энергопотребления по сравнению с Nvidia и Google за счет упрощенной архитектуры NOC и подсистемы памяти.

На базовом уровне OpenAI описывает неупорядоченное (OoO) ядро с кэшем L1. Это сильно отличается от модели, используемой в других ускорителях, где применяются программно управляемые буферы, обычно с поддержкой асинхронных DMA. Аргумент заключается в том, что это позволяет Jalapeño избежать фиксированных накладных расходов, таких как задержки барьеров, которые в других ускорителях, например GPU, необходимо скрывать или распределять за счет увеличения объема работы на ядро, что затрудняет достижение исходной пиковой пропускной способности/вычислительной мощности.
Цена за это — то, что Jalapeño зависит от эффективного предварительного выбора, чтобы обеспечить своевременное поступление запросов к памяти, что сложнее предсказать и проанализировать. Однако с помощью Codex, получающего подробные трассировки в хорошей структуре, можно найти оптимальное ядро с наилучшим предварительным выбором для заданной формы, практически без участия человека. Мы считаем, что именно в этом причина того, почему OpenAI так быстро справился с DeepSeek R1, Kimi K2.5 и GPT-OSS.
Ядро также поддерживает «меньшие» размеры матриц, что (в зависимости от того, насколько малы) должно сделать его более универсальным для различных моделей и размеров пакетов, менее чувствительным к выравниванию размеров матриц, накладным расходам на заполнение и неэффективности блочного разделения. Например, чипы TPU, Trainium и Etched обладают очень большими пульсирующими массивами и могут требовать больших пакетов или точно делимых размеров моделей, чтобы избежать неэффективности блочного разделения.
С помощью Jalapeño OpenAI сосредоточилась на устранении фиксированной задержки в системе, чтобы приблизиться к производительности roofline во всех областях кривой Парето. Теоретически это может обеспечить относительное преимущество по сравнению с GPU на нескольких рабочих точках:
Производительность при низкой задержке / небольших объемах вывода значительно превосходит GPU. GPU ограничены фиксированными накладными расходами, такими как задержка запуска, задержка барьеров и задержка системы памяти.
Даже при больших объемах или длинных контекстах существует потенциал для более тесного приближения к аппаратной roofline.
Это сопровождается предупреждением: даже если теоретически существует верхний предел производительности, фактическое ядро может быть сложнее для достижения этой производительности. Следовательно, их подход кажется таким:
Разработано максимальное производительностное ограничение для всех форм рабочих нагрузок
Позвольте Codex выполнить тяжелую работу и найти ядро, реализующее этот лимит.
Команда OpenAI запустила рабочую нагрузку InferenceX на Jalapeño с крайне быстрой оборачиваемостью.
Мы поэтому оптимистично относимся к этому методу.
Если Jalapeño успешен, это будет сильным сигналом.
Индустрія преодолеет одержимость программными моделями и идеальным универсальным компилятором с помощью передовых моделей ИИ.
OpenAI пишет ядро Jalapeño так, как будто пишет на ассемблере.
Каждое ядро содержит ручную оптимизированную кодовую базу, часть которой составляет около 3000 строк.
А также поддержка проверки корректности и пользовательских санитайзеров.
Ранние ядерные работы были с участием человека, а не полностью автоматизированными.
Позже перешли к более масштабной внутренней версии Codex.
OpenAI планирует продвигать эту версию корпоративным клиентам.
Внутренний сервисный движок называется «Teacup».
Интересно, что ранее у OpenAI не было внутренней реализации ядра MLA.
Пока они не провели тестирование DeepSeek с помощью InferenceX.
Codex может так быстро написать рабочее и эффективное ядро, не требуя вмешательства команды инженеров ядра.
Это демонстрирует возможности разработки программного конвейера.
OpenAI использует Gluon для программирования Jalapeño.
Gluon — это язык программирования ядра OpenAI.
Gluon построен на основе Triton и сохраняет программную модель SPMD (Single Program Multiple Data) Triton.
Но он раскрывает нижележащие программные абстракции.
Например, для NVIDIA GPU предоставляется API, сопоставляющийся с инструкциями PTX.
Включая инструкции MMA, инструкции TMA и механизм mbarrier.
Самым уникальным абстракцией, предоставляемой Gluon, является макет.
В общем случае макет определяет сопоставление между аппаратными ресурсами и элементами тензора.
Например, пятый регистр Warp 9 соответствует элементу тензора в шестой строке и седьмом столбце.
Разметка Gluon основана на линейных макетах.
Это алгебра макета, изобретённая OpenAI.
Linear Layouts математически формализуют, что такое макет.
А также инструменты для настройки интерфейса.
Это поддерживает множество функций, таких как доказуемо корректные преобразования макетов.
Также оптимальное сворачивание памяти.
В программной модели Jalapeño каждый программа Gluon сопоставляется с постоянным потоком.
Мы считаем, что это намекает на то, что Jalapeño подходит для паттерна долгосрочного ядерного программирования.
Каждая программа выполняется на нескольких плитках, причем распределение задач осуществляется программистом, а не аппаратным планировщиком.
OpenAI упомянула TensorInfo.
Это абстракция явно закодированной макетной структуры.
Это может быть набор макетов, разработанных для Jalapeño.
Он будет работать на основе Linear Layouts.
Наконец, каждый ядро предоставляет предварительную выборку данных и декуплированный неупорядоченный блок.
Например, пользователь может запрограммировать ожидание предварительно загруженных данных.
Эти данные заблокированы семафором.
Ирония судьбы в том, что модели OpenAI, такие как GPT 5.6 Sol, в настоящее время работают на NVIDIA GPU.
Они используются для проектирования чипов, представляющих реальную угрозу для CUDA-барьера.
Собственные GPU NVIDIA в реальном времени поддерживают потенциальных преемников.
При сравнении во времени мы также можем увидеть скорость разработки Jalapeño.
За менее чем две недели пропускная способность некоторых сценариев взаимодействия увеличилась более чем в два раза.
Каждый tarball, полученный от команды Jalapeño, содержит волшебный мир.

Не только производительность ядра была улучшена, но и команда Jalapeño включила TP32 за 8 дней.
Расширение предыдущей конфигурации TP8 за пределы одной системы для реализации полной конфигурации стойки для запуска крупных моделей.
Эта скорость разработки действительно впечатляет.

Для проверки производительности перед запуском на реальном оборудовании OpenAI также использует симулятор «chilisim».
Его точность находится в пределах 5% от реальных характеристик оборудования при использовании шины trace фиксированной ширины.
Отслеживание на A0 ограничено, но значительно улучшено на B0.
Это может быть связано с реальными данными работы чипа A0.
Инженер продемонстрировал работу Codex CLI с внутренней моделью.
Его прозвище — «Raiku» или «5.3 Codex Spark», TPOT — 1,2 мс.
Команда также продемонстрировала демонстрацию, написанную Codex, которая работает непосредственно на чипе.
Включая Doom с 36 FPS и симуляцию гидродинамики FP32.
Также визуализация перетаскиванием мышью «Liquid Light».

В плане моделей внутренний проект OpenAI под названием megakernel имеет прозвище «gigakernel».
Он построен вокруг одного мега-ядра и циклически выполняется на устройстве, чтобы снизить нагрузку на ЦП и время запуска.
Команда продолжает разрабатывать стратегии расчетов при тестировании.
Внутреннее особое внимание уделяется координации использования 1 000 000 релазов.
Нужно ли Disagg, это вопрос
Ранее мы упоминали, что OpenAI не использует разделение prefill-decode на этих чипах.
Это удивило нас, поскольку производительность GPU NVIDIA и AMD значительно выиграла от PDD.
Даже на однородном оборудовании.
Давайте разберемся, почему команда Jalapeño поступила именно так.
При фиксированной нагрузке разделение prefill и decode выглядит привлекательно.
Prefill и decode оказывают разное давление на оборудование.
Распределение каждой стадии в отдельно настроенную пуловую группу повышает эффективность при выбранном соотношении входа и выхода.
Но производственный трафик не будет сохранять этот коэффициент.
Длина последовательности ввода-вывода, параллелизм, процент попаданий в кэш, скорость принятия предположений и целевые задержки постоянно меняются в течение дня.
После разделения устройства на пулы prefill и decode, избыточный спрос на prefill приводит к простаиванию чипов decode и накоплению запросов в очереди.
Но избыточный запрос на декодирование имеет обратный эффект.
Операторы должны постоянно прогнозировать правильное разделение и резервировать резервную емкость для обеих сторон.
И перебалансировать систему, у которой идеальное соотношение постоянно меняется.
В единой системе некоторые ресурсы могут недостаточно эффективно использоваться на определенных этапах.
Но каждое устройство по-прежнему может использоваться для обработки следующего запроса.
В разделенной системе весь чип может простаивать только потому, что принадлежит неправильному пулу.
Локальная загрузка выглядит лучше, но глобальная загрузка может быть плохой.

Разделение также нарушает локальность.
prefill worker создает большой KV-кэш, необходимый decode worker'у немедленно.
Система должна передать это состояние через сеть, чтобы генерация могла продолжиться.
Это увеличивает потребление пропускной способности, синхронизацию, очередь и еще одну область отказа.
Стоимость также возрастает с увеличением длины входной последовательности, поскольку KV-кэш растет.
Однако избегание перемещения KV в основном связано с оптимизацией энергопотребления и задержек.
Перемещение некоторых KV может повысить использование аппаратных ресурсов за счет увеличения энергопотребления и задержки одного запроса.

Swapable clusters can shift capacity between latency-sensitive requests and throughput-oriented batches.
Фиксированное разделение приводит к простою оборудования при изменении состава трафика.
Кроме того, изменение длины контекста смещает баланс между вниманием и FFN.
Любое фиксированное соотношение аппаратных компонентов эффективно только около точки проектирования.

Те же ограничения применяются и к спекулятивному декодированию. Черновая модель должна предоставлять кандидаты токенов валидатору с крайне низкой задержкой. Разделение обоих компонентов на отдельные специализированные пулы превратит тесно связаный цикл декодирования в распределённый протокол. Дополнительная коммуникация и координация могут поглотить всю экономию задержки, достигнутую за счёт черновой модели. Только размещение обеих моделей на одном устройстве и в структуре с низкой задержкой сохраняет локальность, делающую спекулятивное декодирование оправданным.

Однако в местах, где спрос достаточно велик, стабилен и предсказуем, декомпозиция все еще побеждает, особенно когда традиционные GPU требуют крупных партий и поэтапной обработки для достижения хорошей пропускной способности. Но это не бесплатный обед.
От японского до индийского (от слегка острого до очень острого): катсу, виндалу и чана — как эти карри-блюда составляют систему стеллажей?
Система Jalapeño состоит из стойки с CPU и стойки с ASIC на уровне стойки. Стойка с CPU содержит 16 хост-платформ Katsu. Каждая платформа Katsu соответствует одной из 16 платформ ASIC справа, называемых Vindaloo. Каждый хост оснащен двумя процессорами AMD EPYC уровня Turin, 1,5 ТБ DRAM, двумя SSD E1.S и двумя SSD M.2. Каждая платформа также имеет сетевой интерфейс 400 Гбит/с (2×200 Гбит/с) на передней панели. Каждая платформа Katsu подключена к каждой платформе Vindaloo с помощью 8 внешних PCIe DAC-кабелей, проложенных горизонтально на передней части стойки. Проектирование системы было выполнено в сотрудничестве с Celestica.
Стойка ASIC состоит из 16 лотков Vindaloo и 8 лотков расширительных коммутаторов (6 локальных + 2 глобальных), называемых «Chana». Каждый лоток Vindaloo содержит 8 ASIC Jalapeño, всего 128 ASIC Jalapeño на стойку. ASIC подключены к каждому коммутаторному лотку Chana с помощью медной задней панели, аналогично Nvidia Oberon. Расширенная топология разделена на локальную и глобальную области. Локальная область охватывает 128 ASIC внутри стойки. Глобальная область соединяет до 16 стоек или 2 048 ASIC. Ниже мы подробнее объясним пропускную способность и топологию.
Питание боковой стойки составляет около 50 кВт (в производстве — 31 кВт), а стойка ASIC потребляет 130 кВт. Вся система из двух стоек потребляет около 160 кВт. С точки зрения энергопотребления, это примерно эквивалентно стойке с двойной шириной GB300.

OpenAI может подключать до 2 048 XPU Jalapeño в одной расширенной сети. Расширенная сеть состоит из двух доменов. Локальный домен соединяет все 128 XPU в стойке через заднюю панель. Глобальный домен использует гибрид медных кабелей и оптических интерфейсов для соединения 2 048 XPU в 16 стойках. Каждая стойка содержит 8 плат с переключателями Chana. Средние 6 переключателей Chana используются для локального домена, каждый из них оснащен коммутационным ASIC Tomahawk 6 мощностью 102,4 Тбит/с. Верхние и нижние 2 переключателя Chana используются для глобального домена. Мы полагаем, что это могут быть 2 переключателя Tomahawk 6 по 102,4 Тбит/с каждый, что дает максимальную пропускную способность до 204,8 Тбит/с на плату.
В локальной области каждый XPU обеспечивает одностороннюю пропускную способность 4,8 Тб/с для 128 чипов Jalapeño. Они соединены полносвязным образом с 6 ASIC Tomahawk 6 по 102,4 Тб/с. Это эквивалентно 48 парам дифференциальных пар (DP) разъемов на каждый XPU. Всего для локального масштабирования используется 6 144 пары пассивных медных кабелей DP на стойку.
В глобальной сети 16 стойок, содержащих 2 048 XPU, соединены с помощью медной задней панели, электрических коммутаторов 204.8T TH6, оптических модулей 1.6T и оптических коммутаторов. Односторонняя пропускная способность глобальной связи каждого XPU составляет 1,6 Тб/с. Каждый XPU имеет 16 пар дифференциальных пар (DP) с разъемами «мама-папа» для подключения к задней панели между XPU и глобальным коммутатором. Каждый слот глобального коммутатора содержит 2 ASIC, пропускная способность выходов которых распределена между задней панелью и оптическими интерфейсами на передней панели.
Между локальной и глобальной областями количество разъемов задней панели на стойку составляет 64 пары DP на каждое XPU. Всего на стойку приходится 8 192 пары пассивных медных кабелей.
Глобальная область построена на чистой архитектуре rail и состоит из 8 rail внутри глобальной области. Мы полагаем, что OpenAI использует оптические коммутаторы (OCS), установленные на каждом стойке, для маршрутизации оптических соединений в глобальной области. Полная глобальная пропускная способность 1,6 Тб/с каждого XPU достигает глобального коммутационного лотка через медную заднюю панель, а затем покидает коммутатор через оптические модули 1,6 Т на передней панели. Сначала сигнал поступает в пассивный оптический коммутатор, а затем покидает стойку. Это позволяет масштабировать домен до 2048 XPU, состоящих из 16 стоек по 128 XPU каждая.

Поскольку расширение сети составляет лишь около 10% от общей стоимости системы, эта гибкость обеспечивает ценную возможность для будущих моделей с параметрами от 10 до 20 триллионов или контекстными окнами от 2 до 4 миллионов токенов. В плане развертывания OpenAI сотрудничает с neocloud. Кроме того, еще месяц назад она собирала данные о надежности с партнерами по центрам обработки данных, одновременно оптимизируя время развертывания от причала до стойки.
Следующий шаг
Далее мы обсудим будущее Jalapeño, чей первый производственный токен вскоре появится. Следующая цель — 100 МВт, основные препятствия связаны с оборудованием: сколько они могут произвести, насколько эффективно смогут развернуть и эксплуатировать центры обработки данных, как будут решать вопросы мониторинга и устойчивости. Программное обеспечение уже проверено, и с наличием внутренней модели любое программное преимущество легко преодолеть. За платной стеной мы обсудим влияние на компании-производители чипов, такие как NVIDIA, AMD, Cerebras, которые заключили контракты с OpenAI на ближайшие годы.
Мы также охватываем объем, количество и график производства чипов следующего поколения в модели Accelerator.
Далее следует платный контент, который из-за ограничений доступа не был дополнительно переведен, однако в предыдущем тексте уже содержится достаточная информация о вызове, который OpenAI бросает чипам NVIDIA. Для инвесторов, следящих за сектором чипов и акциями NVIDIA, эти данные предоставят свежую и надежную информацию.
