Чип Jalapeño от OpenAI превосходит NVIDIA Blackwell по ключевым показателям

iconOdaily
Поделиться
AI summary iconСводка
Чип Jalapeño от OpenAI превосходит Blackwell от NVIDIA по сетевым метрикам, таким как энергоэффективность и скорость отклика. SemiAnalysis сообщает, что Jalapeño обрабатывает 1459 токенов в секунду на GPT-OSS 120B, в то время как NVIDIA GB200 — 535. Чип, созданный совместно с Broadcom, будет внедрен позже в этом году. Альткоины, за которыми стоит следить, могут измениться, поскольку OpenAI оспаривает доминирование NVIDIA в аппаратном обеспечении ИИ.

Автор оригинала: Дун Цзин

Источник: Wall Street Journal

OpenAI представила свой первый собственный чип Jalapeño, который с невероятной скоростью изменил существующую структуру рынка AI-чипов — это не просто запуск продукта, а сигнал: AI меняет сам подход к проектированию чипов.

根据华尔街见闻文章援引彭博社8月25日的报道,OpenAI表示,Jalapeño在单位功耗可处理的AI工作量和响应速度两项关键指标上均领先英伟达GB300。该芯片由OpenAI与Broadcom合作开发,专为AI推理阶段设计,最快将于今年晚些时候投入实际使用。OpenAI芯片负责人Richard Ho表示,Jalapeño在700瓦低功耗下即可实现强劲性能,有助于大幅降低数据中心电力成本。

Согласно данным исследовательской организации в области полупроводников SemiAnalysis, этот чип был разработан и завершен в процессе потока за примерно 16 месяцев, причем ключевой этап упаковки CoWoS был завершен в ноябре 2025 года — всего 9 месяцев назад, что значительно ниже отраслевого стандартного цикла в 18–36 месяцев.

Исследователи SemiAnalysis лично посетили лабораторию OpenAI и протестировали Jalapeño с помощью их собственного набора тестов InferenceX, прийдя к прямому выводу: этот чип превзошел по показателю производительности на ватт (perf/W) все чипы NVIDIA, AMD и Google, которые они ранее тестировали.

Более того, этот результат был достигнут при отсутствии таких оптимизаций, как спекулятивное декодирование, предварительная заполнение и разделение развертки Jalapeño, в то время как другие чипы, участвовавшие в сравнении, уже использовали свои оптимальные конфигурации.

Неудивительно, что известный аналитик полупроводников Дайлан Пейтл прямо заявил: «Побеждены не только Blackwell, но и чипы NVIDIA Rubin также превзойдены»!

Анализ считает, что этот результат представляет прямой вызов для рыночной позиции NVIDIA и заставляет рынок пересмотреть конкурентную среду в сегменте AI-чипов.

Real-world data: Jalapeño outperforms Blackwell across multiple key metrics

Тесты SemiAnalysis показали, что преимущество Jalapeño в эффективности вывода довольно значительное.

На модели GPT-OSS 120B Jalapeño может генерировать около 1459 токенов в секунду, в то время как NVIDIA GB200 — всего 535; с точки зрения конечной задержки, Jalapeño завершает задачу за 1,65 секунды, тогда как GB300 требует почти 6 секунд — разница составляет 3,6 раза. В сценариях с высокой интерактивностью, когда GB300 работает на своей максимальной скорости декодирования (169 токенов в секунду), пропускная способность Jalapeño в 104,3 раза выше.

По ключевому показателю эффективности центра обработки данных — количеству токенов на мегаватт в секунду — Jalapeño достигает около 53 миллионов токенов/МВ/с на модели GPT-OSS, тогда как GB200 NVL72 — всего около 10 миллионов.

SemiAnalysis отмечает, что этот показатель по сути эквивалентен количеству токенов, производимых на один джоуль, и напрямую определяет потолок дохода центра обработки данных — в условиях, когда мощность ограничена электропитанием, это преимущество особенно важно.

С точки зрения системных затрат, по данным SemiAnalysis, которые учли электропитание, охлаждение и сеть, общая стоимость владения Jalapeño составляет около 1,56 доллара США за чип в час, что почти совпадает с 1,55 доллара США у H100, тогда как NVIDIA Vera Rubin достигает 3,61 доллара США.

Стоит отметить, что SemiAnalysis также выдвинула ряд важных оговорок.

Во-первых, модель, использованная для тестирования, не является самой передовой на данный момент: NVIDIA и AMD уже опубликовали результаты на более масштабных моделях (таких как DeepSeek V4 Pro, Kimi K3) с использованием набора AgentX, в то время как Jalapeño еще не прошел тестирование с помощью AgentX — этот набор лучше отражает производительность в реальных производственных сценариях, таких как многоэтапные взаимодействия и длинный контекст.
Во-вторых, более справедливым объектом сравнения является NVIDIA Vera Rubin, использующая HBM4, а не Blackwell; производительность на ватт Vera Rubin выше примерно в 5,4 раза по сравнению с GB200 NVL72 и практически совпадает с Jalapeño по общей стоимости владения (TCO) на токен.
В-третьих, Jalapeño пока находится на этапе инженерных образцов, и серийное производство начнёт постепенно масштабироваться только к 2027 году.

AI-спроектированные чипы: «эффект вращающегося маховика» GPT-Astra и Codex

Одной из ключевых причин, благодаря которым Jalapeño удалось завершить разработку с такой невероятной скоростью, является глубокое использование инструментов ИИ. Согласно данным SemiAnalysis, OpenAI активно применяла внутренние модели ИИ в процессе проектирования чипов, включая GPT-Astra, которая привлекла широкое внимание со стороны внешнего сообщества.

Пользователь социальной платформы X Эндрю Керран, ссылаясь на информацию от OpenAI, отметил, что GPT-Astra активно участвовал в разработке Jalapeño на всех этапах:

Команда с помощью Codex и GPT-Astra за два месяца оптимизировала три открытые модели, изначально не входившие в план массового производства Jalapeño, до высокой производительности.

Это означает, что ИИ не только ускоряет сам процесс проектирования чипов, но и быстро расширяет диапазон моделей, которые могут поддерживаться этими чипами.

Данные SemiAnalysis дополнительно количественно оценили этот вклад:

Использование AI-помощника для проектирования сократило площадь SIMD-блоков на 8% и площадь матричного движка на 10%, при этом обеспечив лучшую производительность по таймингу и энергопотреблению по сравнению с исходной версией.

На программном уровне OpenAI использовала внутреннюю расширенную версию Codex для написания ядра Jalapeño, причем некоторые части кода достигают примерно 3000 строк; в наиболее ресурсоемких модулях внимания и MoE код, сгенерированный ИИ, работает на 1,5–1,8 раза быстрее, чем реализации ведущих инженеров-человеков.

SemiAnalysis прокомментировала это весьма остро: модели OpenAI (например, GPT-5.6 Sol), работающие на GPU NVIDIA, используются для разработки чипа, представляющего реальную угрозу для конкурентного преимущества CUDA — «сами GPU NVIDIA в реальном времени порождают своего потенциального преемника».

Анализ архитектуры: почему «универсальный» оказывается быстрее?

Внешне предполагается, что Jalapeño — это чип, глубоко оптимизированный исключительно для моделей OpenAI, но выводы SemiAnalysis противоположны: Jalapeño — это универсальный чип для AI-вывода, способный запускать различные модели и рабочие нагрузки, включая игру Doom, перенесенную с помощью Codex.

На архитектурном уровне ключевая философия проектирования Jalapeño — «устранение фиксированной задержки». В отличие от GPU, зависящих от сложной иерархии памяти, Jalapeño напрямую связывает вычислительные ядра с сегментами HBM, а ядра синхронизируются через специализированную высокополосную коллекционную сеть, что значительно снижает задержку доступа к памяти.

Кроме того, Jalapeño использует ядро с выполнением в произвольном порядке (OoO) и кэш L1, а не программно управляемые регистры, характерные для других ускорителей, что позволяет ему в сценариях с малым объемом данных и низкой задержкой приближаться к теоретическому пиковому значению аппаратного обеспечения.

В плане пропускной способности памяти Jalapeño использует HBM4 и обеспечивает пропускную способность памяти в упаковке 15,4 ТБ/с, причем пропускная способность HBM на ватт составляет 22, тогда как у NVIDIA Rubin — 11,1, а у GB300 — всего 5,71.

SemiAnalysis отмечает, что скорость выводов HBM4 у Jalapeño составляет 10 Гб/с, что немного выше, чем у NVIDIA Rubin — 9,6 Гб/с, поставщиком HBM, вероятно, является Samsung.

Стоит отметить, что Jalapeño выбрал не разделять развертывание предварительного заполнения и декодирования (PDD). SemiAnalysis предоставила подробное объяснение:

В реальной производственной среде параметры, такие как соотношение ввода и вывода, уровень параллелизма и процент попаданий в кэш, постоянно меняются; фиксированные пулы приводят к снижению общей эффективности, тогда как однородные ресурсные пулы могут гибко реагировать на изменения трафика, динамически распределяя ресурсы между запросами, чувствительными к задержкам, и высокопроизводительными пакетными задачами.

CUDA барьер: появились трещины?

SemiAnalysis в отчете выдвинула весомый вывод: ровесник CUDA может быть мертв.

Это основано на сравнении скорости запуска программного обеспечения. Чип Rubin от NVIDIA с использованием CoWoS был завершен на месяц раньше, чем Jalapeño, но до сих пор единственные открытые результаты тестирования Rubin, доступные внешнему миру, получены от инженерного образца от CoreWeave; NVIDIA не открыла доступ третьим сторонам для свободного тестирования в лаборатории, как это сделал OpenAI. SemiAnalysis считает, что это отражает не разницу в самом оборудовании, а разницу в зрелости программного обеспечения.

Создание программного стека с нуля позволило OpenAI избавиться от исторических ограничений и принять более чистые архитектурные решения. OpenAI использует собственный язык программирования ядра Gluon (построенный на основе Triton) и внутренний движок вывода «Teacup», а также быстро оптимизирует ядро с помощью Codex. SemiAnalysis отметила, что за менее чем две недели производительность Jalapeño по пропускной способности при определённой скорости взаимодействия выросла более чем в два раза; за восемь дней команда расширила тензорное параллелизм с TP8 до TP32, обеспечив развертывание в масштабе всего стойки через несколько стоек.

Однако SemiAnalysis также четко отметила, что текущие тесты охватывают только относительно простую рабочую нагрузку 8k1k и еще не завершены для многократных длинных контекстов AgentX. При более сложных рабочих нагрузках агентов производительность таких компонентов, как маршрутизаторы и кэши префиксов, станет новым испытанием.

Следующий шаг: B0 уже введен в эксплуатацию, план масштабирования 10 ГВт постепенно реализуется

История Jalapeño далеко не закончена.

Согласно данным SemiAnalysis, в текущем открытом тестировании используются только образцы шага A0, тогда как шаг B0 уже поступил на завод по производству пластин и ожидается повышение производительности на ватт примерно на 25% по сравнению с A0 — вычислительная мощность MXFP4 одного кристалла B0 достигнет 13,4 PFLOPs при TDP, сохраняющемся на уровне 700 Вт.

На системном уровне OpenAI сотрудничает с Celestica для разработки полной стойки: каждая стойка ASIC содержит 128 чипов Jalapeño, а общая мощность двухстоечной системы составляет около 160 кВт, что сопоставимо с двухширинной стойкой NVIDIA GB300.

В области масштабирования один сетевой домен может подключать до 2048 процессоров Jalapeño XPU, охватывая 16 стойок. В плане серийного производства SemiAnalysis ожидает постепенного наращивания объемов к 2027 году, следующей ключевой вехой является масштаб развертывания в 100 МВт.

Более широкая стратегическая картина заключается в том, что OpenAI заключила соглашение с Broadcom о поставке 10 ГВт пользовательских ускорителей, что примерно эквивалентно полной мощности десяти ядерных энергоблоков.

Статья Wall Street Journal сообщает, что Ричард Хо, руководитель подразделения чипов OpenAI, заявил, что компания достигла уровня энергопотребления и затрат, позволяющего реально снизить стоимость инфраструктуры: «Это лишь первый шаг». Он также подчеркнул, что NVIDIA остается важным партнером, поскольку потребности OpenAI в вычислительных мощностях чрезвычайно велики, и в ближайшее время компания не собирается отказываться от существующих поставщиков.

Аналитики отмечают, что значение Jalapeño, возможно, не в том, сколько чипов NVIDIA он может заменить сегодня, а в том, что он доказал ранее широко сомневавшийся факт: компания, занимающаяся ИИ, с помощью инструментов ИИ за рекордно короткое время создала по-настоящему конкурентоспособный чип. Этот вращающийся механизм уже начал работать.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.