Автор оригіналу: Дун Цзін
Джерело: 华尔街见闻
Відкритий ІНС перший власний чіп Jalapeño з’явився з неочікуваною швидкістю, змінивши існуючу структуру індустрії чіпів для ШІ — це не просто випуск продукту, а сигнал: ШІ переосмислює сам спосіб проектування чіпів.
За матеріалами статті Wall Street Journal, за даними Bloomberg від 25 серпня, OpenAI повідомила, що чіп Jalapeño поступається NVIDIA GB300 за двома ключовими показниками: обсягом AI-завдань на одиницю споживаної потужності та швидкістю відповіді. Цей чіп розроблений спільно OpenAI та Broadcom спеціально для етапу AI-виведення і може бути введений у експлуатацію ще цього року. Річард Хо, керівник команди чіпів OpenAI, зазначив, що Jalapeño забезпечує потужну продуктивність при низькій потужності 700 Вт, що допоможе значно знизити електропотребу центрів обробки даних.

За даними дослідницької організації напівпровідників SemiAnalysis, цей чіп був розроблений і пройшов процес потокової виробництва лише за 16 місяців, а ключовий етап упаковки CoWoS був завершений у листопаді 2025 року — тобто лише 9 місяців тому, що значно нижче від галузевого стандарту від 18 до 36 місяців.

Дослідники SemiAnalysis особисто відвідали лабораторію OpenAI та протестували Jalapeño за допомогою їхньої власної тестової системи InferenceX, зробивши висновок: цей чіп перевершив за показником продуктивності на ват (perf/W) усі чіпи NVIDIA, AMD та Google, які вони раніше тестували.
Ще більш варто звернути увагу на те, що цей результат досягнуто без використання оптимізацій, таких як увімкнення спекулятивного декодування, розділене розгортання передзаповнення та декодування, тоді як інші чіпи у порівнянні вже мають увімкнені свої оптимальні конфігурації.
Не дивно, що відомий аналітик напівпровідників Дайлан Пейтл прямо сказав: «Перевершено не лише Blackwell, а й чіп Rubin від NVIDIA»!

Аналіз вважає, що цей результат створює прямий виклик для ринкової позиції NVIDIA, а також змушує ринок переглянути конкуренцію в секторі AI-чіпів.
Реальні дані: Jalapeño перевершує Blackwell за кількома ключовими показниками
Результати тестування SemiAnalysis показують, що перевага Jalapeño у ефективності виведення є досить значною.
На моделі GPT-OSS 120B Jalapeño може генерувати приблизно 1459 токенів за секунду, тоді як NVIDIA GB200 — лише 535; щодо загальної затримки, Jalapeño завершує завдання за 1,65 секунди, тоді як GB300 — майже 6 секунд, що становить різницю в 3,6 рази. У сценаріях з високою інтерактивністю, коли GB300 працює на своїй найвищій швидкості декодування (169 токенів за секунду), пропускна здатність Jalapeño в 104,3 рази вища.

У ключовому показнику ефективності центру обробки даних — кількість токенів на мегаватт за секунду — Jalapeño досягає приблизно 53 мільйонів токенів/MW/с на моделі GPT-OSS, тоді як GB200 NVL72 — лише близько 10 мільйонів.

SemiAnalysis зазначає, що цей показник суттєво еквівалентний кількості токенів, що виробляються на один джоуль, і безпосередньо визначає верхню межу доходів центру обробки даних — у поточний період, коли потужність обробки обмежена електроенергією, цей аспект має вирішальне значення.
З точки зору системних витрат, за даними SemiAnalysis, які врахували живлення, охолодження та мережу, загальні витрати на один чіп Jalapeño на годину становлять приблизно 1,56 долара США, що майже збігається з 1,55 долара США для H100, тоді як NVIDIA Vera Rubin досягає 3,61 долара США.

Варто зазначити, що SemiAnalysis також висловила ряд важливих застережень.
По-перше, модель, використана для тестування, не є найсучаснішою; NVIDIA та AMD вже опублікували результати на більш масштабних моделях (наприклад, DeepSeek V4 Pro, Kimi K3) за допомогою набору AgentX, тоді як Jalapeño ще не пройшов тестування AgentX — цей набір краще відображає продуктивність у реальних виробничих сценаріях з багатокроковими та довгими контекстами.
Друге, більш справедливим порівнянням є NVIDIA Vera Rubin, яка також використовує HBM4, а не Blackwell; продуктивність на ват у Vera Rubin вища приблизно у 5,4 рази порівняно з GB200 NVL72, і щодо загальних витрат на токен (TCO) вони майже однакові з Jalapeño.
Третє, Jalapeño наразі все ще перебуває на етапі інженерних зразків, а масове виробництво планується поступово розпочати в 2027 році.
Чіпи, розроблені за допомогою ШІ: «ефект вертушки» GPT-Astra та Codex
Однією з основних причин швидкого розроблення Jalapeño є глибока інтеграція інструментів ШІ. За даними SemiAnalysis, OpenAI активно використовувала внутрішні моделі ШІ під час проектування чіпа, зокрема GPT-Astra, яка отримала велику увагу зовнішнього середовища.
Користувач соціальної мережі X Ендрю Керран цитує інформацію від OpenAI, згідно з якою GPT-Astra активно брав участь у розробці Jalapeño на всіх етапах:
Команда за допомогою Codex та GPT-Astra за два місяці оптимізувала три відкритих моделі, які спочатку не входили до плану масового виробництва Jalapeño, до високопродуктивного стану.

Це означає, що ШІ не лише прискорює сам проектування чіпів, але й швидко розширює діапазон моделей, які можуть підтримуватися чіпами.
Дані SemiAnalysis додатково кількісно оцінили цей внесок:
AI-підтримуване проектування зменшило площу SIMD-одиниць на 8%, а площу матричного двигуна — на 10%, одночасно забезпечивши кращу продуктивність за часом і споживанням енергії порівняно з початковою версією.

На рівні програмного забезпечення OpenAI використовувала внутрішню розширену версію Codex для написання ядра Jalapeño, де частина коду ядра сягала приблизно 3000 рядків; у найбільш вимогливих до продуктивності модулях уваги та MoE код, згенерований ШІ, працює на 1,5–1,8 рази швидше, ніж реалізація від найкращих інженерів-людей.
SemiAnalysis це оцінила дуже гостро: моделі OpenAI (наприклад, GPT-5.6 Sol), що працюють на GPU від NVIDIA, використовуються для розробки чіпа, що становить реальну загрозу для CUDA-бар’єру — «власні GPU NVIDIA прямо зараз породжують потенційних наступників».

Архітектурний аналіз: чому «універсальний» виявляється швидшим?
Зовнішній загальний погляд полягав у тому, що Jalapeño — це чіп, глибоко оптимізований для моделей від OpenAI, але висновок SemiAnalysis протилежний: Jalapeño — це універсальний чіп для AI-виведення, який може запускати різні моделі та завантаження, навіть гру «Doom», перенесену за допомогою Codex.
На архітектурному рівні основна філософія дизайну Jalapeño — «викорінення фіксованих затримок». На відміну від GPU, які залежать від складної ієрархії пам’яті, Jalapeño безпосередньо зв’язує обчислювальні ядра зі слайсами HBM, а ядра синхронізуються за допомогою спеціалізованої високопропускної колективної мережі, що значно зменшує затримку доступу до пам’яті.
Крім того, Jalapeño використовує ядро з виконанням у порядку, відмінному від порядку надходження (OoO), разом із кешем L1, а не програмно керовані буфери, які зазвичай використовуються іншими прискорювачами, що дозволяє йому наближатися до теоретичного пікового значення апаратного забезпечення у сценаріях з малими партіями та низькою затримкою.
Щодо пропускної здатності пам’яті, Jalapeño використовує HBM4 і досягає пропускної здатності 15,4 ТБ/с у одному компакті, при цьому пропускна здатність HBM на ватт становить 22, тоді як у NVIDIA Rubin — 11,1, а у GB300 — лише 5,71.

SemiAnalysis зазначає, що швидкість інтерфейсу HBM4 у Jalapeño становить 10 Гбіт/с, трохи вище, ніж у NVIDIA Rubin — 9,6 Гбіт/с, а постачальником HBM може бути Samsung.
Варто зазначити, що Jalapeño вирішив не використовувати роздільне розгортання передзаповнення та декодування (PDD). SemiAnalysis надала детальне пояснення:
У реальному виробничому середовищі параметри, такі як співвідношення вводу-виводу, рівень паралелізму та частота попадань у кеш, постійно змінюються; фіксоване розподілення на пули призводить до зниження загальної ефективності; а однорідні ресурсні пули можуть гнучко реагувати на зміни навантаження, динамічно розподіляючи ресурси між запитами, чутливими до затримки, та масовими операціями з високою пропускною здатністю.
CUDA огорожа: появилися тріщини?
SemiAnalysis у звіті висунула вагомий висновок: що рівень захисту CUDA, можливо, вже помер.
Це базується на порівнянні швидкості запуску програмного забезпечення. Виробництво CoWoS для NVIDIA Rubin було завершено на місяць раніше, ніж для Jalapeño, але на даний момент єдині публічні результати тестування Rubin, які були доступні зовні, походять від інженерного зразка CoreWeave; NVIDIA не надала стороннім учасникам доступ до лабораторії для вільного тестування, на відміну від OpenAI. SemiAnalysis вважає, що це свідчить не про різницю в самому обладнанні, а про різницю в ступені зрілості програмного забезпечення.
Створення програмного стеку з нуля дозволило OpenAI відкинути історичні навантаження і прийняти чистіші архітектурні рішення. OpenAI використовує власний мову програмування ядра Gluon (на основі Triton) та внутрішній інженерний рушій "Teacup", а також Codex для швидкого налаштування ядра. SemiAnalysis зафіксувала, що за менше ніж два тижні Jalapeño збільшив пропускну здатність більше ніж у 2 рази за певної швидкості взаємодії; за 8 днів команда розширила тензорне паралелізування з TP8 на TP32, досягнувши розгортання в масштабі повного кабінету між стойками.
Однак SemiAnalysis також чітко зазначила, що поточні тести охоплюють лише відносно просте навантаження 8k1k і ще не завершено тестування AgentX з багатокроковим довгим контекстом. У складніших робочих навантаженнях агента випробуванням стануть такі компоненти, як маршрутизатори та кешування префіксів.
Наступний крок: B0 вже введено в експлуатацію, план розгортання 10 ГВт поступово реалізується
Історія Халапеньйо ще не закінчилася.
За даними SemiAnalysis, для поточного публічного тестування використовуються лише зразки A0, тоді як зразки B0 вже потрапили на виробництво і очікується, що їх продуктивність на ват буде на 25% вищою, ніж у A0 — MXFP4 обчислювальна потужність однієї обчислювальної дії B0 досягне 13,4 PFLOPs, а TDP залишиться на рівні 700 Вт.
На системному рівні OpenAI співпрацює з Celestica над розробкою повної схеми стелажів: кожен стелаж ASIC містить 128 чипів Jalapeño, а загальна потужність системи з двох стелажів становить приблизно 160 кВт, що дорівнює потужності подвійного стелажа NVIDIA GB300.

Щодо масштабування, один мережевий домен може підключити до 2048 процесорів Jalapeño XPU, охоплюючи 16 стелажів. Щодо серійного виробництва, SemiAnalysis очікує поступового зростання виробництва до 2027 року, наступною віхою є масштаб розгортання 100 МВт.
Більша стратегічна картина полягає в тому, що OpenAI підписала угоду з Broadcom про 10 ГВт спеціалізованих прискорювачів, що приблизно відповідає повній потужності десяти ядерних установок.
Стаття Wall Street Journal стверджує, що Річард Хо, керівник чіпів OpenAI, сказав, що компанія досягла рівня споживання енергії та витрат, які дозволяють реальне зниження витрат на інфраструктуру: "Це лише перший крок". Він також підкреслив, що NVIDIA залишається важливим партнером, оскільки потреби OpenAI у обчислювальних потужностях надзвичайно великі, і вони не збираються відмовлятися від поточних постачальників у найближчому майбутньому.
Аналітики відзначають, що значення Jalapeño, можливо, не в тому, скільки чипів NVIDIA він зможе замінити сьогодні, а в тому, що він довів раніше широко сумнівну ідею: AI-компанія, використовуючи AI-інструменти, за рекордно короткий термін створила справді конкурентоспроможний чип. Цей інерційний цикл вже почався.
