Автор: SemiAnalysis
Переклад: Shenchao TechFlow
Огляд Shenchao: Опубліковані тестові дані першого власного інференсного чіпа OpenAI Jalapeño, ефективність якого безпосередньо перевищує нинішній флагманський чіп NVIDIA Blackwell і наближається до майбутнього Rubin. Для компаній з ІШ, які стикаються з енергетичними обмеженнями в центрах обробки даних, цей чіп може змінити ринок обчислювальних потужностей. Однак чи зможе перше покоління чіпів справді підірвати екосистему CUDA NVIDIA, залишається під питанням.
Порівняння загальних витрат на володіння, пропускної здатності на мегаватт та гострих деталей для власних ASIC проти Rubin та Jalapeño
Протягом останніх двох років OpenAI таємно розробляла «Jalapeño» — цей чіп для висновків був тільки що оголошений на Hot Chips. Чутки про успішне виробництво ходили вже якийсь час. Але зараз ми отримали деталі. OpenAI запропонувала нам ознайомитися з чіпом, відвідати лабораторію для перевірки його реальності та провести тестування за допомогою нашого інструментарію InferenceX.
У червні цього року OpenAI оголосила про проект чіпа у співпраці з Broadcom, створеного з нуля спеціально для інференсу LLM. Робота над дизайном розпочалася в середині 2024 року, і від першого набору команди до виробництва та виготовлення чіпа пройшло лише близько 16 місяців — це надзвичайно швидкий цикл розробки ASIC.
Зазвичай чіпси першого покоління не мають конкурентної переваги, але OpenAI діє навпаки: на кількох найкращих відкритих моделях вона перевершила всі чіпси NVIDIA, AMD та Google, які ми змогли протестувати, зайнявши лідируючі позиції в галузі. OpenAI досягла цього завдяки екстремальному співвідношенню програмного та апаратного забезпечення. Несподівано, але OpenAI не зосереджувалася надмірно на конкретному етапі висновку моделей, а замість цього зосередилася на створенні універсального чіпса, який забезпечує високу продуктивність у всіх сценаріях.
Ця стаття глибоко розглядає архітектурні, програмні деталі та результати продуктивності Jalapeño на InferenceX.

Універсальний чіп для висновків
Всі кажуть, що чіпи OpenAI розроблені спеціально для моделей OpenAI, але це неправда — OpenAI створила універсальний чіп для AI-виведення.
Таймлайн дуже сумашедший. Це підтверджує, що твердження «використання ШІ для прискорення дизайну чіпів» є правдивим. Незважаючи на швидкий таймлайн, OpenAI вклали величезні кошти, прийняли практичні рішення щодо дизайну та мають дуже сильну команду, тому це не дивно.
Оглядаючи лише специфікації, він одразу стає потужним конкурентом:

А використання HBM4 робить його достатньо потужним, щоб порівнюватися з флагманськими GPU від NVIDIA та AMD:

Багато ЗМІ, описуючи цей чіп, слідують за кількома випадковими зауваженнями OpenAI, стверджуючи, що він оптимізує їхні моделі способами, які інші чіпи не можуть. Це неправда. Jalapeño — це універсальний чіп для висновку, який може запускати різні моделі та різні завантаження, включаючи нашbenchmarks InferenceX — ми запускали цей тест у лабораторії разом із інженерами OpenAI. Як жарт, OpenAI навіть показала нам, як вона запускає Doom — гру, яку було перенесено на їхній чіп лише за допомогою підказок Codex.
Нижче наведено наші найважливіші результати продуктивності на ват: пропускна здатність токенів на мегаватт загального споживання енергії. Jalapeño повністю перевершив усі інші чіпи. Усі ці результати отримані без використання багатотокенного прогнозування (MTP), тоді як інші чіпи на графіку налаштовані на найкращі параметри своїх SKU з увімкненим MTP.

Jalapeño в усіх сценаріях має краще співвідношення продуктивності на ват, ніж Blackwell, і не оптимізований лише для певної точки на кривій. Він відмінно показує себе як у сценаріях з низькою затримкою, так і у сценаріях з високою пропускною здатністю. Більш справедливим порівнянням є перегляд результатів прогнозування одного токена — Jalapeño значно перевершує кожного конкурента. У сценаріях з низькою паралельністю Jalapeño демонструє вражаючу інтерактивність: на моделі DeepSeek R1 при паралельності 1 він досягає більше 700 токенів на користувача за секунду.
Неймовірно, але все це досягнуто за допомогою однотокенного прогнозування (STP), без спекулятивного декодування та без розділення попереднього заповнення та декодування. Крім DeepSeek R1, ми також спостерігаємо інші моделі, зокрема Kimi-K2.5 та GPT-OSS, які досягають приблизно 1 400 токенів на користувача на секунду. Для всіх моделей ми підтвердили, що результати Jalapeño на GSM8k є еквівалентними результатам на чіпах NVIDIA.
Ось кілька зауважень. По-перше, усі дані надані OpenAI. Ми особисто перевірили роботу InferenceX у лабораторії, але не запускали повний набір тестів InferenceX і не бачили результатів AgentX. AgentX — це наш улюблений набір для порівняння продуктивності чіпів, оскільки його набір даних із наддовгим контекстом та багатоетапною природою дозволяє відобразити поведінку кешу під реальними виробничими навантаженнями. Фреймворки, які добре показують себе на 8k1k, можуть гірше працювати на AgentX, оскільки реальні виробничі навантаження навантажують компоненти, такі як маршрутизатори, механізми кешування префіксів, управління кешем та інфраструктура вивантаження. Одноетапний тест 8k1k не охоплює ці аспекти. Докладніше читайте у нашій статті про AgentX.
AgentX - InferenceXv3: Чи витримує CUDA оборонна лінія в інференсі агентів?
Друге, ми вважаємо, що порівняння з Blackwell є неповним і трохи несправедливим. Справжнім суперником Jalapeño є чіпи, такі як Rubin, які також використовують HBM4. Системи Vera Rubin вже почали відправляти клієнтам, тоді як у OpenAI Jalapeño поки що має лише інженерні зразки і ще не досяг масового виробництва.
Тому продуктивність справді слід порівнювати з Рубін, а не з Блеквеллом. З певної точки зору, ми й так очікували, що спеціалізовані чіпи, такі як Jalapeño, перевершать Blackwell. Співвідношення продуктивності на ват для Vera Rubin NVL72 становить 5,4 рази вище, ніж у GB200 NVL72 — про це ми писали у статті про аналіз заяв про продуктивність NVIDIA та CoreWeave, опубліковані минулого місяця. Пізніше ми порівняємо Jalapeño з даними про продуктивність Vera Rubin за липень.
Vera Rubin NVL72 порівняно з GB200 NVL72? Аналіз TCO та архітектури
Третє, модель, яку протестували, не є найсучаснішою серед відкритих. NVIDIA та AMD вже опублікували результати більших моделей за допомогою AgentX, наприклад, DeepSeek V4 Pro та Kimi K3. Чим більша модель і чим новіше її випуск, тим складніше її запустити на нових чіпах. Однак модель, яку OpenAI успішно запустила на Jalapeño, також не є малою.
Аналіз продуктивності
Дизайнерською метою OpenAI є продуктивність на ват. Причина проста: OpenAI зараз обмежена електроживленням дата-центру, а не бюджетом або простором серверної, тому кількість токенів на мегаватт має вирішальне значення. На Computex 2026 Хуан Ренсюнь сказав, що продуктивність на ват, надійність і довгий термін служби є ключовими характеристиками майбутніх GPU. Він сказав: «Якщо у вас є 1 гігават електроенергії, то пропускна здатність на ват — це дохід». Він також зазначив, що не має сенсу вибирати неправильну архітектуру лише тому, що чіп дешевший.

На презентації Vera на Hot Chips 2026 NVIDIA також підкреслила це, продемонструвавши ту саму діаграму доходів: «Сьогодні центри обробки даних обмежені електропостачанням». Електроенергія є критично важливою і забезпечує доходи.
Оператори не можуть легко отримати додаткові мегаватти. Часові масштаби збільшення GPU та збільшення потужності електромережі дуже відрізняються. Межі електропостачання центрів обробки даних обмежені багатьма факторами, наприклад, підключенням до комунальних мереж, інфраструктурою, здатністю до охолодження та проектуванням UPS/резервних генераторів. Затримки в електромережах часто перевищують темпи розробки обладнання та будівництва, що створює попит на потужність після лічильника. Це означає будівництво газових турбін та локальних генераторів безпосередньо на території центру обробки даних. Ця потужність розташована після комунального лічильника і не залежить від публічної електромережі. Це дозволяє операторам забезпечувати об’єкти електроенергією, не чекаючи на підключення до мережі та модернізацію комунальних служб. Саме тому Colossus 2 xAI сильний залежить від потужності після лічильника, хоча його реальне підключення до електромережі значно відстає. Докладніше дивіться у нашій енергетичній моделі.
Як ми написали у пості у X, tok/s/MW можна спростити до кількості токенів на джоуль. Оскільки ват — це джоуль на секунду. Тому tok/s/MW відображає ефективність системи та здатність перетворювати енергію на токени.

У цьому контексті Jalapeño перевершує навіть Rubin. Потужність токенів на мегаватт STP від OpenAI Jalapeño перевищує результати Vera Rubin MTP. Цей результат було опубліковано NVIDIA та CoreWeave у липні. Він також значно перевищує результати GB200 за 2025 рік. Як ми зазначали у статті про Vera Rubin, порівняння VR з результатами GB200 за 2025 рік обґрунтоване, оскільки обидва перебувають на схожому етапі раннього запуску. Одночасно порівняння з GB200 за 2025 рік дозволяє зберегти однаковий рівень дозрілості програмного забезпечення. Відповідно до цієї логіки, ми порівнюємо три набори результатів: останній результат Vera Rubin за липень 2026 року, результат GB200 за 2025 рік та поточний результат Jalapeño. Це порівняння дуже обґрунтоване, оскільки це найкращі публічні дані про Rubin. Крім того, OpenAI випустила власний чіп після Rubin. І OpenAI, і Rubin ще не дозріли, тому їх продуктивність продовжуватиме зростати.

Щодо продуктивності/загальних витрат на володіння, Vera Rubin і Jalapeño мають однакові показники: кожен долар генерує майже однакову кількість вихідних токенів. Однак, як зазначалося раніше, результати Jalapeño не використовують спекулятивне декодування, тоді як результати Vera Rubin — використовують. Спекулятивне декодування зменшує вартість кожного токена приблизно у 3–5 разів. Коли Jalapeño реалізує спекулятивне декодування, його витратна ефективність надання токенів буде вищою. Звичайно, частина переваг у TCO походить від уникнення високої маржі NVIDIA на користь нижчої (але все ще високої) маржі Broadcom. Але це не єдина причина. Наприклад, проекти AI ASIC Meta та Microsoft, яким було виділено більше часу, не змогли бути успішно реалізовані. Це свідчить про те, що вартість — лише частина рівняння. Повний розбір TCO для Jalapeño дивіться у моделі SemiAnalysis AI Cloud TCO.

На рівні архітектури OpenAI вирішила не розділяти попереднє заповнення (prefill) і декодування (decode) на різні пули чіпів. Моделі-прототипи та основні моделі використовують одні й ті ж чіпи та структури з’єднань. Цей підхід жертує частину теоретичної ефективності на користь практичної зручності в експлуатації. Мотивація полягає в тому, що структура навантаження змінюється з часом. Наприклад, співвідношення між вхідними даними, записом кешу, читанням кешу та виведенням токенів значно змінилося. Ця зміна відбулася після проходження трьох епох моделей: знань, міркувань та агентів, як ми обговорювали у нашій останній статті. Тому фіксоване виділення окремих кількостей чіпів для гетерогенних попередніх заповнювачів і декодерів призводило б до зниження ефективності з часом. OpenAI в цій архітектурі обрала гомогенний пул і намагається забезпечити добру продуктивність чіпів для всіх завдань.
І це дійсно вдалося. На Kimi K2.5 (на основі якої створено Cursor Composer 2.5) Jalapeño досяг майже 700 tok/s/user. Ця швидкість у понад 9 разів перевищує показник другого за ефективністю чіпа — 100 tok/s/user.

На GPT-OSS знову повна перевага. Інтерактивна пропускна здатність Jalapeño на мегаватт майже вдвічі перевищує найвищу точку пропускної здатності GB200 і більше ніж у 50 разів перевищує точку паралельної обробки GB200 на 1. Для більшої паралельної обробки Jalapeño використовує EP8.

Ці результати вражають! Але ми повинні бути вимогливими: це лише 8k1k, що має значно нижчу складність налаштування, і ще немає даних виконання AgentX. Як ми зазначали у статті про AgentX, багатокрокові та довгі навантаження з контекстом створюють більше навантаження на різні аспекти інференс-стеку, наприклад, на маршрутизатори та кеш префіксів. Для відмінної роботи на навантаженнях агентів потрібні додаткові оптимізації. Докладніше читайте у статті про AgentX.
AgentX - InferenceXv3: Чи зможе CUDA залишитися конкурентним перевагою у висновуванні агентів?
Глибокі специфікації та архітектура
Всі ці результати отримано з A0-ступеня Jalapeño, лише через 9 місяців після запуску проекту. Але B0-ступінь вже виробляється на заводі! Оптимізація B0 забезпечує приблизно 25% зростання продуктивності на ват порівняно з ранніми кристалами A0. Зокрема, B0-ступінь досягає 13,4 PFLOPs MXFP4 на одному чіпі розміром з один маску. Цей чіп виготовлений за технологією TSMC N3P. Навпаки, один чіп Rubin у подібних розмірах та на тому ж ноді досягає 17,5 PFLOPs щільного Rubin NVFP4.
З урахуванням того, що TDP Jalapeño становить лише 700 Вт, тоді як Rubin витрачає 900–1150 Вт на кожен обчислювальний чіп, цей результат ще більш вражаючий. Оскільки Jalapeño призначений для висновків, а не для навчання, OpenAI не має потреби піднімати TDP для максимізації FLOPs. Це зрозуміло. Але незалежно від цього, наведені результати свідчать про те, що Jalapeño забезпечує значну пікову теоретичну кількість FLOPs.
Порівняно з іншими прискорювачами, Jalapeño має найвищу пропускну здатність HBM на ват та найвищий показник FLOPs на ват. Цей рівень можна порівняти з конфігурацією Rubin Max-Q потужністю 1800 Вт.

Jalapeño буде використовувати HBM4 і стане одним із перших чіпів, що застосували цю технологію після Nvidia та AMD, навіть опередивши наявні проекти TPU та Trainium. Одним із ключових архітектурних принципів Jalapeño є повне використання пропускної здатності HBM, тому компроміс із використанням не найкращого HBM суперечить цій меті. Це дозволяє досягти пропускної здатності пам’яті 15,4 ТБ/с на пакет, що перевищує всі інші прискорювачі, що використовують HBM3E. Пропускна здатність 15,4 ТБ/с свідчить про те, що HBM4 досягає швидкості 10 Гбіт/с на контакти, трохи вище за 9,6 Гбіт/с у HBM4 в Rubins від Nvidia. HBM, ймовірно, надається Samsung.

OpenAI завершила потік Jalapeño у листопаді 2025 року, точніше — потік із дизайном CoWoS, а не лише верхнім чіпом. Протягом 9 місяців після потоку у листопаді 2025 року та лише 3 місяців налагодження на реальному кремнії, OpenAI досягла чудових результатів за допомогою Jalapeño. Це ще більш вражає, враховуючи, що команда почала з нуля з програмним стеком.
Тим часом, виробництво Rubina CoWoS було завершено в жовтні 2025 року, на місяць раніше, але єдині ранні результати, які ми бачимо зараз, походять від інженерних зразків CoreWeave. Nvidia не дозволила нам тестувати та публікувати бенчмарки, як це зробила OpenAI, що свідчить про те, що програмне забезпечення її чіпів все ще не дозріло. Ураховуючи, що OpenAI змогла так швидко запустити нові моделі на власних чіпах, CUDA-захисний бар’єр, можливо, зник.
Вони ще далеко не оптимізовані, і ми бачимо, що в цілому Jalapeño показує кращі дані. Ми не вважаємо, що апаратне забезпечення Nvidia гірше, а тим, що розробка ПЗ для Jalapeño просувається швидше, ніж для Nvidia. Це демонструє потужність спільного проектування апаратного та програмного забезпечення — саме в цій галузі команди ASIC у провідних лабораторіях можуть перевершити більш досвідчені комерційні чіпи. На перший погляд, зовсім новий початок може також вигодити OpenAI, оскільки він може робити повністю нові архітектурні рішення, не обмежуючись сумісністю зворотного типу або старими версіями ПЗ.
Хоча OpenAI вже має прототип Jalapeño, масове виробництво планується поступово розгорнути у 2027 році, а більшість виробництва зараз заплановано на кінець наступного року. Додаткові деталі щодо кількості одиниць та середньої ціни продажу дивіться в моделі SemiAnalysis Accelerator.
Можна сказати, що OpenAI Jalapeno — це справді масштабний ASIC.
Швидкість Jalapeño вражає порівняно з часовою лінією Rubin. Як вже зазначалося, навіть за умови, що Rubin почав раніше, результати Jalapeño все одно перевершують результати Rubin.

Архітектура Jalapeño
З точки зору архітектури, матричний рушій цього чіпа використовує формат MXFP та масиви зі збереженням ваг, подібно до TPU. Однак у порівнянні з TPU він підтримує менші форми/виміри, що означає, що він не стикається з дивними падіннями продуктивності, які виникають при множенні матриць з неспівпадаючими формами на більших масивах.
Він також має 64-бітний скалярний ядро та векторні ядра FP32/INT32. OpenAI також впровадила надлишковість на рівні трейу, а також вбудувала відновлення виходу на рівні ядер і каналів. Вони стверджують, що допомога штучного інтелекту в проектуванні чіпа зменшила площу SIMD на 8%, а площу матричного двигуна — на 10%. Хоча вони не вказали конкретних умов PVT (технологія/напруга/температура), зазначили, що модуль з допомогою штучного інтелекту покращив таймінг і споживання енергії порівняно з початковим модулем.
Архітектура Jalapeño спрямована на видалення переміщення пам’яті KVCache та ваг, а також фіксованих затримок та накладних витрат, щоб наблизитися до початкової пікової продуктивності/пропускної здатності порівняно з іншими прискорювачами, навіть при малих розмірах партій або малих форматах.
Ядра та HBM розділені на кілька сегментів, кожен сегмент ядра має низькочасовий локальний доступ до відповідного сегмента HBM. Синхронізація між сегментами здійснюється за допомогою високопропускної спеціалізованої мережі збору. Ця мінімалістична пам’ять ієрархія надає Jalapeño значну потенційну перевагу порівняно з GPU, оскільки доступ до пам’яті в GPU повинен проходити через складну систему пам’яті, що створює велику затримку, яку потрібно компенсувати або приховати на великих розмірах.
Цей підхід можливий, оскільки синхронізація між ядрами може бути обмежена обмеженим і відомим обсягом високосмугової комунікації, наприклад, комунікацією з тензорним паралелізмом, яка може перекриватися з обчисленнями.

Крім того, існує додаткова універсальна NoC для загальних комунікацій та доступу до розширеної мережі. Загалом, OpenAI за допомогою спрощеної NoC та пам’яті підсистеми зменшила споживання енергії та досягла значного зростання продуктивності порівняно з Nvidia та Google.

На основному рівні OpenAI описує вихідне (OoO) ядро з кешем L1. Це суттєво відрізняється від моделі, яку ми бачимо в інших прискорювачах, де зазвичай використовуються програмно керовані буфери разом із підтримкою асинхронного DMA. Аргумент полягає в тому, що це дозволяє Jalapeño уникнути фіксованих накладних витрат, таких як затримки бар’єрів, які в інших прискорювачах (наприклад, GPU) потрібно приховувати або розподіляти шляхом збільшення обсягу роботи на ядро, що ускладнює досягнення первинної пікової пропускної здатності/обчислювальної потужності.
Ціною є те, що Jalapeño залежить від добрих передбачуваних запитів, щоб забезпечити своєчасне надходження запитів до пам’яті, що складніше передбачити й проаналізувати. Однак, використовуючи Codex для отримання детальних трасувань у добре структурованому фреймворку, можна знайти оптимальний ядро з найкращим передбачуваним запитом для заданого розміру, майже без участі людини. Ми вважаємо, що саме це дозволяє OpenAI так швидко запустити DeepSeek R1, Kimi K2.5 та GPT-OSS.
Ядро також підтримує «менші» розміри матриці, що (залежно від того, наскільки вони малі) має зробити його більш універсальним для різних моделей і розмірів пакетів, менш чутливим до вирівнювання розмірів матриці, накладних витрат на заповнення та неефективного розбиття на блоки. Наприклад, чіпи TPU, Trainium і Etched мають дуже великі пульсуючі масиви, які можуть вимагати великих пакетів або точно кратних розмірів моделі, щоб уникнути неефективного розбиття на блоки.
Завдяки Jalapeño, OpenAI зосереджується на видаленні фіксованої затримки в системі, щоб якомога ближче наблизитися до roofline-продуктивності у всіх областях кривої Парето. Теоретично, це може принести перевагу відносно GPU на кількох робочих точках:
Максимальна продуктивність для висновків з низькою затримкою/малими партіями значно перевищує продуктивність GPU. GPU обмежені фіксованими накладними витратами, такими як затримка запуску, затримка бар’єру, затримка системи пам’яті тощо.
Навіть при великих обсягах або довгих контекстах є потенціал наблизитися до апаратного roofline.
Це супроводжується попередженням: навіть якщо теоретично існує верхній поріг продуктивності, реальні ядра можуть бути складнішими для досягнення цієї продуктивності. Тому їхній підхід, схоже, полягає в:
Розроблено максимальну продуктивність для всіх форм навантаження
Нехай Codex виконає важку роботу та знайде ядро, що реалізує цей ліміт
Команда OpenAI запустила навантаження InferenceX на Jalapeño з надзвичайною швидкістю обробки.
Ми оптимістично ставимося до цього методу.
Якщо Jalapeño вдасться, це відправить сильний сигнал.
Нав’язлива ідея галузі щодо програмних моделей та ідеального універсального компілятора буде зруйнована передовими моделями ШІ.
OpenAI пише ядро Jalapeño, як із Assembly.
Кожен ядро має ручно оптимізований код, частково близько 3000 рядків.
Також підтримка перевірки коректності та налаштовуваних санітайзерів.
Ранній ядерний процес був з участь людини, а не повністю автоматичний.
Потім перейшли до більш масштабної внутрішньої версії Codex.
OpenAI планує продавати цю версію корпоративним клієнтам.
Внутрішній сервісний двигун називається «Teacup».
Цікаво, що раніше OpenAI не мала внутрішньої реалізації MLA-ядра.
Доки вони не провели бенчмаркинг DeepSeek за допомогою InferenceX.
Codex зможе так швидко написати працездатне та ефективне ядро, не вимагаючи участі команди інженерів ядра.
Це демонструє здатність розробки програмного конвеєра.
OpenAI використовує Gluon для програмування Jalapeño.
Gluon — це мова програмування ядра OpenAI.
Gluon побудований на основі Triton і зберігає програмну модель SPMD (Single Program Multiple Data) Triton.
Але це розкриває нижчорівневі програмні абстракції.
Наприклад, для NVIDIA GPU він надає API, яке відображається на інструкції PTX.
Включаючи інструкції MMA, інструкції TMA, механізм mbarrier тощо.
Найунікальнішою абстракцією, яку надає Gluon, є макет.
Загалом, макет визначає відповідність між апаратними ресурсами та елементами тензорів.
Наприклад, п’ятий регістр Warp 9 відповідає елементу тензора у 6-му рядку та 7-му стовпці.
Абстракція макету Gluon ґрунтується на лінійних макетах.
Це алгебра макетів, розроблена OpenAI.
Linear Layouts математично формалізують, що таке макет.
Також надає інструменти для розміщення операцій.
Це підтримує багато функцій, наприклад, доведено правильні перетворення макетів.
Також оптимальне змішування пам’яті.
У програмній моделі Jalapeño кожна програма Gluon відображається на постійний потік.
Ми вважаємо, що це свідчить про те, що Jalapeño підходить для патерну тривалого ядерного програмування.
Кожна програма виконується на кількох плитках, розподіл роботи здійснюється програмістом, а не апаратним планувальником.
OpenAI згадала TensorInfo.
Це абстракція з експліцитно закодованою макетною структурою.
Це може бути набір макетів, розроблених для Jalapeño.
Він буде працювати за допомогою Linear Layouts.
Нарешті, кожен ядро надає передвибірку даних та роз’єднаний вихідний блок.
Наприклад, користувач може програмно очікувати на попереднє завантаження даних.
Ці дані заблоковані семафором.
Жахливою іронією є те, що такі моделі OpenAI, як GPT 5.6 Sol, зараз працюють на NVIDIA GPU.
Їх використовують для розробки чіпів, що становить реальну загрозу для CUDA-фортеці.
Власні GPU NVIDIA безпосередньо підтримують потенційних наступників у реальному часі.
Порівнюючи за часом, ми також можемо побачити швидкість розробки Jalapeño.
За менше ніж два тижні пропускна здатність деяких сценаріїв взаємодії зросла більше ніж у 2 рази.
Кожен tarball, отриманий від команди Jalapeño, містить дивовижний світ.

Не тільки підвищена продуктивність ядра, але й команда Jalapeño увімкнула TP32 протягом 8 днів.
Розширення попередньої конфігурації TP8 за межі однієї системи для реалізації повної конфігурації стелажу для запуску великих моделей.
Ця швидкість розробки справді вражає.

Щоб перевірити продуктивність перед запуском на реальному обладнанні, OpenAI також має симулятор «chilisim».
Його точність становить менше ніж 5% від реальних показників апаратного забезпечення за допомогою шини trace з фіксованою шириною.
Можливості відстеження на A0 обмежені, але значно покращені на B0.
Це може бути пов’язано з реальними даними роботи кристалів A0.
Інженер продемонстрував роботу Codex CLI з внутрішньою моделлю.
Його прізвисько — «Raiku» або «5.3 Codex Spark», TPOT — 1,2 мс.
Команда також продемонструвала демонстрацію, написану Codex, яка працює безпосередньо на чіпі.
Включаючи Doom з 36 FPS та симуляцію гідродинаміки FP32.
Також візуалізація перетягування мишкою «Liquid Light».

Щодо моделей, внутрішній розв’язок OpenAI megakernel має прізвисько «gigakernel».
Він побудований навколо одного мега-ядра, яке циклічно виконується на пристрої, щоб зменшити навантаження на ЦП і час запуску.
Команда продовжує розробляти стратегії розрахунків під час тестування.
Внутрішній пріоритет — як координувати використання 1 мільйона rollout-ів.
Чи варто використовувати Disagg, це питання
Раніше ми згадували, що OpenAI не використовує розділення prefill-decode на цих чіпах.
Це здивувало нас, оскільки продуктивність GPU NVIDIA і AMD значно вигідною від PDD.
Навіть на однорідному обладнанні.
Давайте глибше розберемо, чому команда Jalapeño зробила це.
Коли навантаження фіксоване, розділення prefill-decode виглядає дуже привабливо.
Prefill і decode мають різний навантаження на апаратне забезпечення.
Розподіл кожного етапу окремо настроєними пулами дозволяє підвищити ефективність при вибраному співвідношенні вхідних та вихідних даних.
Але виробничий трафік не збереже цей відсоток.
Довжина послідовності введення-виведення, паралелізм, частота потрапляння у кеш, частота прийняття припущення та цільові затримки постійно змінюються протягом усього дня.
Після розділення пристрою на пули prefill і decode, надмірні потреби prefill призводять до простою чіпів decode та накопичення запитів у черзі.
Але надмірний запит на декодування має зворотний ефект.
Оператори повинні постійно передбачати правильне розгалуження та залишати резервну ємність для обох сторін.
І повторно балансувати систему, ідеальний відсоток якої постійно змінюється.
У єдиній системі деякі ресурси можуть бути недостатньо використані на певних етапах.
Але кожен пристрій все ще може використовуватися для обслуговування наступного запиту.
У розділеній системі весь чіп може залишатися не використаним лише через те, що належить до неправильного пулу.
Локальне використання виглядає краще, але глобальне використання може бути поганим.

Розділення також порушує локальність.
prefill worker створює великий KV-кеш, необхідний decode worker.
Система повинна передати цей стан через мережу, щоб процес генерації міг продовжитися.
Це збільшує витрати пропускної здатності, синхронізацію, чергу та ще одну область відмов.
Вартість також зростає разом із довжиною вхідної послідовності, оскільки KV cache збільшується.
Однак уникання руху KV переважно спрямоване на оптимізацію споживання енергії та затримки.
Переміщення деяких KV може підвищити використання апаратного забезпечення за рахунок споживання енергії та затримки одного запиту.

Обмінні кластери можуть перерозподіляти потужність між запитами, чутливими до затримки, і пакетами, спрямованими на пропускну здатність.
Фіксоване розбиття залишає обладнання бездіяльним при зміні комбінації трафіку.
Крім того, зміна довжини контексту змінює баланс між увагою та FFN.
Будь-який фіксований коефіцієнт апаратного забезпечення ефективний лише біля точки проектування.

Ті самі обмеження стосуються й спекулятивного декодування. Модель-чернетка повинна надавати кандидатів на токени віріфікатору з надзвичайно низькою затримкою. Розділення обох моделей у різні спеціалізовані пули перетворює тісно зв’язаний цикл декодування на розподілений протокол. Додаткова комунікація та координація можуть з’їсти затримку, зекономлену за рахунок спекулятивного підходу. Лише розміщення обох моделей на одному пристрої та в архітектурі з низькою затримкою дозволяє зберегти локальність, яка робить спекулятивне декодування вартою.

Проте в місцях, де попит достатньо великий, стабільний і передбачуваний, роз’єднання все ще переважає, особливо коли традиційні GPU потребують великих партій та поетапних пакетів для досягнення доброї пропускної здатності. Але це не безкоштовний обід.
Від японського до індійського (від м’якого до дуже гострого): Катсу, Віндалу та Чана — як ці карі страви складають систему стелажів?
Система Jalapeño на рівні стоечних блоків складається з CPU-стоечного блоку та ASIC-стоечного блоку. CPU-стоечний блок містить 16 хост-процесорних платформ під назвою «Katsu». Кожна платформа Katsu відповідає одній з 16 ASIC-платформ справа, які називаються «Vindaloo». Кожен хост оснащений двома AMD EPYC CPU рівня Turin, 1,5 ТБ DRAM, 2x E1.S та 2x M.2 SSD. Кожна платформа також має 400 Гб (2x200 Гб) фронтального мережевого інтерфейсу. Кожна платформа Katsu підключена до кожної платформи Vindaloo за допомогою 8 зовнішніх PCIe DAC-кабелів, які прокладені горизонтально на передній частині стоечного блоку. Системний дизайн був розроблений у співпраці з Celestica.
Стелаж ASIC складається з 16 трейлерів Vindaloo та 8 трейлерів розширювальних комутаторів (6 локальних + 2 глобальних), який називається «Chana». Кожен трейлер Vindaloo містить 8 ASIC Jalapeño, що дає загалом 128 ASIC Jalapeño на стелаж. ASIC підключені до кожного комутаторного трейлера Chana за допомогою мідного тилового кабелю, подібно до Nvidia Oberon. Розширена топологія поділена на локальну та глобальну області. Локальна область охоплює 128 ASIC всередині стелажу. Глобальна область з’єднує до 16 стелажів або 2 048 ASIC. Ми детальніше розглянемо пропускну здатність і топологію нижче.
Потужність бокової стойки становить приблизно 50 кВт (у виробництві — 31 кВт), а стойка ASIC споживає 130 кВт. Вся подвійна стойка споживає приблизно 160 кВт. З точки зору споживання електроенергії це приблизно відповідає подвійній стойці GB300.

OpenAI може підключити до одного розширеного мережевого інтерфейсу до 2 048 XPU Jalapeño. Розширена мережа складається з двох доменів. Локальний домен з’єднує всі 128 XPU в стелажі за допомогою задньої панелі. Глобальний домен використовує гібридну комбінацію мідних кабелів та оптичних з’єднань для підключення 2 048 XPU з 16 стелажів. Кожен стелаж містить 8 платформ переключальних пристроїв Chana. Шість середніх переключальних пристроїв Chana використовуються для локального домену, кожен з яких має один 102,4 Тб Tomahawk 6 ASIC. Два переключальних пристрої Chana на верхньому та нижньому кінцях використовуються для глобального домену. Ми вважаємо, що це можуть бути 2 переключальних пристрої Tomahawk 6 по 102,4 Тб кожен, що дає максимальну пропускну здатність до 204,8 Тб на платформу.
У локальному регіоні 128 чіпів Jalapeño забезпечують односторонню пропускну здатність 4,8 Тб/с на кожен XPU. Вони з’єднані повністю з повністю з 6 ASIC Tomahawk 6 по 102,4 Тб/с. Це еквівалентно 48 парам диференційних пар (DP) роз’ємів «папа-матка» на кожен XPU. Загалом для локального розширення використовується 6 144 пари пасивних мідних кабелів DP на кожну стойку.
У глобальній мережі 16 стелажів з 2 048 XPU з’єднані за допомогою мідної задньої панелі, електричних перемикачів 204.8T TH6, оптичних модулів 1.6T та оптичних комутаторів. Одностороння пропускна здатність глобального з’єднання кожного XPU становить 1,6 Тб/с. Кожен XPU має 16 пар диференційних пар (DP) роз’ємів «півмісяць-гніздо» для з’єднання з задньою панеллю та глобальним комутатором. Кожен трей глобального комутатора містить 2 ASIC, пропускна здатність виходу яких розподілена між задньою панеллю та передньою панеллю оптичних пристроїв.
Між локальним та глобальним доменами кількість роз’ємів задньої панелі на стелажі становить 64 пари DP на кожен XPU. Загалом на стелажі використовується 8 192 пари пасивних мідних кабелів.
Глобальна область побудована за чистою архітектурою rail і складається з 8 rail. Ми вважаємо, що OpenAI маршрутизує оптичні з’єднання в глобальній області за допомогою оптичних комутаторів (OCS), встановлених на кожному стелажі. Кожен XPU отримує глобальну пропускну здатність 1,6 Тб/с через мідну задню панель до глобального комутаційного трейу. Потім він виходить із комутатора через оптичні модулі 1,6 Т на передній панелі. Спочатку він потрапляє до пасивного оптичного комутатора, а потім виходить із стелажу. Це дозволяє масштабувати область до 2 048 XPU, розподілених між 16 стелажами по 128 XPU на кожному.

Оскільки розширення мережі становить лише близько 10% від загальних витрат на систему, ця гнучкість забезпечує цінну опцію для майбутніх моделей з 10–20 трильйонами параметрів або контекстним вікном у 2–4 мільйони токенів. Щодо розгортання, OpenAI співпрацює з neocloud. Вона також збирала дані про надійність з партнерами з центрів обробки даних до того, як минув місяць, водночас оптимізуючи час розгортання від причалу до стелажу.
Наступний крок
Далі ми обговоримо майбутнє Jalapeño, чий перший продуктний токен скоро з’явиться. Наступна мета — 100 МВт, основні перешкоди пов’язані з апаратним забезпеченням: скільки вони зможуть виробляти, наскільки добре зможуть розгорнути та експлуатувати центри обробки даних, як забезпечити моніторинг та стійкість тощо. Програмне забезпечення вже підтверджено, і з наявністю внутрішніх моделей будь-яка програмна перевага легко вирівнюється. Після платної стіни ми обговоримо вплив на компанії з виробництва чіпів, такі як NVIDIA, AMD, Cerebras, які уклали угоди з OpenAI на наступні кілька років.
Ми також охоплюємо виробництво, кількість та графік наступного покоління чіпів у моделі Accelerator.
Далі наведено платний контент, який через обмеження прав доступу не був додатково перекладений, але в попередньому тексті вже наведено багато інформації щодо виклику, який OpenAI кидає чіпам NVIDIA. Для гравців, які стежать за сектором чіпів та акціями NVIDIA, ця інформація надасть свіжі та надійні дані.
