Ang Jalapeño Chip ng OpenAI ay lalong mabuting epekto kaysa sa Blackwell ng NVIDIA sa kahusayan

iconTechFlow
I-share
AI summary iconSummary
Ipakita ng on-chain analysis na mas mabuting enerhiya ang Jalapeño chip ng OpenAI kaysa sa Blackwell ng NVIDIA. Ginawa sa 16 buwan, ito ay lumampas sa mga chip ng NVIDIA, AMD, at Google sa mga pangunahing benchmark. Disenyo para sa pangkalahatang AI inference, nagdadala ang Jalapeño ng mataas na token throughput bawat watt nang walang speculative decoding. Bagaman wala itong suporta sa CUDA, maaaring magbago ang performance nito ang merkado ng AI chip. Ipinapakita ng on-chain data ang tumataas na interes sa mga alternatibong solusyon sa AI hardware.

May-akda: SemiAnalysis

Isinalin: Deep潮 TechFlow

DeepChain Guide: Ipinakita ang mga resulta ng pagsubok para sa unang inimbento ng OpenAI na chip para sa pagpapatakbo, ang Jalapeño, na may epekto sa enerhiya na lalong lumalampas sa kasalukuyang flagship na Blackwell ng NVIDIA at malapit na sa susunod na Rubin. Para sa mga AI na kumpanya na nakakaranas ng mga hadlang sa kuryente sa data center, maaaring baguhin ng chip na ito ang balangkas ng merkado sa computing power. Gayunpaman, kung maaari bang talunin ng unang henerasyon ng chip ang CUDA ecosystem ng NVIDIA, ay nasa tanong pa.

Iwasan ang paggamit ng self-developed ASIC sa paghahambing sa total cost of ownership, throughput per megawatt, at mga detalye ng Rubin at Jalapeño

Sa nakaraang dalawang taon, nagrereserch ang OpenAI nang tahimik sa “Jalapeño,” isang inference chip na kahit ngayon ay ipinahayag sa Hot Chips. Ang mga alalahanin tungkol sa tagumpay na pagpapalabas ay nasa paligid na nang ilang panahon. Ngunit ngayon, mayroon na tayong detalye. Inimbita tayo ng OpenAI upang tingnan ang chip, pumasok sa kanilang laboratorio upang patotohanan ang katotohanan nito, at gamitin ang aming InferenceX kit para sa benchmarking.

Noong Hunyo ng taong ito, inilahad ng OpenAI ang kanilang proyektong chip na pinagsama sa Broadcom, na nilikha mula sa zero para sa LLM inference. Ang disenyo ay nagsimula noong gitna ng 2024, at sa loob lamang ng halos 16 buwan mula sa unang pag-recruit ng team hanggang sa paggawa ng chip, isang napakabilis na cycle ng pag-unlad ng ASIC.

Karaniwan, ang mga chip ng unang henerasyon ay walang kompetisyon, ngunit gumawa ng baligtad ang OpenAI—napagtagumpayan nito ang lahat ng mga chip ng NVIDIA, AMD, at Google na aming nasubukan sa maraming pinakamataas na open-source na modelo, at nasa unahan ng industriya. Ang suporta ng OpenAI ay ang ekstremong pagkakaisa ng software at hardware. Sa pagkakataong hindi inaasahan, hindi pinagsikapan ng OpenAI ang isang partikular na bahagi ng model inference, kundi pinagsikapan nito ang paggawa ng isang pangkalahatang chip na nagbibigay ng mataas na performance sa lahat ng mga sitwasyon.

Ang artikulong ito ay maglalalim sa mga detalye ng arkitektura, software, at mga resulta ng performance ng Jalapeño sa InferenceX.

Isang pangkalahatang chip para sa pag-iisip

Sinasabi ng lahat na ang chip ni OpenAI ay disenyo para sa mga modelo ni OpenAI, ngunit mali ito; gumawa ang OpenAI ng isang pangkalahatang chip para sa AI inference.

Ang timeline ay sobrang pabigat. Ito ay nagpapatotoo na totoo ang pahayag na “gamitin ang AI para mabilis ang pagdisenyo ng chip.” Kahit mabilis ang timeline, malaki ang gastos ng OpenAI, gumawa sila ng praktikal na desisyon sa disenyo, at sobrang lakas ng team, kaya hindi ito nakakagulat.

Tingnan lang ang mga spesipikasyon, agad ito ay isang malakas na kalahati:

At gamit ang HBM4, ito ay sapat upang makipagkumpetensya sa mga flagship GPU ng NVIDIA at AMD:

Maraming media ang sumasunod sa ilang pagsasalita ng OpenAI tungkol sa chip na ito, na nagsasabing ito ay mag-o-optimize sa kanilang mga model sa paraan na hindi kayang gawin ng ibang chip. Ito ay mali. Ang Jalapeño ay isang pangkalahatang inference chip na kayang patakbuhin ang iba’t ibang model at workload, kabilang ang aming InferenceX benchmark—na pinatakbuhan namin kasama ang mga engineer ng OpenAI sa kanilang laboratorio. Bilang palaisipan, ipinakita nga nila sa amin kung paano ito pumapatak sa Doom, isang laro na nailipat lamang sa kanilang chip gamit ang Codex prompts.

Narito ang aming pinakamahalagang resulta sa performance/watt, na batay sa token throughput sa bawat megawatt ng kabuuang pagkakagamit ng enerhiya. Ang Jalapeño ay lalong napanalunan ang lahat ng iba pang chip. Walang ginamit na multi-token prediction (MTP) sa lahat ng ito, habang ang iba pang chip sa graph ay nasa kanilang pinakamahusay na konfigurasyon para sa bawat SKU, lahat ay may MTP na naka-on.

Ang Jalapeño ay may mas mataas na performance-per-watt kaysa sa Blackwell sa halos lahat ng mga skena, at hindi ito tinutugma para sa isang partikular na punto sa curve. Hindi lang ito mahusay sa mga skena ng mababang latency, kundi pati na rin sa mga skena ng mataas na throughput. Mas patas na paghahambing ay ang pagtingin sa isang token na pagbibilang, kung saan ang Jalapeño ay naiiwan ng maraming beses ang bawat kalahat. Sa mga mababang concurrency na skena, ipinakita ng Jalapeño ang nakakagigil na interaktibidad, na may higit sa 700 tokens bawat user bawat segundo sa modelong DeepSeek R1 kapag ang concurrency ay 1.

Kahanga-hanga na lahat ng ito ay natutupad gamit ang single-token prediction (STP), walang speculative decoding at walang prefill-decode separation. Bukod sa DeepSeek R1, nakita namin ang iba pang ilang modelong tulad ng Kimi-K2.5 at GPT-OSS na nakakamit ng halos 1,400 tokens bawat user bawat segundo. Para sa lahat ng mga modelong ito, kinumpirma namin na ang mga resulta ni Jalapeño sa GSM8k ay pareho sa mga NVIDIA chip.

May ilang mga paalala dito. Una, lahat ng data ay ibinigay ng OpenAI. Sinubok namin ang InferenceX sa aming laboratorio, ngunit hindi namin sinimulan ang buong benchmark suite ng InferenceX, at hindi namin makita ang mga resulta ng AgentX. Ang AgentX ay ang aming pangunahing suite para sa paghahambing ng performance ng chip, dahil ang mga dataset nito na may sobrang habang konteksto at maraming pagkakataon ay nakakapagpapakita ng pag-uugali ng cache sa tunay na production workload. Ang mga framework na mabuting performa sa 8k1k ay maaaring mas masamang performa sa AgentX, dahil ang tunay na production workload ay nagpapakita ng presyon sa mga komponente tulad ng router, mekanismo ng prefix cache, cache management, at offload infrastructure. Ang single-turn 8k1k test ay hindi nakakapalibot sa lahat ng ito. Para sa karagdagang impormasyon, basahin ang aming artikulo tungkol sa AgentX.

AgentX - InferenceXv3: Nakakatayo pa ba ang CUDA moat sa pagpapatakbo ng agent?

Pangalawa, naniniwala kami na ang paghahambing sa Blackwell ay may kulang at hindi lubos na patas. Ang tunay na kalaban ng Jalapeño ay ang mga chip tulad ng Rubin na gumagamit din ng HBM4. Ang Vera Rubin system ay nagsimula na magpadala sa mga customer, habang ang Jalapeño ng OpenAI ay kumukuha pa lamang ng engineering samples at kailangan pa ng ilang panahon bago makapag-produce sa malaking saklaw.

Kaya ang performance ay dapat talagang i-compare sa Rubin, hindi sa Blackwell. Sa isang paraan, inaasahan namin na ang mga custom chip tulad ng Jalapeño ay lalampas sa Blackwell. Ang performance per watt ng Vera Rubin NVL72 ay 5.4 beses ang dami ng GB200 NVL72, at ito ay isinulat namin sa aming artikulo noong nakaraang buwan tungkol sa mga pagpapahayag ng performance ng NVIDIA at CoreWeave. Pagkatapos ay ipapakita namin ang pagkukumpara ng Jalapeño sa mga performance data ng Vera Rubin noong Hulyo.

Vera Rubin NVL72 kumpara sa GB200 NVL72? Pag-aaral ng TCO at arkitektura

Ikatlo, ang modelo na sinubok ay hindi nasa pinakamoderno na open source. Ang NVIDIA at AMD ay nagsalaysay na ng mas malalaking modelo tulad ng DeepSeek V4 Pro at Kimi K3 gamit ang AgentX. Mas komplikado ang pagpapatakbo ng mas malalaking at mas bago pang modelo sa mga bagong chip. Gayunpaman, ang modelo na pinatakbo ni OpenAI sa Jalapeño ay hindi maliit.

Performance analysis

Ang layunin ng OpenAI ay ang performance per watt. Ang dahilan ay simpleng: ang OpenAI ay limitado ngayon sa kuryente ng data center, hindi sa budget o espasyo ng server room, kaya ang bilang ng token bawat megawatt ay mahalaga. Sa Computex 2026, sinabi ni Jensen Huang na ang performance per watt, reliability, at matagal na buhay ay mga pangunahing katangian ng mga GPU sa hinaharap. Ang kanyang mga salita: “Kung mayroon kang 1 gigawatt ng kuryente, ang throughput bawat watt ay ang kita.” Binanggit niya rin na walang kwenta pumili ng maling arkitektura dahil lamang sa mas mura ang chip.

Pinahalagahan din ng NVIDIA ang puntos na ito sa kanilang pagsasalita tungkol sa Vera sa Hot Chips 2026, habang ipinakita ang parehong grap ng kita: “Ang mga data center ngayon ay limitado sa kuryente.” Mahalaga ang kuryente at ito ang nagpapagalaw sa kita.

Hindi madali para sa mga operator na makakuha ng higit pang megawatt. Ang panahon na kailangan upang dagdagan ang GPU at ang panahon na kailangan upang dagdagan ang kapasidad ng grid ay napakalaking pagkakaiba. Ang limitasyon sa kuryente ng data center ay pinagdadaanan ng maraming paghihirap. Halimbawa, ang mga ugnayan sa utility, infrastraktura, kakayahan sa pagpapalamig, at disenyo ng UPS/backup generator. Madalas na mas hihintayin ng grid ang pag-unlad ng hardware at konstruksyon, na nagdudulot ng pangangailangan para sa table-post power capacity. Ito ay ang pagtatayo ng gas turbine at on-site generator sa loob ng data center. Ang mga kapasidad na ito ay nasa likod ng utility meter at hindi nakadepende sa pampublikong grid. Ito ay nagpapahintulot sa mga operator na magbigay ng kuryente sa kanilang facility nang hindi maghintay ng pag-uugnay sa grid at pag-upgrade ng utility. Ito ang dahilan kung bakit malaki ang pagkakasaligan ni xAI sa table-post power para sa Colossus 2, habang ang kanilang aktwal na ugnayan sa grid ay malayo pa sa pagkakasunod. Para sa karagdagang impormasyon, tingnan ang aming enerhiya model.

Tulad ng isinulat namin sa X post, ang tok/s/MW ay maaaring mapadali bilang bilang ng token bawat joule. Dahil ang watt ay joule bawat segundo. Kaya ang tok/s/MW ay kumakatawan sa epekto ng sistema, at sa kakayahan nito na i-convert ang enerhiya sa token.

Sa larangang ito, lalong lumalabas ang Jalapeño kahit na ihahambing sa Rubin. Ang token throughput ng OpenAI’s Jalapeño bawat megawatt ng STP ay higit sa resulta ng MTP ni Vera Rubin. Ang resultang ito ay inilabas ng NVIDIA at CoreWeave noong Hulyo. Ito ay mas mataas pa kaysa sa MTP resulta ng GB200 noong 2025. Tulad ng aming nabanggit sa artikulo ni Vera Rubin, ang VR ay ihinahambing sa resulta ng GB200 noong 2025. Dahil pareho sila sa parehong maagap na yugto ng pag-start. Samantala, ang paghahambing sa GB200 noong 2025 ay nagpapanatili ng parehong antas ng pagiging matatag ng software. Ayon sa lohikang ito, ihinahambing namin ang tatlong uri ng resulta: ang pinakabagong resulta ni Vera Rubin noong Hulyo 2026, ang resulta ng GB200 noong 2025, at ang kasalukuyang resulta ng Jalapeño. Napakatamang paghahambing ito dahil ito ang pinakamahusay na publikong data ni Rubin. Bukod dito, binuo ng OpenAI ang kanilang sariling chip pagkatapos ni Rubin. Pareho pa ring hindi pa matatag ang OpenAI at Rubin, kaya patuloy pa ang pag-unlad ng performance.

Tungkol sa performance/total cost of ownership, ang Vera Rubin at Jalapeño ay magkakapareho. Parehong nagbibigay ng halos parehong bilang ng output token bawat dolyar. Gayunpaman, tulad na nabanggit, ang mga resulta ng Jalapeño ay hindi ginamit ang speculative decoding. Samantala, ang mga resulta ng Vera Rubin ay gumamit ng speculative decoding. Ang speculative decoding ay maaaring bawasan ang cost bawat token ng halos 3-5 beses. Kapag natutupad na ng Jalapeño ang speculative decoding, mas mataas ang cost-effectiveness nito sa pagbibigay ng token services. Tiyak na, bahagi ng TCO advantage ay mula sa pag-iwas sa mataas na profit margin ng NVIDIA at paglipat sa mas mababang (ngunit patuloy na mataas) profit margin ng Broadcom. Ngunit hindi iyon ang buong dahilan. Halimbawa, ang mga AI ASIC project ng Meta at Microsoft na may higit na panahon sa pagpapalaganap ay hindi nakamit ang tagumpay. Ito ay nagpapakita na ang cost ay bahagi lamang ng equation. Para sa kompletong TCO breakdown ng Jalapeño, tingnan ang SemiAnalysis AI Cloud TCO model.

Sa arkitektura, pinili ni OpenAI na huwag hiwalayin ang prefill at decode sa iba’t ibang pool ng chip. Ang draft model at main model ay nagbabahagi ng parehong chip at interconnect structure. Ang disenyo na ito ay nagtatanggal ng ilang teoretikal na efficiency para makamit ang praktikal na kahusayan sa operasyon. Ang layunin nito ay ang komposisyon ng workload ay nagbabago sa panahon. Halimbawa, ang ratio ng input, cache write, cache read, at output token ay nagbago nang malaki. Ang pagbabagong ito ay naganap pagkatapos nating harapin ang tatlong yugto ng model: kaalaman, pag-iisip, at agent, tulad ng aming pinag-usapan sa kamakailang artikulo. Kaya, kung ikakatakda mo nang maaga ang fixed na bilang ng heterogenous prefill at decode silicon, maaaring magresulta ito sa mababang efficiency sa paglipas ng panahon. Pinili ni OpenAI ang homogenous pool sa arkitekturang ito at pinagsisikapan na gawing mabuting performance ang lahat ng chip sa lahat ng gawain.

At talagang naging ganito. Sa Kimi K2.5 (na batay sa model na Cursor Composer 2.5), nakamit ng Jalapeño ang halos 700 tok/s/user. Ang bilis na ito ay higit sa 9 beses ang bilis ng ikalawang pinakamahusay na chip na 100 tok/s/user.

Sa GPT-OSS, isa pa ring malaking pagkatalo. Ang interaktibong throughput ng Jalapeño bawat megawatt ay halos dalawang beses ang laki ng pinakamataas na throughput point ng GB200. Ito ay higit sa 50 beses ang laki ng concurrency point 1 ng GB200. Ang mas mataas na concurrency point ng Jalapeño ay gumagamit ng EP8.

Ang mga resultang ito ay nakakaimpress! Ngunit kailangan nating maging mas matalino: ang mga ito ay lamang 8k1k, mas madaling i-tune, at wala pa ring data mula sa AgentX. Tulad ng aming sinabi sa artikulo ng AgentX, ang mga workload na may maraming round at mahabang konteksto ay nagdudulot ng mas malaking presyon sa iba’t ibang bahagi ng inference stack. Halimbawa, ang router at prefix cache. Kailangan pa ng karagdagang pag-optimize upang magamit nang maayos sa agent workload. Para sa higit pang impormasyon, basahin ang artikulo ng AgentX.

AgentX - InferenceXv3: Maaari pa bang mapanatili ng CUDA ang kanyang pagkakabukod sa pagpapatakbo ng mga agent?

Mga Detalye at Arkitektura

Lahat ng mga resultang ito ay galing sa A0 step ng Jalapeño, na nagsimula lamang ng 9 buwan. Ngunit ang B0 step ay nasa fab na ngayon! Ang pag-optimize ng B0 ay nagdudulot ng halos 25% na pagtaas sa performance per watt kumpara sa nakaraang A0 silicon. Sa partikular, ang B0 step ay nakakamit ng 13.4 PFLOPs na MXFP4 sa isang chip na may iisang mask size. Ang chip na ito ay ginawa gamit ang TSMC N3P. Sa kumparasyon, ang isang Rubin compute chip ay nakakamit ng 17.5 PFLOPs na dense Rubin NVFP4 sa parehong laki at node.

Dahil ang TDP ng Jalapeño ay lamang 700W, samantalang ang Rubin ay 900-1150W bawat compute chip, mas nakakaimpress ang performance na ito. Dahil ang Jalapeño ay direkta para sa inference at hindi sa training, hindi kailangan ng OpenAI na i-increase ang TDP para maksimisahin ang FLOPs. Maunawaan ito. Ngunit anuman ang mangyari, ipinapakita ng mga resultang ito na ang Jalapeño ay nag-aalok ng malaking peak theoretical FLOPs.

Kapag ihahambing sa iba pang accelerators, may pinakamataas na HBM bandwidth at pinakamataas na FLOPs per watt ang Jalapeño, isang antas na maaaring ikumpara sa 1800W Rubin Max-Q configuration.

Ang Jalapeño ay magdudulot ng HBM4, gawing isa sa mga maagang tagapag-adopt ng teknolohiyang ito pagkatapos ng Nvidia at AMD, kahit na mas maaga pa kaysa sa mga umiiral na TPU at Trainium project. Isa sa mga pangunahing prinsipyo ng arkitektura ng Jalapeño ay ang paggamit nang buong potensyal ng HBM bandwidth, kaya ang pagpapalit sa hindi pinakamataas na HBM ay magiging kontrang sa layunin. Ito ay nagtataglay ng 15.4TB/s na memory bandwidth bawat package, higit pa sa lahat ng iba pang accelerator sa merkado na gumagamit ng HBM3E. Ang 15.4TB/s na bandwidth ay nagpapahiwatig na ang HBM4 nito ay maaaring makamit ang 10Gbps pin rate, kaunting higit pa sa 9.6Gbps ng HBM4 sa Rubin ng Nvidia. Malamang na si Samsung ang nagbibigay ng HBM.

Nakumpleto ng OpenAI ang Jalapeño tape-out noong Nobyembre 2025, mas tumpak na ang CoWoS design tape-out, hindi lamang ang top-level die. Sa loob ng 9 buwan pagkatapos ng tape-out noong Nobyembre 2025, at lamang sa 3 buwan ng debugging sa totoong silicon, nagkaroon na ng napakagandang resulta ang OpenAI gamit ang Jalapeño. Mas nakakaimpress ang mga ito dahil ang team ay nagsimula mula sa zero sa software stack.

Samantala, ang paggawa ng Rubin na CoWoS ay natapos noong Oktubre 2025, isang buwan mas maaga, ngunit ang tanging mga maagang resulta na nakikita natin ay mula sa engineering sample ni CoreWeave. Hindi pinahintulutan ng Nvidia ang aming pagsubok at pagpapalabas ng benchmark tulad ng OpenAI, na nagpapakita na ang software ng kanilang chip ay hindi pa kumpleto. Dahil kay OpenAI ay maaari nang i-run nang mabilis ang mga bagong model sa kanilang sariling chip, maaaring nawala na ang CUDA moat.

Ang mga ito ay patuloy pa ring malayo sa optimal, at makikita natin na ang Jalapeño ay nagbibigay ng mas mabuting data sa pangkabuuan. Hindi namin isasabing mas masama ang Nvidia hardware, kundi mas mabilis ang software debugging ng Jalapeño kumpara sa Nvidia. Ito ay nagpapakita ng kapangyarihan ng hardware/software co-design, na kung saan ito ang pangunahing larangan kung saan ang mga ASIC team ng mga lider sa pagsisiyasat ay nakakalampas sa mga mas matatag na komersyal na chip manufacturer. Sa isang paraan na hindi karaniwan, maaaring nakatulong din sa OpenAI ang pagmumula sa zero, dahil maaari itong gumawa ng mga bagong desisyon sa arkitektura nang walang pagkakabindu sa backward compatibility o mga lumang bersyon ng software.

Bagaman mayroon nang OpenAI na Jalapeño engineering sample, ang mass production ay plano na umabot sa pagsisimula noong 2027, kung saan ang karamihan sa output ay iskedyul na magiging available sa kahuling bahagi ng susunod na taon. Para sa karagdagang detalye tungkol sa bilang ng unit at average selling price, tingnan ang SemiAnalysis Accelerator Model.

Maaaring sabihin na ang OpenAI Jalapeno ay isang tunay na malaking ASIC.

Kumpara sa timeline ni Rubin, ang bilis ni Jalapeño ay nakakatamis. Tulad ng naipakita sa itaas, bagaman mas maaga ang simula ni Rubin, mas mataas pa rin ang resulta ni Jalapeño.

Jalapeño Architecture

Sa mas malalim na arkitektura, ang matrix engine ng chip ay gumagamit ng MXFP numerical format at weight-resident systolic array, na katulad ng TPU. Ngunit sa pagkukumpara direktang sa TPU, ito ay sumusuporta sa mas maliit na shapes/dimensions, na nangangahulugan na hindi ito magkakaroon ng kakaibang performance cliff tulad ng matrix multiplication na may mismatched shapes sa mas malalaking systolic array.

Mayroon ito rin ng 64-bit scalar core at FP32/INT32 vector core. Ang OpenAI ay nag-invest din sa redundancy sa antas ng tray, at may built-in yield recovery sa antas ng core at channel. Sinasabi nila na ang AI-assisted design sa chip ay nagbawas ng 8% sa area ng SIMD at 10% sa area ng matrix engine. Bagaman hindi nila ipinaliwanag ang mga partikular na kondisyon ng proseso/volts/temperatura (PVT), binanggit nila na ang AI-assisted module ay nag-improve ng timing at power consumption kumpara sa initial module.

Ang disenyo ng arkitekturang Jalapeño ay nakatuon sa pag-alis ng paghahatid ng memorya ng KVCache at weights, pati na rin ang fixed latency at overhead, upang maging mas malapit sa original peak compute/bandwidth kumpara sa iba pang accelerators, kahit sa maliit na batch o maliit na shape.

Ang mga core at HBM ay nahahati sa mga slice, kung saan bawat core slice ay may low-latency local view sa sariling HBM slice. Ang synchronization sa pagitan ng mga slice ay ginagawa sa pamamagitan ng high-bandwidth dedicated collective network. Ang simpleng memory hierarchy na ito ay nagbibigay sa Jalapeño ng malaking potensyal na advantage kumpara sa GPU, dahil ang memory access sa GPU ay kailangang lumalabas sa komplikadong memory system, na nagdudulot ng mas malaking latency na kailangang i-amortize o i-hide sa malalaking shape.

Ang pagpili na ito ay maaaring gawin dahil ang pagpapares ng mga weight at KV ay maaaring limitahan sa limitadong at kilalang high-bandwidth communication, tulad ng tensor parallel communication na maaaring mag-overlap sa computation.

Mayroon pa isang karagdagang pangkalahatang NoC para sa pangkalahatang komunikasyon at pag-access sa extended network. Sa kabuuan, nag-save ang OpenAI ng malaking dami ng kapangyarihan at nakamit ng malaking pagpapabuti sa performance kumpara sa Nvidia at Google sa pamamagitan ng pinasimpleang NOC at memory subsystem.

Sa core level, inilarawan ng OpenAI ang isang out-of-order (OoO) core na may L1 cache. Ito ay magkakaiba nang malaki sa mga pattern na nakikita natin sa iba pang accelerators, na lahat ay gumagamit ng software-managed scratchpads, karaniwang kasama ang asynchronous DMA support. Ang argumento dito ay na nagpapahintulot ito sa Jalapeño na iwasan ang fixed overhead tulad ng barrier latency, na sa iba pang accelerators tulad ng GPU, kailangan itong itago o i-ammortize sa pamamagitan ng pagpapataas ng work per core, na nagiging mas mahirap makamit ang raw peak bandwidth/compute.

Ang gastos ay ang pagkakasalig ni Jalapeño sa mahusay na prefetch upang siguraduhing sasabayan ng mga hiling sa memorya, na mas mahirap palagayin at i-interpret. Gayunpaman, sa pamamagitan ng Codex upang makakuha ng detalyadong tracing sa isang maayos na framework, maaaring mahanap ang pinakamahusay na kernel na may pinakamahusay na prefetch para sa ibinigay na hugis, na maaaring kailanganin ng kaunting o walang tulong mula sa tao. Naniniwala kami na ito ang dahilan kung bakit mabilis na nakapag-run ng DeepSeek R1, Kimi K2.5, at GPT-OSS ang OpenAI.

Ang core ay sumusuporta rin sa “mas maliit” mga dimensyon ng matrix, na (depende kung gaano kaliit) dapat itong gawing mas generiko sa iba’t ibang modelo at batch dimensions, at mas mababa ang sensitibidad sa pagkakasunod ng matrix dimensions, overhead ng pagpapuno, at hindi epektibong paghahati. Halimbawa, ang mga TPU, Trainium, at Etched chips ay may napakalaking systolic arrays na maaaring magkakaroon ng pangangailangan para sa malaking batch o mga modelo na dimensyon na eksaktong dibisibleng upang maiwasan ang hindi epektibong paghahati.

Gamit ang Jalapeño, tinutupad ng OpenAI ang pag-alis ng fixed latency sa sistema upang maging malapit sa roofline performance sa lahat ng rehiyon ng Pareto curve. Teoretikal, ito ay maaaring magdala ng kahusayan kumpara sa GPU sa maraming puntos ng paggana:

Ang upper bound performance para sa low-latency/small-batch inference ay mas mahusay kaysa sa GPU. Ang GPU ay limitado ng fixed overhead tulad ng startup latency, barrier latency, at memory system latency.

Kahit sa malalaking dami o mahabang konteksto, may potensyal na mas malapit sa hardware roofline.

May kasamang babala: Kahit na may teoretikal na limitasyon sa performance, ang praktikal na kernel ay mas mahirap makamit ang performance na iyon. Kaya ang kanilang paraan ay tila:

Disenyo ng pinakamataas na limitasyon ng performance para sa lahat ng mga anyo ng workload

Hayaan ang Codex na gawin ang masamang trabaho at hanapin ang kernel na nagpapatupad sa limitasyong ito

Inilunsad ng team ng OpenAI ang InferenceX workload sa Jalapeño, na may napakabilis na turnaround time.

Kaya mas mainam ang aming pagkakatiwala sa paraan na ito.

Kung matagumpay ang Jalapeño, magkakaroon ng malakas na signal.

Ang pagkakadepende ng industriya sa programming models at perfektong universal compiler ay magiging nasusupil ng mga avant-garde AI models.

Isinusulat ng OpenAI ang Jalapeño kernel tulad ng pagsusulat ng assembly.

May hand-tuned code bawat kernel, ang ilan ay humigit-kumulang 3,000 na linya.

Mayroon pa ring suporta para sa pag-check ng kawastuhan at custom sanitizer.

Ang mga unang pagtatrabaho sa core ay may tao sa loop, hindi fully automated.

Pagkatapos ay lumipat sa mas malaking bersyon ng Codex.

Plan ng OpenAI na ipagbili ang bersyon na ito sa mga kliyente sa negosyo.

Ang internal service engine ay tinatawag na "Teacup".

Kakaibang, wala ang OpenAI sa nakaraan sa loob na implementasyon ng MLA kernel.

Hanggang sila ay gumamit ng InferenceX para sa benchmarking ng DeepSeek.

Ang Codex ay nakakasulat nang mabilis ng mga gumagana at epektibong kernel, nang walang kailangang pumasok ang team ng kernel engineering.

Nagpapakita ito ng kakayahan sa pagbuo ng software pipeline.

Ginagamit ng OpenAI ang Gluon para mag-program sa Jalapeño.

Ang Gluon ay ang core programming language ng OpenAI.

Ang Gluon ay binubuo sa ibabaw ng Triton at nagpapanatili ng SPMD (Single Program Multiple Data) programming model ng Triton.

Ngunit ito ay ipinakita ang mga abstrakson sa ilalim ng pagpapatakbo.

Halimbawa, para sa NVIDIA GPU, ito ay nagbibigay ng API na nakakarelasya sa mga PTX instruction.

Kasama ang MMA instruction, TMA instruction, at ang mekanismo ng mbarrier.

Ang pinakamakabagong abstrak na ibinibigay ng Gluon ay ang layout.

Sa pangkalahatan, ang layout ay tumutukoy sa pagtatanggap ng mga mapang pagitan ng mga yunit ng hardware at mga elemento ng tensor.

Halimbawa, ang ika-5 register ng Warp 9, na tumutugon sa tensor element sa ika-6 na row at ika-7 na column.

Ang layout abstraction ng Gluon ay batay sa Linear Layouts.

Ito ay isang layout algebra na nilikha ng OpenAI.

Ang Linear Layouts ay pormalisado ang layout mula sa pananaw ng matematika.

At ibinibigay ang mga kasangkapan para sa layout ng operasyon.

Nag-aalok ito ng maraming mga tampok, tulad ng proof-correct layout transitions.

Mayroon pa rin ang optimal memory swizzling.

Sa programming model ng Jalapeño, bawat Gluon program ay mapapalit sa isang persistent thread.

Naniniwala kami na ito ay nagpapakita na ang Jalapeño ay angkop para sa pattern ng pag-program sa persistent kernel.

Ang bawat programa ay tumatagal sa maraming tile, kung saan ang pagkakabahagi ng trabaho ay ginagawa ng programmer, hindi ng hardware scheduler.

Mentioned ni OpenAI ang TensorInfo.

Ito ay isang abstrak na may eksplisitong encoded layout.

Ito ay maaaring isang set ng layout na disenyo para sa Jalapeño.

Ito ay dadalhin ng Linear Layouts.

Sa huli, bawat core ay nagbibigay ng data prefetch at decoupled out-of-order unit.

Halimbawa, maaaring i-program ng user ang paghintay sa preloaded na data.

Nakalock ang data sa semaphore.

Ang pagkakataon ay nakakatula, ang mga modelo ng OpenAI tulad ng GPT 5.6 Sol ay kasalukuyang tumatakbo sa NVIDIA GPU.

Ginagamit sila upang disenyo ang mga chip, na nagtataguyod ng tunay na banta sa CUDA moat.

Ang mga GPU ng NVIDIA mismo ay nagpapabilis sa potensyal na tagapagpaganap sa real-time.

Sa paghahambing sa iba’t ibang panahon, makikita natin ang bilis ng pag-unlad ng Jalapeño.

Hindi pa nakakaraan ng dalawang linggo, tumataas ng higit sa dalawang beses ang throughput ng ilang interaksyon na mga skena.

Ang bawat tarball na aming natanggap mula sa team ng Jalapeño ay naglalaman ng isang kakaibang mundo.

Hindi lamang itinataas ang core performance, pinagana ng team ng Jalapeño ang TP32 sa loob ng 8 araw.

Ginagawa ang pagpapalawak mula sa dating TP8 configuration patungo sa buong rack-level configuration para sa pagpapatakbo ng malalaking model.

Totoo namang nakakaimpresyon ang bilis ng pag-unlad.

Para sa pag-verify ng performance bago i-run sa totoong hardware, mayroon ding simulator si OpenAI na “chilisim”.

Ang karampatan ay nasa loob ng 5% ng mga nasubok na hardware, gamit ang fixed-width trace bus.

Limitado ang tracking capability sa A0, ngunit malaki ang pagbabago sa B0.

Maaaring dahil sa mga aktwal na data ng pagpapatakbo ng A0 wafer.

Ipinakita ng engineer ang pagpapatakbo ng Codex CLI sa loob na modelo.

Ang itinatawag nito ay "Raiku" o "5.3 Codex Spark", ang TPOT ay 1.2ms.

Ipakita rin ng team ang demo na isinulat ng Codex na tumatakbo nang direkta sa chip.

Kasama ang Doom na may 36 FPS, FP32 fluid dynamics simulation.

Mayroon pa ang visualisasyon ng pag-drag ng mouse na “Liquid Light”.

Sa aspeto ng modelo, ang loob na megakernel na solusyon ng OpenAI ay may palayaw na “gigakernel”.

Ito ay binubuo ng isang megakernel na umiikot sa device upang bawasan ang CPU overhead at startup time.

Patuloy pa ang team sa pagpapalawak ng mga estratehiya sa pagkalkula habang nagtatapos ng pagsubok.

Lalo na pinapansin ang pagkoordinasyon ng paggamit ng 1 milyong rollouts.

Kailangan ba ng Disagg, iyon ang tanong

Nabanggit namin na hindi ginamit ng OpenAI ang prefill-decode separation sa mga chip na ito.

Nakagulat kami dahil ang performance ng NVIDIA at AMD GPU ay nagsarili ng malaking benepisyo mula sa PDD.

Kahit sa parehong homogenous hardware.

Suriin natin kung bakit ginawa ito ng team ng Jalapeño.

Kapag ang workload ay fixed, ang paghihiwalay ng prefill at decode ay tila napakalaking atraksyon.

Ang prefill at decode ay may iba’t ibang presyon sa hardware.

Iwasan ang bawat yugto sa hiwalay na pool na may sariling pagtutuwid, upang mapabuti ang efficiency sa piniling input-output ratio.

Hindi magpapanatili ang production traffic sa proporsyong iyon.

Ang haba ng input-output sequence, concurrency, cache hit rate, speculative acceptance rate, at target latency ay nagbabago sa buong araw.

Kapag hinati ang device sa prefill at decode pools, ang sobrang dami ng prefill demand ay magdudulot ng pagkakawala ng pagkakataon sa decode chips, at magkakaroon ng pagkakasunod-sunod ng mga hiling.

Ngunit kapag masyadong marami ang decode na kahilingan, ang epekto ay kabaligtaran.

Ang operator ay dapat magpatuloy sa paghuhula ng tamang paghahati at pag-iingat ng backup capacity para sa parehong panig.

At balansuhin muli ang isang sistema kung saan ang ideal na proporsyon ay patuloy na nagbabago.

Sa isang unified system, ang ilang mga yaman ay maaaring hindi sapat na gamitin sa tiyak na yugto.

Ngunit ang bawat device ay maaari pa ring gamitin para sa susunod na hiling.

Sa isang disengganyong sistema, ang buong chip ay maaaring maging walang ginagawa lamang dahil sa pagkakaroon nito sa maling pool.

Mas mabuting lokal na paggamit, ngunit maaaring mababa ang pangkalahatang paggamit.

Ang paghihiwalay ay magdudulot din ng pagkasira ng lokalidad.

Ang prefill worker ay naglalabas ng malaking KV cache na agad na kailangan ng decode worker.

Dapat ipasa ng sistema ang estado sa iba’t ibang network para magpatuloy ang pagbuo.

Nagdudulot ito ng dagdag na paggamit ng bandwidth, pag-sync, pagkakaroon ng queue, at isa pang fault domain.

Kumakataas din ang gastos kasabay ng pagtaas ng haba ng input sequence dahil sa paglalaki ng KV cache.

Gayunpaman, ang pag-iwas sa paggalaw ng KV ay pangunahing para sa pag-optimize ng pagkakagastos ng enerhiya at latency.

Ang paglipat ng ilang KV ay maaaring mapataas ang paggamit ng hardware, ngunit sa gastos ng pagkonsumo ng enerhiya at latency ng isang kahilingan.

Ang mga interchangable clusters ay kayang maglipat ng kapasidad sa pagitan ng mga request na sensitibo sa latency at mga batch na nakatuon sa throughput.

Ang fixed splitting ay nag-iisip ng hardware nang walang paggamit kapag nagbabago ang traffic combination.

Dagdag pa, ang pagbabago ng haba ng konteksto ay nagpapalit ng balanse sa pagitan ng attention at FFN.

Ang anumang fixed hardware ratio ay efektibo lamang sa paligid ng design point.

Ang parehong limitasyon ay umiiral sa speculative decoding. Dapat magbigay ang draft model ng candidate tokens sa validator nang sobrang mababang latency. Ang paghihiwalay ng dalawa sa magkakahiwalay na espesyalisadong pool ay magpapalit ng malapit na ugnay na decoding loop sa isang distributed protocol. Ang karagdagang komunikasyon at koordinasyon ay maaaring mapawalang bisa ang latency na napapawi ng draft. Ang pagpapanatili ng parehong model sa iisang device at sa isang mababang latency na istruktura ang tanging paraan upang mapanatili ang locality na nagiging dahilan kung bakit worth it ang speculative decoding.

Gayunpaman, sa mga lugar kung saan ang pangangailangan ay sapat, matatag, at makabuluhan, ang decoupling ay patuloy na nananalo. Lalo na kapag ang tradisyonal na GPU ay nangangailangan ng malalaking batch at phased batching upang makamit ang mabuting throughput. Ngunit hindi ito libreng lunch.

Mula sa Hapon hanggang sa India (mula sa kaunting pait hanggang sa sobrang pait): Ang Katsu, Vindaloo, at Chana—paano nila binuo ang rack system na ito?

Ang sistema ng Jalapeño ay binubuo ng CPU host rack at ASIC rack sa antas ng rack unit. Ang host rack ay naglalaman ng 16 na host CPU trays na tinatawag na “Katsu.” Bawat Katsu ay tumutugma sa isa sa 16 na ASIC trays sa kanan, na tinatawag na “Vindaloo.” Bawat host ay may dalawang AMD EPYC CPU ng Turin class, 1.5TB DRAM bawat rack, 2x E1.S at 2x M.2 SSD. Ang bawat tray ay may 400G (2x200G) front-end network. Ang bawat Katsu tray ay konektado sa bawat Vindaloo tray gamit ang 8 na eksternal PCIe DAC cable. Ang mga kable na ito ay nakalagay sa horizontal sa harap ng rack. Ang system-level design ay ginawa kasama ang Celestica.

Ang ASIC rack ay binubuo ng 16 Vindaloo trays at 8 extension switch trays (6 local + 2 global), na tinatawag na “Chana.” Bawat Vindaloo tray ay naglalaman ng 8 Jalapeño ASIC, na nagbibigay ng kabuuang 128 Jalapeño ASIC bawat rack. Ang mga ASIC ay konektado sa bawat Chana switch tray gamit ang copper backplane, katulad ng Nvidia’s Oberon. Ang extension topology ay nahahati sa local domain at global domain. Ang local domain ay kumakapal sa 128 ASIC sa loob ng rack. Ang global domain ay nag-uugnay sa hanggang 16 rack o 2,048 ASIC. Ipapaliwanag namin nang mas detalyado ang bandwidth at topology sa ibaba.

Ang pagkakapowerng side-mounted server rack ay humigit-kumulang 50kW (31kW sa produksyon), habang ang ASIC rack ay nagkonsumo ng 130kW. Ang buong double-rack system ay humigit-kumulang 160kW. Batay sa pagkakapowerng ito, ito ay katumbas ng isang double-width GB300 rack.

Ang OpenAI ay maaaring magkonekta ng hanggang 2,048 na Jalapeño XPU sa isang solong extended network. Ang extended network ay binubuo ng dalawang domain. Ang local domain ay nagkakonekta sa lahat ng 128 na XPU sa loob ng rack gamit ang backplane. Ang global domain ay gumagamit ng isang halong copper cables at optical interconnects upang magkonekta sa 2,048 na XPU mula sa 16 na rack. Bawat rack ay naglalaman ng 8 na Chana switch trays. Ang 6 na gitnang Chana switches ay ginagamit para sa local domain. Bawat isa ay may isang 102.4T Tomahawk 6 switch ASIC. Ang 2 na Chana switches sa itaas at sa ilalim ay ginagamit para sa global domain. Naniniwala kami na ito ay maaaring 2x 102.4T Tomahawk 6 switches, na nagbibigay ng maximum na 204.8T bawat Chana switch tray.

Sa lokal na rehiyon, ang 128 na Jalapeño chips ay may unidirectional bandwidth na 4.8 Tb/s bawat XPU. Nagkonekta sila sa full-mesh na paraan sa 6 na Tomahawk 6 ASIC na may 102.4 Tb/s. Ito ay katumbas ng 48 pairs ng differential pairs (DP) male-female connectors bawat XPU. Kabuuan, may 6,144 pairs ng DP na passive copper cable para sa lokal na pagpapalawig bawat rack.

Sa global domain, ang 16 na racks na may 2,048 XPU ay konektado sa pamamagitan ng kombinasyon ng copper backplane, electrical 204.8T TH6 switch, 1.6T optical modules, at optical circuit switch. Ang unidirectional bandwidth ng global link bawat XPU ay 1.6Tb/s. Kaya mayroon ang bawat XPU ng 16 pairs ng differential pairs (DP) male-female connectors para sa backplane sa pagitan ng XPU at global switch. Ang bawat global switch tray ay may 2 ASIC, kung saan ang output bandwidth ay hinahati sa pagitan ng backplane at front-panel optics.

Sa pagitan ng lokal at global na domain, may 64 pares ng DP ang bawat rack connector bawat XPU. Kabuuang 8,192 pares ng DP ang passive copper cable sa bawat rack.

Ang global domain ay gumagamit ng pure rail architecture na binubuo ng 8 rail sa loob ng global domain. Naniniwala kami na ang OpenAI ay gumagamit ng optical circuit switches (OCS) na nakakabit sa bawat rack upang i-route ang optical links sa global domain. Ang 1.6Tb/s na global bandwidth ng bawat XPU ay dadalhin sa pamamagitan ng copper backplane patungo sa global switch tray. Pagkatapos, ito ay lumalabas sa switch sa pamamagitan ng 1.6T optical module sa front panel. Una itong pumapasok sa passive optical switch, at pagkatapos ay lumalabas sa rack. Ito ang nagpapahintulot sa pagpapalawak ng domain size hanggang 2,048 XPU, na binubuo ng 16 rack, bawat isa ay may 128 XPU.

Dahil ang pagpapalawak ng network ay nagtatampok lamang ng halos 10% ng kabuuang gastos ng sistema, ang pagkakaroon ng ganitong fleksibilidad ay nagbibigay ng mahalagang opsyon para sa mga modelo na may 10 hanggang 20 trilyon na parameter o 2 milyon hanggang 4 milyon na token na context window. Sa aspeto ng deployment, nagtatrabaho ang OpenAI kasama ang neocloud. Nakikipagtulungan din ito sa mga partner sa data center upang kumalap ng data tungkol sa reliability isang buwan bago, habang pinapabuti ang oras ng deployment mula sa dock hanggang sa rack.

Susunod na hakbang

Susunod, tatalakayin natin ang kinabukasan ng Jalapeño, kung saan ang kanilang unang production token ay malapit nang dumating. Ang sumusunod na layunin ay 100MW, at ang mga hadlang ay pangunahin sa hardware: gaano karami ang kanilang kakayahan na produksyonin, gaano kahusay ang kanilang pag-deploy at pagpapatakbo ng data center, at paano sila mag-aangkop sa monitoring at resilience. Ang software ay napatunayan na, at mayroon silang internal model, kaya ang anumang unang pagkakataon sa software ay madaling makamit. Pagkatapos ng paywall, tatalakayin natin ang epekto sa mga kumpanya ng chip tulad ng NVIDIA, AMD, at Cerebras, na may mga kontrata na sinagot nila kasama ang OpenAI sa mga susunod na taon.

Kasama pa namin sa Accelerator model ang produksyon, dami, at takdang panahon ng mga chip ng susunod na henerasyon.

Ang mga sumusunod ay premium na nilalaman, at dahil sa mga problema sa pahintulot, hindi ito karagdagang isinalin, ngunit ang mga dating impormasyon sa unang bahagi ay nagpapakita na may hamon ang OpenAI sa mga chip ng NVIDIA. Para sa mga manlalaro na nakikinig sa sektor ng chip at presyo ng NVIDIA, ang mga impormasyong ito ay magbibigay ng bago at matibay na gabay.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.