May-akda: Dong Jing
Source: Wall Street Journal
Ang unang sariling chip ng OpenAI, ang Jalapeño, ay lumabas nang biglaan at nagbago sa dating istruktura ng industriya ng AI chip—hindi lamang isang pagpapalabas ng produkto, kundi isang signal: ang AI ay nagbabago sa paraan ng pagdisenyo ng mga chip mismo.
Ayon sa Wall Street Journal article, ayon sa Bloomberg noong Agosto 25, sinabi ng OpenAI na ang Jalapeño ay nangunguna sa dalawang mahahalagang indikador—ang dami ng AI workload na maaaring tratuhin bawat yunit ng pagkakagastusan ng enerhiya at ang bilis ng pagtugon—kumpara sa NVIDIA GB300. Ang chip na ito, na inilikha ng OpenAI at Broadcom, ay espesyal na disenyo para sa pag-iisip ng AI at maaaring maipasok sa praktikal na paggamit sa huling bahagi ng taon. Sinabi ni Richard Ho, pinuno ng chip ng OpenAI, na ang Jalapeño ay nagtataglay ng malakas na performance sa mababang pagkakagastusan ng enerhiya na 700 watt, na makakatulong sa malaking pagbaba ng gastos sa kuryente ng data center.

Ayon sa semiconductor research firm na SemiAnalysis, natapos ang chip mula sa pagmumula ng disenyo hanggang sa pagkumpleto ng fabrication sa loob lamang ng halos 16 na buwan, at ang mahalagang node ng CoWoS packaging fabrication ay natapos noong Nobyembre 2025, na lamang 9 na buwan ang nakalipas, na mas mababa kaysa sa karaniwang cycle ng industriya na 18 hanggang 36 na buwan.

Ang mga siyentipiko ng SemiAnalysis ay direktang dumaan sa OpenAI lab at sinubukan ang Jalapeño gamit ang kanilang sariling benchmark suite na InferenceX, at ang konklusyon ay direkta: nanalo ang chip na ito sa bawat watt na performance (perf/W) kumpara sa lahat ng mga chip ng NVIDIA, AMD, at Google na kanilang nasubukan bago.
Mas mahalaga na ang tagumpay na ito ay natamo habang ang Jalapeño ay hindi pa gumagamit ng mga optimalisasyon tulad ng speculative decoding, pre-filling, at paghihiwalay ng decoding deployment, habang ang iba pang mga chip na nakikilahok sa paghahambing ay nagsasagawa na ng kanilang sariling pinakamahusay na konfigurasyon.
Napapagtotoo na kahit ang kilalang semiconductor analyst na si Dylan Patel ay direktang sinabi, “Hindi lang ang Blackwell ang napasobraan, kundi pati na ang NVIDIA Rubin chip!”

Ang pagsusuri ay nagmumungkahi na ang resultang ito ay direktang lumalaban sa posisyon ng NVIDIA sa merkado at nagpapakilala muli sa kompetisyon sa mga chip ng AI.
Actual test data: Pinasupil ng Jalapeño ang Blackwell sa maraming pangunahing indikador
Ang mga resulta ng pagsubok ng SemiAnalysis ay nagpapakita na ang pangunahing kahusayan sa pagpapaliwanag ng Jalapeño ay lubos na makabuluhan.
Sa GPT-OSS 120B model, ang Jalapeño ay nakakapaglabas ng humigit-kumulang 1,459 na Token bawat segundo, samantalang ang NVIDIA GB200 ay nagpapakita lamang ng 535; sa aspeto ng end-to-end latency, ang Jalapeño ay nakakakumpleto ng isang task sa 1.65 segundo lamang, habang ang GB300 ay nangangailangan ng halos 6 segundo, na may pagkakaiba ng 3.6 beses. Sa mga mataas na interaktibong skena, kapag pinapalakas ang GB300 sa pinakamabilis na decoding speed nito (169 na Token bawat segundo), ang throughput ng Jalapeño ay 104.3 beses ang laki nito.

Sa pangunahing tukoy na pagtukoy sa epekto ng data center na ang bilang ng Token na inilabas bawat megawatt bawat segundo, natamo ng Jalapeño ang halos 53 milyong Token/MW/s sa GPT-OSS model, samantalang ang GB200 NVL72 ay halos 10 milyon lamang.

Sinabi ng SemiAnalysis na ang indikator na ito ay katumbas ng bilang ng Token na nabubuo bawat joule, na direktang tumutukoy sa taas ng kita ng data center—sa panahon na ang computing power ay limitado ng kuryente, ang pagkakaroon ng kahusayan sa aspetong ito ay napakahalaga.
Batay sa sistemang gastos, ayon sa SemiAnalysis na kinasasakop ang pagkakapowder, pagpapalamig, at networking sa kalkulasyon, ang kabuuang gastos sa pagmamay-ari ng Jalapeño ay halos $1.56 bawat chip bawat oras, na katumbas ng $1.55 ng H100, samantalang ang NVIDIA Vera Rubin ay umabot sa $3.61.

Mahalagang tandaan na may ilang mahahalagang pag-aalala ang SemiAnalysis.
Una, ang modelo na ginamit sa pagsubok ay hindi ang pinakamoderno sa kasalukuyan; ang NVIDIA at AMD ay nagsalaysay ng mga resulta batay sa AgentX suite sa mas malalaking modelo tulad ng DeepSeek V4 Pro at Kimi K3, habang ang Jalapeño ay hindi pa natatapos ang pagsubok sa AgentX—ang suite na ito ay mas mabuting nagpapakita ng performance sa tunay na production scenarios tulad ng multi-turn at long-context.
Pangalawa, ang mas patas na paghahambing ay ang NVIDIA Vera Rubin na gumagamit din ng HBM4, hindi ang Blackwell; ang bawat watt na performance ng Vera Rubin ay umabot ng halos 5.4 beses ang pagtaas kumpara sa GB200 NVL72, at sa paghahambing sa Jalapeño, pareho sila sa kabuuang gastos sa pagkakaroon (TCO) bawat Token.
Ikatlo, ang Jalapeño ay kasalukuyang nasa phase ng engineering sample, at ang mass production ay inaasahang magkakaroon ng pagtaas sa 2027.
AI-designed chips: The "flywheel effect" of GPT-Astra and Codex
Ang pagkakaroon ng malalim na paggamit ng mga kasangkapan sa AI ay isa sa pangunahing dahilan kung bakit natapos ng Jalapeño ang pagbuo nito sa ganitong kakaibang bilis. Ayon sa SemiAnalysis, ginamit nang malawakan ng OpenAI ang mga panloob na AI model sa proseso ng pagdisenyo ng chip, kabilang dito ang GPT-Astra na napakalaking pansin ng publiko.
Ang gumagamit ng sosyal na platform X na si Andrew Curran ay binanggit ang impormasyon mula sa OpenAI na ang GPT-Astra ay malalim na nakikilahok sa buong proseso ng pagbuo ng Jalapeño:
Ginamit ng team ang Codex at GPT-Astra upang i-optimize ang tatlong open-source model na hindi kasama sa orihinal na produksyon plan ni Jalapeño sa loob ng dalawang buwan.

Ibig sabihin nito, ang AI ay hindi lamang nagpapabilis sa pagdidisenyo ng mga chip, kundi pati na rin ang mabilis na pagpapalawak sa saklaw ng mga modelo na maaaring suportahan ng chip.
Ang data ng SemiAnalysis ay nag-quantify pa ng kontribusyong ito:
Ang AI-assisted design ay nagbawas ng 8% sa sukat ng SIMD unit at 10% sa sukat ng matrix engine, habang nagtataglay ng mas mabuting performans sa timing at power consumption kumpara sa orihinal na bersyon.

Sa software level, ginamit ng OpenAI ang kanilang internal na extended version ng Codex upang isulat ang Jalapeño kernel, kung saan ang ilang kernel code ay may haba ng humigit-kumulang 3,000 na linya; sa pinakamalakas na performance na attention mechanism at MoE modules, ang code na ginawa ng AI ay 1.5 hanggang 1.8 beses na mas mabilis kaysa sa implementation ng mga pinakamahusay na human engineers.
SemiAnalysis ay nagbigay ng masinsinang pagsusuri: Ang mga modelo ng OpenAI (tulad ng GPT-5.6 Sol) na tumatakbo sa mga GPU ng NVIDIA ay ginagamit upang disenyo ang isang chip na may tunay na banta sa CUDA moat—“ang sariling GPU ng NVIDIA ay direktang nagpapalawak sa posibleng kanyang tagapagpaganap.”

Pagsusuri sa arkitektura: Bakit mas mabilis ang "general-purpose"?
Ang pangkalahatang pagkaunawa ay ang Jalapeño ay isang chip na espesyal na disenyo para sa mga modelo ng OpenAI, ngunit ang konklusyon ng SemiAnalysis ay kabaligtaran: ang Jalapeño ay isang pangkalahatang chip para sa AI inference na kayang patakbuhin ang iba’t ibang mga modelo at workload, kabilang ang laro ng Doom na na-transplant sa pamamagitan ng Codex.
Sa antas ng arkitektura, ang pangunahing pilosopiyang disenyo ni Jalapeño ay "pag-alis ng fixed latency". Sa pagkakaiba sa GPU na nakadepende sa komplikadong memorya hierarchy, pinaghihiwalay nang direkta ni Jalapeño ang mga computing core sa bawat HBM slice, at sinasynchronize ang mga core sa pamamagitan ng isang espesyal na high-bandwidth collective network, na nagpapababa nang malaki sa latency ng pag-access sa memorya.
Bukod dito, gumagamit ang Jalapeño ng OoO core kasama ang L1 cache, kaysa sa software-managed scratchpad na karaniwang ginagamit ng iba pang accelerators, na nagpapahintulot sa mga ito na mas malapit sa teoretikal na hardware peak sa mga maliit na batch at low-latency scenarios.
Sa kahusayan ng bandwidth ng memorya, ang Jalapeño ay gumagamit ng HBM4 na nagtataguyod ng 15.4 TB/s na bandwidth ng memorya sa isang pakete, na may 22 na bandwidth ng HBM bawat watt, habang ang NVIDIA Rubin ay 11.1 at ang GB300 ay lamang 5.71.

Sinabi ng SemiAnalysis na ang pin speed ng HBM4 ni Jalapeño ay 10Gbps, kaunting mas mataas kaysa sa 9.6Gbps ng NVIDIA Rubin, at posibleng supplier ng HBM ay Samsung.
Mahalagang banggitin na pinili ng Jalapeño na hindi gawin ang pre-filling at decoding separation deployment (PDD). Binigyang-paliwanag ng SemiAnalysis ito nang detalyado:
Sa totoong production environment, patuloy na nagbabago ang ratio ng input at output, concurrency, at cache hit rate; ang fixed pooling ay nagdudulot ng pagbaba ng global utilization; samantala, ang homogeneous resource pool ay maaaring mabilis na sumagot sa pagbabago ng traffic at dinamikong mag-aalok sa mga request na sensitive sa latency at high-throughput batch processing.
Ang CUDA moat: May mga butas na?
Inilabas ng SemiAnalysis ang isang malakas na pagtataya sa kanilang ulat: ang pagkakapal ng CUDA ay maaaring namatay na.
Batay sa pagkukumpara sa bilis ng pag-start ng software. Nakumpleto ng NVIDIA ang paggawa ng CoWoS ng Rubin isang buwan mas maaga kaysa sa Jalapeño, ngunit hanggang sa ngayon, ang tanging pampublikong benchmark data ng Rubin na makikita ng labas ay mula sa engineering sample ni CoreWeave; hindi nagbukas ang NVIDIA para sa mga third-party na magpapalaya sa kanilang laboratorio tulad ng OpenAI. Naniniwala ang SemiAnalysis na ito ay nagpapakita hindi ng pagkakaiba sa hardware mismo, kundi ng pagkakaiba sa kasaganaan ng software.
Ang pagbuo ng software stack mula sa zero ay nagbigay-daan sa OpenAI na malaya sa mga nakaraang balakid at gumawa ng mas malinaw na mga desisyon sa arkitektura. Ginagamit ng OpenAI ang kanilang sariling programming language na Gluon (na batay sa Triton) at ang kanilang internal inference engine na "Teacup", at ginamit ang Codex para mabilis na i-optimize ang kernel. Tiningnan ng SemiAnalysis na sa loob ng higit sa dalawang linggo, tumataas ang throughput ng Jalapeño ng higit sa dalawang beses sa partikular na interactive speed; sa loob ng 8 araw, napalawak ng team ang tensor parallelism mula sa TP8 patungo sa TP32, na nagresulta sa full-rack deployment sa iba’t ibang rack.
Gayunpaman, binigyang-diin din ng SemiAnalysis na ang kasalukuyang pagsubok ay nakapokus lamang sa relatibong simpleng workload ng 8k1k at hindi pa natatapos ang maramihang habang konteksto ng pagsubok para sa AgentX. Sa mas kumplikadong mga workload ng agent, ang pagganap ng mga komponente tulad ng router at prefix cache ay magiging bagong hamon.
Susunod na hakbang: Ang B0 ay nasa pabrika na, unti-unting ipinapakita ang 10GW na plano
Hindi pa natatapos ang kuwento ni Jalapeño.
Ayon sa SemiAnalysis, ang mga sample na ginagamit sa kasalukuyang public testing ay A0 stepping, habang ang B0 stepping ay nasa fab na nagpapaproseso, at inaasahang magkakaroon ng karagdagang pagpapabuti ng halos 25% sa performance per watt kumpara sa A0—ang MXFP4 computing power ng isang B0 die ay magiging 13.4 PFLOPs, habang ang TDP ay mananatili sa 700W.
Sa sistemang level, nagtutulungan ang OpenAI at Celestica para disenyo ang buong rack solution: bawat ASIC rack ay naglalaman ng 128 Jalapeño chips, at ang kabuuang pagkonsumo ng enerhiya ng double-rack system ay humigit-kumulang 160kW, katumbas ng NVIDIA GB300 double-width rack.

Sa aspeto ng pagpapalawak, ang isang solong network domain ay maaaring magkonekta ng hanggang 2,048 na Jalapeño XPU, na nakakapalupong 16 na rack. Sa aspeto ng mass production, inaasahan ng SemiAnalysis na magkakaroon ng gradual scaling noong 2027, at ang sumusunod na milestone ay ang 100MW deployment scale.
Mas malaking estratehikong imahe ay ang pagkakasundo ng OpenAI at Broadcom sa isang 10GW na pagsasama-samang akuselerador, na katumbas ng kapasidad ng sampung nuclear power plant na nagpapatakbo sa buong lakas.
Ang artikulo ng Wall Street Journal ay nag-uulat na si Richard Ho, pinuno ng chip ng OpenAI, ay nagsabi na ang kompanya ay nakamit na ang antas ng pagkakasunog ng enerhiya at gastos na makakatulong na bawasan ang gastos sa infrastruktura, "Ito ay tanging unang hakbang." Samantala, pinahalagahan niya na ang NVIDIA ay patuloy na mahalagang kasamahan, at ang pangangailangan ng OpenAI sa computing power ay napakalaki, kaya't hindi ito gagawing pabaya ang mga kasalukuyang supplier sa maikling panahon.
Sinabi ng mga analista na ang kahalagahan ng Jalapeño ay maaaring hindi nasa kung gaano karaming chip ng NVIDIA ang maaaring palitan nito ngayon, kundi sa pagpapatotoo nito sa isang bagay na dating pinagdududahan: isang AI company, gamit ang mga AI tool, ay nakagawa ng isang tunay na kompetitibong chip sa rekord na oras. Ang ganitong siklo ay nagsimula nang umikot.
