Penulis asal: Dong Jing
Sumber asal: Wall Street Vision
Chip pertama buatan sendiri OpenAI, Jalapeño, muncul dengan kecepatan yang mengejutkan dan menggulingkan struktur lama dalam industri chip AI—ini bukan sekadar pelancaran produk, tetapi juga isyarat: AI sedang membentuk semula cara reka bentuk chip itu sendiri.
Menurut artikel Wall Street Journal, seperti dilaporkan Bloomberg pada 25 Ogos, OpenAI menyatakan bahawa Jalapeño memimpin dalam dua indikator utama—jumlah kerja AI yang boleh diolah per unit tenaga dan kelajuan respons—berbanding GB300 milik NVIDIA. Cip ini dibangunkan secara kolaboratif oleh OpenAI dan Broadcom, dirancang khusus untuk peringkat inferens AI, dan dijangka akan digunakan secara praktikal pada akhir tahun ini. Richard Ho, ketua cip OpenAI, menyatakan bahawa Jalapeño mampu mencapai prestasi kuat dengan hanya 700 watt tenaga rendah, yang membantu mengurangkan kos elektrik pusat data secara besar-besaran.

Menurut institut penyelidikan semikonduktor SemiAnalysis, cip ini hanya mengambil masa sekitar 16 bulan dari permulaan reka bentuk hingga selesai proses peluaran, dengan nod peluaran pembungkusan CoWoS kunci selesai pada November 2025, baru 9 bulan yang lalu, jauh lebih rendah daripada kitaran biasa industri iaitu 18 hingga 36 bulan.

Penyelidik SemiAnalysis mengunjungi laboratorium OpenAI secara langsung dan menguji Jalapeño menggunakan rangkaian ujian buatan sendiri mereka, InferenceX, dengan kesimpulan langsung: cip ini mengalahkan semua cip NVIDIA, AMD, dan Google yang sebelumnya mereka uji dalam indikator prestasi per watt (perf/W).
Lebih penting lagi, pencapaian ini diraih tanpa mengaktifkan pengoptimuman seperti penyelesaian spekulatif Jalapeño, pengisian awal, dan penyebaran pemisahan dekod, sementara cip lain yang dibandingkan telah mengaktifkan konfigurasi terbaik masing-masing.
Tidak hairanlah ahli analis semikonduktor terkenal Dylan Patel pun secara terus terang berkata, “Bukan hanya Blackwell yang disalip, tetapi cip Rubin NVIDIA juga telah dilampaui!”

Analisis menganggap bahawa keputusan ini menimbulkan cabaran langsung terhadap kedudukan pasaran NVIDIA, serta memaksa pasaran untuk meninjau semula landskap persaingan cip AI.
Data ujian sebenar: Jalapeño mengalahkan Blackwell dalam beberapa indikator utama
Keputusan ujian SemiAnalysis menunjukkan bahawa Jalapeño mempunyai kelebihan yang ketara dalam kecekapan inferens.
Pada model GPT-OSS 120B, Jalapeño mampu menghasilkan sekitar 1.459 token per saat, manakala NVIDIA GB200 hanya 535; dari segi latensi end-to-end, Jalapeño menyelesaikan satu tugas hanya dalam 1.65 saat, manakala GB300 memerlukan hampir 6 saat, dengan perbezaan sebanyak 3.6 kali. Dalam skenario interaksi tinggi, apabila GB300 didorong kepada kelajuan dekod paling pantasnya (169 token per saat), throughput Jalapeño adalah 104.3 kali ganda.

Pada ukuran inti kecekapan pusat data, iaitu jumlah Token yang dikeluarkan setiap megawatt per saat, Jalapeño mencapai sekitar 53 juta Token/MW/s pada model GPT-OSS, manakala GB200 NVL72 hanya sekitar 10 juta.

SemiAnalysis menunjukkan bahawa indikator ini pada dasarnya setara dengan jumlah Token yang dihasilkan per joule, yang secara langsung menentukan batas pendapatan pusat data—pada masa kini di mana kuasa pengiraan dibatasi oleh tenaga listrik, keunggulan dalam dimensi ini sangat penting.
Dari segi kos peringkat sistem, menurut SemiAnalysis yang memasukkan kuasa, penyejukan, dan rangkaian ke dalam pengiraan, kos kepemilikan keseluruhan setiap jam bagi Jalapeño ialah sekitar $1.56 per cip, hampir sama dengan $1.55 bagi H100, manakala Vera Rubin daripada NVIDIA pula mencapai $3.61.

Perlu diperhatikan bahawa SemiAnalysis juga mengemukakan beberapa kekecualian penting.
Pertama, model yang digunakan dalam ujian bukanlah model terkini; NVIDIA dan AMD telah mengumumkan hasil berdasarkan AgentX suite pada model berskala lebih besar seperti DeepSeek V4 Pro dan Kimi K3, manakala Jalapeño belum menyelesaikan ujian AgentX—suite ini lebih mampu mencerminkan prestasi dalam skenario pengeluaran sebenar seperti perbualan berbilang ronde dan konteks panjang.
Kedua, perbandingan yang lebih adil ialah dengan NVIDIA Vera Rubin yang juga menggunakan HBM4, bukan Blackwell; prestasi setiap watt Vera Rubin meningkat sekitar 5.4 kali ganda berbanding GB200 NVL72, dan dalam hal jumlah kos kepemilikan (TCO) setiap Token, ia hampir seimbang dengan Jalapeño.
Ketiga, Jalapeño masih berada dalam peringkat sampel kejuruteraan, dan pengeluaran berskala besar dijangka mulai meningkat pada tahun 2027.
Cip rekaan AI: "Efek roda pemutar" GPT-Astra dan Codex
Kepantasan Jalapeño dalam menyelesaikan pembangunan merupakan salah satu sebab utama kerana penyertaan mendalam alat AI. Menurut SemiAnalysis, OpenAI menggunakan model AI dalaman secara meluas dalam proses reka cipta cip, termasuk GPT-Astra yang mendapat perhatian luas dari luar.
Pengguna platform sosial X, Andrew Curran, mengutip maklumat dari OpenAI yang menyatakan bahawa GPT-Astra terlibat secara mendalam sepanjang pembangunan Jalapeño:
Pasukan menggunakan Codex dan GPT-Astra untuk mengoptimumkan tiga model sumber terbuka yang asalnya tidak termasuk dalam pelan pengeluaran Jalapeño kepada keadaan berprestasi tinggi dalam masa dua bulan.

Ini bermakna bahawa AI tidak hanya mempercepat proses reka bentuk cip itu sendiri, tetapi juga memperluaskan dengan cepat julat model yang disokong oleh cip tersebut.
Data dari SemiAnalysis mengkuantifikasikan sumbangan ini:
Reka bentuk bantuan AI mengurangkan luas unit SIMD sebanyak 8% dan luas enjin matriks sebanyak 10%, sambil memberikan prestasi jangka masa dan penggunaan kuasa yang lebih baik berbanding versi asal.

Di peringkat perisian, OpenAI menggunakan versi eksternal Codex dalaman untuk menulis teras Jalapeño, dengan sebahagian kod teras mencapai kira-kira 3000 baris; pada mekanisme perhatian dan modul MoE yang paling menuntut prestasi, kod yang dihasilkan AI lebih pantas 1.5 hingga 1.8 kali berbanding implementasi jurutera terkemuka manusia.
SemiAnalysis memberikan penilaian yang sangat tajam: Model OpenAI yang berjalan di GPU NVIDIA, seperti GPT-5.6 Sol, sedang digunakan untuk merancang chip yang benar-benar mengancam moat CUDA—“GPU milik NVIDIA sendiri sedang secara real-time menciptakan pengganti potensialnya.”

Analisis arsitektur: Mengapa "segera" justru lebih pantas?
Secara meluas, orang menganggap Jalapeño sebagai cip yang secara mendalam disesuaikan untuk model milik OpenAI sendiri, tetapi kesimpulan SemiAnalysis justru sebaliknya: Jalapeño adalah cip generik untuk inferensi AI yang mampu menjalankan pelbagai model dan beban kerja, termasuk permainan Doom yang dipindahkan menggunakan Codex.
Pada peringkat arsitek, falsafah reka bentuk inti Jalapeño ialah "menghilangkan latensi tetap". Berbeza dengan GPU yang bergantung pada peringkat memori yang kompleks, Jalapeño mengikat inti pengiraan secara langsung dengan kepingan HBM, dengan inti-inti disegerakkan melalui rangkaian kolektif berpemandu lebar jalur khas, yang secara besar-besaran mengurangkan latensi akses memori.
Selain itu, Jalapeño menggunakan inti eksekusi berurutan (OoO) dengan cache L1, bukan register perisian yang biasa digunakan oleh akselerator lain, menjadikannya mampu mendekati puncak teori peranti keras dalam skenario sampel kecil dan latensi rendah.
Dalam hal lebar pita memori, Jalapeño menggunakan HBM4, mencapai lebar pita memori per paket sebesar 15.4TB/s, dengan lebar pita HBM per watt mencapai 22, manakala NVIDIA Rubin berada pada 11.1 dan GB300 hanya 5.71.

SemiAnalysis menunjukkan bahawa kelajuan pin HBM4 Jalapeño ialah 10Gbps, sedikit lebih tinggi daripada 9.6Gbps Rubin NVIDIA, dengan pemasok HBM mungkin ialah Samsung.
Perlu ditekankan bahawa Jalapeño memilih untuk tidak melaksanakan penghantaran pemisahan pengisian awal dan dekod (PDD). SemiAnalysis memberikan penjelasan terperinci mengenai ini:
Dalam persekitaran pengeluaran sebenar, parameter seperti nisbah input-ke-output, jumlah serentak, dan kadar kejayaan cache sentiasa berubah; pengagihan tetap menyebabkan penggunaan keseluruhan menurun; manakala kolam sumber homogen boleh menanggapi perubahan trafik secara fleksibel, mengalihkan sumber secara dinamik antara permintaan yang peka kepada latensi dan pemprosesan batch berkelajuan tinggi.
CUDA moat: Retak telah muncul?
SemiAnalysis dalam laporan mereka mengemukakan satu kesimpulan yang berkesan: parit pertahanan CUDA mungkin sudah mati.
Ia berdasarkan perbandingan kelajuan permulaan perisian. Pemprosesan CoWoS untuk NVIDIA Rubin selesai sebulan lebih awal berbanding Jalapeño, tetapi sehingga kini, data ujian awam yang boleh dilihat oleh pihak luar untuk Rubin hanya datang daripada contoh kejuruteraan CoreWeave, dan NVIDIA tidak membuka akses bebas kepada pihak ketiga untuk menguji di makmal seperti yang dilakukan oleh OpenAI. SemiAnalysis berpendapat bahawa ini mencerminkan perbezaan dalam kedewasaan perisian, bukan perbezaan dalam peranti keras itu sendiri.
Membina tatarak perisian dari sifar membolehkan OpenAI melepaskan beban sejarah dan membuat keputusan架构 yang lebih bersih. OpenAI menggunakan bahasa pengaturcaraan inti buatan sendiri Gluon (berasaskan Triton) dan enjin inferens dalaman "Teacup", serta memanfaatkan Codex untuk mempercepatkan penyesuaian inti. SemiAnalysis memperhatikan bahawa dalam kurang daripada dua minggu, Jalapeño meningkatkan throughput lebih daripada 2 kali ganda pada kelajuan interaksi tertentu; dalam 8 hari, pasukan mengembangkan paralelisme tensor dari TP8 ke TP32, mencapai penghantaran skala penuh rak di seluruh rak.
Namun, SemiAnalysis juga dengan jelas menunjukkan bahawa ujian semasa hanya mencakup beban kerja 8k1k yang relatif mudah, dan belum menyelesaikan ujian panjang konteks berbilang langkah AgentX. Di bawah beban kerja agen yang lebih kompleks, prestasi komponen-komponen seperti penghala dan cache awalan akan menjadi ujian baru.
Langkah seterusnya: B0 telah tiba di pabrik, peta 10GW sedang berkembang perlahan
Cerita Jalapeño belum berakhir.
Menurut SemiAnalysis, chip yang digunakan dalam ujian awal kini semuanya adalah versi A0, manakala versi B0 telah memasuki pabrik wafer, dengan jangkaan peningkatan kira-kira 25% dalam prestasi per watt berbanding A0—kekuatan komputasi MXFP4 untuk satu die komputasi B0 akan mencapai 13.4 PFLOPs, dengan TDP kekal pada 700W.
Pada peringkat sistem, OpenAI bekerjasama dengan Celestica untuk merekabentuk penyelesaian rak penuh: setiap rak ASIC mengandungi 128 cip Jalapeño, dengan jumlah kuasa sistem dua rak sekitar 160kW, setara dengan rak dual-width NVIDIA GB300.

Dalam hal penghawaan berskala besar, satu domain rangkaian tunggal boleh menyambungkan sehingga 2048 unit Jalapeño XPU, merangkumi 16 rak. Dalam hal pengeluaran berskala besar, SemiAnalysis menganggarkan peningkatan bertahap pada tahun 2027, dengan sasaran peringkat seterusnya ialah skala penghawaan 100MW.
Gambaran strategik yang lebih besar ialah OpenAI telah menandatangani perjanjian kerjasama untuk 10GW akselerator khusus, jumlah yang kira-kira setara dengan kuasa penuh sepuluh unit pembangkit nuklear.
Artikel Wall Street Journal menulis bahawa Richard Ho, ketua chip OpenAI, menyatakan bahawa syarikat telah mencapai tahap penggunaan tenaga dan kos yang mampu mengurangkan kos infrastruktur secara nyata, "Ini hanyalah langkah pertama". Beliau juga menekankan bahawa NVIDIA masih merupakan rakan kongsi penting, dan permintaan OpenAI terhadap kuasa pengiraan sangat besar, sehingga tidak akan meninggalkan pembekal semasa dalam jangka pendek.
Analis menunjukkan bahawa kepentingan Jalapeño mungkin bukan terletak pada berapa banyak chip NVIDIA yang boleh ia gantikan hari ini, tetapi pada bukti yang ia berikan terhadap satu perkara yang sebelum ini banyak diragui: sebuah syarikat AI, menggunakan alat AI, telah menghasilkan satu chip yang benar-benar kompetitif dalam masa yang rekod. Roda ini sudah bermula berputar.
