Cip Jalapeño OpenAI Mengungguli Blackwell NVIDIA dari Segi Kecekapan

iconTechFlow
Kongsi
AI summary iconRingkasan
Cip Jalapeño OpenAI menunjukkan kecekapan tenaga yang lebih baik berbanding Blackwell NVIDIA, menurut analisis atas rantai. Dibina dalam 16 bulan, ia mengungguli cip NVIDIA, AMD, dan Google dalam tolok ukur utama. Direka untuk inferens AI am, Jalapeño memberikan throughput token yang tinggi setiap watt tanpa penghuraian spekulatif. Walaupun ia tidak menyokong CUDA, prestasinya boleh mengubah pasaran cip AI. Data atas rantai menunjukkan minat yang semakin meningkat terhadap penyelesaian peranti AI alternatif.

Penulis: SemiAnalysis

Diterjemahkan oleh Deep潮 TechFlow

Pengenalan DeepChao: Data ujian cip inferens buatan sendiri pertama OpenAI, Jalapeño, telah terbongkar, dengan kecekapan tenaga yang secara langsung mengalahkan cip unggulan semasa NVIDIA, Blackwell, dan mendekati Rubin generasi seterusnya. Bagi syarikat AI yang terperangkap dalam batasan kuasa pusat data, cip ini mungkin mengubah struktur pasaran pengiraan. Namun, masih menjadi tanda tanya sama ada cip generasi pertama ini benar-benar dapat menggoyahkan ekosistem CUDA NVIDIA.

Bandingkan kepunyaan keseluruhan kos, throughput setiap megawatt, dan butiran pedas antara ASIC buatan sendiri dengan Rubin dan Jalapeño

Dalam dua tahun terakhir, OpenAI telah secara diam-diam membangun "Jalapeño", cip inferensia yang baru saja diumumkan di Hot Chips. Rumor tentang kejayaan penghantaran cip telah beredar selama beberapa masa. Tetapi sekarang kami mendapat butiran terperinci. OpenAI mengundang kami untuk melihat cip tersebut, memasuki makmal untuk mengesahkan keasliannya, dan menjalankan ujian berbanding menggunakan pakej InferenceX kami.

Pada Jun tahun ini, OpenAI mengumumkan projek cip bekerjasama dengan Broadcom, direka khas untuk inferensi LLM dari awal. Kerja reka bentuk bermula pada pertengahan 2024, dan hanya mengambil kira 16 bulan dari perekrutan pasukan awal hingga pengeluaran, yang merupakan siklus pembangunan ASIC yang sangat pantas.

Biasanya, cip generasi pertama tidak kompetitif, tetapi OpenAI berlawanan dengan arus ini, mengalahkan semua cip NVIDIA, AMD, dan Google yang kami uji di beberapa model open-source teratas, memimpin industri. OpenAI berjaya melalui reka bentuk sinergi perisian dan peranti yang ekstrem. Secara mengejutkan, OpenAI tidak terlalu fokus pada satu aspek tertentu dalam inferens model, tetapi sebaliknya berfokus pada pembangunan cip universal yang memberikan prestasi tinggi dalam semua senario.

Artikel ini akan mengulas secara mendalam butiran arsitektur, butiran perisian, dan keputusan prestasi Jalapeño di InferenceX.

Sebuah cip inferensia serbaguna

Semua orang mengatakan bahawa cip OpenAI direka khas untuk model OpenAI, tetapi itu salah; OpenAI telah mencipta cip generik yang ditujukan untuk inferens AI.

Garis masa terlalu gila. Ini menunjukkan bahawa pernyataan “menggunakan AI untuk mempercepat rekabentuk cip” adalah benar. Walaupun garis masa pantas, OpenAI telah menghabiskan banyak dana, membuat keputusan rekabentuk yang praktikal, dan pasukan yang sangat kuat, jadi ini tidak mengejutkan.

Dari segi spesifikasi sahaja, ia segera menjadi pesaing yang kuat:

Selain itu, penggunaan HBM4 menjadikannya cukup sepadan dengan GPU unggulan NVIDIA dan AMD:

Banyak media mengikuti perkataan lisan OpenAI bahawa cip ini akan mengoptimumkan model mereka dengan cara yang tidak boleh dilakukan oleh cip lain. Ini salah. Jalapeño adalah cip inferens universal yang boleh menjalankan pelbagai model dan beban kerja, termasuk ujian inferens InferenceX kami—kami menjalankan ujian ini bersama jurutera OpenAI di makmal. Sebagai lawak, OpenAI bahkan menunjukkan kepada kami bagaimana ia menjalankan Doom, permainan yang dipindahkan ke cip mereka hanya dengan petunjuk Codex.

Berikut adalah hasil prestasi/watt paling penting kami, yang mengukur throughput token di bawah jumlah keseluruhan kuasa dalam megawatt. Jalapeño menang telak berbanding semua cip lain. Semua ini dilakukan tanpa menggunakan ramalan token berganda (MTP), manakala cip-cip lain dalam grafik semuanya berada dalam konfigurasi terbaik SKU masing-masing dengan MTP diaktifkan.

Jalapeño dalam hampir semua skenario, prestasi/watt melebihi Blackwell, tanpa dioptimaskan untuk titik tertentu pada kurva. Ia tidak hanya unggul dalam skenario latensi rendah, tetapi juga sangat cemerlang dalam skenario throughput tinggi. Perbandingan yang lebih adil adalah melihat hasil ramalan satu token, di mana Jalapeño mengungguli semua pesaingnya dengan jarak yang jauh. Dalam skenario kongkuren rendah, Jalapeño menunjukkan interaktiviti yang luar biasa, dengan model DeepSeek R1, mencapai lebih dari 700 token per pengguna per saat pada kongkuren 1.

Yang menakjubkan, semua ini dicapai menggunakan single-token prediction (STP), tanpa speculative decoding atau pemisahan prefill-decode. Selain DeepSeek R1, kami juga melihat model lain seperti Kimi-K2.5 dan GPT-OSS yang mampu mencapai sekitar 1,400 token per pengguna per saat. Untuk semua model, kami mengesahkan bahawa hasil penilaian GSM8k Jalapeño setara dengan chip NVIDIA.

Berikut adalah beberapa perhatian. Pertama, semua data disediakan oleh OpenAI. Kami telah menguji InferenceX secara langsung di laboratorium, tetapi tidak menjalankan seluruh rangkaian benchmark InferenceX, dan juga tidak melihat hasil AgentX. AgentX adalah rangkaian pilihan kami untuk membandingkan prestasi chip, kerana konteks yang sangat panjang dan ciri pelbagai peringkat datasetnya mampu mencerminkan perilaku cache di bawah beban kerja pengeluaran sebenar. Kerangka kerja yang berprestasi baik pada 8k1k mungkin berprestasi lebih lemah pada AgentX, kerana beban kerja pengeluaran sebenar akan menguji komponen-komponen seperti router, mekanisme cache awalan, pengurusan cache, dan infrastruktur offload. Ujian 8k1k satu peringkat tidak mencakupi ini. Untuk maklumat lanjut, sila baca artikel AgentX kami.

AgentX - InferenceXv3: Apakah parit CUDA masih bertahan dalam inferensi agen?

Kedua, kami berpendapat bahawa perbandingan dengan Blackwell agak tidak lengkap dan kurang adil. Lawan sebenar Jalapeño ialah cip-cip seperti Rubin yang juga menggunakan HBM4. Sistem Vera Rubin sudah mula menghantar produk kepada pelanggan, manakala Jalapeño OpenAI masih hanya mempunyai sampel kejuruteraan dan memerlukan masa lagi sebelum boleh dihasilkan secara besar-besaran.

Oleh itu, prestasi sebenarnya harus dibandingkan dengan Rubin, bukan Blackwell. Dalam beberapa segi, kami memang mengharapkan cip tersuai seperti Jalapeño untuk melebihi Blackwell. Prestasi per watt Vera Rubin NVL72 adalah 5.4 kali ganda berbanding GB200 NVL72, seperti yang telah kami tulis dalam artikel analisis pernyataan prestasi NVIDIA dan CoreWeave bulan lepas. Kami akan membandingkan Jalapeño dengan data prestasi Vera Rubin pada Julai kemudian.

Vera Rubin NVL72 berbanding GB200 NVL72? Analisis TCO dan arsitektur

Ketiga, model yang diuji tidak berada di garis depan sumber terbuka. NVIDIA dan AMD telah mengumumkan hasil model yang lebih besar, seperti DeepSeek V4 Pro dan Kimi K3, melalui AgentX. Semakin besar model dan semakin baru rilisnya, semakin kompleks proses menjalankannya di chip baru. Namun demikian, model yang dijalankan OpenAI di Jalapeño juga tidak kecil.

Analisis prestasi

Matlamat rekaan OpenAI ialah prestasi per watt. Sebabnya sangat mudah: OpenAI kini dibatasi oleh kuasa data center, bukan bajet atau ruang pusat data, jadi jumlah token per megawatt sangat penting. Di Computex 2026, Jensen Huang mengatakan bahawa prestasi per watt, kebolehpercayaan, dan jangka hayat yang panjang adalah ciri-ciri utama GPU masa depan. Beliau berkata: "Jika anda mempunyai satu gigawatt kuasa, maka throughput per watt adalah pendapatan." Beliau juga menyatakan bahawa tidak masuk akal untuk memilih arsitektur yang salah hanya kerana cipnya lebih murah.

NVIDIA juga menekankan hal ini dalam ucapan Vera di Hot Chips 2026, sambil menunjukkan grafik pendapatan yang sama: “Pusat data hari ini dibatasi oleh tenaga listrik.” Tenaga listrik sangat penting dan mendorong pendapatan.

Pembekal tidak dapat dengan mudah mendapatkan lebih banyak megawatt. Perbezaan skala masa antara peningkatan GPU dan peningkatan kapasiti grid sangat besar. Had kuasa pusat data terhad oleh banyak faktor, seperti sambungan utiliti, infrastruktur, kapasiti penyejukan, dan reka bentuk UPS/penjana simpanan. Keterlambatan grid sering melebihi kemajuan peralatan dan pembinaan, mencetuskan permintaan untuk kapasiti kuasa di belakang meter. Iaitu, membina turbin gas dan penjana tempatan di lokasi pusat data. Kapasiti ini berada di belakang meter utiliti dan tidak bergantung kepada grid awam, membolehkan pembekal memberi kuasa kepada fasiliti tanpa perlu menunggu sambungan grid dan peningkatan utiliti. Inilah sebab utama Colossus 2 xAI sangat bergantung kepada kapasiti di belakang meter, sementara sambungan grid sebenarnya tertinggal jauh. Untuk maklumat lanjut, lihat model tenaga kami.

Seperti yang kami tulis dalam pos X, tok/s/MW boleh disederhanakan sebagai jumlah token per joule. Kerana watt ialah joule per saat. Oleh itu, tok/s/MW mewakili kecekapan sistem dan kemampuan untuk menukar tenaga menjadi token.

Dalam hal ini, Jalapeño unggul berbanding Rubin. Jalapeño OpenAI menghasilkan throughput token per megawatt STP yang melebihi hasil MTP Vera Rubin. Hasil ini dikeluarkan oleh NVIDIA dan CoreWeave pada bulan Julai. Ia juga jauh melebihi hasil MTP GB200 pada tahun 2025. Seperti yang kami nyatakan dalam artikel Vera Rubin, perbandingan antara VR dan hasil GB200 2025 dilakukan kerana kedua-duanya berada pada peringkat awal yang serupa. Sementara itu, perbandingan dengan GB200 2025 mempertahankan kematangan perisian yang sama. Mengikut logik ini, kami membandingkan tiga set hasil: hasil terkini Vera Rubin Julai 2026, hasil GB200 2025, dan hasil Jalapeño semasa ini. Perbandingan ini sangat munasabah kerana ia merupakan data Rubin awam terbaik. Selain itu, OpenAI baru mengalirkan cip mereka selepas Rubin. OpenAI dan Rubin masih belum matang, oleh itu prestasi mereka akan terus meningkat.

Dari segi prestasi/keseluruhan kos kepemilikan, Vera Rubin dan Jalapeño seimbang. Setiap dolar menghasilkan jumlah token yang hampir sama. Namun, seperti yang telah dinyatakan sebelum ini, hasil Jalapeño tidak menggunakan spekulatif decoding. Hasil Vera Rubin pula menggunakan spekulatif decoding. Spekulatif decoding boleh mengurangkan kos setiap token sebanyak kira-kira 3-5 kali. Apabila Jalapeño mewujudkan spekulatif decoding, kos efektivitasnya dalam menyediakan token akan lebih tinggi. Tentu saja, sebahagian kelebihan TCO datang daripada mengelakkan margin keuntungan tinggi NVIDIA dan beralih kepada margin keuntungan yang lebih rendah (tetapi masih tinggi) Broadcom. Tetapi ini bukan keseluruhan sebabnya. Sebagai contoh, projek AI ASIC Meta dan Microsoft yang telah dilaburkan lebih lama gagal dilaksanakan. Ini menunjukkan bahawa kos hanyalah sebahagian daripada persamaan. Untuk perincian TCO penuh Jalapeño, sila rujuk model TCO Awan AI SemiAnalysis.

Secara arsitektur, OpenAI memilih untuk tidak memisahkan prefill dan decode ke dalam kumpulan chip yang berbeda. Model draf dan model utama berkongsi chip dan struktur interkoneksi yang sama. Pendekatan reka bentuk ini mengorbankan sebahagian kecekapan teori demi kemudahan operasi sebenar. Motivasinya ialah komposisi beban kerja berubah seiring masa. Sebagai contoh, nisbah input, penulisan cache, pembacaan cache, dan token output telah berubah secara ketara. Perubahan ini berlaku selepas kami melalui tiga era model: pengetahuan, penalaran, dan agen, seperti yang dibincangkan dalam artikel terkini kami. Oleh itu, menetapkan jumlah tetap untuk silicon prefill heterogen dan silicon decode akan menyebabkan ketidakefisienan seiring masa. OpenAI memilih kumpulan homogen dalam arsitektur ini dan berusaha memastikan chip berprestasi baik pada semua tugas.

Dan ia memang melakukannya. Pada Kimi K2.5 (yang menjadi dasar Cursor Composer 2.5), Jalapeño mencapai hampir 700 tok/s/pengguna. Kelajuan ini lebih daripada 9 kali ganda daripada cip terbaik kedua pada 100 tok/s/pengguna.

Di GPT-OSS, ini adalah keunggulan lain. Jalapeño mencapai throughput interaktif per megawatt yang hampir dua kali ganda titik throughput maksimum GB200, dan lebih dari 50 kali ganda titik konkuren 1 GB200. Titik Jalapeño dengan konkuren lebih tinggi menggunakan EP8.

Keputusan ini sangat mengesankan! Namun, kita perlu bersikap kritis: ia hanya 8k1k, dengan tahap penyesuaian yang jauh lebih rendah, dan belum ada data pengendalian AgentX. Seperti yang disebutkan dalam artikel AgentX, beban kerja berbilang putaran dan konteks panjang akan memberi tekanan kepada lebih banyak aspek stak penjanaan. Contohnya, pemerintah dan cache awalan. Untuk berprestasi baik dalam beban kerja agen, diperlukan lebih banyak pengoptimuman. Baca artikel AgentX untuk maklumat lanjut.

AgentX - InferenceXv3: Apakah parit CUDA masih boleh dipertahankan dalam inferensi agen?

Spesifikasi dan Arkitektur Mendalam

Semua hasil ini berasal dari langkah A0 Jalapeño, hanya 9 bulan selepas projek dilancarkan. Namun, langkah B0 kini sedang di pabrik wafer! Peningkatan pada langkah B0 meningkatkan prestasi per watt sebanyak kira-kira 25% berbanding silikon A0 sebelumnya. Secara khusus, langkah B0 mencapai 13.4 PFLOPs MXFP4 pada cip berukuran mask tunggal. Cip ini diperbuat menggunakan N3P TSMC. Sebagai perbandingan, satu cip komputasi Rubin tunggal mencapai 17.5 PFLOPs Rubin NVFP4 yang padat pada ukuran serupa dan nod yang sama.

Mengingat TDP Jalapeño hanya 700W, manakala Rubin mengonsumsi 900-1150W setiap cip pengiraan, prestasi ini lebih mengagumkan. Kerana Jalapeño dirancang untuk inferens, bukan latihan, OpenAI tidak perlu meningkatkan TDP untuk memaksimumkan FLOPs. Ini boleh difahami. Namun, hasil di atas menunjukkan bahawa Jalapeño menyediakan FLOPs teori puncak yang signifikan.

Bila dibandingkan secara langsung dengan akselerator lain, Jalapeño memiliki bandwidth HBM tertinggi per watt dan FLOPs tertinggi per watt, setara dengan konfigurasi Rubin Max-Q 1800W.

Jalapeño akan menggunakan HBM4, menjadikannya salah satu cip awal yang mengadopsi teknologi ini selepas Nvidia dan AMD, bahkan mendahului projek TPU dan Trainium yang sedia ada. Salah satu prinsip reka bentuk utama Jalapeño ialah memaksimakan lebar pita HBM, jadi kompromi dengan HBM yang bukan kelas tertinggi akan bertentangan dengan matlamat ini. Ini menghasilkan lebar pita memori sebanyak 15.4TB/s setiap pakej, melebihi semua akselerator lain yang menggunakan HBM3E yang sedang dijual. Lebar pita 15.4TB/s menunjukkan bahawa HBM4-nya mungkin mencapai kadar pin 10Gbps, sedikit lebih tinggi daripada 9.6Gbps HBM4 Nvidia dalam Rubin. HBM kemungkinan besar akan disediakan oleh Samsung.

OpenAI menyelesaikan jalur produksi Jalapeño pada November 2025, lebih tepatnya, jalur produksi reka bentuk CoWoS, bukan hanya lapisan atas chip. Dalam sembilan bulan selepas jalur produksi pada November 2025, dan hanya selepas 3 bulan penyesuaian pada silikon asli, OpenAI telah mencapai hasil yang sangat baik dengan Jalapeño. Ini semakin mengesankan mengingat pasukan bermula dari sifar dalam stak perisian.

Sementara itu, pengeluaran CoWoS Rubin selesai pada Oktober 2025, sebulan lebih awal, tetapi satu-satunya keputusan awal yang kami lihat sejauh ini datang daripada sampel kejuruteraan CoreWeave. Nvidia tidak membenarkan kami menguji dan menerbitkan benchmark seperti OpenAI, menunjukkan perisian cipnya masih belum matang. Mengingat OpenAI mampu menjalankan model baru dengan pantas di cip sendiri, parit CUDA mungkin telah hilang.

Ia masih jauh dari pengoptimuman, dan kita boleh melihat bahawa Jalapeño secara keseluruhan memberikan data yang lebih baik. Kami tidak menganggap peranti Nvidia lebih buruk, tetapi kemajuan penyesuaian perisian Jalapeño lebih pantas berbanding Nvidia. Ini menunjukkan kekuatan reka bentuk bersama peranti dan perisian, yang merupakan bidang utama di mana pasukan ASIC di laboratorium terkini mampu melampaui pembuat cip komersial yang lebih matang. Secara tidak intuitif, memulakan dari awal mungkin juga memberi manfaat kepada OpenAI, kerana ia boleh membuat keputusan reka bentuk baru tanpa terikat dengan kompatibiliti ke belakang atau versi perisian lama.

Walaupun OpenAI telah mempunyai contoh kejuruteraan Jalapeño, pengeluaran berskala besar kini dirancang untuk meningkat secara berperingkat pada tahun 2027, dengan sebahagian besar output dijadualkan pada akhir tahun depan. Untuk butiran lanjut mengenai jumlah unit dan harga purata, rujuk Model Accelerator SemiAnalysis.

Boleh dikatakan bahawa OpenAI Jalapeno adalah ASIC berskala besar yang sebenarnya.

Berbanding dengan garis masa Rubin, kelajuan Jalapeño sangat menakjubkan. Seperti yang telah ditunjukkan sebelum ini, walaupun Rubin bermula lebih awal, hasil Jalapeño masih mengatasi Rubin.

Jalapeño Architecture

Dari segi arsitektur mendalam, enjin matriks cip ini menggunakan format nilai MXFP dan array gelombang simpanan bobot, serupa dengan TPU. Namun, berbeza secara langsung dengan TPU, ia menyokong bentuk/dimensi yang lebih kecil, bermakna ia tidak akan mengalami jurang prestasi aneh seperti darab matriks yang tidak sepadan pada array gelombang yang lebih besar.

Ia juga memiliki inti skalar 64-bit dan inti vektor FP32/INT32. OpenAI juga telah mengimplementasikan reka bentuk berlebihan pada aras tray, serta memasukkan pemulihan keberkesanan pada aras inti dan saluran. Mereka menyatakan bahawa bantuan AI dalam reka bentuk cip mengurangkan luas SIMD sebanyak 8% dan luas enjin matriks sebanyak 10%. Walaupun mereka tidak menyatakan syarat PVT (proses/tegangan/suhu) yang spesifik, mereka menyebut bahawa modul bantuan AI telah meningkatkan ketepatan masa dan penggunaan kuasa berbanding modul asal.

Reka bentuk arsitektur Jalapeño berfokus pada menghilangkan pemindahan memori KVCache dan bobot, serta latensi dan overhead tetap, supaya dapat mendekati kapasiti/lebar pita puncak asal lebih dekat berbanding akselerator lain, walaupun dalam batch kecil atau bentuk kecil.

Inti dan HBM dibahagikan kepada beberapa kepingan, di mana setiap kepingan inti mempunyai pandangan tempatan latensi rendah terhadap kepingan HBM sendiri. Segerakan antara kepingan dilakukan melalui rangkaian kolektif khas berpemandu tinggi. Struktur memori yang sangat ringkas ini memberikan Jalapeño kelebihan potensi besar berbanding GPU, kerana akses memori GPU mesti melalui sistem memori yang kompleks, menghasilkan latensi yang lebih besar yang perlu diagihkan atau disembunyikan pada bentuk yang besar.

Pilihan ini boleh dilaksanakan kerana pengasingan berat dan KV yang teliti dapat membataskan penyegerakan antara teras kepada komunikasi berpemandu tinggi yang terhad dan diketahui, seperti komunikasi paralel tensor yang boleh bertindih dengan pengiraan.

Selain itu, terdapat NoC aman tambahan yang digunakan untuk komunikasi umum dan akses ke rangkaian ekstensi. Secara keseluruhan, OpenAI berjaya mengurangkan penggunaan kuasa secara besar-besaran dan mencapai peningkatan prestasi yang ketara berbanding Nvidia dan Google melalui NOC dan sistem memori yang disederhanakan.

Pada aras inti, OpenAI menggambarkan satu inti urutan rawak (OoO) dengan cache L1. Ini berbeza ketara dengan corak yang kita lihat dalam akselerator lain, yang semuanya menggunakan penyimpanan sementara yang dikelola perisian, biasanya disertai sokongan DMA asinkron. Hujah di sini ialah bahawa ini membolehkan Jalapeño mengelakkan overhed tetap seperti latensi barier, yang pada akselerator lain (seperti GPU) memerlukan peningkatan jumlah kerja setiap inti untuk menyembunyikan atau mengagihkan overhed tersebut, menjadikannya lebih sukar untuk mendekati lebar pita/kekuatan puncak asal.

Harganya ialah, Jalapeño bergantung kepada pra-pengambilan yang baik untuk memastikan permintaan memori sampai pada masanya, yang lebih sukar untuk diramal dan dianalisis. Namun, dengan bantuan Codex untuk mendapatkan maklumat jejak terperinci dalam kerangka yang baik, mencari teras optimum dengan pra-pengambilan terbaik untuk bentuk yang diberikan mungkin hampir tidak memerlukan campur tangan manusia. Kami percaya inilah sebabnya OpenAI boleh menjalankan DeepSeek R1, Kimi K2.5, dan GPT-OSS dengan sangat pantas.

Pusat juga menyokong dimensi matriks "lebih kecil", yang (bergantung pada sekecil mana) seharusnya menjadikannya lebih serbaguna di pelbagai model dan dimensi batch, serta kurang sensitif terhadap penyesuaian dimensi matriks, overhead pengisian, dan ketidakefisienan blok. Sebagai contoh, cip TPU, Trainium, dan Etched mempunyai array gelombang yang sangat besar, yang mungkin memerlukan batch besar atau dimensi model yang boleh dibahagi tepat untuk mengelakkan ketidakefisienan blok.

Dengan Jalapeño, OpenAI berfokus pada penghapusan latensi tetap dalam sistem untuk mendekati prestasi roofline sejauh mungkin di semua kawasan lengkung Pareto. Secara teori, ini boleh membawa kelebihan relatif terhadap GPU pada beberapa titik kerja:

Prestasi maksimum untuk inferensi latensi rendah/ukuran batch kecil jauh lebih baik daripada GPU. GPU terhadap batasan overhead tetap seperti latensi permulaan, latensi penghalang, dan latensi sistem memori.

Walaupun dalam jumlah besar atau konteks panjang, berpotensi lebih dekat dengan roofline peranti keras.

Ini disertai dengan peringatan: walaupun secara teori terdapat had prestasi, kernel sebenar mungkin lebih sukar mencapai prestasi tersebut. Oleh itu, pendekatannya nampaknya:

Reka bentuk prestasi had tertinggi untuk semua bentuk beban kerja

Biarkan Codex menangani tugas berat, cari teras yang mencapai had ini

Pasukan OpenAI melancarkan beban kerja InferenceX di Jalapeño dengan masa putaran yang sangat pantas.

Kami dengan demikian merasa optimis terhadap kaedah ini.

Jika Jalapeño berjaya, ia akan melepaskan isyarat yang kuat.

Keteguhan industri terhadap model pemrograman dan kompiler universal yang sempurna akan dipecahkan oleh model AI terkini.

OpenAI menulis teras Jalapeño seperti menulis kod assembler.

Setiap teras mempunyai kod yang disesuaikan secara manual, sebahagiannya sebanyak 3000 baris.

Serta menyokong pemeriksaan kebenaran dan sanitizer tersuai.

Kerja inti awal adalah manusia dalam lingkaran, bukan sepenuhnya automatik.

Kemudian beralih ke versi dalaman Codex yang lebih berskala besar.

OpenAI merancang untuk menjual versi ini kepada pelanggan korporat.

Enjin perkhidmatan dalaman dipanggil "Teacup".

Menariknya, OpenAI sebelum ini tidak mempunyai pelaksanaan dalaman MLA kernel.

Hingga mereka melakukan ujian berbanding DeepSeek menggunakan InferenceX.

Codex mampu menulis kernel yang boleh digunakan dan efisien dengan sangat pantas, tanpa perlu penyertaan pasukan kejuruteraan kernel.

Ini menunjukkan kemampuan pembangunan saluran perisian.

OpenAI menggunakan Gluon untuk memprogram Jalapeño.

Gluon adalah bahasa pengaturcaraan inti OpenAI.

Gluon dibina di atas Triton, mempertahankan model pemrograman SPMD (Single Program Multiple Data) Triton.

Tetapi ia mendedahkan abstrak pengaturcaraan asas.

Sebagai contoh, untuk NVIDIA GPU, ia menyediakan API yang dipetakan ke arahan PTX.

Termasuk arahan MMA, arahan TMA, mekanisme mbarrier, dll.

Abstrak paling unik yang disediakan oleh Gluon ialah susunan.

Secara umum, susunan menentukan pemetaan antara sumber daya peranti keras dengan elemen tensor.

Sebagai contoh, register ke-5 warp 9, yang sepadan dengan elemen tensor pada baris ke-6, lajur ke-7.

Abstrak susunan Gluon berdasarkan Linear Layouts.

Ini adalah aljabar susunan yang dicipta oleh OpenAI.

Linear Layouts secara matematik merumuskan apa itu susunan.

Sediakan alat untuk susunan operasi.

Ini menyokong banyak fungsi, seperti transformasi susunan yang boleh dibuktikan betul.

Masih ada swizzling memori optimum.

Dalam model pemrograman Jalapeño, setiap program Gluon dipetakan ke benang kekal.

Kami percaya ini mengimplikasikan bahawa Jalapeño sesuai untuk corak pemrograman inti yang tahan lama.

Setiap program dijalankan di beberapa tile, dengan tugas yang ditugaskan oleh pengatur program, bukan penjadwal peranti keras.

OpenAI menyebut TensorInfo.

Ia adalah abstrak daripada susunan kod yang eksplisit.

Ini mungkin satu set layout yang direka untuk Jalapeño.

Ia akan didorong oleh Linear Layouts.

Akhirnya, setiap teras menyediakan unit pra-muat dan pemisahan pesanan rawak.

Sebagai contoh, pengguna boleh memprogramkan untuk menunggu data pra-muat.

Data ini dikunci oleh semaphore.

Ironinya, model OpenAI seperti GPT 5.6 Sol kini berjalan di atas GPU NVIDIA.

Ia digunakan untuk merekabentuk cip, yang merupakan ancaman sebenar terhadap moat CUDA.

GPU milik NVIDIA sedang mendorong calon pengganti secara semasa.

Dalam perbandingan masa, kita juga boleh melihat kelajuan pembangunan Jalapeño.

Dalam kurang daripada dua minggu, throughput untuk beberapa senario interaksi meningkat lebih daripada 2 kali ganda.

Setiap tarball yang kami terima daripada pasukan Jalapeño mengandungi dunia yang ajaib.

Selain peningkatan prestasi teras, pasukan Jalapeño mengaktifkan TP32 dalam masa 8 hari.

Berdasarkan konfigurasi TP8 sebelumnya, kembangkan melampaui sistem tunggal untuk mencapai konfigurasi penuh rak untuk menjalankan model besar.

Pembangunan ini memang mengesankan.

Untuk menguji prestasi sebelum dijalankan pada peranti keras sebenar, OpenAI juga mempunyai simulator "chilisim".

Ketepatannya dalam 5% daripada peranti sebenar, menggunakan talian trace lebar tetap.

Kemampuan pelacakan terhadap A0 terhadap had, tetapi peningkatan besar pada B0.

Ini mungkin disebabkan oleh data operasi sebenar keping silikon A0.

Jurutera menunjukkan Codex CLI menjalankan model dalaman.

Ia dikenali sebagai "Raiku" atau "5.3 Codex Spark", dengan TPOT pada 1.2ms.

Pasukan juga menunjukkan demo yang ditulis oleh Codex yang berjalan langsung di cip.

Termasuk Doom pada 36 FPS, simulasi dinamik bendalir FP32.

Masih ada visualisasi seret tetikus "Liquid Light".

Dalam hal model, skema megakernel dalaman OpenAI memiliki nama panggilan “gigakernel”.

Ia dibina di sekitar satu megakernel tunggal yang berputar pada peranti untuk mengurangkan beban CPU dan masa permulaan.

Pasukan masih meneruskan pengiraan strategi semasa ujian lanjutan.

Perhatian khusus dalaman diberikan kepada bagaimana mengkoordinasikan penggunaan 1 juta rollout.

Adakah perlu Disagg, ini adalah persoalan

Kami sebelum ini menyebut bahawa OpenAI tidak menggunakan pemisahan prefill-decode pada cip-cip ini.

Ini membuat kami terkejut, kerana prestasi GPU NVIDIA dan AMD secara signifikan mendapat manfaat daripada PDD.

Sekalipun pada peranti keras yang homogen.

Mari kita teliti mengapa pasukan Jalapeño melakukan ini.

Apabila beban kerja tetap, pemisahan prefill-decode kelihatan menarik.

Prefill dan decode memberi tekanan yang berbeza terhadap peranti keras.

Alokasikan setiap peringkat ke kolam yang dituning secara berasingan untuk meningkatkan kecekapan di bawah nisbah input-output yang dipilih.

Namun, trafik pengeluaran tidak akan mengekalkan nisbah tersebut.

Panjang urutan input-output, konkuren, kadar kejayaan cache, kadar penerimaan spekulatif, dan sasaran latensi berubah sepanjang hari.

Apabila peranti dibahagikan kepada kolam prefill dan decode, permintaan prefill yang berlebihan akan menyebabkan cip decode menganggur dan permintaan akan beratur.

Namun, permintaan decode yang berlebihan akan sebaliknya.

Pengendali mesti terus meramal pemisahan yang betul dan menyediakan kapasiti simpanan untuk kedua-dua sisi.

Dan menyeimbangkan semula sistem yang nisbah idealnya sentiasa berubah.

Dalam sistem seragam, beberapa sumber mungkin tidak digunakan sepenuhnya pada peringkat tertentu.

Namun, setiap peranti masih boleh digunakan untuk melayani permintaan seterusnya.

Dalam sistem terpisah, keseluruhan cip mungkin terbiar hanya kerana berada dalam kolam yang salah.

Penggunaan tempatan kelihatan lebih baik, tetapi penggunaan global mungkin buruk.

Pemisahan juga akan merosakkan lokaliti.

prefill worker menghasilkan KV cache berskala besar yang diperlukan segera oleh decode worker.

Sistem mesti menghantar status ini merentasi rangkaian untuk membolehkan penghasilan berterusan.

Ini meningkatkan penggunaan bandwidth, penyegerakan, antrian, dan domain kegagalan lainnya.

Kos juga meningkat seiring dengan panjang urutan input kerana cache KV bertambah.

Namun, mengelakkan pergerakan KV terutamanya bertujuan untuk pengoptimuman kuasa dan latensi.

Menggerakkan beberapa KV boleh meningkatkan penggunaan peranti keras, dengan harga peningkatan penggunaan kuasa dan latensi permintaan tunggal.

Cluster yang boleh dipertukarkan mampu mengalihkan kapasiti antara permintaan sensitif kepada latensi dan siri yang berorientasikan throughput.

Pembahagian tetap akan menyebabkan peralatan menganggur apabila gabungan trafik berubah.

Selain itu, perubahan panjang konteks mengimbangi keseimbangan antara perhatian dan FFN.

Nisbah peranti tetap hanya efisien di sekitar titik rekaan.

Pembatasan yang sama juga berlaku untuk spekulatif decoding. Model draf mesti menyediakan token calon kepada validator dengan latensi yang sangat rendah. Memisahkan keduanya ke dalam kolam khusus yang berbeza akan mengubah kitaran decoding yang rapat menjadi protokol teragih. Komunikasi dan koordinasi tambahan mungkin menghabiskan latensi yang dijimatkan oleh draf. Hanya dengan meletakkan kedua-dua model pada peranti yang sama dan struktur latensi rendah, keberhampiran yang menjadikan spekulasi bermakna boleh dipertahankan.

Namun, di tempat di mana permintaan cukup besar, stabil, dan dapat diramalkan, pemisahan masih unggul, terutama apabila GPU tradisional memerlukan kumpulan besar dan penghantaran bertahap untuk mencapai throughput yang baik. Tetapi ini bukan makan siang percuma.

Dari masakan Jepun ke India (pedas perlahan hingga sangat pedas): Katsu, Vindaloo, dan Chana—bagaimanakah hidangan kari ini menyusun sistem rak?

Sistem Jalapeño terdiri daripada rak CPU dan rak ASIC pada peringkat unit rak. Rak hos memuatkan 16 baki CPU hos bernama "Katsu". Setiap Katsu berkaitan dengan salah satu daripada 16 baki ASIC di sebelah kanan, bernama "Vindaloo". Setiap hos dilengkapi dengan dua CPU AMD EPYC tahap Turin, 1.5TB DRAM setiap rak, 2x E1.S dan 2x SSD M.2. Setiap baki juga dilengkapi dengan rangkaian depan 400G (2x200G). Setiap baki Katsu disambungkan ke setiap baki Vindaloo melalui 8 kabel DAC PCIe luaran. Kabel-kabel ini dirangkai secara mendatar di hadapan rak. Reka bentuk peringkat sistem telah dilakukan bekerjasama dengan Celestica.

Rak ASIC terdiri daripada 16 baki Vindaloo dan 8 baki suis ekspansi (6 tempatan + 2 global), dinamakan “Chana”. Setiap baki Vindaloo mengandungi 8 ASIC Jalapeño, dengan jumlah keseluruhan 128 ASIC Jalapeño setiap rak. ASIC disambungkan ke setiap baki suis Chana melalui papan belakang kabel tembaga, serupa dengan Oberon Nvidia. Topologi ekspansi dibahagikan kepada domain tempatan dan domain global. Domain tempatan meliputi 128 ASIC di dalam rak. Domain global menghubungkan sehingga 16 rak atau 2,048 ASIC. Kami akan menjelaskan lebih lanjut mengenai bandwidth dan topologi di bawah.

Penghawaian rak sisi sisi kira-kira 50kW (31kW dalam pengeluaran), manakala rak ASIC mengambil 130kW. Keseluruhan sistem rak ganda kira-kira 160kW. Dari segi penggunaan kuasa, ini hampir setara dengan satu rak GB300 lebar ganda.

OpenAI boleh menghubungkan sehingga 2.048 XPU Jalapeño dalam satu rangkaian ekstensi. Rangkaian ekstensi terdiri daripada dua domain. Domain tempatan menghubungkan kesemua 128 XPU dalam rak melalui papan belakang. Domain global menggunakan gabungan kabel tembaga dan interkoneks optik untuk menghubungkan 2.048 XPU daripada 16 rak. Setiap rak mengandungi 8 baki suis Chana. Enam suis Chana tengah digunakan untuk domain tempatan. Setiap satu mempunyai ASIC suis Tomahawk 6 102.4T. Dua suis Chana di atas dan bawah digunakan untuk domain global. Kami menduga ia mungkin 2 suis Tomahawk 6 102.4T, dengan jumlah maksimum 204.8T setiap baki suis.

Dalam wilayah tempatan, 128 cip Jalapeño setiap XPU mempunyai lebar pita searah 4.8 Tb/s. Mereka disambungkan secara penuh-ke-penuh kepada 6 ASIC Tomahawk 6 sebanyak 102.4 Tb/s. Ini setara dengan 48 pasangan pemateri dan soket beza (DP) setiap XPU. Secara keseluruhan, terdapat 6,144 pasangan kabel tembaga pasif DP untuk pengembangan tempatan setiap rak.

Dalam domain global, 16 rak dengan 2,048 XPU dihubungkan melalui kombinasi papan belakang tembaga, suis elektrik 204.8T TH6, modul cahaya 1.6T, dan suis sirkuit cahaya. Lebar pita satu arah untuk tautan global setiap XPU ialah 1.6Tb/s. Setiap XPU mempunyai 16 pasang konektor jantan dan betina diferensial (DP) untuk papan belakang antara XPU dan suis global. Setiap baki suis global mempunyai 2 ASIC, dengan lebar pita keluaran dibahagikan antara papan belakang dan peranti optik depan.

Antara domain tempatan dan domain global, bilangan konektor papan belakang setiap rak ialah 64 pasangan DP setiap XPU. Jumlah keseluruhan kabel tembaga pasif setiap rak ialah 8,192 pasangan DP.

Domain global menggunakan arsitektur rail murni, yang terdiri daripada 8 rail dalam domain global. Kami percaya OpenAI merutekan sambungan optik dalam domain global melalui suis pertukaran optik (OCS) yang dipasang pada setiap rak. Lebar pita global 1.6 Tb/s setiap XPU akan sampai ke baki suis global melalui papan belakang tembaga, kemudian meninggalkan suis melalui modul optik 1.6 T di panel depan. Ia masuk terlebih dahulu ke suis optik pasif, kemudian meninggalkan rak. Ini membolehkan skala domain diperluaskan kepada 2,048 XPU, yang terdiri daripada 16 rak, masing-masing dengan 128 XPU.

Kerana rangkaian ekstensi hanya menyumbang sekitar 10% daripada kos sistem keseluruhan, fleksibiliti ini memberikan pilihan berharga untuk model dengan parameter 10 hingga 20 trilion atau jendela konteks 2 juta hingga 4 juta token di masa depan. Dalam segi pelaksanaan, OpenAI bekerjasama dengan neocloud. Ia juga telah mengumpul data kebolehpercayaan bersama rakan kongsi pusat data sejak sebulan yang lalu, sambil mengoptimumkan masa pelaksanaan dari dermaga ke rak.

Langkah seterusnya

Seterusnya, kita akan membincangkan masa depan Jalapeño, di mana token pengeluaran pertama mereka akan segera dilancarkan. Sasaran seterusnya ialah 100MW, dengan halangan utama berada pada peranti keras: berapa banyak yang boleh mereka hasilkan, sejauh mana mereka boleh melaksanakan dan mengendalikan pusat data, serta bagaimana mereka mengendalikan pemantauan dan ketahanan. Perisian telah disahkan, dan dengan model dalaman yang ada, sebarang kelebihan awal perisian mudah dilampaui. Selepas dinding bayaran, kita akan membincangkan kesan terhadap syarikat cip seperti NVIDIA, AMD, dan Cerebras, yang telah menandatangani perjanjian dengan OpenAI dalam beberapa tahun ke depan.

Kami juga merangkumi keluaran, kuantiti, dan jadual chip generasi seterusnya dalam model Accelerator.

Bahagian seterusnya adalah kandungan berbayar, dan kerana masalah keizinan, tidak dilakukan penterjemahan lanjut, tetapi maklumat yang cukup banyak telah diberikan dalam bahagian sebelumnya mengenai cabaran OpenAI terhadap cip NVIDIA. Bagi pemain yang memperhatikan sektor cip dan harga saham NVIDIA, maklumat ini akan memberikan rujukan yang segar dan kukuh.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.