OpenAI'nin Jalapeño Çipi, NVIDIA'nın Blackwell'inden Verimlilik Açısından Daha İyidir

iconTechFlow
Paylaş
AI summary iconÖzet
On-chain analizlere göre, OpenAI'nin Jalapeño çipi, NVIDIA'nın Blackwell çipinden daha iyi enerji verimliliğine sahip. 16 ayda geliştirilen bu çip, ana performans testlerinde NVIDIA, AMD ve Google çiplerini geçti. Genel AI çıkarımı için tasarlanan Jalapeño, spekülatif dekodlama olmadan watt başına yüksek token verimliliği sağlıyor. CUDA desteği olmamasına rağmen, performansı AI çipi piyasasını değiştirebilir. On-chain veriler, alternatif AI donanımı çözümlerine artan ilgiyi gösteriyor.

Yazar: SemiAnalysis

Derin Akış TechFlow

Derin Akış Özet: OpenAI'nin ilk kendi geliştirilmiş çıkarım çipi Jalapeño'nun test verileri ortaya çıktı; verimlilik, NVIDIA'nın mevcut üst düzey Blackwell çipini doğrudan geride bırakarak bir sonraki Rubin nesline yaklaşıyor. Veri merkezi elektrik sınırlamalarıyla mücadele eden AI şirketleri için bu çip, hesaplama pazarının dengesini değiştirebilir. Ancak ilk nesil çipin, NVIDIA'nın CUDA ekosistemini gerçekten sarsıp saramayacağı hala bir soru işareti.

Kendi ASIC'lerinizle Rubin ve Jalapeño'nun toplam sahiplik maliyetini, megawatt başına verimliliğini ve baharatlı detayları karşılaştırın

Geçen iki yıl boyunca OpenAI, "Jalapeño" adlı bu çıkarım çipini sessizce geliştirdi ve bu çip just Hot Chips'te duyuruldu. Çipin üretiminin başarılı olduğu söylentileri bir süredir dolaşıyordu. Ancak şimdi detaylara eriştik. OpenAI, bize çipi incelemeye, laboratuvarında gerçekliğini doğrulamaya ve InferenceX setimizle performans testi yapmaya davet etti.

2024 yılının Haziran ayında OpenAI, LLM çıkarımı için sıfırdan tasarlanan Broadcom ile ortaklık kurarak çip projesini duyurdu. Tasarım çalışmaları 2024 yılının ortalarında başladı ve ilk ekip alımından üretime kadar yaklaşık 16 ay sürdü; bu, son derece hızlı bir ASIC geliştirme döngüsüdür.

Genel olarak birinci nesil çipler rekabet avantajına sahip değildir, ancak OpenAI tersine hareket ederek, test edebileceğimiz tüm NVIDIA, AMD ve Google çiplerini aşarak birçok üst düzey açık kaynak modelde sektörün öncüsü olmuştur. OpenAI, uç düzeyde yazılım-hardware uyumlu tasarımına dayanmaktadır. İlginç bir şekilde, OpenAI model çıkarımı sürecinin belirli bir aşamasına aşırı odaklanmamış, aksine tüm senaryolarda yüksek performans sunan evrensel bir çip geliştirmeye odaklanmıştır.

Bu makale, Jalapeño'nun InferenceX üzerindeki mimari ayrıntılarını, yazılım ayrıntılarını ve performans sonuçlarını derinlemesine inceleyecektir.

Evrensel çıkarım çipi

Herkes OpenAI'nin çiplerinin OpenAI modelleri için özelleştirildiğini söylüyor, ancak bu yanlış; OpenAI, AI çıkarımı için genel amaçlı bir çip geliştirdi.

Zaman çizelgesi çılgınca. "AI ile çip tasarımı hızlandırma" iddiasının doğru olduğunu gösteriyor. Zaman çizelgesi hızlı olsa da, OpenAI büyük miktarlarda para harcadı, pratik tasarım kararları aldı ve ekip çok güçlüydü, bu nedenle bu beklenen bir durum.

Sadece specifikasyonlara bakıldığında, hemen güçlü bir rakip oluyor:

Ayrıca HBM4 kullanarak NVIDIA ve AMD'nin üst düzey GPU'larıyla kıyaslanabilir düzeyde bir performans elde edin:

Bu çip hakkında birçok medya, OpenAI'nin rastgele yaptığı bazı açıklamalara dayanarak, bu çipin diğer çiplerle yapamadığı şekilde kendi modellerini optimize edeceğini iddia etti. Bu yanlıştır. Jalapeño, çeşitli modelleri ve iş yüklerini çalıştırmak için tasarlanmış evrensel bir çıkarım çipidir; bunlar arasında InferenceX performans testi de yer alır — bu testi laboratuvarımızda OpenAI mühendisleriyle birlikte gerçekleştirdik. Bir şaka olarak, OpenAI bize, Codex uyarıları kullanılarak kendi çiplerine taşınan “Doom” oyununu çalıştırdığını gösterdi.

Aşağıda, her megawatt toplam güç tüketimi altında token verimliliğini ölçen en önemli performans/watt sonuçları yer alıyor. Jalapeño, diğer tüm çipleri açık ara yendi. Bu sonuçlar, çok token tahmini (MTP) kullanılmadan elde edildi; grafikteki diğer çipler ise kendi SKU'ları için MTP'nin etkin şekilde etkinleştirilmiş en iyi yapılandırmaları.

Jalapeño, neredeyse tüm senaryolarda Blackwell’den daha iyi watt başına performans sunar ve eğri üzerindeki herhangi bir noktaya özel optimize edilmemiştir. Düşük gecikme senaryolarında yalnızca değil, yüksek verimlilik senaryolarında da harika sonuçlar verir. Daha adil bir karşılaştırma, tek token tahmin sonuçlarına bakarak yapılır; Jalapeño, her bir rakibini birkaç kat geride bırakır. Düşük eşzamanlılık senaryolarında Jalapeño, DeepSeek R1 modelinde kullanıcı başına saniyede 700’den fazla token üreterek şaşırtıcı bir etkileşim sağlar.

İnanılmaz olan, bunların tümünün tek token tahmini (STP) ile, tahmini çözme veya ön doldurma-çözme ayrımı olmadan gerçekleştirilmesidir. DeepSeek R1'in yanı sıra, Kimi-K2.5 ve GPT-OSS gibi diğer bazı modellerin de kullanıcı başına saniyede yaklaşık 1.400 token hızında çalıştığını gördük. Tüm modeller için, Jalapeño'nun GSM8k değerlendirme sonuçlarının NVIDIA çipleriyle eşit olduğunu doğruladık.

Burada birkaç dikkat edilmesi gereken nokta var. İlk olarak, tüm veriler OpenAI tarafından sağlanmıştır. InferenceX'in çalışmasını laboratuvarımızda doğruladık, ancak tam InferenceX referans test setini çalıştırmadık ve AgentX sonuçlarını görmedik. AgentX, gerçek üretim iş yüklerindeki önbellek davranışını yansıtan uzun bağlam ve çok adımlı özelliklerine dayalı olarak çip performansını karşılaştırmak için tercih ettiğimiz referans test setidir. 8k1k üzerinde iyi performans gösteren çerçeveler, AgentX üzerinde daha kötü performans gösterebilir, çünkü gerçek üretim iş yükleri, yönlendiricileri, önek önbellek mekanizmalarını, önbellek yönetimini ve yük dengeleme altyapısını gibi bileşenleri test eder. Tek adımlı 8k1k testleri bu unsurları kapsamaz. Daha fazla bilgi için AgentX makalemizi okuyun.

AgentX - InferenceXv3: Ağ çıkarımında CUDA koruma duvarı hâlâ dayanıyor mu?

İkinci olarak, Blackwell ile yapılan karşılaştırmayı eksik ve biraz adil olmadığını düşünüyoruz. Jalapeño'nun gerçek rakipleri, aynı HBM4'ü kullanan Rubin gibi çiplerdir. Vera Rubin sistemi şu anda müşterilere gönderim yapmaya başlamıştır, ancak OpenAI'nin Jalapeño'su hâlâ mühendislik örneklerine sahiptir ve seri üretime ulaşması biraz zaman alacaktır.

Bu nedenle, performans gerçekten Rubin ile karşılaştırılmalıdır, Blackwell ile değil. Jalapeño gibi özelleştirilmiş çiplerin Blackwell'i aşması beklenen bir durumdu. Vera Rubin NVL72'nin watt başına performansı, GB200 NVL72'nin 5,4 katıdır; bu bilgiyi geçen ay NVIDIA ile CoreWeave'in performans açıklamalarını analiz ettiğimiz yazıda belirtmiştik. Daha sonra Jalapeño ile Vera Rubin'in Temmuz performans verilerini karşılaştıracağız.

Vera Rubin NVL72 mi GB200 NVL72 mi? TCO ve mimari analizi

Üçüncüsü, test edilen model, açık kaynakta en önde yer almayan modeller arasındadır. NVIDIA ve AMD, AgentX aracılığıyla DeepSeek V4 Pro ve Kimi K3 gibi daha büyük modellerin sonuçlarını açıkladı. Model ne kadar büyük ve ne kadar yeni yayımlanmışsa, yeni çiplerde çalıştırmak o kadar karmaşık hale gelir. Bununla birlikte, OpenAI'nin Jalapeño üzerinde çalıştırdığı model de küçük sayılmaz.

Performans analizi

OpenAI'nin tasarımı, performans/瓦attır. Nedeni basittir: OpenAI şu anda veri merkezi elektrik tüketimine bağlıdır, bütçeye veya veri merkezi alanına değil; bu nedenle her megawatt başına token sayısı kritik öneme sahiptir. Computex 2026'da Huang, performans/瓦att, güvenilirlik ve uzun ömürlülüğün geleceğin GPU'larının temel özellikler olduğunu söyledi. Tam olarak şöyle dedi: "1 gigawatt elektriğiniz varsa, her watt başına verimlilik gelirdir." Ayrıca, sadece çip daha ucuz olduğu için yanlış bir mimari seçmenin anlamsız olduğunu da belirtti.

NVIDIA, Hot Chips 2026'da Vera sunumunda da bu noktayı vurguladı ve aynı gelir grafiğini gösterdi: “Günümüzde veri merkezleri elektrik kısıtlamalarıyla sınırlı.” Elektrik kritik öneme sahiptir ve geliri harekete geçirmektedir.

Operatörler, daha fazla megavat elde etmek için kolayca bir yol bulamıyor. GPU artırımı ile iletken kapasitesi artırımı arasındaki zaman ölçeği büyük fark gösteriyor. Veri merkezlerinin elektrik sınırları birçok kısıtlamadan etkileniyor. Örneğin, kamu hizmeti bağlantıları, altyapı, soğutma kapasitesi ve UPS/备用 jeneratör tasarımı. Şebeke gecikmeleri sıklıkla donanım ve inşaat ilerlemesini aşarak, şebeke sonrası elektrik kapasitesi talebini yaratıyor. Yani, veri merkezleri içinde gaz türbinleri ve yerel jeneratörler inşa etmek. Bu kapasiteler, kamu hizmeti sayacının arkasında yer alır ve kamu ağına bağımlı değildir. Bu durum, operatörlerin şebeke bağlantısı ve kamu hizmeti yükseltmelerini beklemesine gerek kalmadan tesislerine elektrik sağlayabilmesini sağlar. xAI’nin Colossus 2’si tam olarak bu nedenle şebeke sonrası elektriğe büyük ölçüde bağımlıdır ve gerçek şebeke bağlantısı hâlâ geride kalmıştır. Daha fazla bilgi için enerji modelimizi inceleyin.

X gönderimimizde yazdığımız gibi, tok/s/MW, her joule başına token sayısına indirgenebilir. Çünkü watt, saniyede joule'dur. Bu nedenle tok/s/MW, sistemin verimliliğini ve enerjiyi token'lara dönüştürme yeteneğini temsil eder.

Bu bağlamda, Jalapeño, Rubin ile karşılaştırıldığında bile üstünlük kazanıyor. OpenAI'nin Jalapeño'su, her megawatt STP için token verimliliği açısından Vera Rubin'in MTP sonucunu aşıyor. Bu sonuç, NVIDIA ve CoreWeave tarafından Temmuz'da duyuruldu. Ayrıca, 2025 yılındaki GB200 MTP sonucunu da ciddi ölçüde geride bırakıyor. Vera Rubin makalesinde de belirttiğimiz gibi, VR, 2025 yılındaki GB200 sonucuyla karşılaştırıldı. Bunun nedeni, her ikisinin de benzer erken başlatma aşamasında olmasıdır. Aynı zamanda, 2025 yılındaki GB200 ile karşılaştırma, yazılım olgunluğunu sabit tutar. Bu mantıkla, üç farklı sonucu karşılaştırıyoruz: Vera Rubin'in en son 2026 Temmuz sonucu, GB200'un 2025 yılı sonucu ve mevcut Jalapeño sonucu. Bu karşılaştırma oldukça mantıklı çünkü bu, mevcut en iyi açık Rubin verileridir. Ayrıca, OpenAI, Rubin'den sonra kendi çipini üretti. OpenAI ve Rubin hâlâ olgunlaşmamış durumda, bu nedenle performansı hâlâ artmaya devam edecektir.

Performans/Toplam Sahiplik Maliyeti açısından Vera Rubin ve Jalapeño eşit durumda. Dolar başına neredeyse aynı sayıda çıktı token üretiyorlar. Ancak önceki açıklamalarda belirtildiği gibi, Jalapeño sonuçları tahmini kodlamayı kullanmamaktadır. Vera Rubin sonuçları ise tahmini kodlamayı kullanmaktadır. Tahmini kodlama, her token maliyetini yaklaşık 3-5 kat azaltabilir. Jalapeño tahmini kodlamayı uyguladığında, token hizmeti sağlama konusunda daha yüksek maliyet verimliliğine sahip olacaktır. Elbette, TCO avantajlarının bir kısmı NVIDIA’nın yüksek kar marjlarından kaçınıp Broadcom’un daha düşük (ancak hâlâ yüksek) kar marjlarına geçişten kaynaklanmaktadır. Ancak bu tüm neden değildir. Örneğin, Meta ve Microsoft’un AI ASIC projeleri daha uzun süre yatırım yapmış ancak başarıyla hayata geçirememişlerdir. Bu da maliyetin denklemin sadece bir parçası olduğunu göstermektedir. Jalapeño’nun tam TCO analizi için SemiAnalysis AI Cloud TCO modeline bakınız.

Mimari olarak, OpenAI ön doldurma (prefill) ve dekodlama (decode) işlemlerini farklı çip havuzlarına ayırmayı tercih etmedi. Taslak model ve ana model aynı çip ve bağlantı yapısını paylaşır. Bu tasarım yaklaşımı, teorik verimliliğin bir kısmını fedakârlık ederek pratik operasyonel kolaylığı sağlar. Motivasyonu, iş yükü bileşiminin zamanla değişmesidir. Örneğin, giriş, önbellek yazma, önbellek okuma ve çıktı token oranları önemli ölçüde değişti. Bu değişim, son yazılarımızda tartıştığımız gibi, bilgi, muhakeme ve ajan olmak üzere üç model neslini yaşadıktan sonra meydana geldi. Bu nedenle, heterojen ön doldurma ve dekodlama çipleri için sabit bir miktarı önceden belirlemek, zamanla verimsizliğe yol açar. OpenAI bu mimaride homojen bir havuz seçti ve tüm görevlerde çiplerin iyi performans göstermesini sağlamaya çalıştı.

Ve gerçekten做到了。Kimi K2.5 (Cursor Composer 2.5 bu model üzerine kuruludur) üzerinde, Jalapeño saatte kullanıcı başına yaklaşık 700 tok'a ulaşmıştır. Bu hız, ikinci en iyi çipin saatte kullanıcı başına 100 tok'unun 9 katından fazladır.

GPT-OSS'te yine başka bir ezici zafer. Jalapeño'nun her megawatt başına eşzamanlı işlem verimliliği, GB200'un en yüksek verimlilik noktasının neredeyse iki katı ve GB200'un eşzamanlı 1 noktasının 50 katından fazla. Daha yüksek eşzamanlılık için Jalapeño noktası EP8 kullanıyor.

Bu sonuçlar etkileyici! Ancak biraz eleştirel olmalıyız: Bunlar sadece 8k1k, ayarlama zorluğu çok daha düşük ve henüz AgentX çalışma verileri yok. AgentX makalesinde de belirttiğimiz gibi, çok aşamalı ve uzun bağlam iş yükleri, çıkarım yığınının daha fazla yönünü zorlayacaktır. Örneğin, yönlendirici ve önek önbelleği. Agent iş yüklerinde iyi performans göstermek için daha fazla optimizasyona ihtiyaç vardır. Daha fazla bilgi için AgentX makalesini okuyun.

AgentX - InferenceXv3: Akıllı ajan çıkarımında CUDA koruması hâlâ korunabilir mi?

Detaylı özellikler ve mimari

Tüm bu sonuçlar, Jalapeño'nun A0 adımı üzerinden ve proje başlatıldıktan sadece 9 ay sonra elde edildi. Ancak B0 adımı şu anda çip fabrikasında! B0 adımı, daha önceki A0 çipine kıyasla watt başına performansı yaklaşık %25 artırıyor. Özellikle, B0 adımı, tek bir maske boyutunda bir çip üzerinde 13,4 PFLOPs MXFP4 performansı sağlıyor. Bu çip TSMC N3P teknolojisiyle üretilmiştir. Karşılaştırmada, tek bir Rubin hesaplama çipi, benzer boyutta ve aynı işlemde 17,5 PFLOPs yoğun Rubin NVFP4 performansı sağlamaktadır.

Jalapeño'nun TDP'si yalnızca 700W iken, Rubin her hesaplama çipinde 900-1150W tüketiyor; bu nedenle Jalapeño'nun bu performansı daha da saygıdeğer. Jalapeño, eğitim yerine çıkarım için tasarlandığından, OpenAI FLOPs'ı maksimize etmek için TDP'yi artırmaya gerek duymuyor. Bu anlaşılabilir. Ancak yine de yukarıdaki sonuçlar, Jalapeño'nun önemli bir teorik tepe FLOPs sağladığını göstermektedir.

Jalapeño, diğer hızlandırıcılarla doğrudan karşılaştırıldığında, watt başına en yüksek HBM bant genişliğine ve watt başına en yüksek FLOPs'a sahiptir. Bu seviye, 1800W Rubin Max-Q yapılandırmasıyla kıyaslanabilir.

Jalapeño, Nvidia ve AMD'den sonra HBM4 teknolojisini benimseyen erken örneklerden biri olacak ve mevcut TPU ve Trainium projelerini öne çıkaracak. Jalapeño'nun temel mimari ilkelerinden biri, HBM bant genişliğini tam olarak kullanmaktır; bu nedenle üst düzey olmayan bir HBM kullanmak bu hedefe aykırıdır. Bu, paket başına 15,4 TB/s bant genişliği sağlar ve HBM3E kullanan diğer tüm piyasadaki akseleratörleri aşıyor. 15,4 TB/s bant genişliği, HBM4'ün 10 Gbps pin hızına ulaştığını gösteriyor; bu, Nvidia'nın Rubin'de kullandığı HBM4'ün 9,6 Gbps'inden hafifçe daha yüksek. HBM muhtemelen Samsung tarafından sağlanacaktır.

OpenAI, 2025 yılı Kasım ayında Jalapeño'nun sadece üst katman çipini değil, CoWoS tasarımıyla birlikte akışını tamamladı. 2025 yılı Kasım ayında akışın tamamlanmasından sonra 9 ay içinde ve yalnızca gerçek silikon üzerinde 3 ay boyunca hata ayıklama yaptıktan sonra, OpenAI Jalapeño ile çok iyi sonuçlar elde etti. Takımın yazılım yığınında sıfırdan başlamış olmasının dikkate alınması, bu durumun daha da etkileyici hale gelmesini sağlıyor.

Aynı zamanda, Rubin'in CoWoS üretimi Ekim 2025'te tamamlanacak, bir ay önce; ancak şu ana kadar gördüğümüz tek erken sonuçlar CoreWeave'in mühendislik örneklerinden geliyor. Nvidia, OpenAI gibi yeni modelleri test etmemize ve benchmark yayınlamamıza izin vermiyor, bu da çip yazılımının henüz olgunlaşmadığını gösteriyor. OpenAI'nin kendi çiplerinde yeni modelleri bu kadar hızlı çalıştırabiliyor olması, CUDA'nın koruma duvarının ortadan kalktığını gösteriyor.

Hala tam olarak optimize edilmemişler ve genel olarak Jalapeño'nun daha iyi veriler sunduğunu görüyoruz. Nvidia donanımının daha kötü olduğunu düşünmüyoruz, Jalapeño'nun yazılım hatalarını giderme hızının Nvidia'dan daha hızlı olduğunu düşünüyoruz. Bu, donanım/ yazılım ortak tasarımı gücünü gösteriyor ve bu, en üst düzey öncü laboratuvar ASIC ekiplerinin daha olgun ticari çipler üreticilerini aşabildiği ana alan. Tersine, sıfırdan başlamak OpenAI'ye de fayda sağlamış olabilir, çünkü geriye doğru uyumluluk veya eski yazılım sürümleriyle sınırlı kalmadan tamamen yeni mimari kararlar alabiliyor.

OpenAI'nin Jalapeño prototipi mevcut olsa da, seri üretimin 2027 yılında adım adım artırılması planlanıyor ve büyük bölümü gelecek yıl sonuna kadar ertelenmiştir. Birim sayısı ve ortalama satış fiyatı hakkında daha fazla ayrıntı için SemiAnalysis Accelerator Modeline bakın.

OpenAI Jalapeno, gerçekten büyük ölçekli bir ASIC'tir.

Rubin'in zaman çizelgesine kıyasla Jalapeño'nun hızı inanılmaz derecede hızlı. Görüldüğü gibi, Rubin daha erken başlamış olsa da, Jalapeño'nun sonuçları Rubin'i geçti.

Jalapeño Mimarisi

Derin mimariye bakıldığında, bu çipin matris motoru, TPU'ya benzer şekilde MXFP sayı formatını ve ağırlıkları sabit tutan döngüsel dizi kullanır. Ancak TPU ile doğrudan karşılaştırıldığında, daha küçük şekilleri/boyutları destekler, bu da daha büyük döngüsel dizilerdeki şekil uyumsuzluğu nedeniyle ortaya çıkan garip performans düşüşlerine neden olmaz.

Ayrıca 64 bit skaler çekirdek ve FP32/INT32 vektör çekirdekleri de barındırır. OpenAI, palet düzeyinde artımlı tasarım ve çekirdek ile kanal düzeyinde verimlilik geri kazanımını da entegre etti. Şirket, AI destekli tasarım sayesinde SIMD alanının %8 azaldığını ve matris motorunun alanının %10 azaldığını açıkladı. Spesifik bir üretim süreci/gerilim/sıcaklık (PVT) koşulu belirtmese de, AI destekli modülün ilk modüle kıyasla zamanlama ve güç tüketimini iyileştirdiğini belirtti.

Jalapeño mimarisi, KVCache ve ağırlıkların bellek taşıma işlemlerini ve sabit gecikmeyi ve maliyeti ortadan kaldırarak, küçük batch boyutlarında veya küçük şekillerde bile diğer hızlandırıcılara kıyasla orijinal tepe hesaplama gücü/bant genişliğine daha yakın performans sunmayı hedefler.

Çekirdekler ve HBM, birden fazla dilim olarak bölünmüştür; her çekirdek dilimi, kendi HBM dilimine düşük gecikmeli yerel bir görünüm sahiptir. Dilimler arasındaki senkronizasyon, yüksek bant genişlikli özel toplu iletişim ağı aracılığıyla gerçekleştirilir. Bu en basit bellek hiyerarşisi, Jalapeño'nun, bellek erişiminin karmaşık bir bellek sistemi üzerinden geçmesi ve büyük şekillerde amortize edilmesi veya gizlenmesi gereken daha büyük gecikmeler üretmesi nedeniyle GPU'lara kıyasla büyük potansiyel avantajlar sağlamıştır.

Bu seçim, ağırlıkların ve KV'lerin dikkatle yerleştirilmesi sayesinde, çekirdekler arasındaki senkronizasyonun, hesaplama ile örtüşebilecek olan tensör paralel iletişim gibi sınırlı ve bilinen yüksek bant genişliğine sahip iletişimlere sınırlanabilmesi nedeniyle mümkündür.

Ayrıca, genel iletişim ve genişletilmiş ağa erişim için ek bir genel NoC bulunmaktadır. Genel olarak, OpenAI, basitleştirilmiş NOC ve bellek alt sistemi sayesinde Nvidia ve Google'a kıyasla büyük bir enerji tasarrufu sağlıyor ve önemli bir performans artışı elde ediyor.

Çekirdek düzeyinde, OpenAI, L1 önbelleğe sahip bir sıralamalı (OoO) çekirdek tanımlıyor. Bu, diğer tüm akseleratörlerde görülen, genellikle asenkron DMA desteğiyle birlikte kullanılan yazılım yönetimli önbellek modelinden tamamen farklı. Buradaki argüman, Jalapeño'nun bariyer gecikmesi gibi sabit maliyetlerden kaçınmasını sağladığıdır; bu maliyetler, GPU gibi diğer akseleratörlerde, her çekirdeğe düşen iş yükünü artırarak gizlenmeli veya dağıtılmalıdır, bu da orijinal teorik bant genişliği/hesaplama kapasitesine ulaşmayı daha zorlaştırır.

Maliyeti, Jalapeño'nun bellek isteklerinin zamanında ulaşmasını sağlamak için iyi bir önceden alma (prefetch) üzerine bağımlı hale gelmesidir; ancak bu, tahmin edilmesi ve çıkarımı daha zordur. Ancak Codex, iyi bir çerçevede ayrıntılı izleme verilerini sağladığından, verilen bir şekil için en iyi önceden alma ile en iyi çekirdeği bulmak neredeyse tamamen insan müdahalesine gerek kalmadan yapılabilir. Bizce, OpenAI'nin DeepSeek R1, Kimi K2.5 ve GPT-OSS'i bu kadar hızlı çalıştırabilmesinin nedeni budur.

Çekirdek, daha küçük matris boyutlarını da destekler; bu (ne kadar küçük olduğuna bağlı olarak), matris boyutu hizalaması, dolgu maliyeti ve bloklama verimsizliği konularında daha az duyarlı hale getirerek farklı modeller ve toplu boyutlar üzerinde daha genel bir kullanım sağlar. Örneğin, TPU, Trainium ve Etched çipleri çok büyük döngüsel dizilere sahiptir ve bloklama verimsizliğini önlemek için büyük toplu boyutlar veya tam olarak bölünebilir model boyutları gerektirebilir.

Jalapeño ile OpenAI, Pareto eğrisinin tüm bölgelerinde roofline performansına mümkün olduğunca yaklaşmak için sistemdeki sabit gecikmeleri ortadan kaldırmaya odaklanmaktadır. Teorik olarak, bu, birden fazla çalışma noktasında GPU'ya göre bir avantaj sağlayabilir:

Düşük gecikme / küçük miktarlı çıkarımın üst performansı, GPU'dan çok daha iyidir. GPU, başlatma gecikmesi, bariyer gecikmesi, bellek sistemi gecikmesi gibi sabit maliyetlerden etkilenir.

Büyük miktarlarda veya uzun bağlamda bile donanım roofline'ına daha yakın potansiyele sahiptir.

Bu, bir uyarı ile birlikte gelir: teorik olarak bir üst sınır performansı olsa da, gerçek çekirdekler bu performansa ulaşmak daha zor olabilir. Bu nedenle yöntemi şöyledir:

Tüm iş yükü şekilleri için en üst performans sınırını tasarlayın

Codex'a ağır işi yaptırın ve bu üst sınırı gerçekleştiren çekirdeği bulun

OpenAI ekibi, Jalapeño üzerinde InferenceX iş yükünü hızlı bir şekilde başlatıyor.

Bu yönteme göre iyimseriz.

Jalapeño başarılı olursa, güçlü bir sinyal verilecektir.

Programlama modelleri ve mükemmel evrensel derleyicilere olan endüstri tutkusu, öncü AI modelleri tarafından kırılacaktır.

OpenAI, Jalapeño çekirdeğini derleyici gibi yazıyor.

Her çekirdek, yaklaşık 3000 satır olan el ile optimize edilmiş kodlara sahiptir.

Ayrıca doğrulama kontrolü ve özelleştirilmiş sanitizer desteği de mevcuttur.

Erken dönem çekirdek çalışmaları, tamamen otomatik değil, insanın döngüde olduğu şekildedir.

Daha ölçekli iç versiyon olan Codex'e geçiş yapıldı.

OpenAI, bu sürümü kurumsal müşterilere satmayı planlıyor.

İç hizmet motoru "Teacup" adını taşır.

İlginç bir şekilde, OpenAI daha önce dahili bir MLA çekirdeği uygulamasına sahip değildi.

Onlar DeepSeek için InferenceX ile benchmark yapana kadar.

Codex, çekirdek mühendislik ekibinin müdahalesi olmadan bu kadar hızlı ve verimli bir çekirdek yazabiliyor.

Bu, yazılım hattının geliştirme kapasitesini göstermektedir.

OpenAI, Jalapeño için Gluon ile programlama yapıyor.

Gluon, OpenAI'nin çekirdek programlama dilidir.

Gluon, Triton üzerine inşa edilmiştir ve Triton'un SPMD (Single Program Multiple Data) programlama modelini korur.

Ancak alt düzey programlama soyutlamalarını ortaya çıkartıyor.

Örneğin, NVIDIA GPU için PTX komutlarına eşlenen bir API sunar.

MMA komutları, TMA komutları, mbarrier mekanizması vb. dahil.

Gluon, sağladığı en özgün soyutlama düzenlemesidir.

Genel olarak, düzen, donanım kaynaklarını tensör elemanları ile eşler.

Örneğin, Warp 9'un 5. kaydedicisi, tensör elemanının 6. satır ve 7. sütununa karşılık gelir.

Gluon'un düzeni, Doğrusal Düzenlere dayanmaktadır.

Bu, OpenAI tarafından geliştirilen bir düzen cebiridir.

Linear Layouts, düzenlemenin matematiksel olarak ne olduğunu tanımlar.

Ayrıca işlem düzeni araçlarını sağlar.

Bu, kanıtlanabilir doğru düzen dönüşümleri gibi birçok özelliği destekler.

Ayrıca en iyi bellek swizzling.

Jalapeño'nun programlama modelinde, her Gluon programı kalıcı bir iş parçacığına eşlenir.

Jalapeño'nun kalıcı çekirdek programlama modeline uygun olduğunu düşündüğümüzü düşünüyoruz.

Her program, donanım zamanlayıcısı yerine programcı tarafından iş dağıtılan birden fazla tile üzerinde çalışır.

OpenAI, TensorInfo'yu belirtti.

Bu, açıkça kodlanmış bir düzenin soyutlamasıdır.

Bu, Jalapeño için tasarlanmış bir dizi düzen olabilir.

Bu, Linear Layouts tarafından desteklenecektir.

Son olarak, her çekirdek veri ön getirme ve bağımsız sıralama dışı birim sağlar.

Örneğin, kullanıcı önceden alınan verileri beklemek için programlayabilir.

Bu veri semafor ile kilitlenmiştir.

Ironik bir şekilde, GPT 5.6 Sol gibi OpenAI modelleri şu anda NVIDIA GPU'larında çalışıyor.

Bu, CUDA'nın koruma duvarına gerçek bir tehdit oluşturan çiplerin tasarlanmasında kullanılır.

NVIDIA'nın kendi GPU'ları, potansiyel bir varisini gerçek zamanlı olarak destekliyor.

Zamanlar arasında karşılaştırdığımızda, Jalapeño'nun geliştirme hızını da görebiliyoruz.

İki haftadan kısa bir sürede, bazı etkileşim senaryolarının işlem kapasitesi iki katından fazla arttı.

Jalapeño ekibinden aldığımız her tarball, harika bir dünya içeriyor.

Çekirdek performansı arttıkça, Jalapeño ekibi 8 gün içinde TP32'yi etkinleştirdi.

Önceki TP8 yapılandırmasına dayanarak, tek bir sistemden öteye geçerek büyük modelleri çalıştırmak için tam raf seviyesi yapılandırma gerçekleştirin.

Bu geliştirme hızı gerçekten etkileyici.

OpenAI, gerçek donanımda çalıştırmadan önce performansı doğrulamak için bir simülatör olan “chilisim”e de sahiptir.

Sabit genişlikli trace veri yolu kullanılarak, gerçek donanım üzerindeki doğruluk %5 içindedır.

A0'da izleme kapasitesi sınırlı, ancak B0'da büyük ölçüde iyileşti.

Bu, A0 çipinin gerçek çalışma verilerinden kaynaklanıyor olabilir.

Mühendis, Codex CLI'nin dahili modeli çalıştırdığını gösterdi.

Adı "Raiku" veya "5.3 Codex Spark" olan bu cihazın TPOT değeri 1,2 ms'tir.

Takım, Codex tarafından yazılan bir gösteriyi doğrudan çip üzerinde çalıştırdı.

36 FPS ile Doom ve FP32 akışkan dinamik simülasyonu dahil.

Ayrıca “Liquid Light” fare sürüklemeli görselleştirme.

Model açısından, OpenAI'nin iç megakernel çözümünün lakabı "gigakernel".

Tek bir megakernel etrafında oluşturulmuş olup, CPU yükünü ve başlatma süresini azaltmak için cihaz üzerinde döngü yapar.

Takım, test sırasında hesaplama stratejilerini daha da geliştiriyor.

1 milyon rollout'un nasıl koordine edileceği konusunda özel içsel odak.

Disagg mi, yoksa değil mi, bu soru.

Daha önce belirttiğimiz gibi, OpenAI bu çiplerde prefill-decode ayrımını kullanmadı.

NVIDIA ve AMD GPU performansının PDD'den önemli ölçüde fayda gördüğünü düşünmüştük.

Hatta aynı donanımda bile.

Jalapeño ekibinin bunu neden yaptığını derinlemesine inceleyelim.

İş yükü sabit olduğunda, prefill-decode ayrımı çekici görünüyor.

Prefill ve decode, donanım üzerinde farklı yükler oluşturur.

Her aşamayı ayrı ayrı optimize edilmiş havuzlara atayın, seçilen giriş/çıkış oranlarıyla verimliliği artırın.

Ancak üretim trafiği bu oranı korumayacaktır.

Giriş-çıkış dizisi uzunluğu, paralellik, önbellek vuruş oranı, tahmini kabul oranı ve gecikme hedefi gün boyu değişmektedir.

Cihaz prefill ve decode havuzlarına ayrıldığında, prefill talebinin fazla olması decode çiplerinin boş kalmasına ve isteklerin sıraya girmesine neden olur.

Ancak aşırı sayıda decode talebi tersine etki eder.

Operatörler, her iki tarafta yedek kapasite bırakmak için sürekli doğru bölünmeyi tahmin etmelidir.

Değişen bir ideal oranla bir sistemi yeniden dengeleyin.

Birleşik sistemde, bazı kaynaklar belirli aşamalarda yetersiz kullanılabilir.

Ancak her cihaz hala bir sonraki istek için kullanılabilir.

Ayrık sistemde, tam çip yalnızca yanlış havuza ait olmasından dolayı boşta kalabilir.

Yerel kullanım daha iyi görünüyor, ancak genel kullanım kötü olabilir.

Ayrıştırma yerelliliği de bozar.

Prefill worker, hemen ihtiyaç duyulan büyük KV önbelleğini oluşturur.

Durum, üretimin devam etmesi için ağlar arasında aktarılmalıdır.

Bu, bant genişliği tüketimini, senkronizasyonu, sıraya alma ve başka bir hata alanını artırır.

Maliyet, KV önbelleği büyüdükçe girdi dizisi uzunluğuna bağlı olarak artar.

Ancak, KV'nin taşınmasını önlemek temel olarak güç tüketimi ve gecikme optimizasyonudur.

Bazı KV'leri taşımayı tercih etmek, donanım kullanımını artırabilir, ancak güç tüketimi ve tek bir istek gecikmesi artar.

Değiştirilebilir kümeler, gecikme duyarlı istekler ile verimlilik odaklı toplu işlemler arasında kapasite aktarabilir.

Sabit bölümlendirme, trafiğin bileşimi değiştiğinde donanımın kullanılmamasına neden olur.

Ayrıca, bağlam uzunluğu, dikkat ve FFN işleri arasındaki dengeyi değiştirir.

Sabit donanım oranı yalnızca tasarım noktasında etkilidir.

Aynı kısıtlamalar spekülatif dekodlama için de geçerlidir. Taslak model, aday token'ları çok düşük gecikmeyle doğrulayıcıya sağlamalıdır. İkisini farklı özel havuzlara ayırmak, sıkı bağlı dekodlama döngüsünü dağıtık bir protokole dönüştürür. Ek iletişim ve koordinasyon, taslak tarafından kazanılan gecikmeyi yenebilir. Spekülatif dekodlamayı değerli kılan lokaliteyi korumak için iki model de aynı cihazda ve düşük gecikmeli yapıda olmalıdır.

Ancak, talep yeterince büyük, istikrarlı ve öngörülebilir olduğunda, çözülme hâlâ üstünlük sağlar. Özellikle geleneksel GPU'ların iyi bir verimlilik elde etmek için büyük miktarlarda ve aşamalı toplu işlemlere ihtiyaç duyduğu durumlarda. Ancak bu ücretsiz bir öğün değildir.

Japon'dan Hindistan'a (hafif acıdan çok acıya): Katsu, Vindaloo ve Chana—bu kari yemekleri nasıl bir raf sistemi oluşturur?

Jalapeño sistemi, CPU anahtar birimi ve ASIC anahtar biriminden oluşur. Anahtar birimi, "Katsu" adlı 16 adet CPU tray'ı barındırır. Her Katsu, sağ tarafta yer alan "Vindaloo" adlı 16 ASIC tray'ından birine karşılık gelir. Her anahtar, iki Turin sınıfı AMD EPYC CPU, 1,5 TB DRAM, 2x E1.S ve 2x M.2 SSD ile donatılmıştır. Her tray ayrıca 400G (2x200G) ön ağ bağlantısına sahiptir. Her Katsu tray'ı, 8 adet harici PCIe DAC kablo ile her Vindaloo tray'ına bağlanır. Bu kablolar, anahtarın ön kısmında yatay olarak yönlendirilir. Sistem düzeyi tasarım, Celestica ile iş birliği içinde gerçekleştirilmiştir.

Chana adlı ASIC rafı, 16 adet Vindaloo paleti ve 8 adet genişletme anahtar paletinden (6 yerel + 2 genel) oluşur. Her Vindaloo paleti, 8 adet Jalapeño ASIC içerir ve her raf toplamda 128 adet Jalapeño ASIC'e sahiptir. ASIC'ler, Nvidia'nın Oberon'u gibi bakır kablo arka planda her Chana anahtar paletine bağlanır. Genişletme topolojisi, yerel ve genel alanlara ayrılır. Yerel alan, raf içindeki 128 ASIC'i kapsar. Genel alan, en fazla 16 rafı veya 2.048 ASIC'i birbirine bağlar. Bant genişliği ve topolojiyi aşağıda daha ayrıntılı olarak açıklayacağız.

Yan yana monte edilen sunucu rafının güç tüketimi yaklaşık 50 kW (üretimde 31 kW), ASIC rafı 130 kW tüketiyor. Tam çift raf sistemi yaklaşık 160 kW. Enerji tüketimi açısından, bu temel olarak çift genişlikte bir GB300 rafına eşdeğerdir.

OpenAI, tek bir genişletilmiş ağ içinde en fazla 2.048 Jalapeño XPU'yu birbirine bağlayabilir. Genişletilmiş ağ, iki alandan oluşur. Yerel alan, arka planda 128 XPU'yu bir raf içinde birleştirir. Küresel alan, bakır kablolar ve optik bağlantıların karışımını kullanarak 16 rafın 2.048 XPU'sunu birbirine bağlar. Her raf, 8 Chana anahtarlama paleti içerir. Yerel alanda 6 Chana anahtarlama cihazı kullanılır. Her biri, 102,4T Tomahawk 6 anahtar ASIC'ine sahiptir. Küresel alanda, paletin üst ve alt kısmındaki 2 Chana anahtarlama cihazı kullanılır. Her anahtarlama paletinde en fazla 204,8T olmak üzere, her biri 2x 102,4T Tomahawk 6 anahtar olabileceğini düşünüyoruz.

Yerel alanda, her XPU başına 128 Jalapeño çipi, 4,8 Tb/s tek yönlü bant genişliğine sahiptir. Bunlar, 6 adet 102,4 Tb/s Tomahawk 6 ASIC'e tamamen birbirine bağlanmıştır. Bu, her XPU için 48 çift diferansiyel çift (DP) erkek-dişi konektör anlamına gelir. Toplamda, yerel genişletme için her raf başına 6.144 çift DP pasif bakır kablo kullanılmaktadır.

Genel alanda, 16 raf, 2.048 XPU'yu bakır arka plaka, elektriksel 204,8T TH6 anahtarı, 1,6T optik modül ve optik devre anahtarı kombinasyonuyla bağlar. Her XPU'nun genel bağlantısı için tek yönlü bant genişliği 1,6 Tb/s'tir. Yani her XPU, XPU ile genel anahtar arasında arka plaka için 16 çift diferansiyel çift (DP) erkek-dişi konektörüne sahiptir. Her genel anahtar paleti 2 ASIC'e sahiptir ve çıkış bant genişliği arka plaka ile ön panel optikleri arasında paylaşılır.

Her bir XPU başına 64 DP çifti olmak üzere, yerel ve küresel alanlar arasında her rafda 8.192 DP çifti pasif bakır kablo bulunur.

Genel alan, 8 adet rail'den oluşan saf rail mimarisiyle oluşturulmuştur. OpenAI'nin, her bir raf üzerindeki optik devre anahtarları (OCS) aracılığıyla genel alandaki optik bağlantıları yönlendirdiğini düşünüyoruz. Her bir XPU'nun 1,6 Tb/s genel bant genişliği, bakır arka plaka üzerinden genel anahtar paletine ulaşacaktır. Daha sonra, anahtar üzerindeki ön paneldeki 1,6 T optik modüller aracılığıyla dışarı çıkacaktır. Bu, pasif optik anahtara önce girer, ardından rafı terkeder. Bu yapı, 16 raf ve her biri 128 XPU içeren toplam 2.048 XPU'ya kadar alan genişletmesini sağlar.

Genişletme ağı, toplam sistem maliyetinin yaklaşık %10'unu oluşturduğundan, bu esneklik, gelecekteki 10 trilyon ila 20 trilyon parametreli modeller veya 2 milyon ila 4 milyon tokenlik bağlam penceresi için değerli bir seçenek sağlar. Dağıtım açısından, OpenAI, neocloud ile iş birliği yapmaktadır. Aynı zamanda, 1 ay önce veri merkezi ortaklarıyla güvenilirlik verilerini toplayarak, limandan rafa kadar dağıtım süresini optimize etmiştir.

Sonraki adım

Sonra, Jalapeño'nun geleceğini ve ilk üretim token'ının yakında gelmesini tartışacağız. Sonraki hedef 100 MW; engeller ana olarak donanımda: Veri merkezlerini ne kadar üretebilecekler, ne kadar iyi dağıtabilecek ve işletebilecekler, izleme ve direnç gibi konuları nasıl ele alacaklar. Yazılım zaten doğrulandı ve dahili modeller mevcut; herhangi bir yazılım ilk avantajı kolayca yakalanabilir. Ücretli duvarın ardında, NVIDIA, AMD, Cerebras gibi çip şirketlerine olan etkilerini, OpenAI ile sonraki birkaç yıl için imzaladıkları sözleşmeleri tartışacağız.

Aynı zamanda Accelerator modelimizde sonraki nesil çiplerin üretimi, miktarı ve zamanlamasını da kapsıyoruz.

Sonraki bölüm ücretli içerik olup, erişim sorunları nedeniyle daha fazla çeviri yapılmamıştır; ancak önceden verilen bilgiler, OpenAI'nin NVIDIA çiplerine verdiği meydan okumayı ayrıntılı şekilde yansıtmaktadır. Çip sektörüne ve NVIDIA hisse senedi fiyatına ilgi duyanlar için bu bilgiler, yeni ve sağlam bir referans sağlayacaktır.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.