Yazar: Dong Jing
OpenAI'nin kendi geliştirdiği ilk çip Jalapeño, AI çip endüstrisindeki mevcut dengeleri şaşırtıcı bir hızla değiştirdi—bu sadece bir ürün duyurusu değil, AI'nın çip tasarımını nasıl yeniden şekillendirdiğinin bir sinyali.
Wall Street Journal makalesine göre, Bloomberg'in 25 Ağustos'ta verdiği habere göre, OpenAI, Jalapeño'nun birim enerji tüketimi başına işlenebilen AI iş yükü ve yanıt hızı gibi iki temel ölçütte NVIDIA GB300'ü geride bıraktığını açıkladı. Bu çip, OpenAI ve Broadcom tarafından AI çıkarım aşaması için ortaklaşa geliştirildi ve en erken bu yılın sonlarında gerçek dünyada kullanılmaya başlanacak. OpenAI çip sorumlusu Richard Ho, Jalapeño'nun 700 watt düşük güç tüketimiyle güçlü performans sağladığını ve veri merkezi elektrik maliyetlerini önemli ölçüde azaltmaya yardımcı olacağını belirtti.

Yarı iletken araştırma kuruluşu SemiAnalysis'a göre, bu çipin tasarımının başlatılmasından tamamlanmasına kadar yaklaşık 16 ay sürdü ve kritik CoWoS paketleme aşaması Kasım 2025'te tamamlandı, bu da şu ana kadar sadece 9 ay geçtiğini ve endüstride yaygın olan 18 ila 36 aylık süreyi çok altına düşürdüğünü gösteriyor.

SemiAnalysis araştırmacıları, OpenAI laboratuvarını ziyaret ederek kendi geliştirdikleri InferenceX performans test setini kullanarak Jalapeño'yı test etti ve sonucu doğrudan şöyle belirtti: Bu çip, watt başına performans (perf/W) ölçütünde daha önce test ettikleri tüm NVIDIA, AMD ve Google çiplerini geçti.
Daha da önemlisi, bu başarı, Jalapeño'nun spekülatif dekodlamayı, ön doldurma ve dekodlama ayrımını dağıtım gibi optimizasyonları henüz etkinleştirmemiş olmasının yanı sıra, karşılaştırılan diğer çiplerin tümü kendi en iyi yapılandırmalarını açmış durumda iken elde edilmiştir.
Dylan Patel gibi ünlü yarı iletken analistleri bile, "Blackwell değil, NVIDIA Rubin çipinin de aşılması" dedi!

Analiz, bu sonucun NVIDIA'nın pazar konumuna doğrudan bir meydan okuma olduğunu ve AI çip rekabeti düzenini yeniden değerlendirmeye zorladığını gösteriyor.
Gerçek veriler: Jalapeño, birkaç kritik indekste Blackwell'i ezdi
SemiAnalysis'in test sonuçları, Jalapeño'nun çıkarım verimliliğinde önemli bir avantaja sahip olduğunu gösteriyor.
Jalapeño, GPT-OSS 120B modeli üzerinde saniyede yaklaşık 1459 token üretirken, NVIDIA GB200 sadece 535 token üretiyor; uçtan uca gecikme açısından, Jalapeño bir görevi tamamlamak için yalnızca 1,65 saniye gerektirirken, GB300 yaklaşık 6 saniye gerektiriyor ve bu fark 3,6 kat. Yüksek etkileşim senaryolarında, GB300 en hızlı dekodlama hızına (saniyede 169 token) çıkarıldığında, Jalapeño'nun verimliliği onun 104,3 katı.

Veri merkezi verimliliğinin temel ölçütü olan her megavat saniyesindeki Token sayısı açısından, Jalapeño GPT-OSS modelinde yaklaşık 53 milyon Token/MW/s ulaşırken, GB200 NVL72 sadece yaklaşık 10 milyon.

SemiAnalysis, bu endikatörün temelde her joule çıktı başına düşen Token sayısına eşit olduğunu belirtiyor ve bu, veri merkezlerinin gelir tavanını doğrudan belirliyor—şu anda hesaplama gücü elektrik kısıtlaması altında olduğundan, bu boyutun avantajı özellikle kritik.
SemiAnalysis'ın elektrik, soğutma ve ağ maliyetlerini de dahil ettiği sistem düzeyi maliyet analizine göre, Jalapeño'nun saatlik toplam sahiplik maliyeti çip başına yaklaşık 1,56 dolar olup, H100'un 1,55 dolarıyla neredeyse aynı seviyede; ancak NVIDIA Vera Rubin'in maliyeti 3,61 dolarla çok daha yüksek.

Dikkat edilmesi gereken nokta, SemiAnalysis'ın birkaç önemli sakınca da ortaya koyduğunudur.
İlk olarak, test edilen model, şu anki en ileri düzey model değildir; NVIDIA ve AMD, daha büyük ölçekli modellerde (örneğin DeepSeek V4 Pro, Kimi K3) AgentX paketiyle ilgili sonuçları yayınlamıştır, ancak Jalapeño hâlâ AgentX testini tamamlamamıştır—bu paket, çok aşamalı ve uzun bağlam gibi gerçek üretim senaryolarının performansını daha iyi yansıtır.
İkincisi, daha adil bir karşılaştırma nesnesi Blackwell değil, aynı HBM4'ü kullanan NVIDIA Vera Rubin olmalıdır; Vera Rubin, GB200 NVL72'e göre watt başına performansı yaklaşık 5,4 kat artırır ve Jalapeño ile karşılaştırıldığında, her Token başına toplam sahiplik maliyeti (TCO) açısından neredeyse eşittir.
Üçüncüsü, Jalapeño hâlâ mühendislik örnek aşamasındadır ve seri üretim 2027 yılına kadar yavaş yavaş artacaktır.
AI tasarımı çip: GPT-Astra ve Codex'in "fren verme etkisi"
Jalapeño'nun bu kadar hızlı geliştirilmesinin temel nedenlerinden biri, AI araçlarının derin entegrasyonudur. SemiAnalysis'a göre, OpenAI, dışarıda büyük ilgi gören GPT-Astra dahil olmak üzere, çip tasarımı sürecinde iç AI modellerini yoğun bir şekilde kullandı.
Sosyal platform X kullanıcısı Andrew Curran, OpenAI bilgilerine dayanarak GPT-Astra'nın Jalapeño'nun geliştirme sürecine derinlemesine dahil olduğunu belirtiyor:
Takım, Codex ve GPT-Astra'yı kullanarak iki ay içinde Jalapeño üretim planına dahil olmayan üç açık kaynak modeli yüksek performanslı hale getirdi.

Bu, yapay zekânın sadece çip tasarımı hızlandırmakla kalmadığını, aynı zamanda çipin destekleyebileceği modellerin kapsamını da hızla genişlettiğini anlamına gelir.
SemiAnalysis'in verileri bu katkıyı daha da nicelleştiriyor:
Yapay zeka destekli tasarım, SIMD birimlerinin alanını %8 azaltırken, matris motorunun alanını %10 azaltmış ve zamanlama ile güç tüketimi açısından ilk sürümü aşmıştır.

Yazılım düzeyinde, OpenAI, Jalapeño çekirdeğini içsel bir Codex uzantısı kullanarak yazdı; çekirdek kodunun bazı bölümleri yaklaşık 3000 satır uzunluğunda; en fazla işlem gücü tüketen dikkat mekanizması ve MoE modüllerinde, AI tarafından oluşturulan kod, en iyi insan mühendislerinin uygulamalarından 1,5 ila 1,8 kat daha hızlıdır.
SemiAnalysis, bu konuda oldukça keskin bir değerlendirme yaptı: NVIDIA GPU'larında çalışan OpenAI modelleri (örneğin GPT-5.6 Sol), CUDA'nın koruma duvarına gerçek bir tehdit oluşturan bir çip tasarlamak için kullanılıyor — "NVIDIA'nın kendi GPU'ları, potansiyel bir yerine geçeni gerçek zamanlı olarak doğuruyor".

Mimari Analizi: Neden "genel" daha hızlı?
Jalapeño'nun OpenAI'nin kendi modeli için derinlemesine özelleştirilmiş bir çip olduğu önceden varsayılıyordu, ancak SemiAnalysis'in sonucu tam tersine çıkıyor: Jalapeño, Codex ile taşınan Doom oyunu dahil olmak üzere çeşitli modelleri ve iş yüklerini çalıştırmak için tasarlanmış evrensel bir AI çıkarım çipidir.
Mimari düzeyde, Jalapeño'nun temel tasarım felsefesi "sabit gecikmeyi ortadan kaldırmak"tır. GPU'nun karmaşık bellek katmanlarına ihtiyaç duymasının aksine, Jalapeño hesaplama çekirdeklerini doğrudan HBM dilimlerine bağlar ve çekirdekler arası özel yüksek bant genişliğine sahip toplu iletişim ağı ile senkronize olur; bu da bellek erişim gecikmesini büyük ölçüde azaltır.
Ayrıca, Jalapeño, diğer akseleratörlerin yaygın olarak kullandığı yazılım yönetimli önbellek yerine, sıralı yürütme (OoO) çekirdeği ve L1 önbelleği kullanarak, küçük miktarlarda ve düşük gecikme süreli senaryolarda donanım teorik tepe değerine daha yakın performans sunar.
Bellek bant genişliği açısından Jalapeño, HBM4 kullanarak tek pakette 15,4 TB/s bellek bant genişliği sağlıyor ve her watt başına HBM bant genişliği 22 iken, NVIDIA Rubin 11,1 ve GB300 sadece 5,71.

SemiAnalysis, Jalapeño'nun HBM4 pini hızının 10 Gbps olduğunu, NVIDIA Rubin'in 9,6 Gbps'inden hafifçe daha yüksek olduğunu ve HBM tedarikçisinin Samsung olabileceğini belirtti.
Dikkat edilmesi gereken nokta, Jalapeño'nun ön doldurma ve dekodlama ayrımı dağıtımını (PDD) yapmamasıdır. SemiAnalysis bunun için ayrıntılı bir açıklama sunmuştur:
Gerçek üretim ortamında, giriş/çıkış oranı, eşzamanlılık miktarı, önbellek vuruş oranı gibi parametreler sürekli değişir; sabit havuzlama, genel kullanım oranını düşürür; homojen kaynak havuzları ise gecikmeye duyarlı istekler ile yüksek verimli toplu işleme arasında akıllıca kaynak ayırır.
CUDA koruma duvarı: Çatlaklar mı ortaya çıktı?
SemiAnalysis, raporunda CUDA'nın koruma duvarının öldüğüne dair güçlü bir yargı ortaya attı.
Bu, yazılım başlatma hızlarının karşılaştırmasına dayanmaktadır. NVIDIA Rubin'in CoWoS üretimi, Jalapeño'dan bir ay önce tamamlandı, ancak şu ana kadar Rubin ile ilgili dışarıdan görülebilen tek açık performans verileri, CoreWeave'in mühendislik örneğinden gelmektedir; NVIDIA, OpenAI gibi üçüncü tarafları laboratuvarlarına serbestçe test etmeye izin vermemiştir. SemiAnalysis, bunun donanım arasındaki farkı değil, yazılım olgunluğu arasındaki farkı yansıttığını düşünmektedir.
Sıfırdan bir yazılım yığını oluşturmak, OpenAI'nin geçmiş yüklerinden kurtulmasına ve daha temiz mimari kararlar almasına olanak tanımıştır. OpenAI, kendi geliştirdiği Gluon (Triton tabanlı) iç çekirdek programlama dilini ve dahili çıkarım motoru "Teacup"u kullanmış ve Codex ile çekirdek optimizasyonlarını hızlıca tamamlamıştır. SemiAnalysis, Jalapeño'nun belirli etkileşim hızlarında iki haftadan az bir sürede verimliliğinin iki katından fazla arttığını gözlemlemiştir; takımlar, sekiz gün içinde tensör paralelliğini TP8'den TP32'ye çıkarmış ve tüm raf ölçeğinde dağıtım sağlamıştır.
Ancak SemiAnalysis, şu anki testlerin yalnızca nispeten basit bir iş yükü olan 8k1k'ı kapsadığını ve AgentX'in çok adımlı uzun bağlam testlerinin henüz tamamlanmadığını da açıkça belirtti. Daha karmaşık agent iş yüklerinde, yönlendirici, önek önbelleği ve diğer bileşenlerin performansı yeni bir sınav olacak.
Sonraki adım: B0 fabrikaya getirildi, 10 GW'luk plan yavaş yavaş hayata geçiriliyor
Jalapeño'nun hikayesi henüz bitmedi.
SemiAnalysis'e göre, şu anda açık testlerde kullanılan tüm örnekler A0 adımlı çiplerdir; B0 adımlı çipler ise çip fabrikasına girmiş durumda ve A0'a göre her watt başına performansında yaklaşık %25 artış bekleniyor—B0'nın tek bir hesaplama die'si MXFP4 işlem gücü 13,4 PFLOPs olacak ve TDP 700W olarak kalacaktır.
Sistem düzeyinde, OpenAI, Celestica ile iş birliği yaparak tam bir raf çözümü tasarladı: her ASIC rafı 128 adet Jalapeño çipini içeriyor, çift raf sisteminin toplam güç tüketimi yaklaşık 160 kW ve NVIDIA GB300 çift genişlikli rafıyla eşdeğer.

Ölçeklendirme açısından, tek bir genişletilmiş ağ alanı en fazla 2048 adet Jalapeño XPU'yu bağlayabilir ve 16 rafı kapsar. Seri üretim açısından, SemiAnalysis 2027 yılında yavaş yavaş kapasiteyi artırma beklentisinde ve bir sonraki aşamada 100 MW ölçekli bir dağıtım hedefliyor.
Daha büyük stratejik resim, OpenAI'nin Broadcom ile 10 GW özel akseleratör iş birliği anlaşması imzalamasıdır; bu miktar, on nükleer ünitenin tam yükte ürettiği güç düzeyine denk gelmektedir.
Wall Street Journal makalesi, OpenAI'nin çip sorumlusu Richard Ho'nun, şirketin altyapı maliyetlerini gerçek anlamda düşürebilecek bir enerji tüketimi ve maliyet seviyesine ulaştığını, "Bu sadece ilk adım" olduğunu belirttiğini yazıyor. Aynı zamanda NVIDIA'nın önemli bir ortak olduğunu, OpenAI'nin hesaplama gücüne olan ihtiyacının son derece büyük olduğunu ve kısa vadeli olarak mevcut tedarikçilerinden vazgeçmeyeceğini vurguladı.
Uzmanlar, Jalapeño'nun bugün NVIDIA çiplerinin ne kadarını yerine geçebileceğinden ziyade, bir AI şirkatinin AI araçlarını kullanarak rekor sürede gerçekten rekabetçi bir çip ürettiğini kanıtladığını belirtiyor. Bu döngü, zaten dönmeye başlamıştır.
