OpenAI का जलपेन्यो चिप प्रमुख मापदंडों में NVIDIA Blackwell से बेहतर प्रदर्शन करता है

iconOdaily
साझा करें
AI summary iconसारांश
OpenAI का Jalapeño चिप, नेटवर्क मेट्रिक्स जैसे बिजली की दक्षता और प्रतिक्रिया गति में NVIDIA के Blackwell से बेहतर प्रदर्शन करता है। SemiAnalysis के अनुसार, Jalapeño GPT-OSS 120B पर 1459 टोकन प्रति सेकंड प्रोसेस करता है, जबकि NVIDIA के GB200 पर केवल 535। Broadcom के साथ बनाया गया यह चिप इस साल के अंत में डिप्लॉय होने के लिए तैयार है। OpenAI द्वारा AI हार्डवेयर में NVIDIA के प्रभुत्व को चुनौती दिए जाने से देखने योग्य अल्टकॉइन्स में परिवर्तन हो सकता है।

लेखक: डोंग जिंग

Source: Wall Street Journal

OpenAI का अपना बनाया गया पहला चिप Jalapeño ने AI चिप उद्योग के पारंपरिक ढांचे को अद्भुत गति से बदल दिया है—यह केवल एक उत्पाद लॉन्च नहीं है, बल्कि एक संकेत है: AI अब चिप के डिज़ाइन के तरीके को फिर से बना रहा है।

华尔街见闻文章报道,彭博社8月25日称,OpenAI表示,Jalapeño在单位功耗可处理的AI工作量和响应速度两项关键指标上均领先英伟达GB300。该芯片由OpenAI与Broadcom合作开发,专为AI推理阶段设计,最快将于今年晚些时候投入实际使用。OpenAI芯片负责人Richard Ho表示,Jalapeño在700瓦低功耗下即可实现强劲性能,有助于大幅降低数据中心电力成本。

सेमीकंडक्टर अनुसंधान संस्थान SemiAnalysis के अनुसार, यह चिप डिज़ाइन शुरू होने से लेकर फ़ेब्रिकेशन तक केवल लगभग 16 महीने में पूरा हुआ, और इसका महत्वपूर्ण CoWoS पैकेजिंग फ़ेब्रिकेशन नोड 2025 नवंबर में पूरा हुआ, जो अभी तक केवल 9 महीने पुराना है, जो उद्योग के सामान्य 18 से 36 महीने के चक्र से काफी कम है।

SemiAnalysis के शोधकर्ताओं ने OpenAI प्रयोगशाला का दौरा किया और अपने स्वयं के बेंचमार्क सूट InferenceX का उपयोग करके Jalapeño का परीक्षण किया, जिसका निष्कर्ष सीधा था: यह चिप प्रति वाट प्रदर्शन (perf/W) में उनके द्वारा पहले परीक्षण किए गए सभी NVIDIA, AMD और Google चिप्स को हरा देती है।

अधिक महत्वपूर्ण बात यह है कि यह उपलब्धि तब प्राप्त की गई जब Jalapeño में अभी तक अनुमानित डिकोडिंग, प्री-फिलिंग और डिकोडिंग के अलग-अलग डिप्लॉयमेंट जैसे अनुकूलन लागू नहीं किए गए थे, जबकि तुलना के लिए शामिल अन्य चिप्स पहले से ही अपने उत्तम सेटिंग्स के साथ सक्रिय हैं।

It's no wonder that even renowned semiconductor analyst Dylan Patel openly said, "Not only has Blackwell been surpassed, but even NVIDIA's Rubin chip has been overtaken!"

विश्लेषण के अनुसार, यह परिणाम निवर्डिया की बाजार स्थिति के लिए एक प्रत्यक्ष चुनौती है और बाजार को एआई चिप प्रतिस्पर्धा के पैटर्न को पुनः मूल्यांकन करने के लिए प्रेरित करता है।

Real-world data: Jalapeño outperforms Blackwell on multiple key metrics

SemiAnalysis के परीक्षण परिणामों से पता चलता है कि Jalapeño का निष्कर्ष दक्षता पर काफी बड़ा लाभ है।

GPT-OSS 120B मॉडल पर, Jalapeño प्रति सेकंड लगभग 1459 टोकन आउटपुट करता है, जबकि NVIDIA GB200 केवल 535 टोकन ही; एंड-टू-एंड लेटेंसी के मामले में, Jalapeño एक कार्य पूरा करने में केवल 1.65 सेकंड लेता है, जबकि GB300 को लगभग 6 सेकंड लगते हैं, जिसमें 3.6 गुना का अंतर है। उच्च इंटरैक्टिव स्थितियों में, जब GB300 को अपनी सबसे तेज डिकोडिंग गति (प्रति सेकंड 169 टोकन) तक पहुंचाया जाता है, तो Jalapeño की थ्रूपुट GB300 की 104.3 गुना है।

जलपेन्यो ने GPT-OSS मॉडल पर प्रति मेगावाट प्रति सेकंड टोकन की दर के मापदंड पर लगभग 53 मिलियन टोकन/MW/s प्राप्त किए, जबकि GB200 NVL72 केवल लगभग 10 मिलियन है।

SemiAnalysis ने बताया कि यह सूचक वास्तव में प्रति जूल उत्पादित टोकन की संख्या के समान है, जो डेटा केंद्र की आय की सीमा को सीधे निर्धारित करता है—जब वर्तमान में कैलकुलेशन क्षमता बिजली के प्रतिबंधों से प्रभावित है, तो इस मापदंड का लाभ विशेष रूप से महत्वपूर्ण है।

सिमीएनलिसिस के अनुसार, जब बिजली, शीतलन और नेटवर्क सभी को सिस्टम स्तरीय लागत में शामिल किया जाता है, तो Jalapeño की प्रति चिप प्रति घंटा कुल स्वामित्व लागत लगभग 1.56 डॉलर है, जो H100 की 1.55 डॉलर के समान है, जबकि NVIDIA Vera Rubin की लागत 3.61 डॉलर है।

ध्यान देने योग्य बात यह है कि SemiAnalysis ने कई महत्वपूर्ण आरक्षित बिंदु भी प्रस्तुत किए हैं।

पहला, परीक्षण के लिए उपयोग किया गया मॉडल वर्तमान में सबसे अग्रणी मॉडल नहीं है; NVIDIA और AMD ने बड़े पैमाने के मॉडल्स (जैसे DeepSeek V4 Pro, Kimi K3) पर AgentX सूट के आधार पर परिणाम प्रकाशित किए हैं, जबकि Jalapeño अभी तक AgentX परीक्षण पूरा नहीं किया है—यह सूट बहु-चरण, लंबे संदर्भ आदि वास्तविक उत्पादन परिदृश्यों के प्रदर्शन को अधिक अच्छी तरह से दर्शाता है।
दूसरा, एक अधिक न्यायसंगत तुलना है NVIDIA Vera Rubin, जो HBM4 का उपयोग करता है, न कि Blackwell के साथ; Vera Rubin की प्रति वाट क्षमता GB200 NVL72 की तुलना में लगभग 5.4 गुना बेहतर है, और Jalapeño के साथ, दोनों की प्रति टोकन कुल स्वामित्व लागत (TCO) लगभग समान है।
तीसरा, जलपेंयो अभी इंजीनियरिंग सैंपल चरण में है, और बड़े पैमाने पर उत्पादन 2027 तक धीरे-धीरे शुरू होगा।

AI डिज़ाइन्ड चिप: GPT-Astra और Codex का "फ्लाईव्हील इफेक्ट"

जलपेन्यो के इतनी तेजी से विकास का मुख्य कारण एआई उपकरणों की गहन भागीदारी है। सेमीएनालिसिस के अनुसार, ओपनएआई ने चिप डिज़ाइन प्रक्रिया में अपने आंतरिक एआई मॉडल, जिनमें बाहरी दुनिया द्वारा व्यापक रूप से चर्चित GPT-Astra शामिल है, का व्यापक उपयोग किया है।

सोशल मीडिया प्लेटफॉर्म X के उपयोगकर्ता एंड्रयू कर्रन ने OpenAI की जानकारी का हवाला देते हुए बताया कि GPT-Astra ने Jalapeño के विकास के पूरे चक्र में गहराई से भाग लिया:

टीम ने कोडेक्स और GPT-Astra का उपयोग करके दो महीनों में तीन ऐसे ओपन-सोर्स मॉडल्स को अत्यधिक कार्यक्षमता के स्तर तक अनुकूलित किया, जो मूल रूप से जलपेन्यो के बड़े पैमाने पर उत्पादन योजना में शामिल नहीं थे।

This means that AI is not only accelerating the chip design itself but also rapidly expanding the range of models the chip can support.

SemiAnalysis के डेटा ने इस योगदान को आगे मापा है:

AI सहायता डिज़ाइन के कारण SIMD इकाई का क्षेत्रफल 8% कम हो गया है और मैट्रिक्स इंजन का क्षेत्रफल 10% कम हो गया है, जबकि समय और बिजली की खपत के प्रदर्शन में प्रारंभिक संस्करण से बेहतरी हुई है।

सॉफ्टवेयर स्तर पर, OpenAI ने Jalapeño कर्नेल को अपने आंतरिक विस्तारित Codex का उपयोग करके लिखा है, जिसमें कुछ कर्नेल कोड लगभग 3000 पंक्तियों तक हैं; सबसे अधिक प्रदर्शन आधारित ध्यान तंत्र और MoE मॉड्यूल पर, AI द्वारा उत्पन्न कोड मानव शीर्ष इंजीनियरों के कार्यान्वयन से 1.5 से 1.8 गुना तेज है।

SemiAnalysis ने इसकी तीखी टिप्पणी की: निक्किडा GPU पर चल रहे OpenAI मॉडल (जैसे GPT-5.6 Sol) का उपयोग एक ऐसे चिप के डिज़ाइन के लिए किया जा रहा है जो CUDA की रक्षा को वास्तविक खतरे में डाल सकता है—“निक्किडा के अपने GPU वास्तव में अपने संभावित उत्तराधिकारी को जन्म दे रहे हैं।”

आर्किटेक्चर विश्लेषण: क्यों "सामान्य" अधिक तेज़ है?

बाहरी रूप से यह माना जाता है कि Jalapeño एक ऐसा चिप है जो OpenAI के अपने मॉडल के लिए गहराई से कस्टमाइज़ किया गया है, लेकिन SemiAnalysis का निष्कर्ष इसके विपरीत है: Jalapeño एक सामान्य AI निष्कर्षण चिप है जो विभिन्न मॉडल और कार्यभार, यहां तक कि Codex द्वारा पोर्ट किए गए Doom गेम को भी चला सकती है।

आर्किटेक्चरल स्तर पर, जलपेन्यो की केंद्रीय डिजाइन दर्शन है "निश्चित देरी को समाप्त करना"। GPU के जटिल मेमोरी हाइरार्की पर निर्भर करने के बजाय, जलपेन्यो कॉम्प्यूटिंग कोर को HBM स्लाइस के साथ सीधे बांधता है, और कोर्स के बीच विशिष्ट उच्च बैंडविड्थ समूह नेटवर्क के माध्यम से सिंक्रनाइज़ होते हैं, जिससे मेमोरी एक्सेस देरी में भारी कमी आती है।

इसके अलावा, Jalapeño अन्य त्वरकों के सामान्य रूप से उपयोग किए जाने वाले सॉफ्टवेयर प्रबंधित कैश के बजाय अनुक्रमहीन निष्पादन (OoO) कोर के साथ L1 कैश का उपयोग करता है, जिससे यह छोटे बैच और कम लेटेंसी परिदृश्यों में हार्डवेयर सैद्धांतिक शिखर के अधिक करीब पहुँचता है।

मेमोरी बैंडविड्थ के मामले में, Jalapeño HBM4 का उपयोग करता है और एक पैकेज में 15.4 टीबी/सेकंड का मेमोरी बैंडविड्थ प्राप्त करता है, जबकि प्रति वाट HBM बैंडविड्थ 22 है, जबकि NVIDIA Rubin के लिए 11.1 है और GB300 के लिए केवल 5.71 है।

SemiAnalysis ने बताया कि Jalapeño का HBM4 पिन स्पीड 10Gbps है, जो निविडा Rubin के 9.6Gbps से थोड़ा अधिक है, और HBM आपूर्तिकर्ता सैमसंग हो सकता है।

ध्यान देने योग्य बात यह है कि Jalapeño ने प्री-फिलिंग और डिकोडिंग के अलग-अलग डिप्लॉयमेंट (PDD) को नहीं अपनाया। SemiAnalysis ने इसकी विस्तृत व्याख्या की है:

वास्तविक उत्पादन वातावरण में, इनपुट-आउटपुट अनुपात, समानांतरता, कैश हिट दर आदि पैरामीटर लगातार बदलते रहते हैं; स्थिर पूलिंग से वैश्विक उपयोग दर में कमी आती है; जबकि समरूप संसाधन पूल ट्रैफ़िक परिवर्तनों के अनुसार लचीले ढंग से प्रतिक्रिया दे सकते हैं और देरी संवेदनशील अनुरोधों और उच्च थ्रूपुट बैच प्रोसेसिंग के बीच गतिशील रूप से संसाधन आवंटित कर सकते हैं।

CUDA की नहर: दरारें दिखाई दे रही हैं?

SemiAnalysis ने अपनी रिपोर्ट में एक महत्वपूर्ण निष्कर्ष प्रस्तुत किया: CUDA की रक्षा दीवार संभवतः मर चुकी है।

इसका आधार सॉफ्टवेयर स्टार्टअप स्पीड की तुलना है। निविडा रुबिन का CoWoS फैब्रिकेशन जलपेन्यो से एक महीने पहले पूरा हो गया, लेकिन अब तक, बाहरी दुनिया को रुबिन के लिए केवल CoreWeave के प्रोटोटाइप से ही खुले बेंचमार्क डेटा दिखाई देते हैं, और निविडा ने OpenAI की तरह तीसरे पक्ष को अपने प्रयोगशाला में मुक्त रूप से परीक्षण करने की अनुमति नहीं दी है। SemiAnalysis का मानना है कि यह हार्डवेयर के स्वयं के अंतर को नहीं, बल्कि सॉफ्टवेयर परिपक्वता के अंतर को दर्शाता है।

शून्य से सॉफ्टवेयर स्टैक बनाने से OpenAI को ऐतिहासिक बोझ से मुक्त होकर अधिक साफ आर्किटेक्चर निर्णय लेने की अनुमति मिली। OpenAI ने अपने स्वयं के कोर प्रोग्रामिंग भाषा Gluon (Triton पर आधारित) और आंतरिक निष्पादन इंजन "Teacup" का उपयोग किया, और Codex की मदद से कोर ऑप्टिमाइजेशन को तेजी से पूरा किया। SemiAnalysis ने देखा कि केवल दो सप्ताह में, Jalapeño ने विशिष्ट इंटरैक्शन स्पीड पर थ्रूपुट में 2 गुना से अधिक की वृद्धि की; 8 दिनों में, टीम ने टेंसर पैरललिज़म को TP8 से TP32 तक विस्तारित करके पूरे कैबिनेट स्तर पर क्रॉस-रैक डिप्लॉयमेंट प्राप्त किया।

हालांकि, SemiAnalysis ने स्पष्ट रूप से बताया कि वर्तमान परीक्षण केवल 8k1k जैसे तुलनात्मक रूप से सरल कार्यभार को ही कवर करते हैं, और AgentX के बहु-चरणीय लंबे संदर्भ परीक्षण अभी पूरे नहीं हुए हैं। अधिक जटिल एजेंट कार्यभारों में, राउटर, प्रीफिक्स कैशिंग आदि घटकों का प्रदर्शन नया परीक्षण होगा।

अगला कदम: B0 फैक्टरी में पहुँच चुका है, 10GW का नक्शा धीरे-धीरे फैल रहा है

जलपेंयो की कहानी अभी खत्म नहीं हुई है।

SemiAnalysis के अनुसार, वर्तमान ओपन टेस्ट में केवल A0 स्टेप चिप्स का उपयोग किया जा रहा है, जबकि B0 स्टेप वेफर फैक्ट्री में पहुंच चुका है और इसकी प्रति वाट प्रदर्शन क्षमता A0 की तुलना में लगभग 25% बढ़ने की उम्मीद है—B0 के एकल कॉम्प्यूटिंग डाई की MXFP4 कैपेसिटी 13.4 PFLOPs होगी, जबकि TDP 700W पर स्थिर रहेगी।

सिस्टम स्तर पर, OpenAI ने Celestica के साथ मिलकर पूर्ण रैक समाधान डिज़ाइन किया है: प्रत्येक ASIC कैबिनेट में 128 Jalapeño चिप्स शामिल हैं, और डुअल-कैबिनेट सिस्टम की कुल शक्ति लगभग 160kW है, जो NVIDIA GB300 डुअल-विड्थ कैबिनेट के समान है।

स्केलिंग के संदर्भ में, एकल विस्तारित नेटवर्क डोमेन में अधिकतम 2048 Jalapeño XPU जुड़ सकते हैं, जो 16 रैक को कवर करता है। बड़े पैमाने पर उत्पादन के संदर्भ में, SemiAnalysis का अनुमान है कि 2027 तक धीरे-धीरे उत्पादन बढ़ेगा, और अगला मील का पत्थर 100MW के डिप्लॉयमेंट स्केल को हासिल करना है।

बड़ी रणनीतिक छवि यह है कि OpenAI ने Broadcom के साथ 10 GW कस्टम एक्सेलरेटर समझौते पर हस्ताक्षर किए हैं, जो लगभग दस परमाणु इकाइयों की पूर्ण उत्पादन क्षमता के बराबर है।

华尔街见闻文章写道,OpenAI 芯片负责人 Richard Ho 表示,公司已达到能够切实降低基础设施成本的功耗和成本水平,"这只是第一步"。他同时强调,英伟达仍是重要合作伙伴,OpenAI 对算力的需求极为庞大,短期内不会放弃现有供应商。

विश्लेषकों का कहना है कि जलपेंयो का महत्व शायद इस बात में नहीं है कि यह आज निविडा चिप्स के कितने बदले जा सकता है, बल्कि इस बात के साबित होने में है कि एक AI कंपनी, AI उपकरणों का उपयोग करते हुए, रिकॉर्ड समय में एक वास्तविक प्रतिस्पर्धी चिप बना सकती है। यह फ्लाइव्हील अब घूमना शुरू हो चुका है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।