شريحة Jalapeño من OpenAI تتفوق على NVIDIA Blackwell في المؤشرات الرئيسية

iconOdaily
مشاركة
AI summary iconملخص
تفوق رقاقة Jalapeño من OpenAI رقاقة Blackwell من NVIDIA في مقاييس الشبكة مثل كفاءة الطاقة وسرعة الاستجابة. وفقًا لتقرير SemiAnalysis، تعالج رقاقة Jalapeño 1459 رمزًا في الثانية على GPT-OSS 120B، مقابل 535 على GB200 من NVIDIA. تم تصنيع الرقاقة بالتعاون مع Broadcom، ومن المقرر إطلاقها في وقت لاحق من هذا العام. قد تتغير العملات البديلة التي يجب مراقبتها مع تحدي OpenAI لسيطرة NVIDIA على أجهزة الذكاء الاصطناعي.

الكاتب الأصلي: دونغ جينغ

المصدر الأصلي: 华尔街见闻

كشفت OpenAI عن شريحتها الأولى التي طورتها بنفسها، Jalapeño، والتي أحدثت ثورة في صناعة شرائح الذكاء الاصطناعي بسرعة مذهلة — إنها ليست مجرد إصدار منتج، بل إشارة إلى أن الذكاء الاصطناعي يعيد تشكيل طريقة تصميم الشرائح نفسها.

وفقًا لمقال 华尔街见闻文章، ذكرت بلومبرغ في 25 أغسطس أن OpenAI أفادت أن Jalapeño يتفوق على NVIDIA GB300 في مؤشرين رئيسيين: كمية عمل الذكاء الاصطناعي التي يمكن معالجتها لكل وحدة طاقة، وسرعة الاستجابة. تم تطوير هذا الرقاقة بالتعاون بين OpenAI وBroadcom، وهي مصممة خصيصًا لمرحلة الاستنتاج في الذكاء الاصطناعي، ومن المتوقع أن تدخل الخدمة الفعلية في وقت لاحق من هذا العام. وقال ريتشارد هو، مدير الرقائق في OpenAI، إن Jalapeño يحقق أداءً قويًا عند استهلاك طاقة منخفضة قدره 700 واط، مما يساعد على خفض تكاليف الكهرباء في مراكز البيانات بشكل كبير.

وفقًا لمؤسسة أبحاث أشباه الموصلات SemiAnalysis، استغرق تطوير هذه الشريحة من البداية حتى إكمال التدفق 16 شهرًا فقط، حيث تم إكمال عقد التغليف CoWoS الحيوي في نوفمبر 2025، أي قبل 9 أشهر فقط، وهو ما يقل بكثير عن الدورة المعتادة في الصناعة التي تتراوح بين 18 و36 شهرًا.

قام باحثو SemiAnalysis بزيارة مختبرات OpenAI مباشرةً واختبار Jalapeño باستخدام حزمة معاييرهم الخاصة InferenceX، وخلصوا إلى أن هذه الشريحة تتفوق على جميع شرائح NVIDIA وAMD وGoogle التي اختبروها سابقًا من حيث أداء الواط (perf/W).

الأمر الأكثر أهمية هو أن هذا الإنجاز تم تحقيقه دون تفعيل تحسينات مثل فك التشفير الاستباقي وفصل نشر التخزين المسبق وفك التشفير، والتي لم تُفعّل بعد في Jalapeño، في حين أن الرقائق الأخرى المشاركة في المقارنة قد فعّلت جميعها إعداداتها المثلى.

لا عجب أن قال حتى محلل أشباه الموصلات المشهور دylan patel: "لم يُستبدل Blackwell فحسب، بل تجاوز أيضًا شريحة Rubin من NVIDIA!"

التحليل يرى أن هذه النتيجة تشكل تهديدًا مباشرًا لمكانة نيفيديا في السوق، وتُجبر السوق على إعادة تقييم مشهد المنافسة في رقائق الذكاء الاصطناعي.

بيانات مُختبرة: Jalapeño يتفوق على Blackwell في عدة مؤشرات رئيسية

أظهرت نتائج اختبار SemiAnalysis أن Jalapeño يتمتع بميزة كبيرة في كفاءة الاستدلال.

على نموذج GPT-OSS 120B، يمكن لـ Jalapeño إنتاج حوالي 1459 رمزًا في الثانية، بينما لا يتجاوز GB200 من NVIDIA 535 رمزًا؛ من حيث التأخير الكامل، يستغرق Jalapeño 1.65 ثانية لإكمال مهمة واحدة، بينما يحتاج GB300 إلى حوالي 6 ثوانٍ، بفارق يصل إلى 3.6 مرة. في سيناريوهات التفاعل العالي، عندما يتم دفع GB300 إلى أسرع سرعة تحليل لها (169 رمزًا في الثانية)، يكون إنتاج Jalapeño 104.3 مرة أعلى.

في مؤشر أساسي لكفاءة مركز البيانات، وهو عدد الرموز المُخرجة لكل ميغاواط في الثانية، حقق Jalapeño حوالي 53 مليون رمز/MW/s على نموذج GPT-OSS، بينما حقق GB200 NVL72 حوالي 10 ملايين فقط.

أشارت SemiAnalysis إلى أن هذا المؤشر يعادل جوهرًا عدد الرموز المُنتجة لكل جول، مما يحدد مباشرة سقف الدخل لمراكز البيانات—وفي الوقت الحالي حيث تخضع القدرة الحسابية لقيود الطاقة، فإن هذا البعد يتمتع بأهمية خاصة.

من منظور التكلفة على مستوى النظام، وفقًا لـ SemiAnalysis الذي أخذ في الحسبان التغذية الكهربائية والتبريد والشبكة، فإن التكلفة الإجمالية لكل شريحة في الساعة لـ Jalapeño تبلغ حوالي 1.56 دولارًا، وهي تقارب إلى حد كبير تكلفة H100 البالغة 1.55 دولارًا، بينما تصل تكلفة Vera Rubin من NVIDIA إلى 3.61 دولارًا.

يجدر التذكير بأن SemiAnalysis طرحت أيضًا عدة تحفظات مهمة.

أولاً، النموذج المستخدم في الاختبار ليس من أحدث النماذج الحالية؛ فقد أصدرت NVIDIA وAMD نتائج مبنية على مجموعة AgentX على نماذج أكبر (مثل DeepSeek V4 Pro وKimi K3)، بينما لم يكتمل اختبار Jalapeño على مجموعة AgentX بعد — وهي المجموعة التي تعكس بشكل أفضل أداء السيناريوهات الإنتاجية الحقيقية مثل المحادثات متعددة المراحل والسياقات الطويلة.
ثانيًا، يجب مقارنتها بـ NVIDIA Vera Rubin التي تستخدم أيضًا HBM4، وليس Blackwell؛ أداء Vera Rubin لكل واط يزيد بنسبة حوالي 5.4 مرات مقارنة بـ GB200 NVL72، وعند مقارنتها بـ Jalapeño، فإن كلاهما يتقاسمان تقريبًا نفس تكلفة الملكية الإجمالية (TCO) لكل Token.
ثالثًا، لا يزال Jalapeño في مرحلة العينات الهندسية، ومن المتوقع أن يبدأ الإنتاج الضخم تدريجيًا في عام 2027.

تصميم شرائح الذكاء الاصطناعي: "التأثير اللولبي" لـ GPT-Astra و Codex

كان التدخل العميق لأدوات الذكاء الاصطناعي أحد الأسباب الأساسية وراء إكمال Jalapeño للتطوير بسرعة مذهلة. وفقًا لما كشفته SemiAnalysis، استخدمت OpenAI نماذج الذكاء الاصطناعي الداخلية بكثافة خلال عملية تصميم الرقاقة، بما في ذلك GPT-Astra الذي لاقى اهتمامًا واسعًا من الخارج.

مستخدم منصة X Andrew Curran يقتبس معلومات من OpenAI تشير إلى أن GPT-Astra شارك بشكل عميق في تطوير Jalapeño طوال العملية:

استخدم الفريق Codex وGPT-Astra لضبط ثلاثة نماذج مفتوحة المصدر لم تكن ضمن خطة الإنتاج الضخم لـ Jalapeño، وتحسين أدائها إلى حالة عالية الأداء خلال شهرين.

هذا يعني أن الذكاء الاصطناعي لا يُسرّع فقط تصميم الرقائق نفسها، بل يوسع أيضًا بسرعة نطاق النماذج التي يمكن للرقائق دعمها.

توفر بيانات SemiAnalysis كمّية إضافية لهذا الإسهام:

ساعد التصميم المدعوم بالذكاء الاصطناعي في تقليل مساحة وحدات SIMD بنسبة 8%، ومساحة محرك المصفوفة بنسبة 10%، مع تفوق أفضل في الأداء الزمني والاستهلاك الطاقي مقارنة بالإصدار الأولي.

على المستوى البرمجي، استخدمت OpenAI إصدارًا داخليًا موسّعًا من Codex لكتابة نواة Jalapeño، حيث بلغ طول بعض كود النواة حوالي 3000 سطر؛ وفي وحدات الانتباه وMoE التي تتطلب أعلى أداء، كان كود AI أسرع من تنفيذ مهندسين بشريين رائدين بنسبة 1.5 إلى 1.8 مرة.

صنّف SemiAnalysis هذا بحدّة: إن نماذج OpenAI (مثل GPT-5.6 Sol) التي تعمل على وحدات معالجة رسوميات NVIDIA تُستخدم حاليًا لتصميم شريحة تشكل تهديدًا حقيقيًا لحاجز CUDA: "إن وحدات معالجة الرسوميات الخاصة بـ NVIDIA تُنجب في الوقت الحقيقي خلفها المحتمل".

تحليل البنية: لماذا يكون "العام" أسرع؟

يُفترض على نطاق واسع أن Jalapeño هي شريحة مخصصة بعمق لنموذج OpenAI الخاص، لكن استنتاج SemiAnalysis يتعارض تمامًا: Jalapeño هي شريحة عامة موجهة لاستنتاج الذكاء الاصطناعي، ويمكنها تشغيل مجموعة متنوعة من النماذج وأحمال العمل، بما في ذلك لعبة Doom التي نُقلت باستخدام Codex.

على مستوى التصميم، تتمثل فلسفة Jalapeño الأساسية في "القضاء على التأخير الثابت". على عكس GPU التي تعتمد على هياكل ذاكرة معقدة، فإن Jalapeño تربط وحدات الحوسبة مباشرة بشرائح HBM، وتتم مزامنة الوحدات عبر شبكة جمعية عالية النطاق الترددي مخصصة، مما يقلل بشكل كبير من تأخير الوصول إلى الذاكرة.

بالإضافة إلى ذلك، فإن Jalapeño يستخدم نواة تنفيذ غير متسلسل (OoO) مع ذاكرة تخزين مؤقت من المستوى L1، بدلاً من المخزن المؤقت الذي تديره البرمجيات المستخدم على نطاق واسع في مسرّعات أخرى، مما يسمح له بالاقتراب أكثر من الحد الأقصى النظري للعتاد في سيناريوهات حجم صغير وتأخير منخفض.

من حيث عرض النطاق الترددي للذاكرة، يستخدم Jalapeño HBM4 ويوفر عرض نطاق ترددي للذاكرة يبلغ 15.4 تيرابايت/ثانية لكل حزمة، مع عرض نطاق ترددي للذاكرة HBM يبلغ 22 لكل واط، بينما يبلغ ذلك لدى نفيديا Rubin 11.1، و5.71 فقط لدى GB300.

أشارت SemiAnalysis إلى أن سرعة دبابيس HBM4 الخاصة بـ Jalapeño تبلغ 10Gbps، وهي أعلى قليلاً من 9.6Gbps الخاصة بـ Rubin من نيفيديا، وقد يكون مزود HBM هو سامسونغ.

جدير بالذكر أن Jalapeño اختارت عدم تنفيذ نشر منفصل للتعبئة المسبقة والفك (PDD). قدم SemiAnalysis شرحًا تفصيليًا对此:

في بيئة إنتاج حقيقية، تتغير باستمرار معلمات مثل نسبة الإدخال إلى الإخراج، ومستوى التوازي، ونسبة إصابة الذاكرة المؤقتة؛ مما يؤدي إلى انخفاض الاستخدام الكلي عند استخدام مجموعات ثابتة، بينما يمكن للمجموعات المتجانسة الاستجابة بشكل مرن لتغيرات حركة المرور، وتوزيع الموارد ديناميكيًا بين الطلبات الحساسة للتأخير ومعالجة الدفعات عالية الإنتاجية.

حاجز CUDA: هل ظهرت شقوق؟

أصدرت SemiAnalysis تقييمًا قويًا في تقريرها: قد يكون خندق CUDA قد مات.

يعتمد ذلك على مقارنة سرعة بدء تشغيل البرنامج. تم إكمال تدفق إنتاج CoWoS لـ NVIDIA Rubin قبل شهر واحد من Jalapeño، لكن حتى الآن، البيانات المرجعية العامة الوحيدة المتاحة لـ Rubin هي من عينات الهندسة الخاصة بـ CoreWeave، ولم تفتح NVIDIA الوصول إلى مختبراتها للاختبارات الخارجية كما فعلت OpenAI. ترى SemiAnalysis أن هذا يعكس فجوة في نضج البرنامج، وليس فجوة في الأجهزة نفسها.

إن بناء طبقة البرمجيات من الصفر سمح لـ OpenAI بالتخلي عن الأعباء التاريخية واتخاذ قرارات هندسية أكثر نقاءً. استخدمت OpenAI لغة البرمجة الداخلية Gluon (المبنية على Triton) ومحرك الاستدلال الداخلي "Teacup"، واعتمدت على Codex لتسريع تحسين النواة. لاحظ SemiAnalysis أنه خلال أقل من أسبوعين، زادت سعة Jalapeño في سرعة التفاعل المحددة بأكثر من مرتين؛ وفي غضون 8 أيام، قام الفريق بتوسيع التوازي المتجهي من TP8 إلى TP32، مما أتاح نشرًا على نطاق خزانة كامل عبر الرفوف.

ومع ذلك، أشار SemiAnalysis بوضوح إلى أن الاختبارات الحالية تغطي فقط عبء العمل البسيط نسبيًا 8k1k، ولم تُكمل بعد اختبارات AgentX متعددة الجلسات وطويلة السياق. تحت أحمال عمل ذكية أكثر تعقيدًا، ستكون أداء مكونات مثل الموجه وتخزين البادئة اختبارات جديدة.

الخطوة التالية: تم استلام B0، ويتخذ التخطيط بسعة 10 جيجاواط شكلاً تدريجياً

قصة Jalapeño لم تنتهِ بعد.

وفقًا لـ SemiAnalysis، فإن العينات المستخدمة حاليًا في الاختبارات العامة هي من طراز A0، بينما دخل طراز B0 مصنع الرقائق، ومن المتوقع أن يحقق تحسنًا بنسبة حوالي 25% في الأداء لكل واط مقارنة بـ A0 — ستصل قدرة حسابية MXFP4 لوحدة حسابية واحدة من طراز B0 إلى 13.4 PFLOPs، مع الحفاظ على TDP عند 700W.

على المستوى النظامي، تعاونت OpenAI مع Celestica لتصميم حل كامل للرفوف: يحتوي كل خزانة ASIC على 128 شريحة Jalapeño، مع استهلاك إجمالي للطاقة يبلغ حوالي 160 كيلوواط للنظام المزدوج، وهو ما يعادل خزانة مزدوجة العرض من NVIDIA GB300.

في مجال النشر الموسّع، يمكن لوحدة شبكة موسّعة واحدة ربط ما يصل إلى 2048 وحدة Jalapeño XPU، وتغطية 16 رفًا. وفي مجال الإنتاج الضخم، تتوقع SemiAnalysis أن تبدأ في التصاعد تدريجيًا بحلول عام 2027، مع هدف المعلم التالي المتمثل في حجم نشر 100 ميغاواط.

إن الصورة الاستراتيجية الأكبر هي أن OpenAI وقّعت اتفاقية تعاون مع Broadcom لتصنيع مُسرّعات مخصصة بقدرة 10 غيغاواط، وهي كمية تُعادل تقريبًا طاقة تشغيل عشرة مفاعلات نووية بسعة كاملة.

مقال من Wall Street Journal يذكر أن ريتشارد هو، مدير شرائح OpenAI، أشار إلى أن الشركة وصلت إلى مستوى من استهلاك الطاقة والتكلفة يمكنه خفض تكاليف البنية التحتية بشكل ملموس، "هذا مجرد الخطوة الأولى". كما شدد على أن نفيديا لا تزال شريكًا مهمًا، واحتياجات OpenAI من قوة الحوسبة هائلة، ولن تتخلى عن مورديها الحاليين في المدى القصير.

أشار المحللون إلى أن أهمية Jalapeño قد لا تكمن في قدرتها اليوم على استبدال عدد كبير من شرائح NVIDIA، بل في إثباتها لشيء كان يُشكك فيه على نطاق واسع: أن شركة ذكاء اصطناعي، باستخدام أدوات الذكاء الاصطناعي، استطاعت في وقت قياسي أن تصنع شريحة حقيقية تنافسية. هذا الدوّار قد بدأ بالدوران.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.