مذهل جدًا.
للتو، كشفت نيفيديا لأول مرة في تاريخها عن بيانات الاختبار الأولية على الرقاقة لخزانة Vera Rubin NVL72 من الجيل التالي.
وإضافةً إلى ذلك، جذبت هذه التجربة العملية مباشرةً DeepSeek -V4-Pro، قم بتنفيذ مهمة "كود الذكاء الاصطناعي" الأكثر واقعية!
النتيجة مذهلة: مقارنةً بجهاز GB300 NVL72 الرائد الحالي، ارتفع إنتاج Vera Rubin لكل ميغاواط بنسبة تصل إلى 30 مرة، وانخفض تكلفة الرمز إلى حدٍ أقصى بنسبة 35 مرة!

هتف أحدهم: "أنا لا أجرؤ حتى على كتابة عرض تقديمي مزيف للمستثمرين بهذه الطريقة!"
كما علّق أحد المستخدمين ببراعة: "كنت أرى أن سعر H200 بثلاثة آلاف دولار غاليًا، لكن الآن当我回头一看، اتضح أن H200 لا يُعد حتى النسخة الأساسية."

دعونا نتحقق من ذلك بدقة.
من H200 إلى GB300، زادت إنتاجية أحمال العمل الحقيقية للوكيل ما يصل إلى 30 مرة، مع تقريبًا مضاعفة التكلفة.
من GB300 إلى فيرا روبين، ارتفع إنتاجية النظام مرة أخرى بنسبة تصل إلى 30 ضعفًا، وارتفع سعر الرف الكامل تقريبًا مرتين.
وفقًا لقانون مور لـ "الرجل الأصفر"، فإن أكبر إنجاز تقني لشركة NVIDIA على مدار السنتين الماضيتين لم يكن وحدة معالجة الرسوميات نفسها، بل جعل السعر يرتفع أربع مرات، وحقق في المقابل قفزة في السرعة تبلغ 900 ضعف!

هذه المرة، أعلنت نيفيديا للجميع عن حقيقة غير بديهية: انتهى عصر نماذج اللغة الكبيرة، وقد حان عصر الوكلاء، وقد أصبحت جميع معايير الأداء السابقة للذكاء الاصطناعي باطلة!

في الوقت نفسه، تم تركيب Vera CPU المصممة خصيصًا للوكلاء من قبل SpaceXAI التابع لمسك خلال الليل، بل وتجهيزها للإطلاق إلى الفضاء مباشرة.
في نفس اليوم، بدأ الإنتاج الضخم الكامل لـ NVIDIA Groq 3 LPX.
يُشغل Gemma 4 31B في الأعلى، والسرعة مذهلة، تصل مباشرة إلى 3400 رمز في الثانية. إنتاجية نموذج بتريليون معلمة، تزيد 35 مرة.


هذه السجلات الجديدة، ستُعيد كتابة خريطة الأعمال لبيئة Agent ابتداءً من هذه الليلة!
لماذا يجب على نيفيديا إطلاق فيرا روبين؟
أعطت أحدث البيانات من OpenRouter الإجابة: في العالم الحقيقي، يستهلك مهمة Agent AI 15 ضعف عدد الرموز مقارنة بمحادثة دردشة عادية!
على سبيل المثال، إذا تم تكليف وكيل بدراسة شركة من أجل اتخاذ قرار استثماري، فإن الوكيل والوكالات الفرعية سيقومان باستنتاج مستمر، وتصبح التوكنات المتراكمة مدخلات للخطوة التالية، مما يجعل معالجة السياق الطويل العامل الأكثر أهمية الذي يحد من ذكاء الوكيل الاصطناعي.

كلما زاد عدد التفاعلات بين الوكلاء، زادت السعة الإنتاجية — حيث زاد عدد الوكلاء عشر مرات، وازداد استدعاء الأدوات مرتين، مما أدى إلى نشوء متطلبات جديدة نتيجة التناقض بين قوة الحوسبة والخوارزميات.

لا تستخدم المحادثة كوكيل ذكي، جميع المعايير القديمة ألغيت!
في هذا الوقت، تصبح اختبارات الذكاء الاصطناعي التقليدية (مثل اختبارات التسلسل الثابتة الطول 8K/1K) غير فعالة تمامًا.
نفيديا الرسمية توضح: يجب أن تتطور قياسات الأداء! لا يمكن قياس طلب استدلال واحد فقط، بل يجب التقاط سير العمل الكامل للوكيل.
لذلك، استخدموا اختبار AgentX التابع لـ SemiAnalysis.
هذا الاختبار لم يعد أسئلة وأجوبة جامدة، بل هو إعادة تشغيل "جلسة برمجة" حقيقية تتضمن نموًا سياقيًا واستدعاء أدوات وتوليد عوامل فرعية.

هذا هو السبب في أن H200 تبدو غير كافية في ساحة العاملين الجدد، وفيرا روبين مُقدَّر لها أن تصبح الملك.
فيرا روبين NVL72 × DeepSeek-V4-Pro:
قدوم وحش القوة الحسابية
لإثبات قوة Vera Rubin NVL72، استخدمت NVIDIA مباشرةً ملك المصدر المفتوح— DeepSeek إجراء اختبارات على الرقاقة لـ V4-Pro (1.6T)
بمجرد صدور البيانات، كانت النتائج مذهلة—
تحت حمولة AgentX، زاد إنتاجية Vera Rubin NVL72 لكل ميغاواط بنسبة 30 مرة مقارنة بـ GB300 NVL72!

يرجى ملاحظة أن المقارنة هنا ليست مع H200 القديم، بل مع GB300 الرائج والرئيسي.
GB300 في نفس DeepSeek في اختبار V4-Pro، زادت السعة لكل ميغاواط بنسبة 15 مرة مقارنة بـ H200.
لكن فيرا روبين رفعته 30 مرة إضافية على كتف GB300، ورفعته مرة أخرى على منحنى باريتو بأكمله!
What does this mean?
للمصانع التي تعتمد على الطاقة الكهربائية، يمتد هذا حدود القوانين الفيزيائية مباشرة.
بنفس الميزانية الكهربائية، يمكن لفيراروبين القيام بـ 30 ضعف عمل الوكلاء.
للمراكز البيانات بقدرة ميغاواط أو حتى جيغاواط، هذا يعادل توليد 30 ضعفًا من أصول الحوسبة من العدم.
بالإضافة إلى ذلك، يمكن لتقنية NVIDIA DSX MaxLPS إدارة الطاقة على مستوى وحدات معالجة الرسوميات، والخزائن، وعبء العمل، مما يسمح بتكوين ما يصل إلى 40% إضافي من وحدات معالجة الرسوميات ضمن نفس ميزانية الميجاوات، مما يعزز من خلال ذلك إنتاجية كل ميجاوات في مصانع الذكاء الاصطناعي!

انخفض تكلفة الرمز بنسبة 35 مرة! تم إعادة كتابة "دفتر الأستاذ" لصناعة الوكلاء تمامًا
كل ميغاواط من خلالية يُؤثر مباشرةً على تكلفة إنشاء كل رمز. الارتفاع الهائل في الأداء يُسفر عن أثر مباشر هو انفجار نموذج العمل.
أعلنت نيفيديا أن إنتاج Vera Rubin NVL72 يقلل تكلفة كل مليون رمز بنسبة تصل إلى 35 مرة مقارنة بـ GB300 NVL72!

عندما تنخفض تكاليف الاستدلال بنسبة 35 مرة، ستصبح الموظفين الرقميين على مدار 24 ساعة واقعًا، وستشهد التطبيقات الفائقة على جانب المستهلك انفجارًا كبيرًا.
هذا القاطع من لاأو هدأ باب عصر تطبيقات الوكلاء.

تصميم تعاوني ممتاز: كيف فعل ذلك السيد هوانغ؟
قد تسأل: ما الذي يسمح بتسريع الأداء 30 مرة؟ هل يعتمد على تقنية شريحة واحدة؟
Clearly not.
تحسين أداء Vera Rubin NVL72 المذهل يعتمد على "تصميم تعاوني قصوى".

مثل الخدمات المنفصلة، تخزين مؤقت موزع للـ KV، التوجيه المدرك للـ KV، MegaMoE، إلخ.

بالإضافة إلى ذلك، تقوم NVFP4 بضغط أوزان النموذج مباشرة إلى دقة 4 بت، مما يقلل بشكل كبير من استهلاك الذاكرة دون التضحية بجودة الإخراج، ويجعل الإنتاجية ترتفع بشكل فوري.
بينما توفر NVLink من الجيل السادس مع نماذج MoE الكبيرة شبكة اتصال أسرع بعشر مرات وأقل تأخيرًا بثلاث مرات مقارنة بشبكات Ethernet الجاهزة، مما يمكّن DeepSeek يُمكن لهذا النموذج الكبير القائم على بنية MoE أن يستدعي بسلاسة شبكات فرعية "خبير" مختلفة بين 72 وحدة معالجة رسومية (GPU).
لم يعد هذا مجرد بيع بطاقات رسومية، بل يبيع هوانغ مجموعة كاملة من "مولدات الطاقة AI".

إطلاق إنتاج كامل لـ NVIDIA Groq 3 LPX:
3400 رمز/ثانية، تغيّر كبير في وكيل الكود!
في مؤتمر Hot Chips 2026 هذا، كشفت نيفيديا أيضًا عن خبر مذهل: بدأ الإنتاج الضخم لـ Groq 3 LPX!

Groq 3 LPX، وهو توسيع حصري لمنصة مركز البيانات Vera Rubin NVL72.
تم تصميمه خصيصًا لهذا النظام، مع التركيز على تسريع الاستدلال منخفض التأخير.
هذه التكنولوجيا السرية تم شراؤها من الشركة الناشئة Groq من قبل نيفيديا في ديسمبر الماضي بقيمة 20 مليار دولار أمريكي.

قد تواجه الوكلاء الذكاء الاصطناعي مشكلة تأخير الترميز، ولحل هذه النقطة المؤرقة، يفصل Groq 3 LPX بذكاء معالجة السياق الواسع عن توليد الرموز.
حل نيفيديا هو جعل معالج Rubin GPU يتعامل مع السياقات الكبيرة، وتفويض مهمة توليد الرموز بسرعة فائقة إلى Groq 3 LPX.
واحد مسؤول عن "القراءة"، والآخر مسؤول عن "الكتابة"، كلٌّ يفعل ما يتقنه.

في توزيع كامل على مستوى الرف، يمكن لـ 256 وحدة LP30 تسريع العمل بالتعاون مع وحدات المعالجة الرسومية عبر اتصالات فائقة العرض الترددي، لبناء محرك استنتاج بحجم المؤسسة.

وبالتالي، وصل Groq 3 LPX مباشرةً إلى سرعة إخراج قياسية.
في اختبارات Artificial Analysis، حقق Groq 3 LPX بسرعة إخراج مذهلة تبلغ 3,400 رمز/ثانية أثناء تشغيل Gemma 4 31B على نافذة سياق فائقة الطول تبلغ 100,000 رمز!
This makes it four times faster in response than competitors for workloads with extreme latency sensitivity.

المهام متعددة الخطوات التي كانت تستغرق ساعات قليلة في الماضي، يمكن الآن إكمالها في دقائق!

Groq 3 LPX في توليد 5000 Token، انخفض الوقت من 50 ثانية إلى 1.5 ثانية، بفارق 34 ضعفًا.

كما أن مهمة الترميز، فإن أقصى سرعة إخراج لـ Groq 3 LPX هي 6981 رمزًا/ثانية.

قال هوانغ رينشون إن التقدم عبر LPX في توليد الرموز فائقة السرعة حقق "قفزة كبيرة أخرى" في إنتاجية الذكاء الاصطناعي وقدرته على الاستجابة.

تم نشر الشريحة من قبل Nebius في Nebius Token Factory لتقديم تجربة استجابة فورية في كل خطوة من دورة الوكلاء.

يتبعه مباشرة Groq نفسه.

تم إصدار أول معالج مخصص لل-Agent
ماسك يصعد إلى الفضاء ليلاً!
أكبر خطوة في هذا الإعلان الرسمي هي Vera CPU.
لأجل Agent، صممت نيفيديا معالجًا مخصصًا.
هذه المعالجة Vera مصممة خصيصًا لإطعام الوكلاء الذكيين.
يحتوي على 88 نواة Olympus مطورة داخليًا، وذاكرة LPDDR5X بعرض نطاق عالي، يصل عرض النطاق إلى 1.2 تيرابايت/ثانية.

لماذا نحتاج إلى معالجات CPU جديدة في عصر النماذج الكبيرة؟
في موقع Hot Chips، صرح مسؤول تنفيذي من NVIDIA عن Vera CPU: "الذكاء الاصطناعي الوكيل هو أكثر المهام الحسابية تعقيدًا في التاريخ".

مهمة واحدة، وراء العميل تُنفذ مئات الخطوات: استدعاء الأدوات، تنفيذ كود Python، التنقل عبر السياق، معالجة كميات هائلة من البيانات....
جميع مهام جدولة التسليم هذه تُلقى على عاتق وحدة المعالجة المركزية لتحملها بقوة. لذلك، يجب على نيفيديا تصنيع معالج CPU منفصل للوكيل.
بالضبط بسبب هذا، أعلنت SpaceXAI الخاصة بمسك ليلًا عن النشر الواسع النطاق لوحدة معالجة مركزية Vera من NVIDIA!
في مايو من هذا العام، أرسلت نيفيديا بالفعل عينات فيرا الأولى إلى شركة A وOpenAI وSpaceXAI للاختبار المبدئي.
بعد فقط ثلاثة أشهر، كان SpaceXAI متحمسًا لنقله إلى النشر الشامل.
الأكثر إثارةً أن SpaceXAI تبني مصنعًا للحوسبة بقدرة جيجاواط على منصة فيرا روبين لتشغيل Grok.
不仅如此,这套算力还要被直接送上太空。
قال ماسك: "الشركتان الكبيرتان تتعاونان لتصميم نسخة محسّنة من Vera Rubin NVL72، سيتم نشرها على نطاق واسع بحلول عام 2028."

القمر الصناعي الأول من نوع "Starmind" الخاص بـ SpaceXAI مخطط له أن يستخدم نظام Vera Rubin NVL72 على مستوى الرف.

من وحدة معالجة رسومات واحدة إلى مصنع كامل للوكلاء
في نفس اليوم، بدأ الإنتاج الضخم الكامل للشرائح المزدوجة Vera CPU و Groq 3 LPX.
This is significant for NVIDIA.

في عصر النماذج الكبيرة، احتلت نيفيديا السوق في التدريب والاستنتاج من خلال وحدات معالجة الرسوميات (GPU).
في عصر الوكلاء، امتدت أراضيه لتشمل CPU ووحدات تسريع الاستدلال وNVLink وغيرها.
ما يبيعه لاأوáng لم يعد مجرد وحدة معالجة رسومية واحدة.
ما يرغب في بيعه هو مصنع ذكي قادر على إنتاج Token باستمرار.
هذا المرة، يريد هوانغ القديم إعادة تأسيس قاعدة كاملة لـ "عصر الوكلاء".
المراجع:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
هذا المقال من حساب WeChat "New Intelligence Yuan"، المؤلف: Apocalyptic Revelation of ASI
