NVIDIA, Vera Rubin NVL72'yi tanıttı ve DeepSeek veri aktarım hızını 30 kat artırdı

icon MarsBit
Paylaş
AI summary iconÖzet
NVIDIA, Vera Rubin NVL72 test sonuçlarını gösteren zincir üzerindeki bir haber yayınladı; DeepSeek-V4-Pro verimliliği 30 kat arttı. Token maliyetleri, GB300 NVL72 ile karşılaştırıldığında 35 kat düştü. Platform, şimdi SpaceXAI tarafından kullanılan Vera CPU ve Groq 3 LPX’i içeriyor. Performans artışı, daha geniş bir AI uygulaması anlamına geldiğinden yeni token listelemeleri takip edebilir.

Çok harika.

Just now, NVIDIA announced for the first time in its history the first on-chip test data of its next-generation flagship cabinet, Vera Rubin NVL72.

Ayrıca, bu deneme doğrudan getirdi DeepSeek -V4-Pro, en gerçekçi «akıllı ajan kodlama» görevini çalıştırın!

Sonuç şaşırtıcı: Mevcut lider makine GB300 NVL72 ile karşılaştırıldığında, Vera Rubin'in megawatt başına verimliliği en fazla 30 kat arttı ve token maliyeti en fazla 35 kat düştü!

Ajan

Biri haykırdı: "Yatırımcıları kandırmak için bile böyle bir PowerPoint sunumu yapmam!"

Diğer kullanıcıların harika yorumu: "Daha önce H200'ün 30.000 dolarlık fiyatını pahalı buluyordum, şimdi geri dönüp baktığımda H200'un hatta temel versiyonu bile olmadığını görüyorum."

Ajan

Hadi detaylıca inceleyelim.

H200'dan GB300'a kadar, gerçek Agent iş yüklerinin verimliliği en fazla 30 kat arttı, maliyet yaklaşık iki katına çıktı.

GB300'den Vera Rubin'a kadar, veri işlem kapasitesi tekrar en fazla 30 kat arttı ve tam raf fiyatı yaklaşık olarak tekrar iki katına çıktı.

Eski Huang'un Moore Yasası'na göre, bu iki yıl içinde NVIDIA'nın en büyük teknolojik atılımı GPU'nun kendisi değil, fiyatını dört katına çıkararak 900 kat hız artışı sağlamasıydı!

Ajan

Bu sefer, NVIDIA herkese bir ters mantık gerçekliğini duyurdu: LLM dönemi sona erdi, Agent dönemi başladı, eski AI performans testleri tamamen geçersiz kılındı!

Ajan

Aynı zamanda, agentler için özel olarak tasarlanan Vera CPU, Musk'un SpaceXAI tarafından gece boyu kuruldu ve hatta doğrudan uzaya fırlatılmaya hazırlanıyor.

Bugün aynı zamanda NVIDIA Groq 3 LPX de tam ölçekli üretime başlamıştır.

Gemma 4 31B, üstünde muazzam bir hızla çalışıyor, doğrudan saniyede 3400 token'e ulaşıyor. Trilyon parametreli model veri throughput'u, 35 kat artışla hızlanıyor.

Ajan

Ajan

Bu yeni kayıtlar, Agent ekosisteminin ticari yapısını bu gece yeniden yazıyor!

NVIDIA neden Vera Rubin'ı çıkarmak zorunda?

OpenRouter'un en son verileri cevabı veriyor: Gerçek dünyada, bir Agent AI görevi tarafından tüketilen Token sayısı, normal bir sohbet diyaloğundan 15 kat daha fazla!

Örneğin, bir ajan bir şirketi yatırım kararı için araştırdığında, ajan ve alt ajanslar sürekli olarak çıkarımda bulunur, birikmiş Tokenlar bir sonraki adımın girdisi haline gelir ve uzun bağlam işleme, ajan AI'nın en kritik sınırlayıcısı olur.

Ajan

Daha fazla agent etkileşimi, daha yüksek verimlilik anlamına gelir—agent sayısı 10 kat arttığında, araç çağrısı sayısı 2 kat artar ve hesaplama gücü ile algoritma arasındaki çatışma yeni ihtiyaçları ortaya çıkarır.

Ajan

Sohbeti bir agente dönüştürmeyin, eski referanslar tamamen geçersiz!

Bu noktada, geleneksel AI performans testleri (örneğin sabit uzunluktaki 8K/1K diziler) tamamen geçersiz hale gelir.

NVIDIA resmi olarak açıklıyor: Performans ölçümü gelişmelidir! Tek bir çıkarım isteği ölçülmeli, tam Agent iş akışı yakalanmalıdır.

Bunun için SemiAnalysis'ın AgentX performans testini kullandılar.

Bu test artık katı soru-cevap değil, gerçek, bağlam artışı, araç çağrısı ve alt akıllı sistem üretimi içeren bir “kod yazma oturumunun” geri oynatılmasıdır.

Ajan

Bu yüzden H200, yeni Agent savaş alanında yetersiz kalıyor; Vera Rubin kral olmaya mahkûm.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Hasılat canavarı geldi

Vera Rubin NVL72'nin gücünü kanıtlamak için NVIDIA doğrudan açık kaynak liderini— DeepSeek -V4-Pro (1.6T) üzerinde yerel testler yapılıyor.

Veriler ortaya çıktığında sonuç şaşırtıcı—

AgentX yükü altında, Vera Rubin NVL72'nin her megawatt için veri throughput'u, GB300 NVL72'ye kıyasla tam 30 kat artırıldı!

Ajan

Burada karşılaştırılan, eski H200 değil, popüler ana model GB300'dür.

GB300 aynı şekilde DeepSeek -V4-Pro test aşamasında, her megawatt veri throughputu, H200'a göre 15 kat daha yüksek.

Ancak Vera Rubin, GB300'un omuzlarında 30 kat daha yükseldi ve tüm Pareto eğrisini daha da yükseltti!

Bu ne anlama geliyor?

Elektrik tedarikine bağlı olan "AI fabrikaları" için bu, fiziksel kanunların sınırlarını doğrudan genişletiyor.

Aynı elektrik bütçesiyle, Vera Rubin, 30 kat daha fazla akıllı görev yerine getirebilir.

Megawatt hatta gigawatt düzeyindeki veri merkezleri için bu, 30 kat daha fazla hesaplama varlığı oluşturmak anlamına gelir.

Ayrıca, NVIDIA DSX MaxLPS teknolojisi, GPU, raf ve iş yükü düzeyinde güç yönetimi sağlayarak aynı megavat bütçesi içinde GPU sayısını %40'a kadar artırır ve AI fabrikalarının megavat başına verimliliğini daha da artırır!

Ajan

Token maliyeti 35 kat azaldı! Agent sektörünün «defteri» tamamen yeniden yazıldı

Her megawatt verimlilik, her token üretim maliyetini doğrudan etkiler. Performansın patlaması, iş modeli üzerindeki en doğrudan sonucu nükleer bir patlamadır.

NVIDIA, Vera Rubin NVL72'nin milyon token başına maliyetinin, GB300 NVL72'ye kıyasla en fazla 35 kat daha düşük olduğunu duyurdu!

Ajan

Mantık maliyetleri 35 kat düşerken, 24 saat boyunca çalışan dijital çalışanlar gerçek olacak ve Tüketici yönüne yönelik süper uygulamalarda büyük bir patlama yaşanacak.

Lao Huang'ın bu darbesi, Agent uygulamaları çağının kapısını doğrudan açtı.

Ajan

Mükemmel iş birliği tasarımı: Old Huang bunu nasıl başardı?

Belki de soruyorsunuz: 30 kat hızlanma neden mümkün? Tek bir çipin üretim süreci mi sayesinde?

Elbette değil.

Vera Rubin NVL72, "mükemmel koordinasyon tasarımı" sayesinde şaşırtıcı performans artışı sağlıyor.

Ajan

Örneğin ayrılmış hizmetler, dağıtılmış KV önbellek, KV farkında rota, MegaMoE vb.

Ajan

Ayrıca, NVFP4 kantizasyonu, model ağırlıklarını doğrudan 4 bit hassasiyete sıkıştırarak çıktı kalitesini kaybetmeden bellek kullanımını büyük ölçüde azaltır ve verimliliği anında artırır.

Ancak 6. nesil NVLink, büyük modeller MoE ile, mevcut Ethernet'e göre 10 kat daha hızlı ve 3 kat daha düşük gecikmeli bir ağ bağlantısı sunar, böylece DeepSeek MoE mimarisine dayalı bu büyük model, 72 GPU arasında farklı "uzman" alt ağlarını sorunsuz bir şekilde çağırabilir.

Bu artık sadece grafik kartı satmak değil, eski adam bir tamamı «AI elektrik santrali» satıyor.

Ajan

NVIDIA Groq 3 LPX tam ölçekli üretime başlıyor:

Saniyede 3400 token, Agent kodu değişiyor!

Bu Hot Chips 2026 konferansında NVIDIA, Groq 3 LPX'in tam ölçekli üretime başladığını duyurdu!

Ajan

Groq 3 LPX, Vera Rubin NVL72 veri merkezi platformunun özel uzantısıdır.

Bu, bu sistem için özel olarak tasarlanmıştır ve temel vurgusu düşük gecikmeli çıkarım hızlandırmasıdır.

Bu sihirli teknoloji, geçen Aralık'ta NVIDIA, başlangıç şirketi Groq'dan 20 milyar dolar ödenerek satın aldı.

Ajan

AI agenteri dekodlama gecikmesi sorunu ile karşılaşıyor; bu sorunu çözmek için Groq 3 LPX, büyük bağlam işleme ile token üretimi arasında tamamen ayrım yapıyor.

NVIDIA'nın çözümü, Rubin GPU'nun büyük bağlamı işlemesini ve hızlı Token üretimi görevini Groq 3 LPX'e vermesidir.

Biri «okuma», diğeri «yazma» ile ilgilenir, her biri kendi en iyi yaptığı işi yapar.

Ajan

Tam bir raf seviyesi kurulumda, en fazla 256 LP30 akseleratörü, çok yüksek bant genişliğine sahip bağlantılarla GPU'larla birlikte çalışarak kurumsal ölçekli bir çıkarım motoru oluşturabilir.

Ajan

Bu sayede Groq 3 LPX, rekor bir çıktı hızına doğrudan ulaştı.

Artificial Analysis testinde, Groq 3 LPX, 100.000 Token uzunlukta bir bağlam penceresinde Gemma 4 31B’i çalıştırdı ve çıktı hızı 3.400 Token/saniye oldu!

Bu, gecikmeye son derece duyarlı iş yüklerinde rekabetçi ürünlerden dört kat daha hızlı yanıt vermesini sağlar.

Ajan

Önce birkaç saat süren çok adımlı akıllı sistem görevleri artık dakikalar içinde tamamlanıyor!

Ajan

Groq 3 LPX, 5000 Token üretmek için süreyi 50 saniyeden 1,5 saniyeye düşürdü, 34 katlık fark.

Ajan

Ayrıca kodlama görevlerinde Groq 3 LPX'in maksimum çıktı hızı 6981 token/s'tir.

Ajan

Huang Renxun, LPX aracılığıyla süper hızlı Token üretimi yoluyla AI veri throughput ve yanıt kapasitesinde "yeni bir büyük sıçrama" sağlandığını doğruladı.

Ajan

Nebius, akıllı agent döngüsünün her adımında anlık yanıt veren mükemmel deneyimi sağlamak için Nebius Token Factory'de bu çipi dağıttı.

Ajan

Onun ardından Groq kendisi geliyor.

Ajan

İlk Agent özel CPU yayınlandı,

Elon Musk, gece yarısı "uzaya fırlatıldı"!

Bu resmi duyuruda en iddialı adım, Vera CPU oldu.

Agent için NVIDIA özel olarak bir CPU üretti.

Vera bu CPU, akıllı varlıkların doyurulması için özel olarak tasarlanmıştır,

88 adet kendi geliştirilen Olympus çekirdeği, yüksek bant genişliğine sahip LPDDR5X bellek ve 1,2 TB/s doğrudan bant genişliği ile donatılmıştır.

Ajan

Neden büyük model çağında tamamen yeni bir CPU gerekli?

Hot Chips'te NVIDIA Vera CPU yöneticisi, "Agentic AI, şimdiye kadarki en karmaşık hesaplama görevidir." dedi.

Ajan

Bir görevde, Agent arkasında yüzlerce adım çalışır: araçları çağırma, Python kodu yürütme, bağlamı değiştirme, büyük veri kümesi işleme...

Bu çanta görevlerinin tümü, CPU üzerinde zorla yürütülüyor. Bu nedenle NVIDIA, Agent için ayrı bir CPU geliştirmelidir.

Bu noktayı dikkate alarak, Musk'un SpaceXAI, hemen NVIDIA Vera CPU'nun ölçekli dağıtımını duyurdu!

Bu yıl Mayıs'ta, NVIDIA, ilk Vera örneklerini A şirketine, OpenAI'e ve SpaceXAI'ye gizlice gönderdi.

Sadece üç ay sonra, SpaceXAI tam dağıtım için acele ediyor.

Daha da çılgınca, SpaceXAI, Grok'u çalıştırmak için Vera Rubin platformu üzerinde gigawatt seviyesinde bir hesaplama fabrikası inşa ediyor.

Ayrıca, bu hesaplama gücü doğrudan uzaya gönderilecek.

Musk, "İki güçlü ortak, 2028 yılında büyük ölçekli olarak dağıtılacak şekilde optimize edilmiş bir Vera Rubin NVL72 tasarladı." dedi.

Ajan

SpaceXAI'nin ilk nesil «Starmind» AI uydusu, Vera Rubin NVL72 raf sistemiyle planlanmaktadır.

Ajan

Bir GPU'dan, tam bir Agent fabrikasına

Aynı gün, iki çip olan Vera CPU ve Groq 3 LPX tam üretim aşamasına giriyor.

Bu, NVIDIA için büyük bir anlam taşımaktadır.

Ajan

Büyük modellerin dönemiyle, NVIDIA, eğitim ve çıkarım için GPU'larla üstünlük kazandı.

Agent era, alanını CPU, çıkarım hızlandırıcıları, NVLink vb. gibi alanlara genişletti.

Lao Huang'un sattığı, artık sadece bir GPU değil.

Satmak istediği, sürekli Token üreten bir AI fabrikası.

Bu sefer, Huang Lao, "Agent Çağı" için tamamen yeni bir temel hazırlıyor.

Kaynaklar:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Bu yazı, WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI Vahiyleri

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.