Çok harika.
Just now, NVIDIA announced for the first time in its history the first on-chip test data of its next-generation flagship cabinet, Vera Rubin NVL72.
Ayrıca, bu deneme doğrudan getirdi DeepSeek -V4-Pro, en gerçekçi «akıllı ajan kodlama» görevini çalıştırın!
Sonuç şaşırtıcı: Mevcut lider makine GB300 NVL72 ile karşılaştırıldığında, Vera Rubin'in megawatt başına verimliliği en fazla 30 kat arttı ve token maliyeti en fazla 35 kat düştü!

Biri haykırdı: "Yatırımcıları kandırmak için bile böyle bir PowerPoint sunumu yapmam!"
Diğer kullanıcıların harika yorumu: "Daha önce H200'ün 30.000 dolarlık fiyatını pahalı buluyordum, şimdi geri dönüp baktığımda H200'un hatta temel versiyonu bile olmadığını görüyorum."

Hadi detaylıca inceleyelim.
H200'dan GB300'a kadar, gerçek Agent iş yüklerinin verimliliği en fazla 30 kat arttı, maliyet yaklaşık iki katına çıktı.
GB300'den Vera Rubin'a kadar, veri işlem kapasitesi tekrar en fazla 30 kat arttı ve tam raf fiyatı yaklaşık olarak tekrar iki katına çıktı.
Eski Huang'un Moore Yasası'na göre, bu iki yıl içinde NVIDIA'nın en büyük teknolojik atılımı GPU'nun kendisi değil, fiyatını dört katına çıkararak 900 kat hız artışı sağlamasıydı!

Bu sefer, NVIDIA herkese bir ters mantık gerçekliğini duyurdu: LLM dönemi sona erdi, Agent dönemi başladı, eski AI performans testleri tamamen geçersiz kılındı!

Aynı zamanda, agentler için özel olarak tasarlanan Vera CPU, Musk'un SpaceXAI tarafından gece boyu kuruldu ve hatta doğrudan uzaya fırlatılmaya hazırlanıyor.
Bugün aynı zamanda NVIDIA Groq 3 LPX de tam ölçekli üretime başlamıştır.
Gemma 4 31B, üstünde muazzam bir hızla çalışıyor, doğrudan saniyede 3400 token'e ulaşıyor. Trilyon parametreli model veri throughput'u, 35 kat artışla hızlanıyor.


Bu yeni kayıtlar, Agent ekosisteminin ticari yapısını bu gece yeniden yazıyor!
NVIDIA neden Vera Rubin'ı çıkarmak zorunda?
OpenRouter'un en son verileri cevabı veriyor: Gerçek dünyada, bir Agent AI görevi tarafından tüketilen Token sayısı, normal bir sohbet diyaloğundan 15 kat daha fazla!
Örneğin, bir ajan bir şirketi yatırım kararı için araştırdığında, ajan ve alt ajanslar sürekli olarak çıkarımda bulunur, birikmiş Tokenlar bir sonraki adımın girdisi haline gelir ve uzun bağlam işleme, ajan AI'nın en kritik sınırlayıcısı olur.

Daha fazla agent etkileşimi, daha yüksek verimlilik anlamına gelir—agent sayısı 10 kat arttığında, araç çağrısı sayısı 2 kat artar ve hesaplama gücü ile algoritma arasındaki çatışma yeni ihtiyaçları ortaya çıkarır.

Sohbeti bir agente dönüştürmeyin, eski referanslar tamamen geçersiz!
Bu noktada, geleneksel AI performans testleri (örneğin sabit uzunluktaki 8K/1K diziler) tamamen geçersiz hale gelir.
NVIDIA resmi olarak açıklıyor: Performans ölçümü gelişmelidir! Tek bir çıkarım isteği ölçülmeli, tam Agent iş akışı yakalanmalıdır.
Bunun için SemiAnalysis'ın AgentX performans testini kullandılar.
Bu test artık katı soru-cevap değil, gerçek, bağlam artışı, araç çağrısı ve alt akıllı sistem üretimi içeren bir “kod yazma oturumunun” geri oynatılmasıdır.

Bu yüzden H200, yeni Agent savaş alanında yetersiz kalıyor; Vera Rubin kral olmaya mahkûm.
Vera Rubin NVL72 × DeepSeek-V4-Pro:
Hasılat canavarı geldi
Vera Rubin NVL72'nin gücünü kanıtlamak için NVIDIA doğrudan açık kaynak liderini— DeepSeek -V4-Pro (1.6T) üzerinde yerel testler yapılıyor.
Veriler ortaya çıktığında sonuç şaşırtıcı—
AgentX yükü altında, Vera Rubin NVL72'nin her megawatt için veri throughput'u, GB300 NVL72'ye kıyasla tam 30 kat artırıldı!

Burada karşılaştırılan, eski H200 değil, popüler ana model GB300'dür.
GB300 aynı şekilde DeepSeek -V4-Pro test aşamasında, her megawatt veri throughputu, H200'a göre 15 kat daha yüksek.
Ancak Vera Rubin, GB300'un omuzlarında 30 kat daha yükseldi ve tüm Pareto eğrisini daha da yükseltti!
Bu ne anlama geliyor?
Elektrik tedarikine bağlı olan "AI fabrikaları" için bu, fiziksel kanunların sınırlarını doğrudan genişletiyor.
Aynı elektrik bütçesiyle, Vera Rubin, 30 kat daha fazla akıllı görev yerine getirebilir.
Megawatt hatta gigawatt düzeyindeki veri merkezleri için bu, 30 kat daha fazla hesaplama varlığı oluşturmak anlamına gelir.
Ayrıca, NVIDIA DSX MaxLPS teknolojisi, GPU, raf ve iş yükü düzeyinde güç yönetimi sağlayarak aynı megavat bütçesi içinde GPU sayısını %40'a kadar artırır ve AI fabrikalarının megavat başına verimliliğini daha da artırır!

Token maliyeti 35 kat azaldı! Agent sektörünün «defteri» tamamen yeniden yazıldı
Her megawatt verimlilik, her token üretim maliyetini doğrudan etkiler. Performansın patlaması, iş modeli üzerindeki en doğrudan sonucu nükleer bir patlamadır.
NVIDIA, Vera Rubin NVL72'nin milyon token başına maliyetinin, GB300 NVL72'ye kıyasla en fazla 35 kat daha düşük olduğunu duyurdu!

Mantık maliyetleri 35 kat düşerken, 24 saat boyunca çalışan dijital çalışanlar gerçek olacak ve Tüketici yönüne yönelik süper uygulamalarda büyük bir patlama yaşanacak.
Lao Huang'ın bu darbesi, Agent uygulamaları çağının kapısını doğrudan açtı.

Mükemmel iş birliği tasarımı: Old Huang bunu nasıl başardı?
Belki de soruyorsunuz: 30 kat hızlanma neden mümkün? Tek bir çipin üretim süreci mi sayesinde?
Elbette değil.
Vera Rubin NVL72, "mükemmel koordinasyon tasarımı" sayesinde şaşırtıcı performans artışı sağlıyor.

Örneğin ayrılmış hizmetler, dağıtılmış KV önbellek, KV farkında rota, MegaMoE vb.

Ayrıca, NVFP4 kantizasyonu, model ağırlıklarını doğrudan 4 bit hassasiyete sıkıştırarak çıktı kalitesini kaybetmeden bellek kullanımını büyük ölçüde azaltır ve verimliliği anında artırır.
Ancak 6. nesil NVLink, büyük modeller MoE ile, mevcut Ethernet'e göre 10 kat daha hızlı ve 3 kat daha düşük gecikmeli bir ağ bağlantısı sunar, böylece DeepSeek MoE mimarisine dayalı bu büyük model, 72 GPU arasında farklı "uzman" alt ağlarını sorunsuz bir şekilde çağırabilir.
Bu artık sadece grafik kartı satmak değil, eski adam bir tamamı «AI elektrik santrali» satıyor.

NVIDIA Groq 3 LPX tam ölçekli üretime başlıyor:
Saniyede 3400 token, Agent kodu değişiyor!
Bu Hot Chips 2026 konferansında NVIDIA, Groq 3 LPX'in tam ölçekli üretime başladığını duyurdu!

Groq 3 LPX, Vera Rubin NVL72 veri merkezi platformunun özel uzantısıdır.
Bu, bu sistem için özel olarak tasarlanmıştır ve temel vurgusu düşük gecikmeli çıkarım hızlandırmasıdır.
Bu sihirli teknoloji, geçen Aralık'ta NVIDIA, başlangıç şirketi Groq'dan 20 milyar dolar ödenerek satın aldı.

AI agenteri dekodlama gecikmesi sorunu ile karşılaşıyor; bu sorunu çözmek için Groq 3 LPX, büyük bağlam işleme ile token üretimi arasında tamamen ayrım yapıyor.
NVIDIA'nın çözümü, Rubin GPU'nun büyük bağlamı işlemesini ve hızlı Token üretimi görevini Groq 3 LPX'e vermesidir.
Biri «okuma», diğeri «yazma» ile ilgilenir, her biri kendi en iyi yaptığı işi yapar.

Tam bir raf seviyesi kurulumda, en fazla 256 LP30 akseleratörü, çok yüksek bant genişliğine sahip bağlantılarla GPU'larla birlikte çalışarak kurumsal ölçekli bir çıkarım motoru oluşturabilir.

Bu sayede Groq 3 LPX, rekor bir çıktı hızına doğrudan ulaştı.
Artificial Analysis testinde, Groq 3 LPX, 100.000 Token uzunlukta bir bağlam penceresinde Gemma 4 31B’i çalıştırdı ve çıktı hızı 3.400 Token/saniye oldu!
Bu, gecikmeye son derece duyarlı iş yüklerinde rekabetçi ürünlerden dört kat daha hızlı yanıt vermesini sağlar.

Önce birkaç saat süren çok adımlı akıllı sistem görevleri artık dakikalar içinde tamamlanıyor!

Groq 3 LPX, 5000 Token üretmek için süreyi 50 saniyeden 1,5 saniyeye düşürdü, 34 katlık fark.

Ayrıca kodlama görevlerinde Groq 3 LPX'in maksimum çıktı hızı 6981 token/s'tir.

Huang Renxun, LPX aracılığıyla süper hızlı Token üretimi yoluyla AI veri throughput ve yanıt kapasitesinde "yeni bir büyük sıçrama" sağlandığını doğruladı.

Nebius, akıllı agent döngüsünün her adımında anlık yanıt veren mükemmel deneyimi sağlamak için Nebius Token Factory'de bu çipi dağıttı.

Onun ardından Groq kendisi geliyor.

İlk Agent özel CPU yayınlandı,
Elon Musk, gece yarısı "uzaya fırlatıldı"!
Bu resmi duyuruda en iddialı adım, Vera CPU oldu.
Agent için NVIDIA özel olarak bir CPU üretti.
Vera bu CPU, akıllı varlıkların doyurulması için özel olarak tasarlanmıştır,
88 adet kendi geliştirilen Olympus çekirdeği, yüksek bant genişliğine sahip LPDDR5X bellek ve 1,2 TB/s doğrudan bant genişliği ile donatılmıştır.

Neden büyük model çağında tamamen yeni bir CPU gerekli?
Hot Chips'te NVIDIA Vera CPU yöneticisi, "Agentic AI, şimdiye kadarki en karmaşık hesaplama görevidir." dedi.

Bir görevde, Agent arkasında yüzlerce adım çalışır: araçları çağırma, Python kodu yürütme, bağlamı değiştirme, büyük veri kümesi işleme...
Bu çanta görevlerinin tümü, CPU üzerinde zorla yürütülüyor. Bu nedenle NVIDIA, Agent için ayrı bir CPU geliştirmelidir.
Bu noktayı dikkate alarak, Musk'un SpaceXAI, hemen NVIDIA Vera CPU'nun ölçekli dağıtımını duyurdu!
Bu yıl Mayıs'ta, NVIDIA, ilk Vera örneklerini A şirketine, OpenAI'e ve SpaceXAI'ye gizlice gönderdi.
Sadece üç ay sonra, SpaceXAI tam dağıtım için acele ediyor.
Daha da çılgınca, SpaceXAI, Grok'u çalıştırmak için Vera Rubin platformu üzerinde gigawatt seviyesinde bir hesaplama fabrikası inşa ediyor.
Ayrıca, bu hesaplama gücü doğrudan uzaya gönderilecek.
Musk, "İki güçlü ortak, 2028 yılında büyük ölçekli olarak dağıtılacak şekilde optimize edilmiş bir Vera Rubin NVL72 tasarladı." dedi.

SpaceXAI'nin ilk nesil «Starmind» AI uydusu, Vera Rubin NVL72 raf sistemiyle planlanmaktadır.

Bir GPU'dan, tam bir Agent fabrikasına
Aynı gün, iki çip olan Vera CPU ve Groq 3 LPX tam üretim aşamasına giriyor.
Bu, NVIDIA için büyük bir anlam taşımaktadır.

Büyük modellerin dönemiyle, NVIDIA, eğitim ve çıkarım için GPU'larla üstünlük kazandı.
Agent era, alanını CPU, çıkarım hızlandırıcıları, NVLink vb. gibi alanlara genişletti.
Lao Huang'un sattığı, artık sadece bir GPU değil.
Satmak istediği, sürekli Token üreten bir AI fabrikası.
Bu sefer, Huang Lao, "Agent Çağı" için tamamen yeni bir temel hazırlıyor.
Kaynaklar:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Bu yazı, WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI Vahiyleri
