OpenAI, NVIDIA ve Google, LLM Çıkarımı İçin AI Çip Tasarımında Farklılaşıyor

iconMetaEra
Paylaş
AI summary iconÖzet
AI + kripto haberi, büyük oyuncuların LLM çıkarım çip tasarımı konusunda farklılaştığını gösteriyor. OpenAI’nin Jalapeño’su çıkarıma odaklanıyor, NVIDIA GPU’larını Groq’un LPU’suyla birleştiriyor ve Google, TPU 8t ve 8i’yi eğitim ve çıkarım için ayırıyor. Çıkarım artık daha yüksek HBM bant genişliği, daha büyük SRAM ve daha sıkı ağ yolları gerektiriyor. Çipler daha fazla iş yüküne özel hale geldikçe, token maliyeti, FLOPS ile birlikte önem kazanıyor. Tasarım stratejisindeki bir ağ yükseltmesi, AI donanım rekabetini yeniden şekillendiriyor.
AI çip rekabeti derin bir değişime uğruyor. OpenAI, LLM çıkarımı için Jalapeño çipini duyurdu, NVIDIA GPU'yu Groq LPU ile birleştirerek heterojen hesaplama sağlıyor ve Google, eğitim ve çıkarımı sırasıyla TPU 8t ve TPU 8i olmak üzere iki farklı çip olarak ayırdı. Bu üç yol, eğitim ve çıkarımın donanım kaynakları için farklı ihtiyaçları yansıtır: eğitim, matris hesaplamalarına ve büyük ölçekli bağlantıya odaklanırken, çıkarım daha yüksek HBM bant genişliği, daha büyük SRAM ve daha kısa ağ yollarına ihtiyaç duyar. İki iş yükü için çip tasarımları arasındaki fark arttıkça, FLOPS artık tek ölçütki değil; Token maliyeti, AI donanım rekabetinin yeni ölçütü haline geliyor.

Makale yazarı, kaynak: Leifengwang

Token maliyeti, büyük modellerin donanım rekabetinde yeni bir ölçüt haline geliyor

Somutlanmış Yapay Zeka, dumanla kaplı mutfaklara giriyor

Milyonlarca trafik altında robotların iş hayatı

Önceki Covariant AI başkan yardımcısı ve Zhoupu Sayı Merkezi, LPU'nun rolünü Vera Rubin'in düşük gecikmeli Decode alanındaki eksikliklerini gidermek olarak özetledi.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Groq'un çip tasarımı da neredeyse bu etrafında dönmektedir. Bir LPX rafı 256 adet LPU içerir ve toplamda sadece 128 GB SRAM sunar; kapasitesi GPU rafındaki HBM ile karşılaştırılamaz, ancak birleştirilmiş SRAM bant genişliği 40 PB/s'ye ulaşabilir.

Bu tasarım, "yakınlık"a önem verir. HBM, birçok model durumunu depolayabilir ancak hesaplama birimlerinden daha uzaktır; SRAM pahalıdır ve kapasitesini büyütmek zordur, ancak veriler çipin içinde olduğundan çok yüksek bant genişliği ve çok düşük erişim gecikmesi sağlar.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Her adımda yapılan hesaplamalar sınırlıdır ve veriler sıkça alınır; verileri ALU'ya daha yakın tutmak, bir sonraki Token'in bekleme süresine doğrudan yansır.

Groq, dinamik donanım kontrolünü daha da azalttı. LPU, belirleyici yürütme mimarisidir ve talimat zamanlaması çoğunlukla yazılım tarafından önceden tamamlanır. Her çip aynı anda işlemci ve yönlendirici olarak işlev görür; derleyici, hesaplama kaynaklarını ve ağ kaynaklarını birlikte planlar ve geleneksel donanım akış kontrolü ile sanal kanallar gibi mekanizmaları tamamen ortadan kaldırır.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Maliyet de açık: Bu mimari, GPU kadar evrensel değildir ve çip üzerindeki SRAM, tam büyük modellerin durumunu tutamaz. Bu nedenle NVIDIA, Groq 3'ün tam modeli bağımsız olarak çalıştırmamasını sağladı ve daha karmaşık bir heterojen sistem oluşturdu.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Prefill GPU'da gerçekleştirilir, büyük ölçüde Decode LPU'ya aktarılır; Decode içindeki Attention tekrar GPU'ya dönebilir. GPU ve LPU, kendi KV Cache'lerini ayrı ayrı tutar; anahtar olarak draft Tokens değiş tokuş edilir ve micro-batch ile hesaplama ve iletişim üst üste bindirilir. LPU senkron bir alandır, ancak GPU ve dış KV Cache asenkron sistemlerdir; NVIDIA, bunların arasındaki asenkron köprü olarak FPGA eklemiştir.

Bu yapı, AI çiplerindeki görev paylaşımının ne kadar ileri seviyeye ulaştığını çok iyi gösteriyor. Artık sadece “eğitim çipleri” ve “tahmin çipleri” değil, bir Decode işleminin farklı bölümleri bile farklı mimarilerde yürütülebiliyor.

Ancak NVIDIA'nın sunduğu veriler, bu yolun sınırlarını da gösteriyor: İşlem sadece toplam verimliliği hedefliyorsa ve daha yüksek gecikme süresini kabul edebiliyorsa, Rubin GPU hâlâ verimli; tek kullanıcı için Token hızı talebi arttıkça LPX avantaj kazanmaya başlıyor ve daha fazla LPU kullanılmasıyla toplam verimlilik düşüyor.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Bu nedenle Groq 3'ün ortaya çıkışı, GPU'ların çıkarım için yetersiz kaldığı anlamına gelmez. Bunun yerine başka bir şeyi gösterir: aynı bir GPU, yüksek verimlilik ve çok düşük gecikme arasında aynı anda iki uçta da iyi performans göstermek zordur; bu iki donanım türünü kendi daha iyi performans gösterdiği alanlarda çalıştırmak, sistemin performans eğrisini daha kolay genişletmesini sağlar.

Google ise bu kesimi daha üst seviyede yerleştirdi.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Eğitim ve çıkarım, iki farklı çip formülasyonu ile

Google, TPU 8 neslinde hem TPU 8t hem de TPU 8i yaptı,t eğitim için,i çıkarım için. Bu ayrımın arkasındaki mantık, doğrudan çipin bellek yapılandırmasına yazıldı.

Hot Chips sırasında gösterimde, TPU 8t, 6 adet HBM kullanırken, TPU 8i ise 8 adet kullanıyor. Google'ın açıklamasına göre, çıkarım sırasında her birim hesaplama için daha fazla HBM gerekiyor ve aynı zamanda daha yüksek oranda SRAM gerekiyor; bu nedenle 8i, daha fazla kaynağı SRAM, bellek kapasitesi ve bant genişliğine ayırıyor.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Bu fark dikkat edilmesi değerlidir. Eğer AI çipleri yalnızca matris hesaplama gücüyle rekabet ediyorsa, çıkarım sürümü neden bu kadar çok çip alanı ve paketleme kaynağını belleğe harcayacak? TPU 8i'nin bu şekilde tasarlanması, Google'ın darboğazın artık veri sağlayıcıya kaydığını gördüğünü gösteriyor.

Eğitim sırasında büyük batch, ağırlık okuma maliyetini birçok token üzerine yayabilir; decode sırasında her seferde oluşturulan token sayısı az olmasına rağmen, ağırlıklar ve KV önbelleği hâlâ sıklıkla erişilir. Bu nedenle, her bir FLOPS başına ne kadar HBM bant genişliği gereklidir sorusunun, bu iki görev için farklı cevapları vardır.

Google, bu farkı ağ topolojisine kadar getirdi. Geçmişte TPU'lar için yaygın olarak kullanılan 3D Torus, büyük kümelerdeki toplam veri throughput'una odaklanarak eğitim için daha uygundur. TPU 8i, BoardFly'i destekler ve ağ yolları daha kısadır: BoardFly'in yol sınırı 7 hops, 3D Torus ise 16 hops'e ulaşır.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Eğitim için birkaç ek ağ atlamasından sonra genellikle büyük bir matris hesaplaması vardır, bu da iletişim süresini dağıtabilir. Decode adımının hesaplama penceresi kısadır ve birkaç ağ gecikmesi kolayca Token aralıklarına girebilir.

MoE, bu sorunu daha da belirgin hale getiriyor. MoE, bir Token'un yalnızca bir kısmını Expert olarak etkinleştirebilir ve bu hesaplama açısından verimli görünse de, Router Token'ları farklı Expert'lara yönlendirir. Bu Expert'ler farklı çiplerde dağıtıldığında, hesaplama azalırken All-to-All iletişim artar.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Bu nedenle TPU 8i, bazı kolektif işlemlerini ağ arayüzüne yakın bir I/O Die üzerinde işlemek için Collective Acceleration Engine'ı da ekledi. Veriler, önce Compute Die'ye taşınmadan ve HBM üzerinden işlem yapılmadan doğrudan kısmi iç çip veri taşıma işlemleri atlanabilir.

Training version TPU 8t'nin kaynak dağılımı açıkça diğer tarafa doğru eğilim gösteriyor. Eğitim, büyük miktarda FLOPS gerektirir ve parametreleri ve gradyanları senkronize etmek için büyük bir Scale-Up alanı gerekir. TPU 8t'nin Superpod'u 9600 çipe kadar genişletilebilir, yaklaşık 2 PB paylaşılan HBM ve 121 EFLOPS FP4 toplam hesaplama gücüne sahiptir; Google, daha geniş bir eğitim bağlantısını özel bir sistem haline getirmek için Virgo ağını de dahil etmiştir.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

Google, orada çok pratik bir çip tasarımı sorununa da değindi: dark silicon.

Çip alanı ve güç bütçesi sınırlıdır. Aynı çip üzerinde, eğitim için gerekli olan çok sayıda matris hesaplama kaynağı ile inference için daha fazla SRAM, HBM ve düşük gecikmeli ağ aynı anda yerleştirilirse, bir workload çalışırken her zaman bazı devreler uzun süre boşta kalacaktır.

Jalapeño, bölme işlemini patlatıyor, GPU çıkarım yolu ayrılıyor mu?

İki görevin de farklı kaynak oranlarına ihtiyacı olduğuna göre, doğrudan iki çip yapmak daha temiz olur.

FLOPS'tan Token Ekonomisine

Üç rotayı bir araya getirdiğinizde, farklar aslında oldukça açık.

OpenAI, Jalapeño'yu yaparak çipleri LLM çıkarım katmanına kadar özelleştiriyor, ancak Prefill ve Decode işlemlerini homojen donanım üzerinde esnek bir şekilde planlıyor; NVIDIA, GPU ve Groq LPU'yu bir çıkarımın farklı aşamalarını paylaşacak şekilde daha da bölüyor; Google, eğitimi ve çıkarımı doğrudan iki farklı TPU olarak oluşturuyor.

Bu yolların arkasında gizli yeni bir hesaplama prensibi yoktur; değişen kaynak oranlarıdır. Eğitim, daha fazla transistörü matris hesaplamalarına ve büyük ölçekli bağlantılarla ilişkilendirmeyi hedefler, çünkü yüksek Batch ile veri taşıma maliyeti dağıtılabilmektedir; düşük gecikmeli çıkarım ise daha yüksek HBM bant genişliği, daha büyük SRAM, daha iyi KV Önbelleği yerelliliği ve daha kısa ağ yolları gerektirir, çünkü zamanın çoğu veri beklemeye harcanmaktadır.

İki yükün de gerektirdiği “çip tarifi” birbirinden daha da uzaklaştıkça, aynı genel çip ile ikisini de aynı anda karşılamak verim kaybını giderek daha belirgin hale getirecektir.

Bu da neden bu donanım rekabetindeki temel rakamların değiştiğini açıklıyor. FLOPS hâlâ önemli, ancak yanında Tokens/s/user, TBT, TTFT, Tokens/kW, HBM bant genişliği ve ağ gecikmesi ortaya çıkıyor.

Aslında bunlar aynı şeyi tanımlıyor: işleme gücü orada zaten bulunuyor, sistem verileri sürekli olarak girebiliyor mu ve oluşturulan Token'ları en kısa sürede çıkarabiliyor mu.

OpenAI, NVIDIA ve Google şu anda farklı bir sınır çiziyor; ileride gerçekten değişmesi muhtemel olan da bu sınırın nerede çizileceği.

Eğitim ve çıkarım ayrılabilir, Prefill ve Decode ayrılabilir, Decode içindeki Dikkat ve diğer hesaplamalar da daha da ayrılabilir. Ne kadar ince ayrılırsa, tekil verim o kadar kolay artırılabilir, ancak kaynak planlaması, KV Önbelleği taşıma ve çapraz donanım iletişimleri daha karmaşık hale gelir.

Bu nedenle bir sonraki aşamadaki AI çip rekabetinin sorunu, belki de daha güçlü bir çip çıkarmak değil.

Daha zor olan, hangi görevlerin özel bir çip için değerli olduğu ve hangi görevlerin aynı donanım içinde kalıp sistemin toplam Token maliyetini daha düşük tutacağına karar vermek.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.