NVIDIA, AI çıkarım kılavuzunu yayınladı, 6 kat kayıpsız hızlanma Çin takımları tarafından liderlik edildi

icon MarsBit
Paylaş
AI summary iconÖzet
NVIDIA, 2 Eylül'de bir AI çıkarım kılavuzu yayınladı ve altı hızlandırma yöntemi sergiledi. Çin takımları, spekülatif dekodlama ve 6 kat kayıpsız hızlanma sağlayan DFlash gibi ana yenilikleri öncülük etti. Altcoin'lerin dikkat çekmeye başlamasıyla birlikte korku ve açgözlülük endeksi hâlâ yüksek seviyede. GPU blok boyutları gibi donanım sınırları model tasarımını şekillendiriyor. DeepSeek-V3'ün MTP yöntemi ve diğer teknikler verimlilik açısından vurgulanıyor. Kılavuz, her yaklaşımın maliyetlerini ve kullanım senaryolarını detaylı şekilde açıklıyor.

Son zamanlarda NVIDIA, resmi büyük model çıkarım kılavuzunu yayınladı, ancak sayfaları çevirirken aslında bir Çinli ekip makaleleri antolojisi gibi göründü.

Şu şekilde.

2 Eylül'de NVIDIA teknoloji blogu, "Spekülasyonla AI Modeli İşbirlikli Tasarımını Çözmek" adlı uzun bir makale yayınladı.

Makalenin özü, mevcut en popüler 6推理 hızlandırma çözümünü bir tabloda sıralamaktır; eğitim maliyetini ve uygun senaryoları da tamamen ortaya koyar.

DeepSeek

Onun değeri, çip devi'nin nadiren resmi bir tutumla "modelin donanım fiziksel sınırlarına nasıl uygun şekilde tasarlanacağı" konusunu bir standart haline getirmesidir.

Ancak etrafına bakıp silikon çip sınırlarında dans edebilecek en iyi çözümleri ararken, rehberde yer alan temel çözümlerin neredeyse tamamı Çinli ekipler tarafından öncülük ediliyor.

Bu, sıradan bir algoritma gözden geçirmesinin ötesine geçti. Bu tablo nihayetinde ne tür bir sırrı ortaya koyuyor? Hadi satır satır inceleyelim.

Neredeyse tamamen kâr getiren bir işlem: Spekülasyon Çözümlemesi ne yapıyor

Bu tabloyu anlamak için önce "spekülatif deşifre"nin ne olduğunu anlamanız gerekir.

Büyük modeller, kelimeleri tek tek çıkarır. Her kelime çıktığında, yüzlerce GB parametre tamamen GPU belleğinde dolaşır. Aslında çoğu zaman, hesaplama gücü, belleğin veriyi taşımamasını bekler.

"Sızma Kodlaması" çözümü, oldukça basit ve kaba—

Öncelikle hafif bir küçük model kullanarak ilk 7 harfi tahmin edin; ardından büyük model bu 7 harfi tek seferde doğrulayacaktır.

7 harfli doğrulama ile kendi yazdığınız 1 harfli doğrulamanın süresi neredeyse aynı, zira ağırlıkları yine tümüyle taşınmalı.

Doğru tahmin edenler doğrudan alır, yanlış tahmin edenler ise noktadan baştan başlar. Büyük model, kendi yazacağı harfleri dışında hiçbir şey kabul etmez, bu yüzden nihai çıktıda noktalama işaretlerine hiç dokunulmaz. Bu, tam olarak “kayipsiz hızlandırma” olarak adlandırılır.

DeepSeek

Bu oyunda, tüm hesaplama gücü ekstraksiyonu, bir temel matematiksel beklenti formülü etrafında dönmektedir:

Hızlandırma = 𝔼[L] × TtargetTdraft + Tverify

Payda, beklenen kabul uzunluğunu temsil eden 𝔼[L] kazancıdır (büyük modelin ortalama her turda kaç harf seçtiği).

Payda, küçük modelin tahmin için harcadığı zaman (Tdraft) ile büyük modelin nihai doğrulama için harcadığı zaman (Tverify) toplamıdır.

Hızlanma oranını (Speedup) patlatmak için iki yol var: ya payı yükseltin (daha doğru tahmin edin), ya da paydayı aşırı şekilde küçültün (daha hızlı tahmin edin).

Rakiplerin omuzlarında basarak dördüncü nesil evrime ulaşın

NVIDIA'nın bu tablosunu yukarıdan aşağıya doğru takip ederseniz, net bir rekabet çizgisi göreceksiniz.

İlk satır, en eski "dışarıda taslak model"dir ve yardımcı olarak ayrı bir model eğitilmelidir.

NVIDIA doğrudan mukayesesiz fatura sundu: Baştan eğitmek 1T ila 10T token tüketir, maliyet çok yüksektir.

Ancak tabloda kalmasının nedeni, NVIDIA'nın ona özel bir kader belirlemesidir—20 milyar dolar harcayarak satın aldıkları Groq çipini (LPU).

Son satır, üst metinden tekrarlayan parçaları doğrudan arayarak kopyalayan, eğitimsiz n-gram tablo yöntemi olup, yalnızca büyük miktarlarda kopyalama-yapıştırma gerektiren sert senaryolar için uygundur.

Teknolojik ilerlemenin gerçek temsilcisi, ortadaki dört satırdır.

DeepSeek

İkinci satır: EAGLE-3.

Pekin Üniversitesi Yuhui Li ve Waterloo Üniversitesi Hongyang Zhang gibi kişilerden oluşan ekip.

ICML ve EMNLP'den NeurIPS'e kadar yol alarak, üç yıl içinde üç nesil geliştirdi ve "harf harf aşağı doğru tahmin etme" adlı seri eski yöntemi fiziksel sınıra kadar getirdi.

Bu, eski dönemde bu alanda kesin bir liderdi, ancak NVIDIA'nın yeni listesinde nedeni çok kısa olan bir "referans pozisyonuna" itildi: kabul edilen uzunluk, son gelenler tarafından aşıldı.

Üçüncü satır: MTP (Çoklu Token Tahmini).

Düşünce, 2024'te Meta tarafından ilk kez ortaya atıldı, ancak bunu büyük dil modelleri çıkarımı için standart hale getiren, DeepSeek -V3.

NVIDIA, ona çok yüksek puan veriyor — GPU'lar üzerindeki büyük modeller için en iyi seçim. Temel nokta, bu çözümün ön eğitim aşamasında ana modele bağlı olarak eğitilmesidir.

DFlash. 6 kat zararsız hız kazandıran güçlü oyuncu.

Üç yazar: Jian Chen, Yesheng Liang, Zhijian Liu. Bu yöntem, EAGLE ve MTP'nin "bir harf bir harf tahmin etme" serisi yaklaşımını tamamen bırakarak, yayılma modellerinden ilham alır ve tek bir ileri hesaplama ile doğrudan 7 Token'lik tahmin dizisini üretir, payda (zaman) değerini maksimum düzeyde azaltır.

Ayrıca, danışman öğretim üyesi Zhijian Liu, UCSD'de yardımcı doçent olmanın yanı sıra NVIDIA Araştırma Enstitüsü'nde araştırmacı bilim insanıdır.

Beşinci satır: DSpark. DeepSeek ve Pekin Üniversitesi'nin 24 kişilik ortak ekibi tarafından geliştirildi.

DFlash'ın paralel mimarisi hızlı olsa da, bir ölümcül zayıflığı var: ilerledikçe tahminler daha az doğru oluyor. Molekülü (kabul edilen uzunluğu) zorla artırmak için DSpark, paralel temel üzerine çok hafif bir seri modül ekledi.

Gerçek test verileri çok net: Kabul edilen uzunluk, EAGLE-3'e göre yaklaşık %30 daha yüksek, DFlash'e göre %18 daha yüksek. DeepSeek V4 çevrimiçi üretim ortamında, MTP'ye kıyasla hız %60 ile %85 arasında daha hızlıdır.

Donanım sabiti, ters kilitli model mimarisi

Bu dört nesil teknoloji, sadece algoritmik zekâyla değil, hesaplama gücünü bu kadar zorlayabiliyor.

Birçok kişi, taslakta daha fazla tahmin yapmanın daha çok kazandırdığını düşünür, ancak bu tamamen çipin fiziksel kurallarını göz ardı eder.

Dikkat mekanizması, dekodlama süresinin büyük bir kısmını kapladığında, büyük modelin doğrulama aşamasında işlenmesi gereken toplam token sayısı 1+D'dir (1 gerçek girdi + D taslak tahmini).

Bu veri parçasını GPU'ya sağlamak için donanım, alt seviyede Query başlıklarını ve KV başlıklarını gruplar halinde birleştirir; her grubun dikkat çekirdek blok boyutu, GPU fiziksel matris sınırlarına (Tile Size, mevcut mimaride genellikle 128) sıkıca bağlıdır.

Bu, temel hizalama formülünü elde etti: G × (1 + D) ≤ 128

Biraz çıkarımla, NVIDIA kılavuzundaki nihai sabit kuralına ulaşılır:

D = 128G − 1

Burada G, dikkat grup sayısıdır (Query başları ve KV başları oranı).

Bu, modelinizin tasarımında dikkat gruplarını nasıl ayarladığınızın, GPU bloklarını tam olarak doldurmak için taslakta kaç harf tahmin edilmesi gerektiğini doğrudan belirlediği anlamına gelir.

Eğer G=8 ise, taslak tam olarak 15 tahmin yapar; eğer G=32 ise, sadece 3 tahmin yapabilirsiniz. Donanım sınırı geçemez; son Tile’ı sadece yarısını kullansanız bile, hesaplama gücü tam bir Tile olarak ücretlendirilir.

Daha önce, spekülasyon kodu, modelin eğitimi tamamlandıktan sonra mühendislik ekibinin dışarıdan eklediği bir hızlandırma paketiydi. Ancak şimdi, temel fiziksel yasalar size şunu söylüyor: bir donanım matrisinin sabiti, doğrudan model mimarisinin tasarım parametrelerine geri dönüştürülüyor.

Biliyorsunuz ki, nadiren bir çip üreticisi, bir alt seviye donanımın kısıt denklemlerini büyük bir modelin tasarım şemasına dahil eder.

Son

Model çalıştırma verimliliği yarışmasının odak noktası tamamen değişti.

Büyük parametreleri yığılma döneminin sona ermesiyle, artık gerçek zafer, alttaki silikon parçasının fiziksel sınırlarını daha iyi anlayan tarafından belirleniyor.

Bu yeni sahada, çip devi tarafından tersine çevrilen kurallarla, Çinli ekip zaten çözümün varsayılan cevabı haline geldi.

Güçlü bir hesaplama lideri olan NVIDIA, raflarda hangi algoritmanın yer aldığını seçmez.

Ancak bu, silikon çipin sınırlarını tamamen zorlayan en iyi çözümün kimin elinden çıktığı, beyaz kağıt üzerinde siyah harflerle net bir şekilde yazıyor.

Bu yazı WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI İlahiyatı

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.