Son zamanlarda NVIDIA, resmi büyük model çıkarım kılavuzunu yayınladı, ancak sayfaları çevirirken aslında bir Çinli ekip makaleleri antolojisi gibi göründü.
Şu şekilde.
2 Eylül'de NVIDIA teknoloji blogu, "Spekülasyonla AI Modeli İşbirlikli Tasarımını Çözmek" adlı uzun bir makale yayınladı.
Makalenin özü, mevcut en popüler 6推理 hızlandırma çözümünü bir tabloda sıralamaktır; eğitim maliyetini ve uygun senaryoları da tamamen ortaya koyar.

Onun değeri, çip devi'nin nadiren resmi bir tutumla "modelin donanım fiziksel sınırlarına nasıl uygun şekilde tasarlanacağı" konusunu bir standart haline getirmesidir.
Ancak etrafına bakıp silikon çip sınırlarında dans edebilecek en iyi çözümleri ararken, rehberde yer alan temel çözümlerin neredeyse tamamı Çinli ekipler tarafından öncülük ediliyor.
Bu, sıradan bir algoritma gözden geçirmesinin ötesine geçti. Bu tablo nihayetinde ne tür bir sırrı ortaya koyuyor? Hadi satır satır inceleyelim.
Neredeyse tamamen kâr getiren bir işlem: Spekülasyon Çözümlemesi ne yapıyor
Bu tabloyu anlamak için önce "spekülatif deşifre"nin ne olduğunu anlamanız gerekir.
Büyük modeller, kelimeleri tek tek çıkarır. Her kelime çıktığında, yüzlerce GB parametre tamamen GPU belleğinde dolaşır. Aslında çoğu zaman, hesaplama gücü, belleğin veriyi taşımamasını bekler.
"Sızma Kodlaması" çözümü, oldukça basit ve kaba—
Öncelikle hafif bir küçük model kullanarak ilk 7 harfi tahmin edin; ardından büyük model bu 7 harfi tek seferde doğrulayacaktır.
7 harfli doğrulama ile kendi yazdığınız 1 harfli doğrulamanın süresi neredeyse aynı, zira ağırlıkları yine tümüyle taşınmalı.
Doğru tahmin edenler doğrudan alır, yanlış tahmin edenler ise noktadan baştan başlar. Büyük model, kendi yazacağı harfleri dışında hiçbir şey kabul etmez, bu yüzden nihai çıktıda noktalama işaretlerine hiç dokunulmaz. Bu, tam olarak “kayipsiz hızlandırma” olarak adlandırılır.

Bu oyunda, tüm hesaplama gücü ekstraksiyonu, bir temel matematiksel beklenti formülü etrafında dönmektedir:
Hızlandırma = 𝔼[L] × TtargetTdraft + Tverify
Payda, beklenen kabul uzunluğunu temsil eden 𝔼[L] kazancıdır (büyük modelin ortalama her turda kaç harf seçtiği).
Payda, küçük modelin tahmin için harcadığı zaman (Tdraft) ile büyük modelin nihai doğrulama için harcadığı zaman (Tverify) toplamıdır.
Hızlanma oranını (Speedup) patlatmak için iki yol var: ya payı yükseltin (daha doğru tahmin edin), ya da paydayı aşırı şekilde küçültün (daha hızlı tahmin edin).
Rakiplerin omuzlarında basarak dördüncü nesil evrime ulaşın
NVIDIA'nın bu tablosunu yukarıdan aşağıya doğru takip ederseniz, net bir rekabet çizgisi göreceksiniz.
İlk satır, en eski "dışarıda taslak model"dir ve yardımcı olarak ayrı bir model eğitilmelidir.
NVIDIA doğrudan mukayesesiz fatura sundu: Baştan eğitmek 1T ila 10T token tüketir, maliyet çok yüksektir.
Ancak tabloda kalmasının nedeni, NVIDIA'nın ona özel bir kader belirlemesidir—20 milyar dolar harcayarak satın aldıkları Groq çipini (LPU).
Son satır, üst metinden tekrarlayan parçaları doğrudan arayarak kopyalayan, eğitimsiz n-gram tablo yöntemi olup, yalnızca büyük miktarlarda kopyalama-yapıştırma gerektiren sert senaryolar için uygundur.
Teknolojik ilerlemenin gerçek temsilcisi, ortadaki dört satırdır.

İkinci satır: EAGLE-3.
Pekin Üniversitesi Yuhui Li ve Waterloo Üniversitesi Hongyang Zhang gibi kişilerden oluşan ekip.
ICML ve EMNLP'den NeurIPS'e kadar yol alarak, üç yıl içinde üç nesil geliştirdi ve "harf harf aşağı doğru tahmin etme" adlı seri eski yöntemi fiziksel sınıra kadar getirdi.
Bu, eski dönemde bu alanda kesin bir liderdi, ancak NVIDIA'nın yeni listesinde nedeni çok kısa olan bir "referans pozisyonuna" itildi: kabul edilen uzunluk, son gelenler tarafından aşıldı.
Üçüncü satır: MTP (Çoklu Token Tahmini).
Düşünce, 2024'te Meta tarafından ilk kez ortaya atıldı, ancak bunu büyük dil modelleri çıkarımı için standart hale getiren, DeepSeek -V3.
NVIDIA, ona çok yüksek puan veriyor — GPU'lar üzerindeki büyük modeller için en iyi seçim. Temel nokta, bu çözümün ön eğitim aşamasında ana modele bağlı olarak eğitilmesidir.
DFlash. 6 kat zararsız hız kazandıran güçlü oyuncu.
Üç yazar: Jian Chen, Yesheng Liang, Zhijian Liu. Bu yöntem, EAGLE ve MTP'nin "bir harf bir harf tahmin etme" serisi yaklaşımını tamamen bırakarak, yayılma modellerinden ilham alır ve tek bir ileri hesaplama ile doğrudan 7 Token'lik tahmin dizisini üretir, payda (zaman) değerini maksimum düzeyde azaltır.
Ayrıca, danışman öğretim üyesi Zhijian Liu, UCSD'de yardımcı doçent olmanın yanı sıra NVIDIA Araştırma Enstitüsü'nde araştırmacı bilim insanıdır.
Beşinci satır: DSpark. DeepSeek ve Pekin Üniversitesi'nin 24 kişilik ortak ekibi tarafından geliştirildi.
DFlash'ın paralel mimarisi hızlı olsa da, bir ölümcül zayıflığı var: ilerledikçe tahminler daha az doğru oluyor. Molekülü (kabul edilen uzunluğu) zorla artırmak için DSpark, paralel temel üzerine çok hafif bir seri modül ekledi.
Gerçek test verileri çok net: Kabul edilen uzunluk, EAGLE-3'e göre yaklaşık %30 daha yüksek, DFlash'e göre %18 daha yüksek. DeepSeek V4 çevrimiçi üretim ortamında, MTP'ye kıyasla hız %60 ile %85 arasında daha hızlıdır.
Donanım sabiti, ters kilitli model mimarisi
Bu dört nesil teknoloji, sadece algoritmik zekâyla değil, hesaplama gücünü bu kadar zorlayabiliyor.
Birçok kişi, taslakta daha fazla tahmin yapmanın daha çok kazandırdığını düşünür, ancak bu tamamen çipin fiziksel kurallarını göz ardı eder.
Dikkat mekanizması, dekodlama süresinin büyük bir kısmını kapladığında, büyük modelin doğrulama aşamasında işlenmesi gereken toplam token sayısı 1+D'dir (1 gerçek girdi + D taslak tahmini).
Bu veri parçasını GPU'ya sağlamak için donanım, alt seviyede Query başlıklarını ve KV başlıklarını gruplar halinde birleştirir; her grubun dikkat çekirdek blok boyutu, GPU fiziksel matris sınırlarına (Tile Size, mevcut mimaride genellikle 128) sıkıca bağlıdır.
Bu, temel hizalama formülünü elde etti: G × (1 + D) ≤ 128
Biraz çıkarımla, NVIDIA kılavuzundaki nihai sabit kuralına ulaşılır:
D = 128G − 1
Burada G, dikkat grup sayısıdır (Query başları ve KV başları oranı).
Bu, modelinizin tasarımında dikkat gruplarını nasıl ayarladığınızın, GPU bloklarını tam olarak doldurmak için taslakta kaç harf tahmin edilmesi gerektiğini doğrudan belirlediği anlamına gelir.
Eğer G=8 ise, taslak tam olarak 15 tahmin yapar; eğer G=32 ise, sadece 3 tahmin yapabilirsiniz. Donanım sınırı geçemez; son Tile’ı sadece yarısını kullansanız bile, hesaplama gücü tam bir Tile olarak ücretlendirilir.
Daha önce, spekülasyon kodu, modelin eğitimi tamamlandıktan sonra mühendislik ekibinin dışarıdan eklediği bir hızlandırma paketiydi. Ancak şimdi, temel fiziksel yasalar size şunu söylüyor: bir donanım matrisinin sabiti, doğrudan model mimarisinin tasarım parametrelerine geri dönüştürülüyor.
Biliyorsunuz ki, nadiren bir çip üreticisi, bir alt seviye donanımın kısıt denklemlerini büyük bir modelin tasarım şemasına dahil eder.
Son
Model çalıştırma verimliliği yarışmasının odak noktası tamamen değişti.
Büyük parametreleri yığılma döneminin sona ermesiyle, artık gerçek zafer, alttaki silikon parçasının fiziksel sınırlarını daha iyi anlayan tarafından belirleniyor.
Bu yeni sahada, çip devi tarafından tersine çevrilen kurallarla, Çinli ekip zaten çözümün varsayılan cevabı haline geldi.
Güçlü bir hesaplama lideri olan NVIDIA, raflarda hangi algoritmanın yer aldığını seçmez.
Ancak bu, silikon çipin sınırlarını tamamen zorlayan en iyi çözümün kimin elinden çıktığı, beyaz kağıt üzerinde siyah harflerle net bir şekilde yazıyor.
Bu yazı WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI İlahiyatı
