NVIDIA Menerbitkan Panduan Inferensi AI, Peningkatan Kecepatan Tanpa Kehilangan Data Sebesar 6x Dipimpin oleh Tim Tiongkok

icon MarsBit
Bagikan
AI summary iconRingkasan
NVIDIA merilis panduan inferensi AI pada 2 September, yang menampilkan enam metode akselerasi. Tim Tiongkok memimpin inovasi kunci seperti speculative decoding dan DFlash, yang menawarkan percepatan tanpa kehilangan data hingga 6x. Indeks fear and greed tetap tinggi sementara altcoin yang perlu diwaspadai semakin populer. Batasan perangkat keras seperti ukuran tile GPU membentuk desain model. Metode MTP DeepSeek-V3 dan teknik lainnya ditonjolkan untuk efisiensi. Panduan ini merinci biaya dan kasus penggunaan untuk setiap pendekatan.

Baru-baru ini, NVIDIA merilis panduan resmi untuk inferensi model besar, tetapi saat membacanya, rasanya seperti membaca kumpulan paper dari tim Tiongkok.

Hal ini seperti ini.

Pada 2 September, blog teknologi NVIDIA merilis artikel panjang berjudul "Mendekode Kolaborasi Desain Model AI dengan Spekulasi".

Inti artikelnya adalah sebuah tabel pemilihan, yang memaparkan secara berurutan keenam solusi akselerasi inferensi paling populer saat ini, termasuk biaya pelatihan dan skenario yang sesuai, semuanya dijelaskan secara jelas.

DeepSeek

Nilainya terletak pada kenyataan bahwa ini adalah langka sekali sang raksasa chip secara resmi menuliskan "bagaimana model harus dirancang menyentuh batas fisik perangkat keras" sebagai sebuah spesifikasi.

Saat mereka melihat sekeliling mencari solusi optimal yang bisa menari di batas silikon, solusi utama dalam panduan tersebut hampir semuanya dipimpin oleh tim Tiongkok.

Ini sudah jauh melampaui tinjauan algoritmik biasa. Apa rahasia besar yang diungkapkan tabel ini? Mari kita uraikan baris demi baris.

Hampir pasti untung: Apa yang sedang dilakukan Speculation Decode

Untuk memahami tabel ini, Anda harus terlebih dahulu memahami apa itu "spekulasi dekode".

Model besar mengeluarkan kata satu per satu. Setiap kali mengeluarkan satu kata, ratusan GB parameter harus berjalan penuh di memori GPU. Sebenarnya, sebagian besar waktu, daya komputasi hanya menunggu memori memindahkan data.

Cara menyelesaikan "Spekulasi Terdekripsi" sangat sederhana dan langsung—

Gunakan model kecil yang ringan untuk prediksi awal, tebak 7 karakter sekaligus; kemudian model besar memverifikasi ketujuh karakter tersebut sekaligus.

Verifikasi tujuh karakter dan menulis satu karakter sendiri memakan waktu hampir sama, mengingat bobotnya tetap harus dipindahkan semuanya.

Yang tebak benar langsung terima, yang tebak salah mulai ulang dari titik putus. Karena model besar hanya menerima kata-kata yang memang biasa ia tulis, jadi output akhir tidak perlu mengubah tanda baca apa pun. Inilah yang disebut «akselerasi tanpa kerugian».

DeepSeek

Dalam permainan ini, semua eksploitasi daya komputasi berpusat pada rumus harapan matematis inti:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

The numerator is the expected value 𝔼[L], representing the expected accepted length (the average number of characters a large model can select per round).

Denominator adalah biaya tambahan yang Anda keluarkan, yaitu waktu yang dibutuhkan model kecil untuk membuat prediksi (Tdraft) ditambah waktu verifikasi akhir oleh model besar (Tverify).

Untuk membuat speedup melonjak, hanya ada dua cara: either meningkatkan pembilang (menebak lebih akurat), atau memampatkan penyebut secara ekstrem (menebak lebih cepat).

Menginjak bahu pesaing, menciptakan evolusi generasi keempat

Dengan mengikuti tabel NVIDIA dari atas ke bawah, Anda akan melihat garis utama persaingan yang jelas.

Baris pertama adalah "model draf eksternal" tertua, yang memerlukan pelatihan model kecil terpisah sebagai asisten.

NVIDIA langsung menunjukkan tagihan harga tinggi: pelatihan dari awal memerlukan 1T hingga 10T token, dengan biaya yang sangat tinggi.

Namun, ia tetap berada di daftar karena NVIDIA menetapkan tujuan khusus untuknya—chip Groq (LPU) yang mereka akuisisi senilai $20 miliar.

Baris terakhir adalah metode tabel pencarian n-gram tanpa pelatihan, yang hanya menyalin langsung fragmen berulang dari teks sebelumnya, cocok hanya untuk skenario kaku yang membutuhkan penyalinan tempel dalam jumlah besar.

Empat baris di tengahlah yang benar-benar mewakili evolusi teknologi.

DeepSeek

Baris kedua: EAGLE-3.

Dari tim Yuhui Li dari Peking University, Hongyang Zhang dari University of Waterloo, dll.

Dari ICML hingga EMNLP, lalu ke NeurIPS, dalam tiga tahun mengeluarkan tiga generasi, mendorong jalur lama "menebak kata demi kata secara sekuensial" hingga batas fisiknya.

It was once the absolute dominant force in this field, but in NVIDIA's new ranking, it has been pushed to the "reference position" for a reason as brief as this: its acceptance length has been surpassed by the next wave.

Baris ketiga: MTP (Multi-Token Prediction).

Meskipun ide ini pertama kali diperkenalkan oleh Meta pada tahun 2024, yang benar-benar menjadikannya standar baku dalam inferensi model besar adalah DeepSeek -V3.

NVIDIA memberikan evaluasi sangat tinggi—pilihan terbaik untuk model besar di GPU. Intinya adalah, solusi ini harus dilatih bersamaan dengan model utama sejak tahap pra-pelatihan.

Baris keempat: DFlash. Sosok tangguh yang meraih akselerasi 6x tanpa kerugian.

Tiga penulis: Jian Chen, Yesheng Liang, Zhijian Liu. Ini sepenuhnya meninggalkan pendekatan serial seperti EAGLE dan MTP yang menebak satu kata demi satu kata, dan beralih ke model diffusion, menghasilkan urutan prediksi 7 Token sekaligus dalam satu perhitungan forward, meminimalkan penyebut (waktu).

By the way, the advisor, Zhijian Liu, is an assistant professor at UCSD, but he is also a research scientist at NVIDIA Research.

Baris kelima: DSpark. Dikembangkan oleh tim 24 orang gabungan dari DeepSeek dan Universitas Peking.

Arsitektur paralel DFlash memang cepat, tetapi memiliki kelemahan mendasar: semakin ke belakang, perkiraannya semakin tidak akurat. Untuk secara paksa meningkatkan pembilang (panjang penerimaan), DSpark menambahkan modul serial yang sangat ringan di atas dasar paralel.

Data uji nyata sangat intuitif: panjang penerima meningkat hampir 30% dibandingkan EAGLE-3, dan 18% dibandingkan DFlash. Di DeepSeek Di lingkungan produksi online V4, kecepatannya 60% hingga 85% lebih cepat daripada MTP.

Hardware constants, reverse lock model architecture

Keempat generasi teknologi ini mampu mengekstraksi daya komputasi hingga sejauh ini, bukan hanya karena kecerdikan algoritmik.

Banyak orang mengira semakin banyak tebakan dalam satu draf, semakin besar keuntungannya, tetapi ini sama sekali mengabaikan aturan fisik silikon.

Ketika mekanisme perhatian mendominasi waktu dekode, total token yang perlu diproses selama tahap verifikasi model besar adalah 1+D (1 input nyata + D prediksi draf).

Untuk memberikan data ini ke GPU, perangkat keras akan mengelompokkan kepala Query dan kepala KV di tingkat bawah, dan ukuran blok perhatian setiap kelompok harus secara ketat dibatasi oleh batas matriks fisik GPU (Tile Size, biasanya 128 pada arsitektur saat ini).

Ini mendapatkan rumus penyelarasan dasar: G × (1 + D) ≤ 128

Dengan sedikit penalaran, diperoleh prinsip konstanta utama dalam panduan NVIDIA:

D = 128G − 1

Di mana G adalah jumlah grup perhatian (rasio kepala Query dan kepala KV).

Ini berarti bagaimana model Anda mengelompokkan perhatian sejak awal desainnya langsung menentukan berapa banyak karakter yang harus ditebak oleh draf agar blok GPU terisi sempurna.

Jika G=8, draf tepat menebak 15; jika G=32, hanya bisa menebak 3. Perangkat keras tidak bisa melewati batas, bahkan jika Anda hanya menggunakan setengah dari Tile terakhir, daya komputasi tetap dibebankan secara penuh.

Sebelumnya, speculative decoding adalah paket percepatan yang ditambahkan secara eksternal oleh tim teknik setelah model selesai dilatih. Tetapi sekarang, hukum fisika dasar memberi tahu Anda: konstanta dari matriks perangkat keras secara langsung dipantulkan kembali ke parameter desain arsitektur model.

Dalam ingatan kami, jarang ada produsen chip yang memasukkan persamaan kendala perangkat keras dasar ke dalam desain model besar seperti ini.

Penutup

Fokus perlombaan efisiensi pemrosesan model benar-benar berubah.

Era menumpuk parameter besar-besaran sedang berakhir; kini, penentu kemenangan sejati tergantung pada siapa yang lebih memahami batas fisik silikon di bawah kaki mereka.

Di medan baru yang diatur ulang oleh raksasa chip ini, tim Tiongkok telah secara diam-diam menjadi jawaban default untuk memecahkan kebuntuan.

Pemain utama komputasi seperti NVIDIA tentu tidak akan memilih algoritma mana yang ditampilkan di rak.

Tetapi solusi optimal yang mengekstraksi batas maksimal wafer silikon ini sebenarnya berasal dari siapa, tertulis jelas dalam hitam di atas putih.

Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.