NVIDIA Menerbitkan Panduan Inferens AI, Peningkatan Kelajuan 6x Tanpa Kehilangan Dipimpin oleh Pasukan Cina

icon MarsBit
Kongsi
AI summary iconRingkasan
NVIDIA menerbitkan panduan inferens AI pada 2 September, yang memperkenalkan enam kaedah akselerasi. Pasukan Cina memimpin inovasi utama seperti speculative decoding dan DFlash, yang menawarkan peningkatan kelajuan tanpa kehilangan data sebanyak 6x. Indeks ketakutan dan keserakahan tetap tinggi sementara altcoin yang perlu diawasi mendapat perhatian. Had peranti seperti saiz tile GPU membentuk reka bentuk model. Kaedah MTP DeepSeek-V3 dan teknik lain ditekankan untuk kecekapan. Panduan ini menerangkan kos dan kes penggunaan setiap pendekatan.

Baru-baru ini, NVIDIA menerbitkan panduan rasmi untuk inferens model besar, tetapi semasa membacanya, ia seolah-olah menjadi kumpulan kertas kerja oleh pasukan Cina.

Perkara ini adalah seperti berikut.

Pada 2 September, sebuah artikel panjang berjudul "Menggunakan Spekulasi untuk Mendedah Reka Bentuk Kolaboratif Model AI" telah dilancarkan di blog teknologi NVIDIA.

Inti artikel ialah satu jadual pemilihan, yang memaparkan enam kaedah akselerasi inferens paling utama semasa ini secara bersebelahan, serta mengupas habis kos latihan dan skenario yang sesuai.

DeepSeek

Nilainya terletak pada kenyataan bahawa pemimpin cip ini sangat jarang secara rasmi menulis garis panduan tentang "bagaimana model harus direka untuk menyesuaikan dengan had fizikal peranti".

Sementara mereka melihat sekeliling untuk mencari penyelesaian terbaik yang mampu menari di sempadan silikon, pendekatan utama dalam panduan itu hampir kesemuanya dipimpin oleh pasukan Cina.

Ini sudah melampaui lingkup ulasan algoritma biasa. Apa rahasia besar yang diungkapkan oleh tabel ini? Mari kita uraikan baris demi baris.

Perdagangan hampir pasti untung: Apa yang sedang dilakukan Speculation Decoder

Untuk memahami jadual ini, anda perlu terlebih dahulu memahami apa itu "spekulasi dekod".

Model besar mengeluarkan perkataan satu per satu. Setiap kali mengeluarkan satu perkataan, parameter berhampiran ratusan GB perlu berjalan penuh dalam memori GPU. Sebenarnya, sebahagian besar masa, kuasa pengiraan hanya menunggu memori memindahkan data.

Penyelesaian untuk "Spekulasi Terkod" sangat ringkas dan kasar—

Gunakan model kecil yang ringan terlebih dahulu untuk pra-prediksi, tebak 7 aksara sekaligus; kemudian model besar mengesahkan ketujuh-tujuh aksara itu sekaligus.

Mengesahkan tujuh huruf dan menulis sendiri satu huruf mengambil masa yang hampir sama, kerana beratnya tetap perlu dipindahkan semuanya.

Yang teka betul terus terima, yang teka salah mulakan semula dari titik putus. Kerana model besar hanya menerima perkataan yang sebenarnya boleh ia tulis, maka output akhir tidak perlu ubah sebarang tanda baca. Ini dipanggil “percepatan tanpa kehilangan data”.

DeepSeek

Dalam permainan ini, semua pemerasan daya pengiraan berpusat pada satu formula jangkaan matematik utama:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

Numerator is the expected value 𝔼[L], representing the expected accepted length (on average, how many characters the large model selects per round).

Penyebut adalah kos tambahan yang anda keluarkan, iaitu masa yang diambil oleh model kecil untuk membuat ramalan (Tdraft) ditambah dengan masa pengesahan akhir oleh model besar (Tverify).

Untuk meningkatkan speedup secara drastik, hanya ada dua cara: either naikkan pembilang (tebak lebih tepat), atau tekankan penyebutnya hingga maksimum (tebak lebih cepat).

Menginjak bahu pesaing, mencipta evolusi generasi keempat

Dengan mengikuti jadual NVIDIA dari atas ke bawah, anda akan melihat garis utama pertarungan yang jelas.

Baris pertama adalah "model draf luaran" paling lama, yang memerlukan pelatihan model kecil tersendiri sebagai pembantu.

NVIDIA secara langsung menunjukkan bilangan harga tinggi: melatih dari awal memerlukan penggunaan 1T hingga 10T token, dengan kos yang sangat tinggi.

Namun ia masih berada di senarai kerana NVIDIA telah menetapkan nasib khusus untuknya—chip Groq (LPU) yang mereka beli sebanyak US$20 bilion.

Baris terakhir adalah kaedah carian n-gram tanpa latihan, yang bergantung pada pencarian keras fragmen berulang dari teks sebelumnya untuk disalin terus, sesuai hanya untuk situasi kaku yang memerlukan salin-tempel dalam jumlah besar.

Empat baris di tengah itulah yang benar-benar mewakili evolusi teknologi.

DeepSeek

Baris kedua: EAGLE-3.

Dari pasukan Yuhui Li dari Universiti Peking, Hongyang Zhang dari Universiti Waterloo, dll.

Dari ICML dan EMNLP hingga NeurIPS, tiga generasi berturut-turut dalam tiga tahun, mendorong jalan lama "menebak perkata demi perkata" hingga ke hadapan fizikalnya.

Ia pernah menjadi penguasa mutlak dalam bidang ini, tetapi dalam senarai baharu NVIDIA, ia dipindahkan ke kedudukan「rujukan」dengan sebab yang sangat ringkas: panjang penerimaan telah dilampaui oleh gelombang selepasnya.

Baris ketiga: MTP (Multi-Token Prediction).

Walaupun idea ini diperkenalkan pertama kali oleh Meta pada tahun 2024, ia benar-benar dijadikan piawaian inferens model besar oleh DeepSeek -V3.

NVIDIA memberikan penilaian yang sangat tinggi kepadanya—pilihan terbaik untuk model besar di GPU. Intinya ialah, solusi ini perlu dilatih bersama dengan model utama sejak tahap pra-pelatihan.

Baris keempat: DFlash. Pemain tangguh yang mengejar percepatan 6 kali tanpa kerugian.

Tiga penulis: Jian Chen, Yesheng Liang, Zhijian Liu. Ia sepenuhnya meninggalkan pendekatan siri seperti EAGLE dan MTP yang menebak satu perkataan demi satu perkataan, sebaliknya mengambil inspirasi daripada model penyebaran, menghasilkan urutan ramalan 7 Token secara serentak dalam satu pengiraan maju, serta memampatkan penyebut (masa yang diambil) sehingga maksimum.

Secara sampingan, pensyarah pembimbing Zhijian Liu ialah pensyarah asisten di UCSD, tetapi beliau juga seorang saintis penyelidik di Institut NVIDIA.

Baris kelima: DSpark. Dikendalikan oleh pasukan 24 orang gabungan DeepSeek dan Universiti Peking.

Walaupun arsitektur paralel DFlash cepat, ia mempunyai kelemahan maut: semakin jauh tekaan, semakin tidak tepat. Untuk memaksa meningkatkan molekul (panjang penerimaan), DSpark memasang modul siri yang sangat ringan di atas asas paralel.

Data ujian sebenar sangat jelas: panjang penerimaan meningkat hampir 30% berbanding EAGLE-3 dan 18% berbanding DFlash. Di DeepSeek Dalam persekitaran pengeluaran dalam talian V4, kelajuan adalah 60% hingga 85% lebih pantas berbanding MTP.

Hardware constants, reverse lock-in model architecture

Keempat-empat generasi teknologi ini mampu memeras daya pengiraan hingga ke tahap ini, bukan semata-mata kerana kecerdikan algoritma.

Banyak orang menganggap semakin banyak tekaan dalam draf, semakin banyak keuntungan yang diperoleh, tetapi ini sama sekali mengabaikan peraturan fizikal cip silikon.

Apabila mekanisme perhatian mengambil bahagian terbesar masa dekod, jumlah token keseluruhan yang perlu diproses dalam fasa pengesahan model besar ialah 1+D (1 input sebenar + D ramalan draf).

Untuk memberikan data ini kepada GPU, peranti keras akan mengumpulkan kepala Query dan kepala KV pada peringkat bawah, dan saiz blok perhatian setiap kumpulan mesti dipatuhi secara ketat mengikut sempadan matriks fizikal GPU (Tile Size, biasanya 128 pada arsitektur semasa).

Ini mendapat formula penyelarasan asas: G × (1 + D) ≤ 128

Dengan sedikit penarikan kesimpulan, didapati prinsip pemalar utama dalam panduan NVIDIA:

D = 128G − 1

Di mana G ialah bilangan kumpulan perhatian (nisbah kepala Query dan kepala KV).

Ini bermakna, bagaimana model anda mengumpulkan perhatian pada awal reka bentuknya secara langsung menentukan berapa banyak huruf yang perlu diteka oleh draf agar blok GPU diisi dengan sempurna.

Jika G=8, anda boleh menebak tepat 15 draf; jika G=32, anda hanya boleh menebak 3. Peranti keras tidak boleh melintasi sempadan, walaupun anda hanya menggunakan separuh blok terakhir, kuasa pengiraan tetap dikenakan bayaran penuh untuk setiap blok.

Sebelum ini, spekulasi dekod adalah pakej pecutan yang ditambah oleh pasukan kejuruteraan selepas model dilatih dan dilancarkan. Tetapi sekarang, hukum fizikal asas memberitahu anda: pemalar matriks peranti secara langsung diubah menjadi parameter reka bentuk model.

Dalam ingatan kami, jarang ada pembuat cip yang melakukan ini—memasukkan persamaan pembatas peranti keras dasar ke dalam reka bentuk model besar.

Penutup

Fokus pertandingan kecekapan model telah berubah sepenuhnya.

Zaman menumpuk parameter besar-besaran sedang berakhir; kini, penentu kejayaan sebenar ialah siapa yang lebih memahami had fizikal cip silikon di bawah kaki mereka.

Di medan permainan baru yang ditetapkan semula oleh raksasa cip, pasukan Cina telah secara diam-diam menjadi jawapan lalai untuk memecahkan kebuntuan.

Pemain utama dalam kekuatan pengiraan seperti NVIDIA pasti tidak akan memilih algoritma mana yang dipaparkan di rak.

Tetapi siapa sebenarnya yang menciptakan penyelesaian optimal yang memaksimakan batas keping silikon ini, semuanya tertulis dengan jelas di atas kertas putih.

Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan", penulis: ASI Revelation

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.