Baru-baru ini, NVIDIA menerbitkan panduan rasmi untuk inferens model besar, tetapi semasa membacanya, ia seolah-olah menjadi kumpulan kertas kerja oleh pasukan Cina.
Perkara ini adalah seperti berikut.
Pada 2 September, sebuah artikel panjang berjudul "Menggunakan Spekulasi untuk Mendedah Reka Bentuk Kolaboratif Model AI" telah dilancarkan di blog teknologi NVIDIA.
Inti artikel ialah satu jadual pemilihan, yang memaparkan enam kaedah akselerasi inferens paling utama semasa ini secara bersebelahan, serta mengupas habis kos latihan dan skenario yang sesuai.

Nilainya terletak pada kenyataan bahawa pemimpin cip ini sangat jarang secara rasmi menulis garis panduan tentang "bagaimana model harus direka untuk menyesuaikan dengan had fizikal peranti".
Sementara mereka melihat sekeliling untuk mencari penyelesaian terbaik yang mampu menari di sempadan silikon, pendekatan utama dalam panduan itu hampir kesemuanya dipimpin oleh pasukan Cina.
Ini sudah melampaui lingkup ulasan algoritma biasa. Apa rahasia besar yang diungkapkan oleh tabel ini? Mari kita uraikan baris demi baris.
Perdagangan hampir pasti untung: Apa yang sedang dilakukan Speculation Decoder
Untuk memahami jadual ini, anda perlu terlebih dahulu memahami apa itu "spekulasi dekod".
Model besar mengeluarkan perkataan satu per satu. Setiap kali mengeluarkan satu perkataan, parameter berhampiran ratusan GB perlu berjalan penuh dalam memori GPU. Sebenarnya, sebahagian besar masa, kuasa pengiraan hanya menunggu memori memindahkan data.
Penyelesaian untuk "Spekulasi Terkod" sangat ringkas dan kasar—
Gunakan model kecil yang ringan terlebih dahulu untuk pra-prediksi, tebak 7 aksara sekaligus; kemudian model besar mengesahkan ketujuh-tujuh aksara itu sekaligus.
Mengesahkan tujuh huruf dan menulis sendiri satu huruf mengambil masa yang hampir sama, kerana beratnya tetap perlu dipindahkan semuanya.
Yang teka betul terus terima, yang teka salah mulakan semula dari titik putus. Kerana model besar hanya menerima perkataan yang sebenarnya boleh ia tulis, maka output akhir tidak perlu ubah sebarang tanda baca. Ini dipanggil “percepatan tanpa kehilangan data”.

Dalam permainan ini, semua pemerasan daya pengiraan berpusat pada satu formula jangkaan matematik utama:
Speedup = 𝔼[L] × TtargetTdraft + Tverify
Numerator is the expected value 𝔼[L], representing the expected accepted length (on average, how many characters the large model selects per round).
Penyebut adalah kos tambahan yang anda keluarkan, iaitu masa yang diambil oleh model kecil untuk membuat ramalan (Tdraft) ditambah dengan masa pengesahan akhir oleh model besar (Tverify).
Untuk meningkatkan speedup secara drastik, hanya ada dua cara: either naikkan pembilang (tebak lebih tepat), atau tekankan penyebutnya hingga maksimum (tebak lebih cepat).
Menginjak bahu pesaing, mencipta evolusi generasi keempat
Dengan mengikuti jadual NVIDIA dari atas ke bawah, anda akan melihat garis utama pertarungan yang jelas.
Baris pertama adalah "model draf luaran" paling lama, yang memerlukan pelatihan model kecil tersendiri sebagai pembantu.
NVIDIA secara langsung menunjukkan bilangan harga tinggi: melatih dari awal memerlukan penggunaan 1T hingga 10T token, dengan kos yang sangat tinggi.
Namun ia masih berada di senarai kerana NVIDIA telah menetapkan nasib khusus untuknya—chip Groq (LPU) yang mereka beli sebanyak US$20 bilion.
Baris terakhir adalah kaedah carian n-gram tanpa latihan, yang bergantung pada pencarian keras fragmen berulang dari teks sebelumnya untuk disalin terus, sesuai hanya untuk situasi kaku yang memerlukan salin-tempel dalam jumlah besar.
Empat baris di tengah itulah yang benar-benar mewakili evolusi teknologi.

Baris kedua: EAGLE-3.
Dari pasukan Yuhui Li dari Universiti Peking, Hongyang Zhang dari Universiti Waterloo, dll.
Dari ICML dan EMNLP hingga NeurIPS, tiga generasi berturut-turut dalam tiga tahun, mendorong jalan lama "menebak perkata demi perkata" hingga ke hadapan fizikalnya.
Ia pernah menjadi penguasa mutlak dalam bidang ini, tetapi dalam senarai baharu NVIDIA, ia dipindahkan ke kedudukan「rujukan」dengan sebab yang sangat ringkas: panjang penerimaan telah dilampaui oleh gelombang selepasnya.
Baris ketiga: MTP (Multi-Token Prediction).
Walaupun idea ini diperkenalkan pertama kali oleh Meta pada tahun 2024, ia benar-benar dijadikan piawaian inferens model besar oleh DeepSeek -V3.
NVIDIA memberikan penilaian yang sangat tinggi kepadanya—pilihan terbaik untuk model besar di GPU. Intinya ialah, solusi ini perlu dilatih bersama dengan model utama sejak tahap pra-pelatihan.
Baris keempat: DFlash. Pemain tangguh yang mengejar percepatan 6 kali tanpa kerugian.
Tiga penulis: Jian Chen, Yesheng Liang, Zhijian Liu. Ia sepenuhnya meninggalkan pendekatan siri seperti EAGLE dan MTP yang menebak satu perkataan demi satu perkataan, sebaliknya mengambil inspirasi daripada model penyebaran, menghasilkan urutan ramalan 7 Token secara serentak dalam satu pengiraan maju, serta memampatkan penyebut (masa yang diambil) sehingga maksimum.
Secara sampingan, pensyarah pembimbing Zhijian Liu ialah pensyarah asisten di UCSD, tetapi beliau juga seorang saintis penyelidik di Institut NVIDIA.
Baris kelima: DSpark. Dikendalikan oleh pasukan 24 orang gabungan DeepSeek dan Universiti Peking.
Walaupun arsitektur paralel DFlash cepat, ia mempunyai kelemahan maut: semakin jauh tekaan, semakin tidak tepat. Untuk memaksa meningkatkan molekul (panjang penerimaan), DSpark memasang modul siri yang sangat ringan di atas asas paralel.
Data ujian sebenar sangat jelas: panjang penerimaan meningkat hampir 30% berbanding EAGLE-3 dan 18% berbanding DFlash. Di DeepSeek Dalam persekitaran pengeluaran dalam talian V4, kelajuan adalah 60% hingga 85% lebih pantas berbanding MTP.
Hardware constants, reverse lock-in model architecture
Keempat-empat generasi teknologi ini mampu memeras daya pengiraan hingga ke tahap ini, bukan semata-mata kerana kecerdikan algoritma.
Banyak orang menganggap semakin banyak tekaan dalam draf, semakin banyak keuntungan yang diperoleh, tetapi ini sama sekali mengabaikan peraturan fizikal cip silikon.
Apabila mekanisme perhatian mengambil bahagian terbesar masa dekod, jumlah token keseluruhan yang perlu diproses dalam fasa pengesahan model besar ialah 1+D (1 input sebenar + D ramalan draf).
Untuk memberikan data ini kepada GPU, peranti keras akan mengumpulkan kepala Query dan kepala KV pada peringkat bawah, dan saiz blok perhatian setiap kumpulan mesti dipatuhi secara ketat mengikut sempadan matriks fizikal GPU (Tile Size, biasanya 128 pada arsitektur semasa).
Ini mendapat formula penyelarasan asas: G × (1 + D) ≤ 128
Dengan sedikit penarikan kesimpulan, didapati prinsip pemalar utama dalam panduan NVIDIA:
D = 128G − 1
Di mana G ialah bilangan kumpulan perhatian (nisbah kepala Query dan kepala KV).
Ini bermakna, bagaimana model anda mengumpulkan perhatian pada awal reka bentuknya secara langsung menentukan berapa banyak huruf yang perlu diteka oleh draf agar blok GPU diisi dengan sempurna.
Jika G=8, anda boleh menebak tepat 15 draf; jika G=32, anda hanya boleh menebak 3. Peranti keras tidak boleh melintasi sempadan, walaupun anda hanya menggunakan separuh blok terakhir, kuasa pengiraan tetap dikenakan bayaran penuh untuk setiap blok.
Sebelum ini, spekulasi dekod adalah pakej pecutan yang ditambah oleh pasukan kejuruteraan selepas model dilatih dan dilancarkan. Tetapi sekarang, hukum fizikal asas memberitahu anda: pemalar matriks peranti secara langsung diubah menjadi parameter reka bentuk model.
Dalam ingatan kami, jarang ada pembuat cip yang melakukan ini—memasukkan persamaan pembatas peranti keras dasar ke dalam reka bentuk model besar.
Penutup
Fokus pertandingan kecekapan model telah berubah sepenuhnya.
Zaman menumpuk parameter besar-besaran sedang berakhir; kini, penentu kejayaan sebenar ialah siapa yang lebih memahami had fizikal cip silikon di bawah kaki mereka.
Di medan permainan baru yang ditetapkan semula oleh raksasa cip, pasukan Cina telah secara diam-diam menjadi jawapan lalai untuk memecahkan kebuntuan.
Pemain utama dalam kekuatan pengiraan seperti NVIDIA pasti tidak akan memilih algoritma mana yang dipaparkan di rak.
Tetapi siapa sebenarnya yang menciptakan penyelesaian optimal yang memaksimakan batas keping silikon ini, semuanya tertulis dengan jelas di atas kertas putih.
Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan", penulis: ASI Revelation
