Membuat sesuatu menjadi lebih kecil dan lebih baik pada masa yang sama kelihatan seperti melanggar fizik asas. Tetapi penyelidik di Universiti Edinburgh, bekerjasama dengan NVIDIA, telah berjaya melakukannya dengan model bahasa besar. Teknik mereka, dipanggil Dynamic Memory Sparsification (DMS), mengkompresi satu komponen penting infrastruktur AI sebanyak 8x sambil membuat model tersebut mencapai skor lebih tinggi pada tolok uji yang sukar.
Jika model AI boleh berjalan sama baik, atau lebih baik, dengan sebahagian kecil memori, pintu terbuka untuk melaksanakan kemampuan penalaran serius pada peranti yang sekarang tidak mampu menanganinya, termasuk peranti yang dipakai, peranti rumah pintar, dan peranti tepi.
Bagaimana DMS sebenarnya berfungsi
Untuk memahami terobosan ini, anda perlu mengetahui tentang cache nilai-kunci (KV). Semasa model AI berfikir melalui satu masalah, ia menyimpan keputusan sementara dalam cache ini, pada dasarnya memori kerja yang membolehkan model mengikuti proses pemikirannya sendiri. Semakin panjang dan kompleks rantai penalaran, semakin besar cache itu bertambah, dan semakin banyak sumber komputasi yang diperlukan.
DMS menggunakan skalpel untuk proses ini. Alih-alih menyimpan semua token dalam cache, ia secara selektif mengekalkan hanya token yang paling penting dan membuang yang lain. Hasilnya, cache KV dikompres menjadi satu-lapan saiz asalnya. Dengan menghapus gangguan, model dapat meneroka laluan penalaran yang lebih dalam dan lebih rumit dalam anggaran pengiraan yang sama.
Keputusan tolok ukur
Pada AIME 24, ujian kelayakan olimpiad matematik, model terkompresi yang menggunakan DMS mendapat purata 12 mata lebih tinggi berbanding versi tidak terkompresi.
Di GPQA Diamond, satu tolok ukur yang dibina daripada masalah sains peringkat ijazah dalam fizik, kimia, dan biologi, model yang dikompresi DMS mendapat skor lebih tinggi sebanyak 8 mata purata.
Di LiveCode Bench, yang menguji kemampuan pengaturcaraan praktikal, model yang dimampatkan mendapat 10 mata lebih tinggi berbanding versi penuh-cache mereka semasa membaca jumlah data cache KV yang sama.
Penyelidik utama Dr. Edoardo Ponti merumuskan manfaat ganda dengan ringkas.
Model boleh berfikir lebih pantas tetapi dengan kualiti yang sama.
Dalam jendela masa yang tetap, LLM yang menggunakan DMS boleh meneroka lebih banyak benang penaakulan dan sampai kepada kesimpulan yang lebih kuat.
Tren yang lebih panjang, mempercepat
Bidang AI telah mengejar kecekapan model sejak pertengahan 2010-an, apabila teknik seperti distilasi pengetahuan, pemangkasan, dan kuantisasi mula membuktikan bahawa model yang lebih kecil boleh bersaing dengan model yang lebih besar dalam tugas-tugas tertentu. Apa yang DMS tambahkan kepada garis keturunan ini ialah fokus pada memori masa inferens, sumber yang digunakan bukan semasa model sedang dilatih, tetapi semasa ia sebenarnya digunakan. Mampatkan memori inferens sebanyak 8x bermakna setiap pelaksanaan menjadi jauh lebih murah untuk dijalankan.
Penyelidikan ini telah dipaparkan di konferens NeurIPS dan diterangkan secara terperinci dalam kertas bertajuk “Inference-Time Hyper-Scaling with KV Cache Compression.” Penilaian telah dijalankan menggunakan model Llama dan Qwen.
