Kertas Google DeepMind mengungkap kaedah resirkulasi meningkatkan prestasi Transformer

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
Google DeepMind telah menerbitkan kertas kerja baru yang memperkenalkan kaedah bernama 'recirculation' untuk meningkatkan model transformer. Teknik ini menghantar aktivasi lapisan yang lebih dalam kembali ke lapisan awal semasa inferens, meningkatkan prestasi tanpa perlu latihan semula. Laporan berita di blok rantai menunjukkan kaedah ini mengurangkan perplexity sebanyak 23% dan meningkatkan ketepatan penaakulan sebanyak 21% pada tolok GSM8K. Namun, ia meningkatkan kos pemprosesan awal. Laporan kripto menekankan potensi keuntungan kecekapan AI dalam aplikasi blok rantai.

Google DeepMind baru saja menerbitkan sebuah kertas kerja yang mungkin secara diam-diam mengubah cara model bahasa memproses teks. Teknik ini, dipanggil “recirculation”, mengambil aktivasi dari lapisan yang lebih dalam pada transformer dan mencampurkannya semula ke lapisan yang lebih cetek semasa inferens. Kertas kerja ini, yang ditulis bersama penyelidik dari Universiti Texas di Austin, menunjukkan bahawa sambungan berulang ringan ini memberikan peningkatan prestasi yang sebanding, dan dalam kes tertentu melebihi, penyesuaian penuh. Tiada keperluan untuk melatih semula. Tiada pembedahan arsitektur besar-besaran.

Apa yang sebenarnya dilakukan oleh recirculation

Pengulangan mengganggu aliran satu arah pemprosesan transformer. Sebahagian daripada aktivasi yang dikira dalam lapisan yang lebih dalam model dikembalikan semula ke lapisan yang lebih cetek semasa penghasilan token. Model pada dasarnya mendapat dua kali laluan untuk memahami representasi dalaman sendiri, membolehkannya menyempurnakan apa yang dipanggil sebagai "keadaan kepercayaan"nya dalam beberapa langkah.

Perbezaan utama berbanding pendekatan sedia ada seperti prompting rantai pemikiran atau arsitektur transformer berulang ialah bahawa recirculation tidak memerlukan token penalaran tambahan atau kedalaman arsitektur yang ditambah. Ia adalah modifikasi tambahan terhadap cara inferens dijalankan, bukan reka semula model itu sendiri.

Iklan

Nombor-nombor itu sukar untuk diabaikan

Pasukan DeepMind menguji kitar semula di seluruh keluarga model Gemma3, termasuk varian parameter 1B, 4B, dan 12B. Kitar semula asas memberikan pengurangan kira-kira 8.5% dalam perplexity di sembilan set data pemodelan bahasa, dengan latensi tambahan sifar semasa penghasilan.

Pengulangan adaptif didorong lebih jauh, mencapai penurunan rata-rata 23% dalam perplexity di kesembilan set data yang sama. Sebagai konteks, fine-tuning penuh hanya mampu mencapai penurunan 21,6%. Pada tugas penalaran, tolok ukur GSM8K melihat peningkatan relatif 21% dalam ketepatan dengan pengulangan adaptif.

Terdapat kompromi. Pemprosesan pra-isian, peringkat di mana model mengolah soalan awal, menjadi siri semasa pengulangan, meningkatkan kos awal pemprosesan soalan.

Mengapa komuniti AI memberi perhatian

Kertas kerja ini, disenaraikan sebagai arXiv:2608.17981, telah berjaya diterbitkan semula secara berasingan. Pelaksanaan di GitHub telah mengesahkan keuntungan pada model di luar keluarga Gemma, termasuk Llama 3.2 1B. Perbincangan telah tersebar di kalangan komuniti penyelidikan di X dan platform media teknologi Cina.

Pengulangan beroperasi pada aras pengaktifan, di bawah permukaan penghasilan token, yang menjadikannya pelengkap kepada teknik pemicuan seperti penarikan pemikiran berantai, yang menghabiskan token output dan menambah latensi.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.