Google DeepMind baru saja menerbitkan sebuah kertas kerja yang mungkin secara diam-diam mengubah cara model bahasa memproses teks. Teknik ini, dipanggil “recirculation”, mengambil aktivasi dari lapisan yang lebih dalam pada transformer dan mencampurkannya semula ke lapisan yang lebih cetek semasa inferens. Kertas kerja ini, yang ditulis bersama penyelidik dari Universiti Texas di Austin, menunjukkan bahawa sambungan berulang ringan ini memberikan peningkatan prestasi yang sebanding, dan dalam kes tertentu melebihi, penyesuaian penuh. Tiada keperluan untuk melatih semula. Tiada pembedahan arsitektur besar-besaran.
Apa yang sebenarnya dilakukan oleh recirculation
Pengulangan mengganggu aliran satu arah pemprosesan transformer. Sebahagian daripada aktivasi yang dikira dalam lapisan yang lebih dalam model dikembalikan semula ke lapisan yang lebih cetek semasa penghasilan token. Model pada dasarnya mendapat dua kali laluan untuk memahami representasi dalaman sendiri, membolehkannya menyempurnakan apa yang dipanggil sebagai "keadaan kepercayaan"nya dalam beberapa langkah.
Perbezaan utama berbanding pendekatan sedia ada seperti prompting rantai pemikiran atau arsitektur transformer berulang ialah bahawa recirculation tidak memerlukan token penalaran tambahan atau kedalaman arsitektur yang ditambah. Ia adalah modifikasi tambahan terhadap cara inferens dijalankan, bukan reka semula model itu sendiri.
Nombor-nombor itu sukar untuk diabaikan
Pasukan DeepMind menguji kitar semula di seluruh keluarga model Gemma3, termasuk varian parameter 1B, 4B, dan 12B. Kitar semula asas memberikan pengurangan kira-kira 8.5% dalam perplexity di sembilan set data pemodelan bahasa, dengan latensi tambahan sifar semasa penghasilan.
Pengulangan adaptif didorong lebih jauh, mencapai penurunan rata-rata 23% dalam perplexity di kesembilan set data yang sama. Sebagai konteks, fine-tuning penuh hanya mampu mencapai penurunan 21,6%. Pada tugas penalaran, tolok ukur GSM8K melihat peningkatan relatif 21% dalam ketepatan dengan pengulangan adaptif.
Terdapat kompromi. Pemprosesan pra-isian, peringkat di mana model mengolah soalan awal, menjadi siri semasa pengulangan, meningkatkan kos awal pemprosesan soalan.
Mengapa komuniti AI memberi perhatian
Kertas kerja ini, disenaraikan sebagai arXiv:2608.17981, telah berjaya diterbitkan semula secara berasingan. Pelaksanaan di GitHub telah mengesahkan keuntungan pada model di luar keluarga Gemma, termasuk Llama 3.2 1B. Perbincangan telah tersebar di kalangan komuniti penyelidikan di X dan platform media teknologi Cina.
Pengulangan beroperasi pada aras pengaktifan, di bawah permukaan penghasilan token, yang menjadikannya pelengkap kepada teknik pemicuan seperti penarikan pemikiran berantai, yang menghabiskan token output dan menambah latensi.
