Google DeepMind baru saja menerbitkan sebuah makalah yang mungkin secara diam-diam mengubah cara model bahasa memproses teks. Teknik ini, disebut “recirculation,” mengambil aktivasi dari lapisan yang lebih dalam pada transformer dan mencampurnya kembali ke lapisan yang lebih dangkal selama inferensi. Makalah ini, yang ditulis bersama peneliti dari University of Texas at Austin, menunjukkan bahwa koneksi berulang ringan ini memberikan peningkatan kinerja yang sebanding, dan dalam beberapa kasus melebihi, fine-tuning penuh. Tidak diperlukan pelatihan ulang. Tidak perlu operasi arsitektur besar.
Apa yang sebenarnya dilakukan oleh siklus ulang
Siklus ulang memecah aliran satu arah pada pemrosesan transformer. Sebagian kecil aktivasi yang dihitung pada lapisan lebih dalam model dikembalikan ke lapisan yang lebih dangkal selama generasi token. Model pada dasarnya mendapatkan putaran kedua untuk memahami representasi internalnya sendiri, memungkinkannya menyempurnakan apa yang disebut paper sebagai "keadaan keyakinan"nya dalam beberapa langkah.
Perbedaan utama dari pendekatan yang ada seperti chain-of-thought prompting atau arsitektur transformer berulang adalah bahwa recirculation tidak memerlukan token penalaran tambahan atau peningkatan kedalaman arsitektur. Ini adalah modifikasi tambahan terhadap cara inferensi berjalan, bukan perancangan ulang model itu sendiri.
Angka-angka itu sulit diabaikan
Tim DeepMind menguji recirculation pada keluarga model Gemma3, termasuk varian dengan 1B, 4B, dan 12B parameter. Recirculation dasar memberikan pengurangan perplexity sekitar 8,5% di sembilan dataset pemodelan bahasa, dengan latensi tambahan nol selama generasi.
Re-sirkulasi adaptif didorong lebih jauh, mencapai penurunan rata-rata 23% dalam perplexity di sembilan dataset yang sama. Sebagai konteks, fine-tuning penuh hanya mampu mencapai penurunan 21,6%. Pada tugas penalaran, benchmark GSM8K melihat peningkatan relatif 21% dalam akurasi dengan re-sirkulasi adaptif.
Ada tradeoff. Proses prefill, tahap di mana model memproses prompt awal, menjadi serial di bawah recirculation, meningkatkan biaya awal dalam memproses prompt.
Mengapa komunitas AI memperhatikan
Makalah tersebut, yang terdaftar sebagai arXiv:2608.17981, telah berhasil direproduksi secara independen. Implementasi di GitHub telah mengonfirmasi peningkatan pada model di luar keluarga Gemma, termasuk Llama 3.2 1B. Diskusi telah menyebar di komunitas penelitian di X dan platform media teknologi Tiongkok.
Recirculation beroperasi pada tingkat aktivasi, di bawah permukaan generasi token, yang membuatnya komplementer daripada bersaing dengan teknik prompting seperti chain-of-thought reasoning, yang mengonsumsi token output dan menambah latensi.
