Paper Google DeepMind Mengungkap Metode Recirculation Meningkatkan Kinerja Transformer

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Google DeepMind merilis makalah baru yang memperkenalkan metode bernama 'recirculation' untuk meningkatkan model transformer. Teknik ini mengirimkan aktivasi lapisan yang lebih dalam kembali ke lapisan-lapisan sebelumnya selama inferensi, meningkatkan kinerja tanpa perlu pelatihan ulang. Laporan berita on-chain menunjukkan bahwa metode ini mengurangi perplexity sebesar 23% dan meningkatkan akurasi penalaran sebesar 21% pada benchmark GSM8K. Namun, metode ini meningkatkan biaya pemrosesan awal. Media berita kripto menyoroti potensi peningkatan efisiensi AI dalam aplikasi blockchain.

Google DeepMind baru saja menerbitkan sebuah makalah yang mungkin secara diam-diam mengubah cara model bahasa memproses teks. Teknik ini, disebut “recirculation,” mengambil aktivasi dari lapisan yang lebih dalam pada transformer dan mencampurnya kembali ke lapisan yang lebih dangkal selama inferensi. Makalah ini, yang ditulis bersama peneliti dari University of Texas at Austin, menunjukkan bahwa koneksi berulang ringan ini memberikan peningkatan kinerja yang sebanding, dan dalam beberapa kasus melebihi, fine-tuning penuh. Tidak diperlukan pelatihan ulang. Tidak perlu operasi arsitektur besar.

Apa yang sebenarnya dilakukan oleh siklus ulang

Siklus ulang memecah aliran satu arah pada pemrosesan transformer. Sebagian kecil aktivasi yang dihitung pada lapisan lebih dalam model dikembalikan ke lapisan yang lebih dangkal selama generasi token. Model pada dasarnya mendapatkan putaran kedua untuk memahami representasi internalnya sendiri, memungkinkannya menyempurnakan apa yang disebut paper sebagai "keadaan keyakinan"nya dalam beberapa langkah.

Perbedaan utama dari pendekatan yang ada seperti chain-of-thought prompting atau arsitektur transformer berulang adalah bahwa recirculation tidak memerlukan token penalaran tambahan atau peningkatan kedalaman arsitektur. Ini adalah modifikasi tambahan terhadap cara inferensi berjalan, bukan perancangan ulang model itu sendiri.

Iklan

Angka-angka itu sulit diabaikan

Tim DeepMind menguji recirculation pada keluarga model Gemma3, termasuk varian dengan 1B, 4B, dan 12B parameter. Recirculation dasar memberikan pengurangan perplexity sekitar 8,5% di sembilan dataset pemodelan bahasa, dengan latensi tambahan nol selama generasi.

Re-sirkulasi adaptif didorong lebih jauh, mencapai penurunan rata-rata 23% dalam perplexity di sembilan dataset yang sama. Sebagai konteks, fine-tuning penuh hanya mampu mencapai penurunan 21,6%. Pada tugas penalaran, benchmark GSM8K melihat peningkatan relatif 21% dalam akurasi dengan re-sirkulasi adaptif.

Ada tradeoff. Proses prefill, tahap di mana model memproses prompt awal, menjadi serial di bawah recirculation, meningkatkan biaya awal dalam memproses prompt.

Mengapa komunitas AI memperhatikan

Makalah tersebut, yang terdaftar sebagai arXiv:2608.17981, telah berhasil direproduksi secara independen. Implementasi di GitHub telah mengonfirmasi peningkatan pada model di luar keluarga Gemma, termasuk Llama 3.2 1B. Diskusi telah menyebar di komunitas penelitian di X dan platform media teknologi Tiongkok.

Recirculation beroperasi pada tingkat aktivasi, di bawah permukaan generasi token, yang membuatnya komplementer daripada bersaing dengan teknik prompting seperti chain-of-thought reasoning, yang mengonsumsi token output dan menambah latensi.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.