Kasalukuyang ipinakilala ng Google DeepMind ang isang papel na maaaring magbago nang tahimik ang paraan kung paano nila ginagawa ng mga language model ang pagproseso ng teksto. Ang teknik, na tinatawag na “recirculation,” ay kumukuha ng activations mula sa mga mas malalim na layer ng isang transformer at iniuugnay ito muli sa mga mas maliit na layer habang nagaganap ang inference. Ipinakikita ng papel, na isinulat kasama ng mga mananaliksik mula sa University of Texas at Austin, na ang simpleng recurrent na koneksyong ito ay nagdadala ng pagtaas sa performance na katumbas, at sa ilang kaso ay hihigit pa sa buong fine-tuning. Walang kailangang i-retrain. Walang malaking pagbabago sa arkitektura.
Ano ang tunay na ginagawa ng recirculation
Ang recirculation ay nagbabreak sa isang-direksyon na paggalaw ng transformer processing. Isang bahagdan ng mga activations na kinalkula sa mas malalim na mga layer ng model ay binabalik sa mga mas maliit na layer habang ginagawa ang token generation. Sa praktika, nakakakuha ang model ng pangalawang pagkakataon na maunawaan ang sariling internal na mga representasyon, na nagpapahintulot sa kanya na paunlarin ang mga “belief states” na tinatawag ng papel sa loob ng maraming hakbang.
Ang pangunahing pagkakaiba sa mga umiiral na pamamaraan tulad ng chain-of-thought prompting o looped transformer architectures ay ang pag-recirculate ay hindi nangangailangan ng karagdagang reasoning tokens o dagdag na depth sa arkitektura. Ito ay isang bolt-on na pagbabago sa paraan ng pag-infer, hindi isang pag-redesign ng modelo mismo.
Mahirap iwasan ang mga numero
Sinubok ng koponan ng DeepMind ang recirculation sa buong pamilya ng Gemma3, kabilang ang mga bersyon na may 1B, 4B, at 12B na parameter. Ang basic recirculation ay nagdala ng halos 8.5% pagbaba sa perplexity sa siyam na dataset ng language modeling, na may zero dagdag na latency sa pag-generate.
Pinaglalabasan ang adaptive recirculation, na nakamit ang 23% na pagbawas sa mean perplexity sa mga parehong siyam na dataset. Para sa konteksto, ang full fine-tuning ay nakamit lamang ng 21.6% na pagbawas. Sa mga gawain sa pag-iisip, ang GSM8K benchmark ay nakakita ng 21% na pagtaas sa accuracy gamit ang adaptive recirculation.
May kompromiso. Ang prefill processing, ang tahap kung saan ang modelo ay sinusuri ang unang prompt, ay naging serial sa ilalim ng recirculation, na nagpapataas ng upfront cost sa pagproseso ng isang prompt.
Bakit pinapansin ng komunidad ng AI
Ang papel, na listahan bilang arXiv:2608.17981, ay nareproduksyon nang independiyente na. Ang mga implementasyon sa GitHub ay nagpatunay ng mga pagtaas sa mga modelo labas ng pamilya ng Gemma, kabilang ang Llama 3.2 1B. Ang mga diskusyon ay nagsalat sa mga komunidad ng pananaliksik sa X at mga platform ng Chinese tech media.
Ang recirculation ay gumagana sa antas ng pag-activate, sa ilalim ng surface ng pagbuo ng token, na nagiging komplemento kaysa kompetisyon sa mga teknik ng prompting tulad ng chain-of-thought reasoning, na naglalabas ng output tokens at nagdaragdag ng latency.
