Google DeepMind, dil modellerinin metin işleme şeklini sessizce değiştirebilecek bir makale yayınladı. "Yeniden dolaşım" adı verilen bu teknik, bir transformerın daha derin katmanlarından gelen aktivasyonları, çıkarım sırasında daha yüzeysel katmanlara geri karıştırıyor. Texas Üniversitesi, Austin'den araştırmacılarla birlikte yazılan makale, bu hafif tekrarlı bağlantının, tam ince ayarla eşit ve bazı durumlarda onu aşan performans kazanımları sağladığını gösteriyor. Yeniden eğitme gerekmiyor. Büyük mimari müdahale gerekmiyor.
Gerçekten ne yapar bu yeniden dolaşım
Yeniden dolaşım, transformer işleminin tek yönlü akışını bozar. Modelin daha derin katmanlarında hesaplanan aktivasyonların bir kısmı, token üretimi sırasında daha yüzeysel katmanlara geri beslenir. Model, kendi dahili temsillerini anlamak için neredeyse ikinci bir geçiş yapar ve bu, makalede “inancı durumları” olarak adlandırılan şeyleri birden fazla adımda iyileştirmesine olanak tanır.
Var olan yaklaşımlarla, örneğin zincir-düşünce teşviklemesi veya döngüsel dönüşüm mimarileriyle temel fark, yeniden dolaştırmanın ek akıl yürütme belirteçleri veya ek mimari derinlik gerektirmemesidir. Bu, modelin kendisini yeniden tasarlamak yerine, çıkarımın nasıl çalıştığını değiştiren bir eklentidir.
Sayılar göz ardı edilemez
DeepMind ekibi, 1B, 4B ve 12B parametreli varyantları da dahil olmak üzere Gemma3 model ailesi boyunca geri döngüyü test etti. Temel geri döngü, dokuz dil modelleme veri seti boyunca yaklaşık %8,5lik bir perplexity azalması sağladı ve üretirken ek gecikme olmadı.
Adaptif geri döngü, aynı dokuz veri kümesi boyunca karmaşıklıkta 23% ortalama azalma sağladı. Bağlam olarak, tam ince ayar yalnızca 21,6% azalma sağladı. Akıl yürütme görevlerinde, GSM8K benchmark'ı adaptif geri döngü ile %21 nispi doğruluk artışı yaşadı.
Bir uzlaşım vardır. Modelin ilk isteği işlemesi aşaması olan ön doldurma, döngüsel işleme altında serileşir ve bir isteğin işlenmesinin başlangıç maliyetini artırır.
Neden yapay zeka topluluğu dikkatli izliyor
arXiv:2608.17981 olarak listelenen makale, bağımsız olarak tekrarlanmıştır. GitHub uygulamaları, Gemma ailesinin dışında kalan modellerde, Llama 3.2 1B dahil olmak üzere kazançları doğrulamıştır. Tartışmalar, X üzerinde ve Çinli teknoloji medya platformlarında araştırma toplulukları arasında yayılmıştır.
Yeniden dolaşım, etkinleştirme seviyesinde çalışır ve zincirleme akıl yürütme gibi çıktı token'ları tüketen ve gecikme ekleyen teşvik tekniklerine rekabetçi değil, tamamlayıcıdır.
