Google DeepMind Makalesi, Geri Döngü Yönteminin Transformer Performansını Artırdığını Açıklıyor

iconCryptoBriefing
Paylaş
AI summary iconÖzet
Google DeepMind, transformer modellerini geliştirmek için 'recirculation' adlı bir yöntem tanıtan yeni bir makale yayınladı. Bu teknik, eğitimi yeniden yapmadan çıkarım sırasında daha derin katman aktivasyonlarını daha erken katmanlara geri gönderiyor. Zincir üzerindeki haberler, yöntemin GSM8K benchmark'ında perplexity'yi %23 azalttığını ve muhakeme doğruluğunu %21 artırdığını rapor ediyor. Ancak ilk işlem maliyetlerini artırıyor. Kripto haber siteleri, blok zinciri uygulamalarında AI verimliliği kazanımları için bu yöntemin potansiyelini vurguluyor.

Google DeepMind, dil modellerinin metin işleme şeklini sessizce değiştirebilecek bir makale yayınladı. "Yeniden dolaşım" adı verilen bu teknik, bir transformerın daha derin katmanlarından gelen aktivasyonları, çıkarım sırasında daha yüzeysel katmanlara geri karıştırıyor. Texas Üniversitesi, Austin'den araştırmacılarla birlikte yazılan makale, bu hafif tekrarlı bağlantının, tam ince ayarla eşit ve bazı durumlarda onu aşan performans kazanımları sağladığını gösteriyor. Yeniden eğitme gerekmiyor. Büyük mimari müdahale gerekmiyor.

Gerçekten ne yapar bu yeniden dolaşım

Yeniden dolaşım, transformer işleminin tek yönlü akışını bozar. Modelin daha derin katmanlarında hesaplanan aktivasyonların bir kısmı, token üretimi sırasında daha yüzeysel katmanlara geri beslenir. Model, kendi dahili temsillerini anlamak için neredeyse ikinci bir geçiş yapar ve bu, makalede “inancı durumları” olarak adlandırılan şeyleri birden fazla adımda iyileştirmesine olanak tanır.

Var olan yaklaşımlarla, örneğin zincir-düşünce teşviklemesi veya döngüsel dönüşüm mimarileriyle temel fark, yeniden dolaştırmanın ek akıl yürütme belirteçleri veya ek mimari derinlik gerektirmemesidir. Bu, modelin kendisini yeniden tasarlamak yerine, çıkarımın nasıl çalıştığını değiştiren bir eklentidir.

Reklam

Sayılar göz ardı edilemez

DeepMind ekibi, 1B, 4B ve 12B parametreli varyantları da dahil olmak üzere Gemma3 model ailesi boyunca geri döngüyü test etti. Temel geri döngü, dokuz dil modelleme veri seti boyunca yaklaşık %8,5lik bir perplexity azalması sağladı ve üretirken ek gecikme olmadı.

Adaptif geri döngü, aynı dokuz veri kümesi boyunca karmaşıklıkta 23% ortalama azalma sağladı. Bağlam olarak, tam ince ayar yalnızca 21,6% azalma sağladı. Akıl yürütme görevlerinde, GSM8K benchmark'ı adaptif geri döngü ile %21 nispi doğruluk artışı yaşadı.

Bir uzlaşım vardır. Modelin ilk isteği işlemesi aşaması olan ön doldurma, döngüsel işleme altında serileşir ve bir isteğin işlenmesinin başlangıç maliyetini artırır.

Neden yapay zeka topluluğu dikkatli izliyor

arXiv:2608.17981 olarak listelenen makale, bağımsız olarak tekrarlanmıştır. GitHub uygulamaları, Gemma ailesinin dışında kalan modellerde, Llama 3.2 1B dahil olmak üzere kazançları doğrulamıştır. Tartışmalar, X üzerinde ve Çinli teknoloji medya platformlarında araştırma toplulukları arasında yayılmıştır.

Yeniden dolaşım, etkinleştirme seviyesinde çalışır ve zincirleme akıl yürütme gibi çıktı token'ları tüketen ve gecikme ekleyen teşvik tekniklerine rekabetçi değil, tamamlayıcıdır.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.