Gürültü, Yarı-İzlenimli Öğrenmede Model Performansını İyileştirebilir

icon MarsBit
Paylaş
AI summary iconÖzet
ICML 2026'da yayınlanan 'Yarı-Üstünlü Gürültü Uyumlaştırma: Gürültü Alanından Bilgi Aktarımı' başlıklı yeni bir çalışma, rastgele gürültünün düşük etiketli senaryolarda model performansını artırabileceğini gösteriyor. Gürültü Uyumlaştırma Çerçevesi (NAF), gürültüden sınıf yapıları oluşturur ve bunları gerçek verilere aktararak CIFAR-10 ve ImageNet-1K gibi veri kümelerinde doğrulukları artırır. MiCA (AB Kripto Varlıklar Piyasaları Düzenlemesi) gelişmeleriyle birlikte, bu ilerlemeler, alım satım ve risk analizinde kullanılan tahmin modellerini iyileştirerek likiditeyi ve kripto piyasalarını güçlendirebilir.

Transfer learning'de "kaynak veri", mutlaka görüntü, metin veya ses olmak zorunda değildir.

Anlamsız, Gauss dağılımından rastgele örneklenen gürültü, modelin az sayıda etiketli veriyle daha iyi öğrenmesine yardımcı olabilir.

Bu çalışma, Yarı-İzlenceli Gürültü Uyumlaştırma (Semi-Supervised Noise Adaptation, SSNA) adını taşımaktadır ve makale ICML 2026'da yayınlanmıştır.

Bilgisayarla görme

SSNA ekibi, rastgele üretilen gürültüyü kullanarak ayırt edici bir sınıf yapısı oluşturup bu yapıyı gerçek hedef verilere aktararak az etiketli senaryolarda modelin öğrenme performansını artıran Gürültüye Uyumlu Çerçeve (Noise Adaptation Framework, NAF) önerdi.

Bilgisayarla görme

△NAF, gürültü alanını ve hedef alanını ortak bir temsil uzayına projekte eder ve kategori düzeyinde hizalar. Resim, makaleden alınmıştır.

Her kategoride yalnızca 4 etiketli örnek kullanılarak, ResNet-18 temel ağına dayalı NAF, CIFAR-10, CIFAR-100, DTD-47 ve Caltech-101 üzerindeki doğruluk oranlarını, yalnızca etiketli örneklerle eğitilen standart gözetimli öğrenme tabanı ERM (Deneysel Risk Minimizasyonu) ile karşılaştırıldığında sırasıyla %12,35, %7,61, %4,38 ve %2,74 artırıyor. Şu anda makalenin kaynak kodu açık kaynak haline getirilmiştir; ayrıntılar için makalenin sonuna bakın.

Gerçek kaynak alanını gürültüye dönüştürün

Geleneksel aktarım öğrenmesi genellikle etiketlenmiş zengin bir kaynak alan gerektirir. Ancak gerçek kaynak verileri her zaman kolayca elde edilebilir değildir. Gizlilik, gizlilik ve telif hakkı kısıtlamaları, kaynak alan verilerinin paylaşılmasını engelleyebilir. SSNA, bu öncülüğü ortadan kaldırmayı amaçlar: kaynak alan, gerçek örnekler yerine basit olasılık dağılımlarından üretilen gürültü ile değiştirilir.

İşlem oldukça basittir; hedef görev C adet sınıf içermektedir. Araştırma ekibi, her bir sınıf için öncelikle 1024 boyutlu bir uzayda rastgele bir ortalama vektörü örnekleme ve birim matrisi kovaryans olarak kullanarak C adet Gauss dağılımı oluşturur, ardından her dağılımdan 50 adet gürültü vektörü örnekleme yapar. Gürültü alanı, hedef alanı ile aynı sınıf indeks kümesini kullanır; her bir gürültü sınıfı önceden bir hedef sınıf indeksiyle eşlenir, ancak bu eşleme kendiliğinden bir anlam içermemektedir.

Buradaki numaraların kendilerinin bir anlamı yoktur. Gürültü sınıfı 0, doğası itibarıyla “kedi”yi temsil etmez; sadece eğitim başlamadan önce araştırmacılar bunu hedef alanın bir sınıfına sabitlemişlerdir. Gerçekten aktarılan, kedi veya köpeğin görsel bilgisi değil, gürültü alanındaki oluşturulan ayırt edici yapıdır.

Aynı kategorideki gürültüler bir araya getirilir, farklı kategorilerdeki gürültüler ayrılır. Bu yapı hedef alanla hizalandığında, gerçek hedef örnekleri için daha net bir sınırlama sağlar.

Az sayıda etiket hâlâ gerekli.

Gürültü, gerçek kaynak verilerini değiştirebilir, ancak hedef alan etiketlerini tamamen yerine geçiremez. Neden oldukça açık: gürültü başka bir uzaydan gelir ve sınıf numaraları insan tarafından atanmıştır; model, gürültü sınıfının 0'ın hangi gerçek sınıfa hizmet etmesi gerektiğini bilmek için az sayıda etiketli hedef örneğine ihtiyaç duyar.

CIFAR-100 üzerinde her sınıf için etiketli örnek sayısı sıfıra indirildiğinde, ERM ve NAF'nin doğruluk oranları sırasıyla yalnızca %0,97 ve %1,34 olup, rastgele seviyeye yakın düzeydedir. Az sayıda etiket sağlandığında, NAF sürekli olarak ERM'yi geçer.

Bu çalışmanın sonucu olarak, yarı gözetimli sınıflandırma ayarında, gerçek kaynak domainin pozitif transfer sağlamanın gerekli bir koşulu olmadığı ortaya çıkmıştır.

NAF, üç ana şey yaptı

Verilen genelleme sınırına dayanarak, NAF eğitim hedefini üç parçaya ayırır.

Az sayıda gerçek etiketi önceden öğrenin

Hedef alan kodlayıcı, gerçek örnekleri paylaşılan temsil uzayına haritalar; sınıflandırıcı, az sayıda etiketli örnek kullanarak çapraz entropi kaybını hesaplar. Bu bölüm, gürültülü sınıflar ile gerçek sınıflar arasında bir köprü kurmak için standart gözetimli öğrenme ile aynıdır.

Gürültüyü açık bir sınıf yapısı oluşturacak şekilde yeniden oluşturun

Gürültü projektörü, rastgele vektörleri aynı temsil uzayına haritalar; sınıflandırıcı ise bu gürültüleri önceden tanımlanmış kategori numaralarına göre tanımlar. Eğitimden sonra, aynı sınıfa ait gürültüler birbirine yaklaşır, farklı sınıflara ait gürültüler ise birbirinden ayrılır.

Son olarak ikisini de hizalayın

NAF, gürültü alanı ile hedef alanı arasındaki dağılım farkını da hesaplar. Dağılım hizalama modülü, belirli bir uygulamaya bağlı değildir; makale, çeşitli yöntemleri karşılaştırmıştır ve deneylerde deneysel olarak negatif alan benzerliği (Negative Domain Similarity, NDS) varsayılan mekanizma olarak seçilmiştir. NDS, iki alanın genel ortalamalarını ve her sınıfın ortalamalarını aynı anda karşılaştırır ve bunları birbirine yaklaştırmak için kosinüs benzerliğini kullanır. Etiketsiz hedef örneklerin sınıf ortalamaları, modelin ürettiği sahte etiketlerle yinelemeli olarak tahmin edilir.

Tam hedefler şu şekilde yazılabilir

Bilgisayarla görme

. Bunun içinde

Bilgisayarla görme

Etiketlenmiş gerçek küçük hedef örneklerinin sınıflandırılmasını yürütün.

Bilgisayarla görme

Gürültü sınıflandırmadan sorumlu

Bilgisayarla görme

Hedef alan ve gürültü alanının dağılım hizalamasını sorumlu tutar. Makalede verilen genelleme üst sınırı, bu üç unsura karşılık gelir: hedef alan deneyimsel hatası, gürültü alan deneyimsel hatası ve paylaşılan temsil uzayında iki alan arasındaki dağılım farkı.

CIFAR'dan ImageNet'e kadar gürültü her zaman avantaj sağlar

Ana deney, sekiz görsel veri kümesi ve bir metin sınıflandırma veri kümesini kapsar. ImageNet-1K dışındaki görsel görevlerde her sınıf için 4 etiketli örnek kullanılır; kalan eğitim örnekleri etiketsiz veri olarak kullanılır.

ResNet-18 üzerinde, NAF'in ERM'e kıyasla Top-1 artışı şunlardır: CIFAR-10 +12,35, CIFAR-100 +7,61, DTD-47 +4,38, Caltech-101 +2,74 puan.

Bilgisayarla görme

İnce ayrıntılı sınıflandırma aynı şekilde etkilidir. ResNet-18 kullanıldığında, NAF, CUB-200, Oxford Flowers-102 ve Stanford Cars-196 üzerinde ERM'e göre sırasıyla %8,94, %5,51 ve %7,74 artış sağlar.

Daha büyük bir ImageNet-1K veri setinde, araştırma ekibi her sınıf için 100 etiketli örnek tuttu. NAF, 37,10% doğruluk oranı ile ERM'den 0,99 puan daha yüksek çıktı. AG News-4 metin görevinde, BERT ile kullanılan NAF, ERM'in %78,64'üne kıyasla %82,82 doğruluk oranı sağlayarak 4,18 puan daha yüksek çıktı.

NAF, mevcut yarı-supervize yöntemlere doğrudan entegre edilebilir. Makale, NAF'yi UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM ve SA-FixMatch'e entegre ederek tümünde artış elde etmiştir. CIFAR-10 üzerindeki 20 tur eğitimin sonucu örneği olarak, UDA ve FixMatch'e NAF eklenmesiyle doğruluk sırasıyla %20,83 ve %9,91 artmıştır.

Rastgele değil, yapı gerçekten faydalıdır.

Gürültü neden yardımcı olur? Makalenin ablasyon deneyleri cevabı aynı faktöre yönlendiriyor: sınıflar arasında ayrıştırılabilir bir yapı olup olmadığı.

Takım, tüm kategorilerin gürültüsünü önce tek bir noktaya sıkıştırır. Bu durumda gürültü alanı tamamen ayırt edici yapısını kaybeder, NAF hem bir kazanç sağlamaz hem de belirgin bir olumsuz aktarım ortaya çıkar. CIFAR-10 doğruluk oranı, ERM'in %58,15'inden %33,34'e düşer; CIFAR-100 ise %42,24'ten %6,79'a düşer.

Bunun yerine, gürültü sınıflarının merkezleri arasındaki mesafe arttıkça, CIFAR-100 doğruluğu %43,80'den %49,78'e kadar yükseldi. Bu, gürültü sınıflarının ayrıştırılması kolaylaştıkça sağladığı yapısal yönlendirmenin genellikle daha güçlü olduğunu gösterir.

Gürültü miktarı o kadar kritik değil. Her kategori için gürültü sayısı 10'dan 100'e çıkarıldığında doğruluk oranı yaklaşık %50'de sabit kalıyor; 200'e çıkarıldığında hafifçe düşüyor. Makale, ayrıştırılabilir bir model oluştuğunda, az sayıda gürültünün yeterli olduğunu öne sürüyor.

Bilgisayarla görme

Araştırma ekibi gürültü alanını her sınıf için bir merkez noktası haline getirdi. Merkezler sabit ya da öğrenilebilir olsun, sonuçlar ERM'den daha iyiydi; öğrenilebilir merkezler, sabit merkezlerden daha iyiydi, ancak tam NAF'den daha düşük kaldı.

Amazon'dan Caltech-10'a geçiş deneyinde, gerçek kaynak verileri hâlâ hafifçe daha iyi performans gösterse de, gürültülü kaynak domain, ERM'in %83,51 doğruluk oranını yaklaşık %88 ila %89'a çıkarmıştır. Bu, daha gerçekçi bir pozisyon sunar: gerçek kaynak veriler erişilemezken, sentetik gürültü düşük maliyetli bir alternatif olabilir.

Bu, yaygın veri artırma yöntemlerinden de farklıdır. Veri artırma genellikle gerçek örneklerin yakınında döndürme, kırpma, içine alma veya üretme yapar; SSNA ise önce bağımsız bir gürültü alanı oluşturur, ardından temsil uzayında bu alanlar arasında hizalama gerçekleştirir.

Özet: Anlam yok, ancak yapı hala aktarılabilir.

Bu çalışma, kaynak verilerin hedef görevlere yardımcı olabilmesi için tamamen gerçek anlamlara bağlı olmak zorunda olmadığını, aynı zamanda temsil uzayında oluşturulan sınıf yapılarının da aktarılabilir bilgi olabileceğini gösteren tersine çevrilebilir bir bakış açısı sunar.

NAF, rastgele gürültünün paylaşılan temsil uzayında ayırt edici bir yapı oluşturmasını ve ardından az sayıda etiketli örnekle bunu gerçek verilere aktarmasını sağlar. Deney sonuçları, kaynak alanın gerçek görüntü, metin veya ses içermesine rağmen uygun sınıf yapısı korunursa, hedef görev için hâlâ olumlu bir etki yaratabileceğini göstermektedir.

Yani, aktarım öğrenmesiyle aktarılan, sadece “verilerin ne söylediğinden” ziyade, “verilerin temsilsel uzayda nasıl organize edildiğinden” de oluşabilir. Bu, gizlilik kısıtlı, telif hakkı hassas veya gerçek kaynak verilere erişimin zor olduğu senaryolar için yeni bir araştırma yolu sunar.

Makale Başlığı: Yarı-İzlenceli Gürültü Uyumlaması: Gürültü Alanından Bilgi Aktarımı

Kağıt adresi: https://arxiv.org/pdf/2606.00558

Kaynak kodu adresi: https://github.com/AIResearch-Group/SSNA

Video açıklaması: https://www.bilibili.com/video/BV1UV7h61EvW/

Bu yazı, WeChat hesabından "Quantum Bits" tarafından yazılmıştır, yazar: SSNA ekibi

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.