Kebisingan Boleh Meningkatkan Prestasi Model dalam Pembelajaran Semi-Diselia

icon MarsBit
Kongsi
AI summary iconRingkasan
Satu kajian baharu berjudul 'Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain' yang diterbitkan di ICML 2026 menunjukkan bahawa kebisingan rawak boleh meningkatkan prestasi model dalam skenario dengan label rendah. Kerangka Adaptasi Kebisingan (NAF) membina struktur kelas daripada kebisingan dan memindahkan mereka ke data sebenar, meningkatkan ketepatan pada set data seperti CIFAR-10 dan ImageNet-1K. Dalam konteks peraturan MiCA (EU Markets in Crypto-Assets Regulation) yang terus berkembang, kemajuan seperti ini boleh meningkatkan likuiditi dan pasaran kripto dengan memperbaiki model ramalan yang digunakan dalam perdagangan dan analisis risiko.

Dalam pembelajaran transfer, "data sumber" tidak semestinya berupa gambar, teks, atau audio.

Satu set gangguan tanpa makna yang diambil secara rawak daripada taburan Gaussian juga boleh membantu model belajar dengan lebih baik di bawah pelabelan yang sedikit.

Kerja ini dikenali sebagai Penyesuaian Kebisingan Semi-Pengawasan (Semi-Supervised Noise Adaptation, SSNA), dan kertas kerjanya telah diterbitkan di ICML 2026.

Penglihatan Komputer

Pasukan SSNA seterusnya mencadangkan Kerangka Penyesuaian Kebisingan (Noise Adaptation Framework, NAF), yang memanfaatkan kebisingan yang dihasilkan secara rawak untuk membina struktur kelas yang diskriminatif, serta mentransfer struktur ini kepada data sasaran sebenar, untuk meningkatkan keberkesanan pembelajaran model dalam skenario dengan label terhadap.

Penglihatan Komputer

△NAF memproyeksikan domain kebisingan dan domain sasaran ke ruang representasi bersama dan menyelaraskan pada tahap kelas. Gambar diambil daripada kertas kerja.

Dalam keadaan hanya ada 4 contoh berlabel untuk setiap kelas, dengan jaringan tulang belakang ResNet-18, NAF meningkatkan ketepatan sebanyak 12.35, 7.61, 4.38, dan 2.74 peratus masing-masing pada CIFAR-10, CIFAR-100, DTD-47, dan Caltech-101 berbanding dengan garis dasar pembelajaran berpengawasan standard ERM (Empirical Risk Minimization) yang hanya menggunakan contoh berlabel. Kode sumber makalah kini telah dibuka kepada umum; butiran lanjut lihat di akhir artikel.

Tukar domain sumber sebenar dengan bunyi bising

Pembelajaran transfer tradisional biasanya memerlukan domain sumber yang kaya label. Namun, data sumber sebenarnya tidak selalu mudah diperoleh. Pembatasan privasi, kerahsiaan, dan hak cipta boleh menjadikan data domain sumber tidak boleh dikongsi. SSNA cuba menghilangkan anggapan ini: domain sumber tidak lagi menggunakan sampel sebenar, tetapi digantikan dengan bunyi yang dihasilkan daripada taburan kebarangkalian yang mudah.

Prosedur spesifiknya tidak rumit; andaikan tugas target mengandung C kelas, pasukan penyelidik terlebih dahulu mengambil sampel secara rawak satu vektor min untuk setiap kelas dalam ruang 1024 dimensi, dengan matriks unit sebagai kovarians, untuk membina C taburan Gaussian, kemudian mengambil sampel 50 vektor gangguan dari setiap taburan tersebut. Domain gangguan dan domain target menggunakan set indeks kelas yang sama, dengan setiap kelas gangguan secara pra-tertakrif berkaitan dengan indeks kelas target, tetapi kaitan ini tidak mengandungi maklumat semantik.

Nombor di sini tidak mempunyai makna itu sendiri. Kelas kebisingan 0 tidak secara semula jadi mewakili "kucing", tetapi hanya ditetapkan oleh penyelidik untuk berkaitan dengan satu kelas dalam domain sasaran sebelum latihan bermula. Yang benar-benar dipindahkan bukanlah pengetahuan visual kucing atau anjing, tetapi struktur diskriminatif yang terbentuk dalam domain kebisingan.

Kebisingan dalam kategori yang sama ditekan bersama, manakala kebisingan dalam kategori yang berbeza dipisahkan. Selama struktur ini selari dengan domain sasaran, ia akan memberikan sempadan pengelasan yang lebih jelas untuk sampel sasaran sebenar.

Beberapa label masih diperlukan

Kebisingan boleh menggantikan data sumber sebenar, tetapi tidak boleh menggantikan label domain sasaran sepenuhnya. Sebabnya sangat jelas: kebisingan berasal dari ruang lain, dan nombor kelas ditentukan secara artifisial; model perlu menggunakan sampel sasaran yang ditandai sedikit untuk mengetahui kelas kebisingan 0 perlu diselaraskan dengan kelas sebenar yang mana.

Apabila sampel berlabel setiap kelas diturunkan kepada 0 pada CIFAR-100, ketepatan ERM dan NAF masing-masing hanya 0.97% dan 1.34%, kedua-duanya hampir pada tahap rawak. Sekali sedikit berlabel diberikan, NAF terus melebihi ERM.

Oleh itu, kesimpulan kerja ini ialah: dalam tetapan pengelasan separa berpandukan, domain sumber sebenar tidak semestinya merupakan syarat perlu untuk mencapai pemindahan positif.

NAF telah melakukan tiga perkara utama

Berdasarkan batas generalisasi yang diberikan dalam kertas, NAF membahagikan objektif latihan menjadi tiga bahagian.

Pelajari terlebih dahulu sedikit label sebenar

Pengodet domain sasaran memetakan sampel sebenar ke ruang representasi bersama, dan pengklasifikasi mengira kerugian entropi silang menggunakan sedikit sampel berlabel. Bahagian ini sejajar dengan pembelajaran berawasan biasa untuk membina jambatan antara kelas bising dan kelas sebenar.

Biar kebisingan membentuk struktur kelas yang jelas

Pemproyeksi kebisingan bertanggung jawab untuk memetakan vektor rawak ke ruang representasi yang sama, sementara pengklasifikasi mengenali kebisingan tersebut mengikut nombor kategori yang telah ditetapkan. Selepas latihan, kebisingan sejenis secara beransur-ansur berkumpul, manakala kebisingan yang berbeza jenis terpisah satu sama lain.

Alihkan kedua-dua belah ke tengah

NAF juga mengira perbezaan taburan antara domain kebisingan dan domain sasaran. Modul penyelarasan taburan tidak terhad kepada pelaksanaan tertentu; kertas kerja ini membandingkan pelbagai pendekatan dan akhirnya secara empirikal mengambil Negative Domain Similarity (NDS) sebagai mekanisme lalai. NDS membandingkan min global dan min setiap kelas kedua-dua domain, serta menggunakan kesamaan kosinus untuk mendorong mereka saling mendekat. Min kelas untuk sampel sasaran tanpa label diperkirakan secara berulang melalui pseudo-label yang dihasilkan oleh model.

Sasaran keseluruhan boleh ditulis sebagai

Penglihatan Komputer

Di antaranya,

Penglihatan Komputer

Mengendalikan pengelasan sampel target sebenar dalam jumlah kecil yang telah diberi label,

Penglihatan Komputer

Mengurus pengelasan bunyi bising,

Penglihatan Komputer

Mengendalikan penyelarasan taburan domain sasaran dan domain kebisingan. Batas penggeneralisasian yang diberikan dalam kertas ini juga berkaitan dengan ketiga-tiga perkara ini: ralat pengalaman domain sasaran, ralat pengalaman domain kebisingan, dan perbezaan taburan antara kedua-dua domain dalam ruang representasi bersama.

Dari CIFAR hingga ImageNet, kebisingan dapat memberikan keuntungan

Eksperimen utama merangkumi 8 set data visual dan 1 set data pengelasan teks. Selain ImageNet-1K, tugas visual menggunakan 4 sampel berlabel setiap kelas, dengan sampel latihan lainnya sebagai data tanpa label.

Pada ResNet-18, peningkatan Top-1 NAF berbanding ERM masing-masing adalah: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 peratus.

Penglihatan Komputer

Klasifikasi halus juga berkesan. Semasa menggunakan ResNet-18, NAF meningkatkan ERM sebanyak 8.94, 5.51, dan 7.74 peratus masing-masing pada CUB-200, Oxford Flowers-102, dan Stanford Cars-196.

Pada set data ImageNet-1K yang lebih besar, pasukan penyelidik mengekalkan 100 sampel berlabel untuk setiap kelas. NAF mencapai ketepatan 37.10%, 0.99 peratus lebih tinggi daripada ERM. Dalam tugas teks AG News-4, NAF dengan BERT mencapai 82.82%, 4.18 peratus lebih tinggi daripada ERM pada 78.64%.

NAF juga boleh disambungkan secara langsung ke kaedah separa pengawasan yang sedia ada. Kertas ini menghubungkannya dengan UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM, dan SA-FixMatch, dan kesemuanya mendapat peningkatan. Sebagai contoh, hasil latihan 20 pusingan pada CIFAR-10, akurasi UDA dan FixMatch meningkat masing-masing sebanyak 20.83 dan 9.91 peratus apabila NAF ditambahkan.

Yang benar-benar berguna bukanlah "rawak", tetapi struktur

Mengapa kebisingan boleh membantu? Eksperimen ablasi dalam kertas ini menunjukkan jawapannya kepada faktor yang sama: sama ada struktur yang boleh dipisahkan wujud di antara kelas-kelas.

Timm pertama-tama menekan semua jenis kebisingan menjadi satu titik yang sama. Akibatnya, domain kebisingan sepenuhnya kehilangan struktur pembezanya, NAF tidak hanya gagal memberikan keuntungan, tetapi juga mengalami peralihan negatif yang jelas. Ketepatan CIFAR-10 turun dari 58.15% ERM kepada 33.34%, manakala CIFAR-100 turun dari 42.24% kepada 6.79%.

Sebaliknya, apabila jarak antara pusat kelas bunyi diperbesar secara bertahap, ketepatan CIFAR-100 meningkat dari 43.80% hingga 49.78%. Ini menunjukkan bahawa semakin mudah kelas bunyi dibezakan, semakin kuat panduan struktur yang boleh diberikan.

Jumlah kebisingan sebenarnya tidak begitu penting. Apabila setiap kelas ditingkatkan dari 10 menjadi 100 kebisingan, ketepatan tetap stabil pada sekitar 50%; selepas ditingkatkan kepada 200, ia sedikit menurun. Berdasarkan ini, kertas kerja menyimpulkan bahawa sekiranya corak yang boleh dipisahkan dapat dibentuk, sedikit kebisingan sudah cukup untuk berfungsi.

Penglihatan Komputer

Kumpulan penyelidik juga menyederhanakan domain kebisingan menjadi satu titik pusat setiap kelas. Hasilnya lebih tinggi daripada ERM, sama ada pusat tetap atau boleh belajar; di mana pusat boleh belajar lebih baik daripada pusat tetap, tetapi masih lebih rendah daripada NAF penuh.

Dalam eksperimen perpindahan dari Amazon ke Caltech-10, data sumber sebenar masih sedikit lebih unggul secara keseluruhan, tetapi domain sumber berisik telah mampu meningkatkan ketepatan dari 83.51% ERM kepada sekitar 88% hingga 89%. Ini juga memberikan penempatan yang lebih realistik: apabila data sumber sebenar tidak tersedia, bunyi sintetik boleh menjadi alternatif dengan kos yang sangat rendah.

Ia juga berbeza daripada peningkatan data biasa. Peningkatan data biasanya melakukan putaran, pemotongan, interpolasi, atau penghasilan di sekitar sampel sebenar; SSNA pula membina domain kebisingan yang berasingan terlebih dahulu, kemudian melaksanakan penyelarasan antar domain dalam ruang perwakilan.

Ringkasan: Tanpa makna, struktur masih boleh dipindahkan

Kerja ini memberikan perspektif baru yang tidak biasa terhadap pembelajaran berpindah: data sumber boleh membantu tugas sasaran tanpa perlu sepenuhnya bergantung pada makna sebenarnya; struktur kelas yang terbentuk dalam ruang representasi juga boleh menjadi pengetahuan yang boleh dipindahkan.

NAF memanfaatkan titik ini untuk membentuk struktur yang diskriminatif dalam ruang representasi bersama melalui gangguan rawak, kemudian mentransmisikannya kepada data sebenar menggunakan sedikit sampel berlabel. Keputusan eksperimen menunjukkan bahawa walaupun domain sumber tidak mengandungi imej, teks, atau audio sebenar, ia masih mungkin memberi kesan positif kepada tugas sasaran selama struktur kelas yang sesuai dikekalkan.

Dengan kata lain, apa yang dipindahkan oleh pembelajaran berpindah mungkin bukan hanya “apa yang diceritakan oleh data”, tetapi juga “bagaimana data diorganisasikan dalam ruang representasi”. Ini juga memberikan pendekatan penyelidikan baharu untuk skenario yang terhad dari segi privasi, sensitif terhadap hak cipta, atau sukar untuk mendapatkan data sumber asal.

Tajuk kertas: Adaptasi Kebisingan Semi-berpengawasan: Memindahkan Pengetahuan dari Domain Kebisingan

Alamat kertas: https://arxiv.org/pdf/2606.00558

Alamat kod sumber: https://github.com/AIResearch-Group/SSNA

Penjelasan video: https://www.bilibili.com/video/BV1UV7h61EvW/

Artikel ini berasal dari akaun WeChat "Quantum Bit", penulis: pasukan SSNA

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.