噪音可提升半監督學習中的模型表現

icon MarsBit
分享
AI summary icon精華摘要
一項於 ICML 2026 發表的名為「半監督噪聲適應:從噪聲領域傳遞知識」的新研究顯示,隨機噪聲可提升模型在低標註情境下的表現。噪聲適應框架(NAF)從噪聲中建構類別結構,並將其轉移至真實數據,從而提升 CIFAR-10 和 ImageNet-1K 等數據集的準確率。在 MiCA(歐盟加密資產市場法規)不斷演變的背景下,此類進展有望透過改善交易與風險分析中使用的預測模型,提升流動性與加密市場。

在遷移學習中,「源數據」未必非得是圖像、文本或音頻。

從高斯分佈中隨機採樣、無任何語義的噪聲,也能幫助模型在少量標註下學得更好。

這項工作名為半監督噪聲自適應(Semi-Supervised Noise Adaptation,SSNA),論文已發表於 ICML 2026。

计算机视觉

The SSNA team further proposes a Noise Adaptation Framework (NAF), which constructs discriminative category structures using randomly generated noise and transfers these structures to real target data, thereby enhancing the model’s learning performance in low-label scenarios.

计算机视觉

△NAF 將噪聲域和目標域投影到共享表徵空間,並在類別層面進行對齊。圖片來自論文。

在每類僅有 4 個標註樣本的情況下,基於 ResNet-18 骨幹網絡,NAF 在 CIFAR-10、CIFAR-100、DTD-47 和 Caltech-101 上的準確率,相比僅使用有標註樣本訓練的標準監督學習基線 ERM(經驗風險最小化,Empirical Risk Minimization),分別提升了 12.35、7.61、4.38 和 2.74 個百分點。目前,論文源碼已開源,詳情見文末。

將真實源域換成雜訊

傳統遷移學習通常需要一個標籤豐富的源域。但真實源數據並不總是容易獲得。隱私、保密和版權限制,都可能讓源域數據無法共享。SSNA 試圖把這個前提拿掉:源域不再放置真實樣本,而是換成從簡單概率分佈中生成的噪聲。

具體做法並不複雜,假設目標任務包含 C 個類別,研究團隊首先在 1024 維空間中為每個類別隨機採樣一個均值向量,並以單位矩陣作為協方差,由此構造 C 個高斯分佈,再從每個分佈中採樣 50 個噪聲向量。噪聲域與目標域使用相同的類別索引集合,每個噪聲類別預先對應一個目標類別索引,但這種對應本身不包含語義資訊。

這裡的編號本身沒有語義。噪聲類 0 並不天然代表「貓」,只是在訓練開始前,研究者將其固定對應到目標域中的某一類。真正被遷移的,也不是貓或狗的視覺知識,而是噪聲域中形成的判別結構。

同一類別的噪聲被壓縮在一起,不同類別的噪聲被分開。只要這套結構能與目標域對齊,它就能為真實目標樣本提供更清晰的分類邊界。

少量標籤仍然是必要的

噪聲可以替代真實源數據,但不能完全替代目標域標籤。原因很直接:噪聲來自另一個空間,而類別編號是人為指定的,模型必須借助少量已標註的目標樣本,才能知道噪聲類 0 究竟該與哪個真實類別對齊。

當論文在 CIFAR-100 上將每類標註樣本降至 0 時,ERM 和 NAF 的準確率分別僅為 0.97% 和 1.34%,均接近隨機水平。一旦提供少量標註,NAF 即持續超越 ERM。

因此,這項工作的結論是:在半監督分類設定中,真實源域未必是實現正遷移的必要條件。

NAF 主要做了三件事

基於論文提出的泛化上界,NAF 將訓練目標拆分為三部分。

先學好少量真實標籤

目標域編碼器將真實樣本映射到共享表徵空間,分類器使用少量標註樣本計算交叉熵損失。這部分與普通監督學習一致,用於建立噪聲類別與真實類別之間的橋樑。

再讓噪聲形成清晰的類別結構

噪聲投影器負責將隨機向量映射到同一個表徵空間,分類器則根據預設類別編號識別這些噪聲。訓練之後,同類噪聲逐漸聚攏,不同類噪聲彼此分離。

最後將兩邊對齊

NAF 也會計算噪聲域與目標域之間的分佈差異。分佈對齊模組並不限定具體實現,論文對多種方案進行了比較,最終在實驗中經驗性地採用負域相似度(Negative Domain Similarity,NDS)作為默認機制。NDS 同時比較兩域的全局均值和各類別均值,並使用餘弦相似度推動它們靠近。未標註目標樣本的類別均值,則由模型產生的偽標籤迭代估計。

整套目標可以寫成

计算机视觉

。其中,

计算机视觉

負責真實且少量帶標註的目標樣本分類,

计算机视觉

負責噪聲分類,

计算机视觉

負責目標域與噪聲域分佈對齊。論文給出的泛化上界也對應這三項:目標域經驗誤差、噪聲域經驗誤差,以及兩域在共享表徵空間中的分佈差異。

From CIFAR to ImageNet, noise can bring gains

主實驗涵蓋8個視覺數據集和1個文本分類數據集。除 ImageNet-1K 外,視覺任務均採用每類4個標註樣本,其餘訓練樣本作為無標註數據。

On ResNet-18, NAF achieves Top-1 improvements over ERM of +12.35 on CIFAR-10, +7.61 on CIFAR-100, +4.38 on DTD-47, and +2.74 on Caltech-101 percentage points.

计算机视觉

細粒度分類同樣有效。使用 ResNet-18 時,NAF 在 CUB-200、Oxford Flowers-102 和 Stanford Cars-196 上相對 ERM 分別提高 8.94、5.51 和 7.74 個百分點。

在更大規模的 ImageNet-1K 上,研究團隊為每類保留 100 個標註樣本。NAF 達到 37.10% 準確率,比 ERM 高 0.99 個百分點。在文本任務 AG News-4 上,使用 BERT 的 NAF 達到 82.82%,比 ERM 的 78.64% 高 4.18 個百分點。

NAF 也可直接整合至現有的半監督方法中。論文將其接入 UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM 和 SA-FixMatch,所有方法均獲得提升。以 CIFAR-10 的 20 輪訓練結果為例,加入 NAF 後,UDA 和 FixMatch 的準確率分別提升了 20.83 和 9.91 個百分點。

真正有用的不是「隨機」,而是結構

噪聲為何能提供幫助?論文的消融實驗將答案指向同一個因素:類別之間是否具有可分離的結構。

團隊首先將所有類別的噪聲壓縮為同一個點。這樣一來,噪聲域完全失去判別結構,NAF不僅沒有帶來增益,反而出現明顯的負遷移。CIFAR-10 的準確率從 ERM 的 58.15% 下跌至 33.34%,CIFAR-100 則從 42.24% 下跌至 6.79%。

相反,當逐步拉大噪聲類別中心之間的距離時,CIFAR-100 的準確率從 43.80% 一路提高到 49.78%。這說明噪聲類越容易區分,能夠提供的結構引導通常越強。

噪聲數量反而沒那麼關鍵。當每類噪聲從10個增加到100個時,準確率一直穩定在約50%;增加到200個後還略有下降。論文據此認為,只要能形成可分離模式,少量噪聲就足以發揮作用。

计算机视觉

研究團隊還將噪聲域簡化為每類一個中心點。無論中心是固定還是可學習,結果均高於 ERM;其中,可學習中心優於固定中心,但仍低於完整的 NAF。

In the migration experiment from Amazon to Caltech-10, the real source data still slightly outperforms, but the noisy source domain has already improved accuracy from ERM’s 83.51% to approximately 88% to 89%. This also provides a more realistic perspective: when real source data is unavailable, synthetic noise can serve as a low-cost alternative.

它也不同於常見的資料增強。資料增強通常在真實樣本附近進行旋轉、裁剪、插值或生成;SSNA 則先構造一個獨立噪聲域,再在表徵空間中完成跨域對齊。

總結:沒有語義,結構仍可遷移

這項工作為遷移學習提供了一個頗具反直覺的新視角:源數據能夠幫助目標任務,未必完全依賴其真實語義,表徵空間中形成的類別結構同樣可能成為可遷移的知識。

NAF 正是利用這一點,讓隨機噪聲在共享表徵空間中形成具有區分性的結構,再借助少量標註樣本將其傳遞給真實數據。實驗結果表明,即使源域不包含真實圖像、文本或音頻,只要保留合適的類別結構,依然可能對目標任務產生正面作用。

In other words, what transfer learning transfers may not only be “what the data says,” but also “how the data is organized in the representation space.” This provides a new research direction for scenarios with privacy constraints, copyright sensitivity, or difficulty in obtaining real source data.

論文標題:半監督噪聲適應:從噪聲領域轉移知識

論文地址:https://arxiv.org/pdf/2606.00558

原始碼地址:https://github.com/AIResearch-Group/SSNA

影片解讀:https://www.bilibili.com/video/BV1UV7h61EvW/

本文來自微信公眾號「量子位」,作者:SSNA 團隊

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露