在遷移學習中,「源數據」未必非得是圖像、文本或音頻。
從高斯分佈中隨機採樣、無任何語義的噪聲,也能幫助模型在少量標註下學得更好。
這項工作名為半監督噪聲自適應(Semi-Supervised Noise Adaptation,SSNA),論文已發表於 ICML 2026。

The SSNA team further proposes a Noise Adaptation Framework (NAF), which constructs discriminative category structures using randomly generated noise and transfers these structures to real target data, thereby enhancing the model’s learning performance in low-label scenarios.

△NAF 將噪聲域和目標域投影到共享表徵空間,並在類別層面進行對齊。圖片來自論文。
在每類僅有 4 個標註樣本的情況下,基於 ResNet-18 骨幹網絡,NAF 在 CIFAR-10、CIFAR-100、DTD-47 和 Caltech-101 上的準確率,相比僅使用有標註樣本訓練的標準監督學習基線 ERM(經驗風險最小化,Empirical Risk Minimization),分別提升了 12.35、7.61、4.38 和 2.74 個百分點。目前,論文源碼已開源,詳情見文末。
將真實源域換成雜訊
傳統遷移學習通常需要一個標籤豐富的源域。但真實源數據並不總是容易獲得。隱私、保密和版權限制,都可能讓源域數據無法共享。SSNA 試圖把這個前提拿掉:源域不再放置真實樣本,而是換成從簡單概率分佈中生成的噪聲。
具體做法並不複雜,假設目標任務包含 C 個類別,研究團隊首先在 1024 維空間中為每個類別隨機採樣一個均值向量,並以單位矩陣作為協方差,由此構造 C 個高斯分佈,再從每個分佈中採樣 50 個噪聲向量。噪聲域與目標域使用相同的類別索引集合,每個噪聲類別預先對應一個目標類別索引,但這種對應本身不包含語義資訊。
這裡的編號本身沒有語義。噪聲類 0 並不天然代表「貓」,只是在訓練開始前,研究者將其固定對應到目標域中的某一類。真正被遷移的,也不是貓或狗的視覺知識,而是噪聲域中形成的判別結構。
同一類別的噪聲被壓縮在一起,不同類別的噪聲被分開。只要這套結構能與目標域對齊,它就能為真實目標樣本提供更清晰的分類邊界。
少量標籤仍然是必要的
噪聲可以替代真實源數據,但不能完全替代目標域標籤。原因很直接:噪聲來自另一個空間,而類別編號是人為指定的,模型必須借助少量已標註的目標樣本,才能知道噪聲類 0 究竟該與哪個真實類別對齊。
當論文在 CIFAR-100 上將每類標註樣本降至 0 時,ERM 和 NAF 的準確率分別僅為 0.97% 和 1.34%,均接近隨機水平。一旦提供少量標註,NAF 即持續超越 ERM。
因此,這項工作的結論是:在半監督分類設定中,真實源域未必是實現正遷移的必要條件。
NAF 主要做了三件事
基於論文提出的泛化上界,NAF 將訓練目標拆分為三部分。
先學好少量真實標籤
目標域編碼器將真實樣本映射到共享表徵空間,分類器使用少量標註樣本計算交叉熵損失。這部分與普通監督學習一致,用於建立噪聲類別與真實類別之間的橋樑。
再讓噪聲形成清晰的類別結構
噪聲投影器負責將隨機向量映射到同一個表徵空間,分類器則根據預設類別編號識別這些噪聲。訓練之後,同類噪聲逐漸聚攏,不同類噪聲彼此分離。
最後將兩邊對齊
NAF 也會計算噪聲域與目標域之間的分佈差異。分佈對齊模組並不限定具體實現,論文對多種方案進行了比較,最終在實驗中經驗性地採用負域相似度(Negative Domain Similarity,NDS)作為默認機制。NDS 同時比較兩域的全局均值和各類別均值,並使用餘弦相似度推動它們靠近。未標註目標樣本的類別均值,則由模型產生的偽標籤迭代估計。
整套目標可以寫成

。其中,

負責真實且少量帶標註的目標樣本分類,

負責噪聲分類,

負責目標域與噪聲域分佈對齊。論文給出的泛化上界也對應這三項:目標域經驗誤差、噪聲域經驗誤差,以及兩域在共享表徵空間中的分佈差異。
From CIFAR to ImageNet, noise can bring gains
主實驗涵蓋8個視覺數據集和1個文本分類數據集。除 ImageNet-1K 外,視覺任務均採用每類4個標註樣本,其餘訓練樣本作為無標註數據。
On ResNet-18, NAF achieves Top-1 improvements over ERM of +12.35 on CIFAR-10, +7.61 on CIFAR-100, +4.38 on DTD-47, and +2.74 on Caltech-101 percentage points.

△
細粒度分類同樣有效。使用 ResNet-18 時,NAF 在 CUB-200、Oxford Flowers-102 和 Stanford Cars-196 上相對 ERM 分別提高 8.94、5.51 和 7.74 個百分點。
在更大規模的 ImageNet-1K 上,研究團隊為每類保留 100 個標註樣本。NAF 達到 37.10% 準確率,比 ERM 高 0.99 個百分點。在文本任務 AG News-4 上,使用 BERT 的 NAF 達到 82.82%,比 ERM 的 78.64% 高 4.18 個百分點。
NAF 也可直接整合至現有的半監督方法中。論文將其接入 UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM 和 SA-FixMatch,所有方法均獲得提升。以 CIFAR-10 的 20 輪訓練結果為例,加入 NAF 後,UDA 和 FixMatch 的準確率分別提升了 20.83 和 9.91 個百分點。
真正有用的不是「隨機」,而是結構
噪聲為何能提供幫助?論文的消融實驗將答案指向同一個因素:類別之間是否具有可分離的結構。
團隊首先將所有類別的噪聲壓縮為同一個點。這樣一來,噪聲域完全失去判別結構,NAF不僅沒有帶來增益,反而出現明顯的負遷移。CIFAR-10 的準確率從 ERM 的 58.15% 下跌至 33.34%,CIFAR-100 則從 42.24% 下跌至 6.79%。
相反,當逐步拉大噪聲類別中心之間的距離時,CIFAR-100 的準確率從 43.80% 一路提高到 49.78%。這說明噪聲類越容易區分,能夠提供的結構引導通常越強。
噪聲數量反而沒那麼關鍵。當每類噪聲從10個增加到100個時,準確率一直穩定在約50%;增加到200個後還略有下降。論文據此認為,只要能形成可分離模式,少量噪聲就足以發揮作用。

△
研究團隊還將噪聲域簡化為每類一個中心點。無論中心是固定還是可學習,結果均高於 ERM;其中,可學習中心優於固定中心,但仍低於完整的 NAF。
In the migration experiment from Amazon to Caltech-10, the real source data still slightly outperforms, but the noisy source domain has already improved accuracy from ERM’s 83.51% to approximately 88% to 89%. This also provides a more realistic perspective: when real source data is unavailable, synthetic noise can serve as a low-cost alternative.
它也不同於常見的資料增強。資料增強通常在真實樣本附近進行旋轉、裁剪、插值或生成;SSNA 則先構造一個獨立噪聲域,再在表徵空間中完成跨域對齊。
總結:沒有語義,結構仍可遷移
這項工作為遷移學習提供了一個頗具反直覺的新視角:源數據能夠幫助目標任務,未必完全依賴其真實語義,表徵空間中形成的類別結構同樣可能成為可遷移的知識。
NAF 正是利用這一點,讓隨機噪聲在共享表徵空間中形成具有區分性的結構,再借助少量標註樣本將其傳遞給真實數據。實驗結果表明,即使源域不包含真實圖像、文本或音頻,只要保留合適的類別結構,依然可能對目標任務產生正面作用。
In other words, what transfer learning transfers may not only be “what the data says,” but also “how the data is organized in the representation space.” This provides a new research direction for scenarios with privacy constraints, copyright sensitivity, or difficulty in obtaining real source data.
論文標題:半監督噪聲適應:從噪聲領域轉移知識
論文地址:https://arxiv.org/pdf/2606.00558
原始碼地址:https://github.com/AIResearch-Group/SSNA
影片解讀:https://www.bilibili.com/video/BV1UV7h61EvW/
本文來自微信公眾號「量子位」,作者:SSNA 團隊
