ノイズはセミスーパービジョン学習におけるモデル性能を向上させる可能性がある

icon MarsBit
共有
AI summary icon概要
ICML 2026で発表された新しい研究「Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain」は、ラベルが少ない状況においてランダムノイズがモデルのパフォーマンスを向上させることを示しています。Noise Adaptation Framework(NAF)は、ノイズからクラス構造を構築し、それを実データに振替ることで、CIFAR-10やImageNet-1Kなどのデータセットでの精度を向上させます。欧州のMiCA(Crypto-Assets市場規制)が進化する中、このような進展は、取引やリスク分析に使用される予測モデルの改善を通じて、流動性および暗号資産市場の強化に寄与する可能性があります。

転移学習における「ソースデータ」は、画像、テキスト、またはオーディオである必要はない。

ガウス分布からランダムにサンプリングされた、意味のないノイズでも、モデルは少ないラベルでより良く学習できる。

この作業は半監督ノイズ適応(Semi-Supervised Noise Adaptation、SSNA)と呼ばれ、論文はICML 2026に掲載されています。

コンピュータービジョン

SSNAチームは、ノイズ適応フレームワーク(Noise Adaptation Framework, NAF)をさらに提案し、ランダムに生成されたノイズを用いて判別的なクラス構造を構築し、その構造を実際のターゲットデータに移転することで、ラベル付きデータが少ない状況におけるモデルの学習効果を向上させます。

コンピュータービジョン

△NAFはノイズドメインとターゲットドメインを共有表現空間に投影し、カテゴリレベルでアラインメントを行います。画像は論文より。

各カテゴリにつき4つのラベル付きサンプルのみを使用し、ResNet-18バックボーンに基づくNAFは、CIFAR-10、CIFAR-100、DTD-47、Caltech-101において、ラベル付きサンプルのみで訓練した標準的な監視学習ベースラインERM(経験リスク最小化)と比較して、それぞれ12.35、7.61、4.38、2.74ポイントの精度向上を達成しました。現在、論文のソースコードはオープンソース化されており、詳細は本文末をご覧ください。

実際のソースドメインをノイズに置き換える

従来の転移学習では、ラベルが豊富なソースドメインが必要です。しかし、現実のソースデータは常に容易に入手できるとは限りません。プライバシー、機密性、著作権の制約により、ソースドメインのデータを共有できない場合があります。SSNAはこの前提を取り除こうとします:ソースドメインには実際のサンプルではなく、単純な確率分布から生成されたノイズを用います。

具体的手法はそれほど複雑ではありません。ターゲットタスクがC個のクラスを含むと仮定した場合、研究チームはまず1024次元空間において各クラスごとに平均ベクトルをランダムにサンプリングし、単位行列を共分散として用いてC個のガウス分布を構築します。その後、各分布から50個のノイズベクトルをサンプリングします。ノイズドメインとターゲットドメインは同じクラスインデックス集合を使用し、各ノイズクラスは事前に1つのターゲットクラスインデックスに対応付けられていますが、この対応関係自体には意味的情報は含まれていません。

この番号自体には意味を持たない。ノイズクラス0が天然に「猫」を表すわけではない。これは、訓練開始前に研究者がターゲットドメイン内の特定のクラスに固定して対応付けたにすぎない。実際に移転されるのは、猫や犬の視覚的知識ではなく、ノイズドメイン内で形成された判別構造である。

同じカテゴリのノイズはまとめられ、異なるカテゴリのノイズは分離されます。この構造がターゲットドメインとアラインメントすれば、実際のターゲットサンプルに対してより明確な分類境界を提供できます。

少量のタグは依然として必要です

ノイズは実際のソースデータに代わることはできるが、ターゲットドメインのラベルを完全に置き換えることはできない。その理由は明確である:ノイズは別の空間から生成され、カテゴリ番号は人為的に設定されたものであるため、モデルは少数のラベル付きターゲットサンプルを用いて、ノイズクラス0がどの実際のクラスと対応するべきかを学習しなければならない。

CIFAR-100で各クラスのラベル付きサンプルを0にした場合、ERMとNAFの精度はそれぞれ0.97%と1.34%にとどまり、ランダムレベルに近い。わずかでもラベル付きデータを提供すると、NAFはERMを継続的に上回る。

したがって、この研究の結論は、半教師あり分類設定において、真のソースドメインが正の転移を実現するための必要条件ではないということである。

NAFは主に三つのことを行いました

論文で示された一般化上限に基づき、NAFは訓練目標を三つの部分に分割します。

まず少量の実際のラベルを学んでください

ターゲットドメインエンコーダーは、実際のサンプルを共有表現空間にマッピングし、分類器は少数のラベル付きサンプルを使用して交差エントロピー損失を計算します。この部分は、ノイズクラスと真のクラスとの間の橋渡しを構築するために、通常の教師あり学習と同様です。

ノイズを明確なカテゴリ構造として再構成する

ノイズプロジェクターはランダムベクトルを同じ表現空間にマッピングし、分類器は事前に設定されたカテゴリ番号に基づいてこれらのノイズを識別します。訓練後、同じクラスのノイズは徐々に集まり、異なるクラスのノイズは互いに分離します。

最後に両側を整列してください

NAFは、ノイズドメインとターゲットドメイン間の分布差異も計算する。分布アライメントモジュールの具体的な実装は制限されず、論文では複数の手法を比較し、実験的に負のドメイン類似度(Negative Domain Similarity、NDS)をデフォルトメカニズムとして採用した。NDSは、両ドメインのグローバル平均と各クラスの平均を比較し、コサイン類似度を用いてそれらを近づける。ラベルのないターゲットサンプルのクラス平均は、モデルが生成した擬似ラベルを用いて反復的に推定される。

目標全体は次のように記述できます

コンピュータービジョン

。其中、

コンピュータービジョン

ラベル付きの実際の少量のターゲットサンプルの分類を担当します。

コンピュータービジョン

ノイズ分類を担当

コンピュータービジョン

ターゲットドメインとノイズドメインの分布アライメントを担当する。論文で提示された汎化上限は、これらの3項目に対応している:ターゲットドメインの経験誤差、ノイズドメインの経験誤差、および共有表現空間における両ドメイン間の分布差。

CIFARからImageNetまで、ノイズは常に利益をもたらす

主実験は8つの視覚データセットと1つのテキスト分類データセットをカバーしています。ImageNet-1Kを除き、視覚タスクでは各クラスにつき4つのラベル付きサンプルを使用し、残りの訓練サンプルはラベルなしデータとして使用しています。

ResNet-18において、NAFはERMと比較してTop-1精度がそれぞれCIFAR-10で+12.35ポイント、CIFAR-100で+7.61ポイント、DTD-47で+4.38ポイント、Caltech-101で+2.74ポイント向上しました。

コンピュータービジョン

細粒度分類でも同様に効果があります。ResNet-18を使用した場合、NAFはCUB-200、Oxford Flowers-102、Stanford Cars-196でERMに対してそれぞれ8.94、5.51、7.74ポイントの向上を達成しました。

より大規模なImageNet-1Kでは、研究チームが各クラスに100個のラベル付きサンプルを保持しました。NAFは37.10%の精度を達成し、ERMより0.99ポイント高い結果となりました。テキストタスクAG News-4では、BERTを使用したNAFの精度は82.82%で、ERMの78.64%より4.18ポイント高い結果となりました。

NAFは既存の半教師あり手法に直接組み込むことができる。論文では、NAFをUDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM、SA-FixMatchに適用し、すべての手法で性能向上が確認された。CIFAR-10における20ラウンドの訓練結果を例に取ると、UDAとFixMatchにNAFを追加した場合、精度はそれぞれ20.83ポイントと9.91ポイント向上した。

本当に役立つのは「ランダム」ではなく、構造である

ノイズがどのように役立つのか?論文のアブレーション実験は、答えを同じ要因——クラス間の分離構造の有無——に導いた。

チームはまず、すべてのカテゴリのノイズを同じ点に圧縮した。その結果、ノイズ領域の判別構造が完全に失われ、NAFは利益をもたらさず、逆に顕著なネガティブトランスファーが発生した。CIFAR-10の精度はERMの58.15%から33.34%に低下し、CIFAR-100は42.24%から6.79%に低下した。

一方で、ノイズクラスの中心間の距離を段階的に広げると、CIFAR-100の精度は43.80%から49.78%まで向上した。これは、ノイズクラスがより区別しやすくなるほど、提供される構造的ガイドが通常より強くなることを示している。

ノイズの数はそれほど重要ではない。ノイズを各クラスで10個から100個に増やしても、精度は約50%で安定し、200個に増やした後はやや低下した。この論文は、分離可能なパターンが形成されれば、少量のノイズで十分に機能すると結論づけている。

コンピュータービジョン

研究チームはノイズ領域を各クラスごとに1つの中心点に簡略化した。中心を固定しても学習可能にしても、結果はERMを上回った。特に、学習可能な中心は固定中心よりも優れた結果を示したが、完全なNAFには及ばなかった。

AmazonからCaltech-10への移行実験において、実際のソースデータは依然としてやや優れているが、ノイズのあるソースドメインはERMの83.51%から精度を約88%〜89%まで向上させている。これはより現実的な位置付けを示している:実際のソースデータが利用できない場合、合成ノイズは非常に低コストな代替手段となり得る。

これは一般的なデータ拡張とも異なります。データ拡張は通常、実際のサンプルの周辺で回転、切り抜き、補間、または生成を行いますが、SSNAはまず独立したノイズ領域を構築し、その後、表現空間内でドメイン間のアライメントを実行します。

要約:意味はなくても、構造は依然として移譲可能

この作業は、移動学習に対して反直感的な新しい視点を提供する:ソースデータがターゲットタスクを支援できるのは、その真の意味に完全に依存する必要はなく、表現空間内で形成されるカテゴリ構造もまた移転可能な知識となり得る。

NAFはこの点を活用し、ランダムなノイズを共有表象空間内で判別的な構造として形成し、少数のラベル付きサンプルを通じてそれを実データに伝達します。実験結果によると、ソースドメインに実際の画像、テキスト、オーディオが含まれていても、適切なクラス構造を保持すれば、ターゲットタスクにポジティブな影響を与える可能性があります。

言い換えれば、転移学習が移行するのは「データが何を語っているか」だけでなく、「データが表現空間内でどのように構成されているか」も含みます。これは、プライバシー制限や著作権の敏感さ、または実際のソースデータの取得が困難なシナリオにおいて、新たな研究の道筋を提供します。

論文タイトル:セミスーパーバイズドノイズ適応:ノイズドメインからの知識移転

論文のアドレス:https://arxiv.org/pdf/2606.00558

ソースコードのアドレス:https://github.com/AIResearch-Group/SSNA

動画解説:https://www.bilibili.com/video/BV1UV7h61EvW/

本文は微信公衆アカウント「量子位」より、著者:SSNAチーム

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。