Шум может улучшить производительность модели в полусупервизированном обучении

icon MarsBit
Поделиться
AI summary iconСводка
Новое исследование под названием «Полу-контролируемая адаптация к шуму: передача знаний из домена шума», опубликованное на ICML 2026, показывает, что случайный шум может повысить производительность моделей в условиях малого количества меток. Фреймворк адаптации к шуму (NAF) строит классовые структуры на основе шума и передает их на реальные данные, улучшая точность на наборах данных, таких как CIFAR-10 и ImageNet-1K. На фоне эволюции MiCA (Европейское регулирование рынков криптоактивов) такие достижения могут улучшить ликвидность и криптовалютные рынки за счет повышения точности прогнозных моделей, используемых в торговле и анализе рисков.

В обучении с переносом данные источника не обязательно должны быть изображениями, текстом или аудио.

Шум, случайно выбранный из гауссовского распределения и не имеющий семантического смысла, также может помочь модели лучше обучаться при небольшом количестве размеченных данных.

Эта работа называется полунадзорной адаптацией к шуму (Semi-Supervised Noise Adaptation, SSNA), и статья уже опубликована на ICML 2026.

Компьютерное зрение

Команда SSNA дополнительно предложила шумоадаптивную рамку (Noise Adaptation Framework, NAF), которая использует случайно сгенерированный шум для построения дифференцированной структуры классов и переносит эту структуру на реальные целевые данные, что улучшает способность модели обучаться при малом количестве аннотаций.

Компьютерное зрение

△NAF проецирует шумовую и целевую области в общее пространство представлений и выполняет выравнивание на уровне классов. Изображение из статьи.

При наличии всего по 4 размеченных образца в каждой категории и использовании архитектуры ResNet-18 в качестве основы, NAF показал повышение точности на CIFAR-10, CIFAR-100, DTD-47 и Caltech-101 на 12,35, 7,61, 4,38 и 2,74 процентных пункта соответственно по сравнению со стандартной базовой моделью ERM (эмпирическая минимизация риска), обученной исключительно на размеченных данных. Исходный код статьи уже открыт, подробности см. в конце статьи.

Замените реальный источник домена на шум

Традиционное переносное обучение обычно требует богато аннотированной исходной области. Однако реальные исходные данные не всегда легко доступны. Ограничения, связанные с конфиденциальностью, секретностью и авторскими правами, могут препятствовать обмену данными исходной области. SSNA стремится устранить это предположение: исходная область больше не содержит реальных образцов, а заменяется шумом, сгенерированным из простого вероятностного распределения.

Конкретный подход несложен: предположим, что целевая задача включает C классов. Исследовательская команда сначала случайным образом выбирает вектор среднего значения в 1024-мерном пространстве для каждого класса и использует единичную матрицу в качестве ковариации, чтобы построить C гауссовых распределений, а затем выбирает по 50 шумовых векторов из каждого распределения. Шумовая область и целевая область используют одинаковый набор индексов классов, где каждый шумовой класс заранее сопоставлен с индексом целевого класса, однако само это сопоставление не содержит семантической информации.

Номера здесь сами по себе не имеют смысла. Шумовый класс 0 не означает «кошку» по умолчанию; он просто был заранее сопоставлен исследователями с определенным классом в целевой области до начала обучения. То, что действительно переносится, — это не визуальные знания о кошках или собаках, а дискриминативная структура, сформированная в шумовой области.

Шум одного класса сжимается вместе, а шум разных классов разделяется. Если эта структура может быть выровнена с целевой областью, она обеспечивает более четкие границы классификации для реальных целевых образцов.

Небольшие ярлыки по-прежнему необходимы

Шум может заменить исходные данные, но не может полностью заменить метки целевой области. Причина проста: шум поступает из другого пространства, а номера классов присваиваются вручную; модель должна использовать небольшое количество уже размеченных целевых образцов, чтобы определить, с каким реальным классом должен быть сопоставлен шумовый класс 0.

При снижении количества размеченных образцов на класс до нуля на CIFAR-100 точность ERM и NAF составила всего 0,97% и 1,34% соответственно, что близко к случайному уровню. Как только предоставляется небольшое количество размеченных данных, NAF постоянно превосходит ERM.

Таким образом, вывод работы заключается в том, что в условиях полусупервизированной классификации реальный исходный домен не обязательно является необходимым условием для положительного переноса.

NAF совершил три основных действия

На основе общей верхней границы, указанной в статье, NAF разделяет целевую функцию обучения на три части.

Сначала изучите небольшое количество реальных меток

Целевой доменный энкодер отображает реальные образцы в общее пространство представлений, а классификатор вычисляет кросс-энтропийную потерю на основе небольшого количества аннотированных образцов. Эта часть совпадает с обычным обучением с учителем и служит для построения связи между шумовыми классами и реальными категориями.

Снова сформируйте четкую структуру категорий для шума

Шумовой проектор отвечает за отображение случайных векторов в одно и то же представительное пространство, а классификатор распознает эти шумы в соответствии с предустановленными номерами категорий. После обучения шумы одного класса постепенно объединяются, а шумы разных классов разделяются.

В конце выровняйте обе стороны

NAF также вычисляет расхождение распределений между шумовой и целевой областями. Модуль выравнивания распределений не ограничивается конкретной реализацией; в статье сравнивались различные подходы, и в экспериментах опытным путем был выбран отрицательный показатель сходства доменов (Negative Domain Similarity, NDS) в качестве механизма по умолчанию. NDS одновременно сравнивает глобальные средние значения и средние значения для каждого класса в двух доменах, используя косинусное сходство для их сближения. Средние значения для неразмеченных целевых образцов оцениваются итеративно с использованием псевдометок, генерируемых моделью.

Полный набор целей можно записать как

Компьютерное зрение

.其中,

Компьютерное зрение

Ответственен за классификацию небольшого количества реальных целевых образцов с аннотациями.

Компьютерное зрение

Отвечает за классификацию шумов,

Компьютерное зрение

Отвечает за выравнивание распределений целевой и шумовой областей. Верхняя граница обобщения, представленная в статье, также соответствует этим трем пунктам: эмпирическая ошибка целевой области, эмпирическая ошибка шумовой области и различие распределений между двумя областями в пространстве общих представлений.

От CIFAR до ImageNet шум приносит пользу

Основной эксперимент охватывает 8 визуальных наборов данных и 1 набор данных для классификации текста. Для визуальных задач, кроме ImageNet-1K, используется по 4 аннотированных образца на класс, а остальные обучающие образцы используются как неаннотированные данные.

На ResNet-18 повышение Top-1 NAF по сравнению с ERM составило: CIFAR-10 +12,35%, CIFAR-100 +7,61%, DTD-47 +4,38%, Caltech-101 +2,74%.

Компьютерное зрение

Тонкая классификация также эффективна. При использовании ResNet-18 NAF повышает показатели относительно ERM на 8,94, 5,51 и 7,74 процентных пункта на наборах данных CUB-200, Oxford Flowers-102 и Stanford Cars-196 соответственно.

На более масштабном наборе данных ImageNet-1K исследовательская команда сохранила по 100 аннотированных образцов для каждого класса. NAF достиг точности 37,10%, что на 0,99 процентных пункта выше, чем у ERM. На текстовой задаче AG News-4 NAF с использованием BERT достиг 82,82%, что на 4,18 процентных пункта выше, чем у ERM (78,64%).

NAF также можно напрямую интегрировать в существующие полупривлеченные методы. Авторы статьи применили его к UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM и SA-FixMatch, и во всех случаях был получен прирост. Например, при 20 циклах обучения на CIFAR-10 точность UDA и FixMatch после добавления NAF повысилась на 20,83 и 9,91 процентных пункта соответственно.

Полезно не «случайное», а структура

Почему шум помогает? Эксперименты по абляции в статье указывают на один и тот же фактор: наличие разделимой структуры между классами.

Команда сначала сжала весь шум всех категорий в одну точку. В результате шумовое пространство полностью потеряло дискриминативную структуру, и NAF не только не принес выгоды, но и вызвал явный негативный перенос. Точность на CIFAR-10 упала с 58,15% у ERM до 33,34%, а на CIFAR-100 — с 42,24% до 6,79%.

Напротив, при постепенном увеличении расстояния между центрами шумовых классов точность на CIFAR-100 повысилась с 43,80% до 49,78%. Это указывает на то, что чем легче различать шумовые классы, тем сильнее обычно становится структурное направление.

Количество шума на самом деле не столь важно. При увеличении шума с 10 до 100 на каждый класс точность оставалась стабильной на уровне около 50%; после увеличения до 200 она немного снизилась. Авторы статьи делают вывод, что достаточно небольшого количества шума, если он способен формировать разделяемые паттерны.

Компьютерное зрение

Исследовательская команда также упростила шумовое пространство, сведя его к одной центральной точке на каждый класс. Результаты были выше, чем у ERM, независимо от того, были ли центры фиксированными или обучаемыми; обучаемые центры показали лучший результат, чем фиксированные, но все еще уступали полной версии NAF.

В эксперименте по переносу с Amazon на Caltech-10 реальные исходные данные по-прежнему немного превосходят другие варианты, однако шумовые источники уже способны повысить точность с 83,51% при ERM до примерно 88–89%. Это также предлагает более реалистичную позицию: когда реальные исходные данные недоступны, синтетический шум может служить недорогой альтернативой.

Он также отличается от распространенных методов усиления данных. Усиление данных обычно включает вращение, обрезку, интерполяцию или генерацию рядом с реальными образцами; SSNA сначала создает независимую шумовую область, а затем выполняет выравнивание между областями в пространстве представлений.

Резюме: без семантики структура все еще может быть перенесена

Эта работа предлагает неожиданный новый взгляд на обучение с переносом: исходные данные могут помочь целевой задаче не обязательно благодаря своей истинной семантике — структура категорий, сформированная в пространстве представлений, также может стать переносимыми знаниями.

NAF как раз использует это свойство, чтобы случайный шум формировал дифференцируемую структуру в общем пространстве представлений, а затем с помощью небольшого количества размеченных образцов передавал ее реальным данным. Экспериментальные результаты показывают, что даже если исходная область не содержит реальных изображений, текстов или аудио, при сохранении подходящей структуры классов это все еще может положительно повлиять на целевую задачу.

Другими словами, при переносе обучения переносится не только «что говорят данные», но и «как данные организованы в пространстве представлений». Это открывает новый подход для исследований в сценариях, где ограничены конфиденциальность, авторские права или доступ к реальным исходным данным.

Название статьи: Полуобучаемая адаптация к шуму: Перенос знаний из домена шума

Адрес статьи: https://arxiv.org/pdf/2606.00558

Адрес исходного кода: https://github.com/AIResearch-Group/SSNA

Видео-разбор: https://www.bilibili.com/video/BV1UV7h61EvW/

Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: команда SSNA

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.