El ruido puede mejorar el rendimiento del modelo en el aprendizaje semisupervisado

icon MarsBit
Compartir
AI summary iconResumen
Un nuevo estudio titulado 'Adaptación al ruido semisupervisada: Transferencia de conocimiento desde el dominio del ruido', publicado en ICML 2026, muestra que el ruido aleatorio puede mejorar el rendimiento de los modelos en escenarios con pocas etiquetas. El Marco de Adaptación al Ruido (NAF) construye estructuras de clase a partir del ruido y las transfiere a datos reales, mejorando la precisión en conjuntos de datos como CIFAR-10 e ImageNet-1K. En medio de la evolución de MiCA (Regulación de Mercados de Activos Criptográficos de la UE), tales avances podrían mejorar la liquidez y los mercados de criptoactivos al optimizar los modelos predictivos utilizados en el comercio y el análisis de riesgos.

En el aprendizaje por transferencia, los "datos de origen" no necesitan ser necesariamente imágenes, texto o audio.

Un conjunto de ruido aleatorio muestreado de una distribución gaussiana, sin ningún significado semántico, también puede ayudar al modelo a aprender mejor con pocas etiquetas.

Este trabajo se denomina Semi-Supervised Noise Adaptation (SSNA), y el artículo ya ha sido publicado en ICML 2026.

Visión por computadora

El equipo SSNA propone adicionalmente un marco de adaptación al ruido (Noise Adaptation Framework, NAF), que utiliza ruido generado aleatoriamente para construir una estructura de categoría discriminativa y transfiere esta estructura a datos objetivo reales, mejorando así el rendimiento de aprendizaje del modelo en escenarios con poca anotación.

Visión por computadora

△NAF proyecta el dominio de ruido y el dominio objetivo en un espacio de representación compartido y realiza el alineamiento a nivel de categoría. Imagen tomada del artículo.

Con solo 4 muestras etiquetadas por categoría y utilizando una red ResNet-18 como backbone, NAF mejora la precisión en CIFAR-10, CIFAR-100, DTD-47 y Caltech-101 en 12.35, 7.61, 4.38 y 2.74 puntos porcentuales, respectivamente, en comparación con la línea base de aprendizaje supervisado estándar ERM (Minimización del Riesgo Empírico) que solo utiliza muestras etiquetadas. El código fuente del artículo ya está disponible públicamente; consulte al final del artículo para obtener más detalles.

Reemplazar el dominio de origen real con ruido

El aprendizaje por transferencia tradicional generalmente requiere un dominio fuente con muchas etiquetas. Sin embargo, los datos fuente reales no siempre son fáciles de obtener. Restricciones de privacidad, confidencialidad y derechos de autor pueden impedir que los datos del dominio fuente se compartan. SSNA intenta eliminar este supuesto: el dominio fuente ya no contiene muestras reales, sino ruido generado a partir de distribuciones de probabilidad simples.

El procedimiento no es complejo: supongamos que la tarea objetivo contiene C categorías. El equipo de investigación primero muestrea aleatoriamente un vector medio en un espacio de 1024 dimensiones para cada categoría, utilizando la matriz identidad como covarianza, lo que permite construir C distribuciones gaussianas. Luego, se muestrean 50 vectores de ruido desde cada distribución. El dominio de ruido y el dominio objetivo utilizan el mismo conjunto de índices de categoría, donde cada categoría de ruido se corresponde previamente con un índice de categoría objetivo, pero esta correspondencia no contiene información semántica.

El número en sí no tiene significado. La clase de ruido 0 no representa inherentemente "gato"; simplemente, antes del entrenamiento, los investigadores la fijaron como correspondiente a una cierta clase en el dominio objetivo. Lo que realmente se transfiere no es el conocimiento visual de gatos o perros, sino la estructura discriminativa formada en el dominio de ruido.

El ruido de la misma categoría se agrupa, mientras que el ruido de categorías diferentes se separa. Si esta estructura puede alinearse con el dominio objetivo, proporcionará fronteras de clasificación más claras para las muestras objetivo reales.

Se necesitan algunas etiquetas aún

El ruido puede reemplazar los datos de origen reales, pero no puede reemplazar completamente las etiquetas del dominio objetivo. La razón es directa: el ruido proviene de otro espacio, y los números de clase son asignados artificialmente; el modelo debe utilizar una pequeña cantidad de muestras objetivo etiquetadas para determinar a qué clase real debe alinearse la clase de ruido 0.

Cuando se reducen a cero las muestras etiquetadas por clase en CIFAR-100, la precisión de ERM y NAF es solo del 0,97% y el 1,34%, respectivamente, ambos cercanos al nivel aleatorio. Una vez que se proporcionan pocas etiquetas, NAF supera consistentemente a ERM.

Por lo tanto, la conclusión de este trabajo es que, en el contexto de clasificación semisupervisada, el dominio fuente real no es necesariamente un requisito para lograr una transferencia positiva.

NAF realizó tres cosas principales

En torno al límite de generalización presentado en el artículo, NAF divide el objetivo de entrenamiento en tres partes.

Aprende primero un pequeño número de etiquetas reales

El codificador de dominio mapea las muestras reales al espacio de representación compartido, y el clasificador calcula la pérdida de entropía cruzada utilizando una pequeña cantidad de muestras etiquetadas. Esta parte es consistente con el aprendizaje supervisado común y sirve para establecer un puente entre las clases ruidosas y las categorías reales.

Vuelve a formar una estructura de categorías clara con el ruido.

El proyector de ruido mapea vectores aleatorios al mismo espacio de representación, mientras que el clasificador identifica estos ruidos según los números de categoría preestablecidos. Después del entrenamiento, los ruidos de la misma clase tienden a agruparse, mientras que los ruidos de diferentes clases se separan entre sí.

Alinea finalmente ambos lados

NAF también calcula la diferencia de distribución entre el dominio de ruido y el dominio objetivo. El módulo de alineación de distribución no restringe una implementación específica; el artículo compara varias estrategias y, finalmente, adopta empíricamente la similitud de dominio negativo (Negative Domain Similarity, NDS) como mecanismo predeterminado en los experimentos. NDS compara simultáneamente la media global y las medias de cada clase de ambos dominios, utilizando la similitud del coseno para acercarlas. Las medias de clase de las muestras objetivo no etiquetadas se estiman iterativamente mediante etiquetas pseudoelegidas generadas por el modelo.

El conjunto completo de objetivos se puede escribir como

Visión por computadora

. Donde,

Visión por computadora

Encargarse de la clasificación de muestras objetivo reales, en pequeñas cantidades y con etiquetas.

Visión por computadora

Responsible for noise classification,

Visión por computadora

Responsable del alineamiento de las distribuciones del dominio objetivo y del dominio de ruido. La cota de generalización proporcionada en el artículo corresponde a estos tres elementos: el error empírico del dominio objetivo, el error empírico del dominio de ruido y la diferencia de distribución entre ambos dominios en el espacio de representación compartido.

Desde CIFAR hasta ImageNet, el ruido siempre aporta beneficios

El experimento principal cubre ocho conjuntos de datos visuales y un conjunto de datos de clasificación de texto. Excepto ImageNet-1K, en las tareas visuales se utilizan cuatro muestras etiquetadas por clase, y el resto de las muestras de entrenamiento se consideran sin etiquetar.

En ResNet-18, la mejora de NAF respecto a ERM en Top-1 es de: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 puntos porcentuales.

Visión por computadora

La clasificación de granularidad fina también es efectiva. Al usar ResNet-18, NAF mejora en 8.94, 5.51 y 7.74 puntos porcentuales respecto a ERM en CUB-200, Oxford Flowers-102 y Stanford Cars-196, respectivamente.

En el conjunto de datos ImageNet-1K a mayor escala, el equipo de investigación reservó 100 muestras etiquetadas por clase. NAF alcanzó una precisión del 37,10%, 0,99 puntos porcentuales más que ERM. En la tarea de texto AG News-4, NAF con BERT alcanzó un 82,82%, 4,18 puntos porcentuales más que el 78,64% de ERM.

NAF también se puede integrar directamente en métodos semisupervisados existentes. El artículo lo incorporó a UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM y SA-FixMatch, obteniendo mejoras en todos los casos. Como ejemplo con los resultados de 20 rondas de entrenamiento en CIFAR-10, la precisión de UDA y FixMatch aumentó 20,83 y 9,91 puntos porcentuales, respectivamente, tras incorporar NAF.

Lo realmente útil no es "aleatorio", sino la estructura

¿Por qué ayuda el ruido? Los experimentos de ablativo del artículo apuntan a un mismo factor: si existe una estructura separable entre las categorías.

El equipo primero comprimió todo el ruido de todas las categorías en un solo punto. Como resultado, el dominio del ruido perdió por completo su estructura discriminativa; NAF no solo no aportó beneficios, sino que experimentó una migración negativa clara. La precisión en CIFAR-10 descendió del 58,15% de ERM al 33,34%, y en CIFAR-100, del 42,24% al 6,79%.

Por el contrario, al aumentar progresivamente la distancia entre los centros de las clases de ruido, la precisión en CIFAR-100 aumentó desde el 43,80% hasta el 49,78%. Esto indica que cuanto más fáciles son de distinguir las clases de ruido, más fuerte es típicamente la guía estructural que proporcionan.

La cantidad de ruido no es tan crucial. Cuando se aumentó el ruido de 10 a 100 por categoría, la precisión se mantuvo estable alrededor del 50%; al aumentar a 200, descendió ligeramente. El artículo concluye que, siempre que se pueda formar un patrón separable, una pequeña cantidad de ruido es suficiente para funcionar.

Visión por computadora

El equipo de investigación también simplificó el dominio de ruido a un solo punto central por clase. Independientemente de si el centro es fijo o aprendible, los resultados superan a ERM; los centros aprendibles son mejores que los fijos, pero aún inferiores a NAF completo.

En el experimento de migración de Amazon a Caltech-10, los datos reales de origen aún superan ligeramente al conjunto completo, pero el dominio fuente con ruido ya puede aumentar la precisión del 83.51% de ERM a aproximadamente el 88% al 89%. Esto proporciona una ubicación más realista: cuando los datos de origen reales no están disponibles, el ruido sintético puede convertirse en una alternativa de bajo costo.

También difiere de las técnicas comunes de aumento de datos. El aumento de datos generalmente realiza rotaciones, recortes, interpolaciones o generaciones cerca de muestras reales; SSNA primero construye un dominio de ruido independiente y luego logra el alineamiento entre dominios en el espacio de representación.

Resumen: Sin significado, la estructura aún puede transferirse

Este trabajo ofrece una nueva perspectiva contraintuitiva para el aprendizaje por transferencia: los datos de origen pueden ayudar a la tarea objetivo sin depender necesariamente de su semántica real; la estructura de categorías formada en el espacio de representación también puede convertirse en conocimiento transferible.

NAF aprovecha precisamente este aspecto para que el ruido aleatorio forme una estructura discriminativa en el espacio de representaciones compartidas, y luego transmite esta estructura a los datos reales mediante un pequeño número de muestras etiquetadas. Los resultados experimentales muestran que, incluso si el dominio fuente no contiene imágenes, textos o audios reales, siempre que se conserve la estructura de clase adecuada, aún es posible tener un efecto positivo en la tarea objetivo.

En otras palabras, lo que se transfiere en el aprendizaje por transferencia puede no solo ser “lo que los datos describen”, sino también “cómo los datos se organizan en el espacio de representación”. Esto abre una nueva línea de investigación para escenarios con restricciones de privacidad, sensibilidad de derechos de autor o dificultad para acceder a los datos de origen reales.

Título del artículo: Adaptación al ruido semisupervisada: Transferencia de conocimiento desde el dominio de ruido

Dirección del artículo: https://arxiv.org/pdf/2606.00558

Dirección del código fuente: https://github.com/AIResearch-Group/SSNA

Análisis en video: https://www.bilibili.com/video/BV1UV7h61EvW/

Este artículo proviene del canal de WeChat "Quantum Bit", autor: equipo SSNA

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.