En el aprendizaje por transferencia, los "datos de origen" no necesitan ser necesariamente imágenes, texto o audio.
Un conjunto de ruido aleatorio muestreado de una distribución gaussiana, sin ningún significado semántico, también puede ayudar al modelo a aprender mejor con pocas etiquetas.
Este trabajo se denomina Semi-Supervised Noise Adaptation (SSNA), y el artículo ya ha sido publicado en ICML 2026.

El equipo SSNA propone adicionalmente un marco de adaptación al ruido (Noise Adaptation Framework, NAF), que utiliza ruido generado aleatoriamente para construir una estructura de categoría discriminativa y transfiere esta estructura a datos objetivo reales, mejorando así el rendimiento de aprendizaje del modelo en escenarios con poca anotación.

△NAF proyecta el dominio de ruido y el dominio objetivo en un espacio de representación compartido y realiza el alineamiento a nivel de categoría. Imagen tomada del artículo.
Con solo 4 muestras etiquetadas por categoría y utilizando una red ResNet-18 como backbone, NAF mejora la precisión en CIFAR-10, CIFAR-100, DTD-47 y Caltech-101 en 12.35, 7.61, 4.38 y 2.74 puntos porcentuales, respectivamente, en comparación con la línea base de aprendizaje supervisado estándar ERM (Minimización del Riesgo Empírico) que solo utiliza muestras etiquetadas. El código fuente del artículo ya está disponible públicamente; consulte al final del artículo para obtener más detalles.
Reemplazar el dominio de origen real con ruido
El aprendizaje por transferencia tradicional generalmente requiere un dominio fuente con muchas etiquetas. Sin embargo, los datos fuente reales no siempre son fáciles de obtener. Restricciones de privacidad, confidencialidad y derechos de autor pueden impedir que los datos del dominio fuente se compartan. SSNA intenta eliminar este supuesto: el dominio fuente ya no contiene muestras reales, sino ruido generado a partir de distribuciones de probabilidad simples.
El procedimiento no es complejo: supongamos que la tarea objetivo contiene C categorías. El equipo de investigación primero muestrea aleatoriamente un vector medio en un espacio de 1024 dimensiones para cada categoría, utilizando la matriz identidad como covarianza, lo que permite construir C distribuciones gaussianas. Luego, se muestrean 50 vectores de ruido desde cada distribución. El dominio de ruido y el dominio objetivo utilizan el mismo conjunto de índices de categoría, donde cada categoría de ruido se corresponde previamente con un índice de categoría objetivo, pero esta correspondencia no contiene información semántica.
El número en sí no tiene significado. La clase de ruido 0 no representa inherentemente "gato"; simplemente, antes del entrenamiento, los investigadores la fijaron como correspondiente a una cierta clase en el dominio objetivo. Lo que realmente se transfiere no es el conocimiento visual de gatos o perros, sino la estructura discriminativa formada en el dominio de ruido.
El ruido de la misma categoría se agrupa, mientras que el ruido de categorías diferentes se separa. Si esta estructura puede alinearse con el dominio objetivo, proporcionará fronteras de clasificación más claras para las muestras objetivo reales.
Se necesitan algunas etiquetas aún
El ruido puede reemplazar los datos de origen reales, pero no puede reemplazar completamente las etiquetas del dominio objetivo. La razón es directa: el ruido proviene de otro espacio, y los números de clase son asignados artificialmente; el modelo debe utilizar una pequeña cantidad de muestras objetivo etiquetadas para determinar a qué clase real debe alinearse la clase de ruido 0.
Cuando se reducen a cero las muestras etiquetadas por clase en CIFAR-100, la precisión de ERM y NAF es solo del 0,97% y el 1,34%, respectivamente, ambos cercanos al nivel aleatorio. Una vez que se proporcionan pocas etiquetas, NAF supera consistentemente a ERM.
Por lo tanto, la conclusión de este trabajo es que, en el contexto de clasificación semisupervisada, el dominio fuente real no es necesariamente un requisito para lograr una transferencia positiva.
NAF realizó tres cosas principales
En torno al límite de generalización presentado en el artículo, NAF divide el objetivo de entrenamiento en tres partes.
Aprende primero un pequeño número de etiquetas reales
El codificador de dominio mapea las muestras reales al espacio de representación compartido, y el clasificador calcula la pérdida de entropía cruzada utilizando una pequeña cantidad de muestras etiquetadas. Esta parte es consistente con el aprendizaje supervisado común y sirve para establecer un puente entre las clases ruidosas y las categorías reales.
Vuelve a formar una estructura de categorías clara con el ruido.
El proyector de ruido mapea vectores aleatorios al mismo espacio de representación, mientras que el clasificador identifica estos ruidos según los números de categoría preestablecidos. Después del entrenamiento, los ruidos de la misma clase tienden a agruparse, mientras que los ruidos de diferentes clases se separan entre sí.
Alinea finalmente ambos lados
NAF también calcula la diferencia de distribución entre el dominio de ruido y el dominio objetivo. El módulo de alineación de distribución no restringe una implementación específica; el artículo compara varias estrategias y, finalmente, adopta empíricamente la similitud de dominio negativo (Negative Domain Similarity, NDS) como mecanismo predeterminado en los experimentos. NDS compara simultáneamente la media global y las medias de cada clase de ambos dominios, utilizando la similitud del coseno para acercarlas. Las medias de clase de las muestras objetivo no etiquetadas se estiman iterativamente mediante etiquetas pseudoelegidas generadas por el modelo.
El conjunto completo de objetivos se puede escribir como

. Donde,

Encargarse de la clasificación de muestras objetivo reales, en pequeñas cantidades y con etiquetas.

Responsible for noise classification,

Responsable del alineamiento de las distribuciones del dominio objetivo y del dominio de ruido. La cota de generalización proporcionada en el artículo corresponde a estos tres elementos: el error empírico del dominio objetivo, el error empírico del dominio de ruido y la diferencia de distribución entre ambos dominios en el espacio de representación compartido.
Desde CIFAR hasta ImageNet, el ruido siempre aporta beneficios
El experimento principal cubre ocho conjuntos de datos visuales y un conjunto de datos de clasificación de texto. Excepto ImageNet-1K, en las tareas visuales se utilizan cuatro muestras etiquetadas por clase, y el resto de las muestras de entrenamiento se consideran sin etiquetar.
En ResNet-18, la mejora de NAF respecto a ERM en Top-1 es de: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 puntos porcentuales.

△
La clasificación de granularidad fina también es efectiva. Al usar ResNet-18, NAF mejora en 8.94, 5.51 y 7.74 puntos porcentuales respecto a ERM en CUB-200, Oxford Flowers-102 y Stanford Cars-196, respectivamente.
En el conjunto de datos ImageNet-1K a mayor escala, el equipo de investigación reservó 100 muestras etiquetadas por clase. NAF alcanzó una precisión del 37,10%, 0,99 puntos porcentuales más que ERM. En la tarea de texto AG News-4, NAF con BERT alcanzó un 82,82%, 4,18 puntos porcentuales más que el 78,64% de ERM.
NAF también se puede integrar directamente en métodos semisupervisados existentes. El artículo lo incorporó a UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM y SA-FixMatch, obteniendo mejoras en todos los casos. Como ejemplo con los resultados de 20 rondas de entrenamiento en CIFAR-10, la precisión de UDA y FixMatch aumentó 20,83 y 9,91 puntos porcentuales, respectivamente, tras incorporar NAF.
Lo realmente útil no es "aleatorio", sino la estructura
¿Por qué ayuda el ruido? Los experimentos de ablativo del artículo apuntan a un mismo factor: si existe una estructura separable entre las categorías.
El equipo primero comprimió todo el ruido de todas las categorías en un solo punto. Como resultado, el dominio del ruido perdió por completo su estructura discriminativa; NAF no solo no aportó beneficios, sino que experimentó una migración negativa clara. La precisión en CIFAR-10 descendió del 58,15% de ERM al 33,34%, y en CIFAR-100, del 42,24% al 6,79%.
Por el contrario, al aumentar progresivamente la distancia entre los centros de las clases de ruido, la precisión en CIFAR-100 aumentó desde el 43,80% hasta el 49,78%. Esto indica que cuanto más fáciles son de distinguir las clases de ruido, más fuerte es típicamente la guía estructural que proporcionan.
La cantidad de ruido no es tan crucial. Cuando se aumentó el ruido de 10 a 100 por categoría, la precisión se mantuvo estable alrededor del 50%; al aumentar a 200, descendió ligeramente. El artículo concluye que, siempre que se pueda formar un patrón separable, una pequeña cantidad de ruido es suficiente para funcionar.

△
El equipo de investigación también simplificó el dominio de ruido a un solo punto central por clase. Independientemente de si el centro es fijo o aprendible, los resultados superan a ERM; los centros aprendibles son mejores que los fijos, pero aún inferiores a NAF completo.
En el experimento de migración de Amazon a Caltech-10, los datos reales de origen aún superan ligeramente al conjunto completo, pero el dominio fuente con ruido ya puede aumentar la precisión del 83.51% de ERM a aproximadamente el 88% al 89%. Esto proporciona una ubicación más realista: cuando los datos de origen reales no están disponibles, el ruido sintético puede convertirse en una alternativa de bajo costo.
También difiere de las técnicas comunes de aumento de datos. El aumento de datos generalmente realiza rotaciones, recortes, interpolaciones o generaciones cerca de muestras reales; SSNA primero construye un dominio de ruido independiente y luego logra el alineamiento entre dominios en el espacio de representación.
Resumen: Sin significado, la estructura aún puede transferirse
Este trabajo ofrece una nueva perspectiva contraintuitiva para el aprendizaje por transferencia: los datos de origen pueden ayudar a la tarea objetivo sin depender necesariamente de su semántica real; la estructura de categorías formada en el espacio de representación también puede convertirse en conocimiento transferible.
NAF aprovecha precisamente este aspecto para que el ruido aleatorio forme una estructura discriminativa en el espacio de representaciones compartidas, y luego transmite esta estructura a los datos reales mediante un pequeño número de muestras etiquetadas. Los resultados experimentales muestran que, incluso si el dominio fuente no contiene imágenes, textos o audios reales, siempre que se conserve la estructura de clase adecuada, aún es posible tener un efecto positivo en la tarea objetivo.
En otras palabras, lo que se transfiere en el aprendizaje por transferencia puede no solo ser “lo que los datos describen”, sino también “cómo los datos se organizan en el espacio de representación”. Esto abre una nueva línea de investigación para escenarios con restricciones de privacidad, sensibilidad de derechos de autor o dificultad para acceder a los datos de origen reales.
Título del artículo: Adaptación al ruido semisupervisada: Transferencia de conocimiento desde el dominio de ruido
Dirección del artículo: https://arxiv.org/pdf/2606.00558
Dirección del código fuente: https://github.com/AIResearch-Group/SSNA
Análisis en video: https://www.bilibili.com/video/BV1UV7h61EvW/
Este artículo proviene del canal de WeChat "Quantum Bit", autor: equipo SSNA
