Ang ingay ay maaaring mapabuti ang pagganap ng modelo sa Semi-Supervised Learning

icon MarsBit
I-share
AI summary iconSummary
Isang bagong pag-aaral na may pamagat na 'Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain' na napanood sa ICML 2026 ay nagpapakita na ang random noise ay maaaring palakasin ang performance ng model sa mga sitwasyon na mababa ang mga label. Ang Noise Adaptation Framework (NAF) ay bumubuo ng mga klase na istruktura mula sa noise at i-transfer ito sa totoong data, na nagpapabuti sa akurasyon sa mga dataset tulad ng CIFAR-10 at ImageNet-1K. Sa gitna ng patuloy na pag-unlad ng MiCA (EU Markets in Crypto-Assets Regulation), ang ganitong mga pag-unlad ay maaaring mapalakas ang likuididad at mga crypto market sa pamamagitan ng pagpapabuti ng mga predictive model na ginagamit sa trading at risk analysis.

Ang "source data" sa transfer learning ay hindi kailangang larawan, teksto, o audio.

Ang isang set ng ingay na random na kinuha mula sa Gaussian distribution na walang semantika ay maaari ring tumulong sa modelong matututo nang mas mabuti sa maliit na bilang ng mga label.

Ang proyektong ito ay tinatawag na Semi-Supervised Noise Adaptation (SSNA), at ang papel ay na-publish sa ICML 2026.

Computer vision

Hinulma ng team ng SSNA ang Noise Adaptation Framework (NAF), na gumagamit ng random na noise upang lumikha ng isang diskriminatibong estruktura ng kategorya at isasalin ito sa totoong target data, upang mapabuti ang pagkatuto ng modelo sa mga sitwasyon na may kaunting pag-annotation.

Computer vision

△INA ay proyekto ang noise domain at target domain sa isang shared representation space at nag-aalign sa antas ng kategorya. Larawan mula sa papel.

Sa pamamagitan ng apat na label na sample lamang bawat kategorya, at gamit ang ResNet-18 backbone, ang NAF ay nagdala ng pagtaas sa accuracy ng 12.35, 7.61, 4.38, at 2.74 puntos sa CIFAR-10, CIFAR-100, DTD-47, at Caltech-101, kumpara sa standard supervised learning baseline na ERM (Empirical Risk Minimization) na gumagamit lamang ng label na data. Ang source code ng papel ay nasa open source na kasalukuyan; tingnan ang dulo ng artikulo para sa karagdagang impormasyon.

Palitan ang tunay na source domain ng ingay

Ang tradisyonal na transfer learning ay karaniwang nangangailangan ng isang may sapat na label na source domain. Ngunit ang totoong source data ay hindi laging madaling maabot. Ang privacy, confidentiality, at copyright restrictions ay maaaring magdulot ng pagkakaroon ng mga hadlang sa pagbabahagi ng source domain data. Sinubukan ng SSNA na tanggalin ang ipinapalagay na ito: ang source domain ay hindi na naglalaman ng totoong sample, kundi napalitan ng ingay na ginawa mula sa simpleng probability distribution.

Hindi komplikado ang paraan: Sa pagpapalagay na ang layuning task ay may C mga kategorya, unang pinagsamantalahan ng panel ng pag-aaral ang isang mean vector na pinili nang random sa isang 1024-dimensyonal na espasyo para sa bawat kategorya, gamit ang identity matrix bilang covariance, upang buuin ang C mga Gaussian distribution, at pagkatapos ay pinagsamantalahan ang 50 noise vectors mula sa bawat distribution. Ang noise domain at ang target domain ay gumagamit ng parehong set ng index ng kategorya, kung saan bawat noise category ay nakapre-assign sa isang target category index, ngunit ang pagkakatugma na ito ay hindi naglalaman ng anumang semantikong impormasyon.

Ang numero mismo ay walang kahulugan. Ang ingay na klase 0 ay hindi natural na nangangahulugan ng “pusa,” ngunit pinili ng mga mananaliksik ito na iugnay sa isang partikular na klase sa target domain bago magsimula ang pagtuturo. Ang hindi talagang na-migrate ay ang visual na kaalaman ng pusa o aso, kundi ang diskriminatibong istruktura na nabuo sa noise domain.

Pinipigil ang ingay na kabilang sa iisang kategorya, habang pinapalayo ang ingay na kabilang sa iba’t ibang kategorya. Kung ang istrukturang ito ay maaaring mag-align sa target domain, maaari itong magbigay ng mas malinaw na hangganan para sa mga totoong target sample.

Kailangan pa rin ang kaunting mga label

Ang ingay ay maaaring magpalit ng totoong source data, ngunit hindi ito maaaring buong-pusong magpalit ng mga label ng target domain. Ang dahilan ay diretso: ang ingay ay galing sa ibang espasyo, at ang mga numero ng kategorya ay tao-ang nakatakda, kaya kailangan ng modelo ang ilang kaunting may-annotasyon na target sample upang malaman kung aling totoong kategorya ang dapat i-align sa noise class 0.

Kapag binawasan ang mga sample ng label sa bawat klase sa CIFAR-100 hanggang sa zero, ang accuracy ng ERM at NAF ay bumaba lamang sa 0.97% at 1.34% nang magkakasama, na malapit sa antas ng random. Kapag ibinigay ang kaunting mga label, patuloy na lumalampas ang NAF sa ERM.

Kaya ang konklusyon ng gawain na ito ay: sa halagang semi-supervised classification, ang totoong source domain ay hindi kailangang maging kinakailangan para sa positive transfer.

Ginawa ng NAF ang tatlong bagay

Batay sa pangkalahatang hangganan na ibinigay sa papel, hinati ng NAF ang layunin sa pagtatrain sa tatlong bahagi.

Magsimula muna sa kaunting totoong label

Ang target domain encoder ay nagpapalit ng totoong sample sa shared representation space, samantalang ang classifier ay gumagamit ng kaunting may-annotation na sample upang kalkulahin ang cross-entropy loss. Ang bahaging ito ay pareho sa karaniwang supervised learning, na ginagamit upang buuin ang tulay sa pagitan ng noise class at totoong klase.

Gawin ulit ang ingay na may malinaw na istruktura ng mga kategorya

Ang noise projector ang responsable sa pagmamapa ng random vectors sa parehong representation space, habang ang classifier ay nag-iidentify ng mga noise batay sa pre-set na kategorya. Pagkatapos ng pagtuturo, ang mga magkakatulad na noise ay nagsisikap na mag-umpisa, habang ang iba’t ibang uri ng noise ay nagsiseparate.

I-align ang parehong gilid

Ang NAF ay kumukalkula rin ng pagkakaiba sa distribusyon sa pagitan ng noise domain at target domain. Ang distribution alignment module ay hindi nakalimita sa isang partikular na implementasyon; ang papel ay nagkumpara ng iba’t ibang solusyon at sa huli ay empirikal na napili ang Negative Domain Similarity (NDS) bilang default na mekanismo sa mga eksperimento. Ang NDS ay naghahambing nang sabay sa global mean at class-specific mean ng dalawang domain, at gumagamit ng cosine similarity upang palapitin ang mga ito. Ang class-specific mean ng mga hindi inlabel na target sample ay iniiwasan sa pamamagitan ng iteratibong pag-estima gamit ang pseudo-labels na nilikha ng modelo.

Ang buong target ay maaaring isulat bilang

Computer vision

. Kung saan,

Computer vision

Mag-assign ng mga maliit na bilang ng mga target sample na may annotation para sa pagklasipikasyon.

Computer vision

Nakakasalang sa pagkakategorya ng ingay,

Computer vision

Nakikisali sa pagpapareho ng distribusyon ng target domain at noise domain. Ang upper bound ng generalization na ibinigay ng papel ay tumutugma sa tatlong ito: empirical error ng target domain, empirical error ng noise domain, at pagkakaiba ng distribusyon sa pagitan ng dalawang domain sa shared representation space.

Mula sa CIFAR hanggang sa ImageNet, ang ingay ay nagdudulot ng pagpapabuti

Ang pangunahang eksperimento ay sumasakop sa 8 na dataset ng visual data at 1 na dataset ng text classification. Sa mga visual task, maliban sa ImageNet-1K, ginagamit ang 4 na may-annotasyon na sample bawat klase, habang ang natitirang training samples ay ginagamit bilang hindi may-annotasyon na data.

Sa ResNet-18, ang pagtaas ng Top-1 ng NAF kumpara sa ERM ay: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 na puntos.

Computer vision

Ang detalyadong klasipikasyon ay epektibo rin. Habang ginagamit ang ResNet-18, tinataas ng NAF ang ERM sa CUB-200, Oxford Flowers-102, at Stanford Cars-196 ng 8.94, 5.51, at 7.74 puntos porsiyento, ayon sa pagkakasunod-sunod.

Sa mas malaking ImageNet-1K, ang panel ng mga siyentipiko ay nag-iisa ng 100 na may-annote na sample bawat klase. Ang NAF ay nakamit ang 37.10% na akurasyon, 0.99 puntos porsyento ang higit sa ERM. Sa text task na AG News-4, ang NAF na gumagamit ng BERT ay nakamit ang 82.82%, na 4.18 puntos porsyento ang higit sa 78.64% ng ERM.

Ang NAF ay maaari ring direktang i-integrate sa umiiral na semi-supervised na paraan. Ipinasok ng papel ang NAF sa UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM, at SA-FixMatch, at lahat ay nakaranas ng pagpapabuti. Bilang halimbawa sa 20 na round ng pagtatrain sa CIFAR-10, tumataas ang akurasyon ng UDA at FixMatch ng 20.83 at 9.91 puntos porsyento pagkatapos magdagdag ng NAF.

Hindi ang "random" ang tunay na kapaki-pakinabang, kundi ang istruktura

Bakit nakakatulong ang ingay? Ang mga eksperimento sa ablation ng papel ay nagtuturo sa iisang salik: Kung mayroon bang hiwalay na istruktura sa pagitan ng mga kategorya.

Unang-una ay pinagsama ng team ang lahat ng uri ng ingay sa isang tanging punto. Dahil dito, nawala ang ganap na diskriminatibong istruktura ng noise domain, at hindi lamang wala ang benepisyo ng NAF, kundi lumabas din ang malaking negative transfer. Bumaba ang accuracy sa CIFAR-10 mula sa 58.15% ng ERM patungo sa 33.34%, habang bumaba ang CIFAR-100 mula sa 42.24% patungo sa 6.79%.

Sa kabaligtaran, habang dinadagdagan ang distansya sa pagitan ng mga sentro ng ingay na kategorya, tumataas ang akurasyon ng CIFAR-100 mula sa 43.80% patungo sa 49.78%. Ito ay nagpapakita na mas madaling distingguhin ang ingay na kategorya, mas malakas ang estruktural na gabay na maaari itong magbigay.

Ang bilang ng ingay ay hindi gaanong mahalaga. Habang tumataas ang ingay mula sa 10 hanggang 100 bawat kategorya, ang akurasyo ay nanatili sa halos 50%; nang tumaba ito sa 200, bumaba kaunti. Ayon sa papel, kung makakabuo ng hiwalay na pattern, sapat na ang kaunting ingay upang magtrabaho.

Computer vision

Pinasimple rin ng panel ng pag-aaral ang noise domain sa isang sentro bawat klase. Anuman ang fixed o learnable na sentro, mas mataas ang resulta kaysa sa ERM; ang learnable center ay mas mahusay kaysa sa fixed center, ngunit mas mababa pa rin kaysa sa buong NAF.

Sa eksperimento ng paglipat mula sa Amazon patungo sa Caltech-10, ang totoong source data ay patuloy na may kaunting pagkakalaban, ngunit ang noise source domain ay nakapagpataas na ng accuracy mula sa 83.51% ng ERM patungo sa halos 88% hanggang 89%. Ito ay nagbibigay din ng mas realistiko na pagkakaposition: kapag hindi available ang totoong source data, ang synthesized noise ay maaaring maging isang mura at alternatibong solusyon.

Ito rin ay iba sa karaniwang data augmentation. Ang data augmentation ay karaniwang nagpapagawa ng pag-ikot, pag-crop, pag-interpolate, o pag-generate malapit sa totoong sample; ang SSNA naman ay nagbuo muna ng isang independiyenteng noise domain, at pagkatapos ay nagawa ang cross-domain alignment sa representation space.

Buod: Walang semantika, ang istruktura ay maa pa ring i-migrate

Nagbibigay ang pag-aaral na ito ng isang hindi karaniwang pananaw sa transfer learning: ang source data ay makakatulong sa target task, hindi lamang sa pamamagitan ng tunay na kahulugan nito, kundi maaari ring sa pamamagitan ng istruktura ng kategorya na nabubuo sa representation space na maaaring maging isang nakakatransfer na kaalaman.

Gumagamit ang NAF ng point na ito upang mabuo ang mga diskriminatibong istruktura sa shared representation space mula sa random noise, at pagkatapos ay ipapasa ito sa totoong data gamit ang kaunting may-annotasyong sample. Ipinakita ng mga resulta ng eksperimento na kahit hindi naglalaman ang source domain ng totoong imahe, teksto, o audio, maaari pa ring magkaroon ng positibong epekto sa target task kung angkop ang klaseng istruktura.

Sa ibang salita, ang napapalitan ng transfer learning ay hindi lamang “ano ang sinasabi ng data”, kundi kung paano din nakakalikom ang data sa representation space. Ito ay nagbibigay ng bagong direksyon sa pag-aaral para sa mga sitwasyon na may limitasyon sa privacy, sensitibo sa copyright, o kung saan ang tunay na source data ay mahirap maabot.

Pamagat ng papel: Semi-Supervised Noise Adaptation: Pagpapadala ng Kaalaman mula sa Noise Domain

Link ng papel: https://arxiv.org/pdf/2606.00558

Source code address: https://github.com/AIResearch-Group/SSNA

Video analysis: https://www.bilibili.com/video/BV1UV7h61EvW/

Ang artikulong ito ay galing sa WeChat public account na “Quantum Bit”, may-akda: Ang ekipa ng SSNA

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.