在迁移学习领域,所谓的“源数据”并不一定局限于图像、文本或音频等传统形式。
一组从高斯分布中随机采样、并完全不含语义信息的噪声数据,同样能够有效辅助模型在仅有少量标注的情况下实现更好的学习效果。
这项研究正式命名为半监督噪声自适应(Semi-Supervised Noise Adaptation,SSNA),其相关论文已成功发表于ICML 2026。

SSNA研究团队进一步提出了一种噪声自适应框架(Noise Adaptation Framework, NAF)。其核心思路是:利用随机生成的噪声,构造出具有判别性的类别结构,并将这种结构高效迁移到真实目标数据上,从而显著提升模型在少量标注场景下的学习性能。

△NAF将噪声域和目标域投影到共享表征空间,并在类别层面进行对齐。图片来自论文。
在每类仅有4个标注样本的条件下,基于ResNet-18骨干网络,NAF在CIFAR-10、CIFAR-100、DTD-47和Caltech-101上的准确率,相比仅使用有标注样本训练的标准监督学习基线ERM(经验风险最小化,Empirical Risk Minimization),分别实现了12.35、7.61、4.38和2.74个百分点的显著提升。目前,该论文的源代码已开源,详情请参阅文末资源。
将真实源域替换为噪声
传统迁移学习通常依赖一个标签丰富的源域。然而,真实源数据并不总是容易获取。隐私保护、保密协议以及版权限制等因素,常常导致源域数据无法共享。SSNA的核心突破在于:它试图移除这一前提,将源域中的真实样本替换为从简单概率分布中生成的噪声。
具体实现方法并不复杂。假设目标任务包含C个类别,研究团队首先在1024维空间中为每个类别随机采样一个均值向量,并以单位矩阵作为协方差,由此构造出C个高斯分布。随后,从每个分布中采样50个噪声向量。噪声域与目标域使用相同的类别索引集合,每个噪声类别预先对应一个目标类别索引,但这种对应关系本身并不包含语义信息。
这里的编号本身没有语义。例如,噪声类0并不天然代表“猫”,它只是在训练开始前,研究者将其固定对应到目标域中的某一特定类别。真正被迁移的,并非猫或狗的视觉知识,而是噪声域中形成的判别结构。
同一类别的噪声被压缩到一起,而不同类别的噪声则被拉开。只要这套结构能够与目标域有效对齐,它就能为真实目标样本提供更清晰的分类边界。
少量标签仍然是必要的
噪声可以替代真实源数据,但并不能完全取代目标域中的标签信息。原因非常直接:噪声来自另一个空间,且类别编号是人为指定的,因此模型必须借助少量已标注的目标样本,才能确定噪声类0究竟对应哪个真实类别。
论文在CIFAR-100数据集上,将每类标注样本数量降至0时,ERM和NAF的准确率分别仅为0.97%和1.34%,均接近随机水平。然而,一旦提供少量标注样本,NAF便持续超越ERM。
因此,这项研究得出的结论是:在半监督分类设定中,真实源域并非实现正迁移的必要条件。
NAF主要完成了三项核心工作
围绕论文给出的泛化上界,NAF将训练目标分解为三个关键部分。
首先,充分学习少量真实标签
目标域编码器负责将真实样本映射到共享表征空间,分类器则利用少量标注样本计算交叉熵损失。这一部分与普通监督学习一致,旨在建立噪声类与真实类别之间的桥梁。
其次,让噪声形成清晰的类别结构
噪声投影器负责将随机向量映射到同一表征空间,分类器则根据预设的类别编号识别这些噪声。经过训练,同类噪声逐渐聚拢,不同类噪声彼此分离。
最后,实现两域对齐
NAF还会计算噪声域与目标域之间的分布差异。分布对齐模块并不限定具体实现方式,论文对多种方案进行了比较,最终在实验中经验性地采用负域相似度(Negative Domain Similarity,NDS)作为默认机制。NDS同时比较两域的全局均值和各类别均值,并利用余弦相似度推动它们相互靠近。未标注目标样本的类别均值,则由模型产生的伪标签迭代估计得出。

从CIFAR到ImageNet,噪声均可带来性能增益
主实验覆盖了8个视觉数据集和1个文本分类数据集。除ImageNet-1K外,视觉任务均采用每类4个标注样本,其余训练样本作为无标注数据使用。
在ResNet-18架构下,NAF相比ERM在Top-1准确率上取得了显著提升,具体为:CIFAR-10提升+12.35个百分点,CIFAR-100提升+7.61个百分点,DTD-47提升+4.38个百分点,Caltech-101提升+2.74个百分点。

△ResNet-18下,NAF在五个标准数据集上均超过ERM。图片来自论文。
细粒度分类任务同样效果显著。使用ResNet-18时,NAF在CUB-200、Oxford Flowers-102和Stanford Cars-196上相对ERM分别提升了8.94、5.51和7.74个百分点。
在更大规模的ImageNet-1K数据集上,研究团队为每类保留了100个标注样本。NAF达到了37.10%的准确率,比ERM高出0.99个百分点。在文本任务AG News-4上,使用BERT的NAF准确率达到82.82%,显著高于ERM的78.64%,提升了4.18个百分点。
NAF还可以直接集成到现有半监督方法中。论文将其接入UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM和SA-FixMatch,均观察到性能提升。以CIFAR-10的20轮训练结果为例,UDA和FixMatch在加入NAF后,准确率分别提高了20.83和9.91个百分点。
真正关键的不是“随机性”,而是结构
噪声为何能带来帮助?论文的消融实验将答案指向了同一个核心因素:类别之间是否具有可分离的结构。
团队首先将各类别的噪声均压缩至同一个点。这样一来,噪声域彻底失去了判别结构,NAF不仅没有带来增益,反而出现了明显的负迁移。CIFAR-10的准确率从ERM的58.15%跌至33.34%,而CIFAR-100则从42.24%跌至6.79%。
相反,当逐步拉大噪声类别中心之间的距离时,CIFAR-100的准确率从43.80%一路提升至49.78%。这表明,噪声类越容易区分,其能够提供的结构引导通常就越强。
噪声数量反而没那么关键。当每类噪声从10个增加到100个时,准确率稳定在约50%;增加到200个后甚至略有下降。据此,论文认为,只要能够形成可分离的模式,少量的噪声就足以发挥积极作用。

△NAF学到的目标表征更容易形成分离的类别簇,而ERM的表征则更为混杂。图片来自论文。
研究团队还将噪声域简化为每类一个中心点。无论中心点是固定的还是可学习的,结果均高于ERM;其中,可学习中心比固定中心效果更好,但仍低于完整的NAF。
在从Amazon到Caltech-10的迁移实验中,真实源数据整体仍略胜一筹,但噪声源域已经能够将准确率从ERM的83.51%提升至约88%到89%。这也为该方法提供了更现实的定位:当真实源数据不可得时,合成噪声可以成为一种成本极低的替代方案。
该方法也不同于常见的数据增强技术。数据增强通常在真实样本附近进行旋转、裁剪、插值或生成;而SSNA则是先构造一个独立的噪声域,再在表征空间中完成跨域对齐。
总结:没有语义,结构依然可以迁移
这项研究为迁移学习领域提供了一个颇具颠覆性的全新视角:源数据能够帮助目标任务,并不完全依赖于其真实语义,表征空间中形成的类别结构同样可能成为可迁移的知识。
NAF正是利用这一原理,让随机噪声在共享表征空间中形成具有判别性的结构,再借助少量标注样本将其传递给真实数据。实验结果表明,即使源域不包含真实图像、文本或音频,只要保留合适的类别结构,依然可能对目标任务产生正向作用。
换句话说,迁移学习所迁移的,或许不仅仅是“数据讲述了什么内容”,还包括“数据在表征空间中如何组织”。这也为隐私受限、版权敏感或真实源数据难以获取的应用场景,提供了一条全新的研究思路。
论文标题:Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain
论文地址:https://arxiv.org/pdf/2606.00558
源码地址:https://github.com/AIResearch-Group/SSNA
视频解读:https://www.bilibili.com/video/BV1UV7h61EvW/
