游乐游手机版
首页/AI热点日报/热点详情

噪声正迁移技术助力AI训练涨分

类型:热点整理2026-07-22
迁移学习中的“源数据”,不一定局限于图像、文本或音频。 一组从高斯分布中随机采样、**毫无语义信息**的噪声,同样能在少量标注样本下帮助模型取得更优的学习效果。 这项研究被命名为**半监督噪声自适应(Semi-Supervised Noise Adaptation,SSNA)**,相关论文已被ICM
迁移学习中的“源数据”,不一定局限于图像、文本或音频。 一组从高斯分布中随机采样、**毫无语义信息**的噪声,同样能在少量标注样本下帮助模型取得更优的学习效果。 这项研究被命名为**半监督噪声自适应(Semi-Supervised Noise Adaptation,SSNA)**,相关论文已被ICML 2026收录。 SSNA团队还推出了**噪声自适应框架(Noise Adaptation Framework, NAF)**,该框架利用随机生成的噪声构建具有判别性的类别结构,并将这种**结构**迁移至真实目标数据,从而在仅有少量标注样本的条件下提升模型的学习能力。 **△**NAF将噪声域与目标域共同映射到共享表征空间,并在类别层面进行对齐。图片源自论文。 在每类仅提供4个标注样本的情况下,基于ResNet-18骨干网络,NAF在CIFAR-10、CIFAR-100、DTD-47和Caltech-101上的准确率,相较于**仅利用有标注样本训练的标准监督学习基线ERM**(经验风险最小化,Empirical Risk Minimization),分别提升了12.35、7.61、4.38和2.74个百分点。目前,论文源代码已开源。 ## **将真实源域替换为噪声** 传统的迁移学习方法通常需要一个拥有丰富标签的源域。然而,真实源数据往往难以获取,隐私、保密及版权限制都会导致源域数据无法共享。**SSNA试图打破这一前提:源域不再放置真实样本,而是替换为从简单概率分布中生成的噪声。** 具体实现并不复杂。假设目标任务包含C个类别,研究团队首先在1024维空间中为每个类别随机采样一个均值向量,并以单位矩阵作为协方差,由此构建C个高斯分布。接着从每个分布中采样50个噪声向量。噪声域与目标域使用相同的类别索引集合,每个噪声类别预先对应一个目标类别索引,但这种对应关系本身不包含任何语义信息。 这些编号本身不具备语义。噪声类0并不天然代表“猫”,仅在训练开始前由研究者固定对应到目标域中的某一类。真正被迁移的,并非猫或狗的视觉知识,而是噪声域中形成的**判别结构**。 同一类别的噪声被聚集在一起,不同类别的噪声则彼此分离。只要这套结构能够与目标域对齐,就能为真实目标样本提供更清晰的分类边界。 ### **少量标签仍然不可或缺** 噪声可以替代真实源数据,但无法完全替代目标域标签。原因十分直接:**噪声来自另一个空间,类别编号又是人为指定的,模型必须借助少量已标注的目标样本,才能确定噪声类0究竟对应哪个真实类别。** 论文在CIFAR-100上将每类标注样本降至0时,ERM和NAF的准确率分别仅为0.97%和1.34%,均接近随机水平。一旦提供少量标注,NAF便持续超越ERM。 因此,结论是:**在半监督分类设定中,真实源域并非实现正迁移的必要条件。** ## **NAF主要完成三项任务** 基于论文给出的泛化上界,NAF将训练目标分解为三个部分。 ### **先学好少量真实标签** 目标域编码器将真实样本映射到共享表征空间,分类器利用少量标注样本计算交叉熵损失。这部分与常规监督学习一致,用于建立噪声类与真实类别之间的桥梁。 ### **再让噪声形成清晰的类别结构** 噪声投影器负责将随机向量映射到同一表征空间,分类器则按照预设类别编号识别这些噪声。经过训练,同类噪声逐渐聚拢,不同类噪声彼此分离。 ### **最后完成两域对齐** NAF还会计算噪声域与目标域之间的分布差异。分布对齐模块不限定具体实现,论文对多种方案进行了比较,最终在实验中经验性地采用负域相似度(Negative Domain Similarity,NDS)作为默认机制。NDS同时比较两域的全局均值和各类别均值,并用余弦相似度推动它们靠近。未标注目标样本的类别均值,则由模型产生的伪标签迭代估计。 整套目标可以写成 。其中, 负责真实少量有标注的目标样本分类, 负责噪声分类, 负责目标域与噪声域的分布对齐。论文给出的泛化上界也对应这三项:目标域经验误差、噪声域经验误差,以及两域在共享表征空间中的分布差异。 ## **从CIFAR到ImageNet,噪声均能带来增益** 主实验覆盖了8个视觉数据集和1个文本分类数据集。除ImageNet-1K外,视觉任务均采用每类4个标注样本,其余训练样本作为无标注数据。 在ResNet-18上,NAF相较ERM的Top-1提升分别达到:CIFAR-10**+12.35**、CIFAR-100**+7.61**、DTD-47**+4.38**、Caltech-101**+2.74**个百分点。 △ 细粒度分类同样有效。使用ResNet-18时,NAF在CUB-200、Oxford Flowers-102和Stanford Cars-196上相对ERM分别提高8.94、5.51和7.74个百分点。 在更大规模的ImageNet-1K上,研究团队为每类保留100个标注样本。NAF达到37.10%准确率,比ERM高0.99个百分点。文本任务AG News-4上,使用BERT的NAF达到82.82%,比ERM的78.64%高4.18个百分点。 NAF也可以直接插入现有半监督方法。论文将其接入UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM和SA-FixMatch,整体都获得了增益。以CIFAR-10的20轮训练结果为例,UDA和FixMatch加入NAF后,准确率分别提高20.83和9.91个百分点。 ## **真正有用的不是“随机”,而是结构** 噪声为何能发挥作用?论文的消融实验将答案指向了同一个因素:**类别之间是否具有可分离的结构。** 团队首先将所有类别的噪声都压缩到同一个点。这样一来,噪声域彻底失去判别结构,NAF不但没有增益,反而出现明显的负迁移。CIFAR-10准确率从ERM的58.15%跌至33.34%,CIFAR-100则从42.24%跌至6.79%。 相反,当逐步拉大噪声类别中心之间的距离时,CIFAR-100准确率从43.80%一路提升至49.78%。这说明噪声类越容易区分,其提供的结构引导通常越强。 噪声数量反而没有那么关键。每类从10个增加到100个噪声时,准确率一直稳定在约50%;增加到200个后还略有下降。论文据此认为,只要能形成可分离模式,少量噪声就足以发挥作用。 △ 研究团队还将噪声域简化成每类一个中心点。无论中心固定还是可学习,结果都高于ERM;其中,可学习中心比固定中心更好,但仍低于完整NAF。 在Amazon到Caltech-10的迁移实验中,真实源数据整体仍略胜一筹,但噪声源域已经能将准确率从ERM的83.51%提升至约88%到89%。这也给出了更现实的定位:当真实源数据不可得时,合成噪声可以提供一种成本极低的替代方案。 它也不同于常见的数据增强。数据增强通常在真实样本附近进行旋转、裁剪、插值或生成;SSNA则先构造一个独立的噪声域,再在表征空间中完成跨域对齐。 ## **总结:没有语义,结构依然可以迁移** 这项工作为迁移学习提供了一个颇具反常识的新视角:**源数据能够帮助目标任务,未必完全依赖其真实语义,表征空间中形成的类别结构同样可能成为可迁移的知识。** NAF正是利用这一点,让随机噪声在共享表征空间中形成具有判别性的结构,再借助少量标注样本将其传递给真实数据。实验结果表明,即使源域不包含真实图像、文本或音频,只要保留合适的类别结构,依然可能对目标任务产生正向作用。 换句话说,迁移学习所迁移的,或许不只是“数据讲了什么”,还包括“数据在表征空间中如何组织”。这也为隐私受限、版权敏感或真实源数据难以获取的场景,提供了一条新的研究思路。
来源:https://36kr.com/p/3906459582747784

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。