自监督学习在自然语言处理(NLP)和计算机视觉(CV)等领域已取得令人瞩目的成果。然而,一个不容忽视的现实是:尽管这些算法在理论上具有通用性,但在实际应用中却几乎是为特定数据模态“量身定制”的。例如,为图像设计的方法很难直接迁移到文本或点云处理上。针对这一痛点,本文提出了一项核心贡献——一种通用的数据增强技术,理论上可适用于任意数据模态。实验结果表明,该技术不仅性能显著超越现有的通用自监督方法,而且在许多场景下能够替代为特定模态精心设计的复杂数据增强组合,效果几乎持平甚至更优。
简介
当前的孪生网络表征学习(对比学习)的核心机制是依赖数据增强,从同一数据样本中生成不同的视图,然后送入两个并行的网络进行对比,从而产生足够的监督信号。问题在于,这些数据增强技术高度依赖模态特定的先验知识。开发者通常需要手动设计或借助搜索工具来寻找当前模态下的最优组合——这一过程既耗时费力,且找到的增强方式几乎无法迁移到其他领域。典型的例子是,针对自然RGB图像设计的颜色抖动(color jittering),对于非图像数据模态基本失效。
从一般视角看,输入数据可表示为由序列维度(sequential)和通道维度(channel)构成的二维向量。序列维度通常与模态相关——如图像的空间维度、语音的时间维度、语言的句法维度;而通道维度则是模态无关的。在自监督学习中,掩码建模(masked modeling)或基于掩码的数据增强已被证明非常有效,但这些操作几乎都作用于序列维度。为了实现真正跨模态的通用性,本文提出了一种作用于通道维度的数据增强方法:随机量化(randomized quantization)。具体做法是:每个通道中的数据通过一个非均匀量化器进行动态量化,量化值从随机划分的区间中随机采样。这样一来,落在同一区间内的原始输入信息差异被消除,同时不同区间数据的相对大小得以保留——从而在通道维度上实现了类似掩码的效果。

实验表明,该方法在多种数据模态上均超越了现有的任意模态自监督学习方法——涵盖自然图像、3D点云、语音、文本、传感器数据、医疗图像等。在多种预训练任务中(如对比学习MoCo-v3、自蒸馏自监督学习BYOL),该方法学习到的特征均优于现有方法。此外,该方法对不同骨干网络(如CNN、Transformer)均表现友好且稳定。
方法
量化(Quantization)本身并非新概念,它通过一组离散数值表征连续数据,便于存储、传输和计算。但传统量化操作的目标是在不损失过多精度的前提下压缩数据,因此整个过程是确定性的,并力求逼近原始数据。这种特性恰好限制了其作为数据增强手段时的强度与信息丰富度。
本文提出的随机量化操作则反其道而行之:输入的每个通道数据被独立地划分为多个互不重叠的随机区间(
),然后落在各区间内的原始输入被映射到一个从该区间随机采样的常数
。

随机量化之所以能成为自监督学习中有效的通道维度掩码手段,关键在于以下三点设计:1) 随机划分数值区间;2) 随机采样输出值;3) 控制划分的数值区间个数。
具体而言,随机性带来了更丰富的数据样本——同一份数据每次执行随机量化都能生成不同的视图。同时,随机性也放大了增强的力度,例如随机划分出很大的数据区间,或当映射点严重偏离区间中值时,都会使落在该区间的原始输入与输出之间产生显著差异。此外,通过适当减少划分的区间个数可进一步提升增强强度。如此一来,在孪生网络表征学习中,两个网络分支能够看到信息差异足够大的输入,从而构建出足够强的学习信号,显著促进特征学习。
下图展示了不同数据模态应用该数据增强方法后的效果:

实验结果
模态1:图像
在ImageNet-1K数据集上,将随机量化应用于MoCo-v3和BYOL,评测指标采用线性评估(linear evaluation)。无论是单独作为唯一的数据增强方式(配合中心裁剪使用),还是与常见的随机缩放裁剪搭配使用,本文方法均取得了比现有通用自监督方法更好的效果。

与专门为图像设计的数据增强(如颜色抖动CJ)相比,本文方法具有明显的性能优势。而且,该方法完全可以取代MoCo-v3/BYOL中那套复杂的数据增强组合(包括颜色抖动、随机灰度化、随机高斯模糊、随机曝光等),并达到与之类似甚至更优的效果。

模态2:3D点云
在ModelNet40分类任务和ShapeNet Part分割任务上,随机量化同样展现了相对于现有自监督工作的优越性。尤其在下游训练数据量较少时,本文方法显著优于已有的点云自监督算法。

模态3:语音
在语音数据上,该方法也取得了比现有自监督学习方法更优的性能。在六个下游数据集上的验证表明,本文方法具有明显优势。尤其是在最具挑战性的VoxCeleb1数据集上(包含远超其他数据集的类别数量),取得了5.6个百分点的显著性能提升。

模态4:DABS
DABS是模态通用自监督学习的公开基准,涵盖自然图像、文本、语音、传感器数据、医学图像、图文等多种模态。在DABS的各类任务上,本文方法同样优于现有的任意模态自监督学习方法。

