本教程系统解析CLIP-VG方法,该技术通过自步课程学习,成功将多模态大模型CLIP迁移至无监督视觉定位任务。学习本教程,您将深入理解其核心思想、模型架构、单源与多源自适应算法,以及如何借助伪标签逐步提升定位精度。
1. 背景与挑战
视觉定位(Visual Grounding,VG),亦称指代表达理解或短语定位,其核心目标是在图像中精准定位文本描述句子所指示的边界框(bbox)区域。该技术广泛用于视觉问答、视觉语言导航等前沿领域。
传统方法通常依赖全监督学习,需要大量人工标注的三元组数据(图像、表达式、bbox)。为降低标注成本,研究者逐步探索出弱监督方法(仅需图像-查询对,无需bbox)以及无监督方法(完全无需任务相关标注)。
当前的无监督方法大多依赖预训练检测器和人工模板来生成伪标签,然而存在两大核心瓶颈:
- 伪标签质量高度依赖特定数据集上预训练的检测器,导致语言分类多样性受限。
- 上下文语义丰富度不足,削弱了模型的泛化能力。
2. CLIP-VG:核心思想
CLIP-VG提出了一种创新的自步课程自适应(Self-paced Curriculum Adapting)框架,通过伪语言标签逐步将CLIP的多模态能力迁移至视觉定位任务。其核心创新包括:
- 首次实现CLIP在无监督视觉定位中的迁移,训练成本极低。
- 引入自步课程学习,以由易到难的策略逐步利用伪标签增强模型能力。
- 支持多源伪标签融合,显著提升语言分类多样性。

图1. CLIP-VG整体思路:采用自步课程自适应范式,借助伪语言标签对CLIP进行自适应微调,从而实现视觉定位迁移。
3. 模型架构
CLIP-VG采用纯Transformer的仅编码器架构,端到端设计,仅需调整少量参数即可实现任务迁移。图2展示了其具体结构:

图2. CLIP-VG模型架构(对应III-B部分),作为视觉语言定位模型,实现了CLIP的自步课程自适应。
