在三维视觉研究领域,一项来自Meta的最新成果VLM³引起了广泛关注。该研究首次揭示了三维视觉学习中的“Bitter Lesson”:标准的视觉语言模型(VLM)配合足够的数据规模,就是最简单且最有效的范式。那些为特定任务设计的复杂架构、自定义损失函数、数据增强策略,甚至回归形式,都并非三维视觉学习不可或缺的要素。

当前主流的视觉语言模型(VLM)凭借统一的架构,确实能够灵活处理多种视觉任务。然而,它们在语义理解、视觉问答、图像指令等方面表现优异,却在三维视觉领域表现欠佳。相比之下,专家模型(如绝对深度估计任务)通过定制化的网络结构、损失函数和数据增强,精度甚至超越了人类水平。
这引出了一个关键问题:VLM在三维视觉学习上是否永远无法取代专家模型?VLM³给出了否定答案。
该模型设计极为简洁,却在多种三维视觉任务上逼近甚至超越专家模型,并大幅领先其他VLM:在单目深度估计方面,与UniDepthV2和MoGe2不相上下;在目标级三维理解上,超越了SpatialRGPT;像素匹配任务优于DKM和RoMa;相机姿态估计与DA3持平,且超越了VGGT。

- 论文地址:https://arxiv.org/pdf/2605.30561
- 代码地址:https://github.com/facebookresearch/VLM3
亮点
在此之前,即使是最先进的VLM,在标准三维视觉任务中也远落后于专家模型。
VLM³通过大量实验发现,一个标准VLM只需执行两项操作:相机焦距归一化和像素空间归一化,就能令人惊叹地学会各种三维视觉任务。在单目深度估计上与UniDepthV2和MoGe2持平;目标级三维理解超过SpatialRGPT;像素匹配击败DKM和RoMa;相机姿态估计与DA3相当,且优于VGGT。

与以往的三维视觉VLM不同,VLM³既不需要修改VLM的架构,也无需在图像上绘制任何标记。相比专家模型复杂的架构、损失函数和数据增强设计,它仅需一个标准VLM(例如Qwen3-vl-4B),配合常规的基于文本的SFT训练,即可在多种三维任务上达到SOTA水平。
这种简洁性直接颠覆了以往的三维视觉学习范式。它揭示了那个Bitter Lesson:我们根本无需为特定三维任务手工设计复杂的架构、损失函数和数据增强。简单的视觉语言建模,加上数据规模,就能实现同等效果,并且还能与其他非三维视觉任务在统一的语言模型框架下无缝兼容。这意味着,三维视觉从此不必再与VLM的预训练脱节,我们可以用同一套方法实现三维视觉的scaling law。
VLM³的成功也表明,三维视觉的学习比我们想象的要容易得多。它不仅不需要特殊架构和损失函数,甚至连回归都未必需要,就能实现细粒度的三维理解。这在以往的工作中几乎无法想象,因为连续输出空间的回归一直是多数三维视觉模型的核心设计。
主要结果 / 性能对比
在四大三维视觉任务上,性能显著优于最先进的VLM
在单目深度估计上,将DepthLM的准确率从84直接提升到90,且训练和推理更简单高效,无需渲染标记。
在目标级三维理解上,使用同样的训练数据超过了SpatialRGPT,且不需要额外编码器,模型参数量仅为后者的一半(4B对比8B)。
在多视角几何任务(如像素匹配和相机姿态估计)上,大幅超越Qwen3-vl-32B。

即便与最先进的专家模型(如MoGe2、DA3、RoMa等)对位,VLM³也毫不逊色,而且完全不需要那些复杂的架构、损失函数和数据增强。


意义 / 应用前景
VLM³重新定义了三维视觉的最佳学习范式:最简单的通用架构(如VLM)加上数据规模,就是最通用的三维视觉范式。过去三维视觉领域那些人为设计的、任务特定的方案,并非必需。
这将极大简化三维基础模型的构建。将三维视觉任务整合进VLM的预训练,能使三维视觉与其他视觉任务高效兼容,把VLM在语义和二维视觉任务上的灵活性、泛化性扩展到三维世界,从而大幅提升模型的能力上限。
结语
VLM³首次打通了VLM与三维视觉之间的壁垒,用统一的架构简洁地学会各类视觉任务,并达到专家模型的性能。这既是科研层面上的里程碑,也为未来在实际系统中统一多模态推理能力提供了可能。后续在机器人、自动驾驶、增强现实等场景中的落地应用,值得期待。
