游乐游手机版
首页/AI热点日报/热点详情

基于几何信息的自监督单目深度估计框架

类型:热点整理2026-07-21
GasMono利用多视图几何估算粗略相机位姿,经旋转和平移优化精炼以应对室内大旋转;采用视觉Transformer与迭代自蒸馏机制解决低纹理区域挑战。在NYUv2、ScanNet、7scenes和KITTI上达到自监督单目深度估计最优性能,泛化能力强。

1. 笔者总结

室内场景的单目深度估计,一直是个“老大难”问题——帧间旋转大、纹理少,自监督方法常常力不从心。GasMono这个框架,专门为室内环境设计,核心思路是把几何方法和现代学习手段揉在一起:先用多视图几何拿到粗糙的相机位姿,再通过旋转和平移/尺度优化把这些位姿“打磨”一下;与此同时,为了对抗低纹理区域的“信息荒漠”,框架把视觉Transformer和迭代式自蒸馏机制结合起来。从NYUv2、ScanNet、7scenes到KITTI,实验数据摆在那里——GasMono在室内自监督单目深度估计上,做到了当前最优,泛化能力也相当亮眼。

图1. 现有方法和GasMono的比较。我们的框架在薄物体和全局结构上展现出了卓越的精度。

2. 原文摘要

室内场景里的大旋转和低纹理,是自监督深度估计的两座大山。GasMono怎么翻过去?首先,用多视图几何从单目序列中估算出粗略的相机位姿——这招对大旋转有效。但问题来了:不同场景之间尺度不一致,直接拿几何粗略位姿训练,深度估计性能反而上不去,听着有点反直觉吧?解决办法是在训练过程中对位姿做旋转和平移/尺度优化。至于低纹理,那就让全局推理能力强的视觉Transformer上场,再配上迭代式自蒸馏机制,从网络自身“抠”出更准确的深度指导。在NYUv2、ScanNet、7scenes和KITTI上的实验,每个组件都被验证有效,整体达到了室内自监督单目深度估计的新高度,泛化能力也过硬。

3. GasMono框架

图2. GasMono: 一种基于几何的自监督单目深度估计框架,用于室内场景。注意,在训练过程中没有使用真实标签。通过从多个室内场景中选择的单目图像序列,使用结构从运动(structure-from-motion)软件包COLMAP来估计每个序列上相机的粗略姿态。然后,使用图像序列和粗略姿态来训练深度模型。为了改善粗略的平移,设计了一个AlignNet来估计尺度sNN和残差平移∆t。此外,还设计了一个PoseNet来进一步改善姿态,特别是基于重建和目标图像的粗略旋转。AlignNet和PoseNet只在训练过程中使用。

3.1. 几何辅助姿态估计

标准的自监督单目深度训练,需要根据估计的深度和相对相机位姿,把源图像像素重投影到目标图像上。这本身没什么问题,但室内场景的大旋转让网络很难学准位姿。于是,一个直截了当的想法出现了:干脆不用PoseNet,换传统的姿态估计算法。具体就是用COLMAP为每个室内序列的每张图像算出相机姿态,然后通过相对变换得到两帧之间的位姿。和两帧估计不同,COLMAP这种结构从运动管道能对整段序列做全局推理——既然位姿估计只是深度学习的“副业”,用全局信息显然是划算的。

不过,COLMAP给出的粗略位姿有两个硬伤:第一,不同序列之间的尺度不一致,还有单目歧义带来的尺度漂移;第二,低纹理区域让旋转和平移都带上了噪声。所以,不能直接把COLMAP替换PoseNet来用。

3.1.1 平移缩放和精炼

第一个问题怎么解?部署一个轻量级的AlignNet,在训练过程中对平移做精炼和重新缩放,来克服尺度不一致。AlignNet处理目标和源图像,输出一个尺度因子和一个残差移位,作用在COLMAP估计的平移分量上,最终得到修正后的平移向量。这个向量被用到重投影公式里,相当于只在训练时调整图像尺度,让整体尺度统一起来。

把AlignNet看作一个训练优化工具就好——训练完了,它也就完成了使命。

图3. 不同编码器对低纹理深度估计的影响。

3.1.2 旋转优化

平移优化完了,旋转也不能放过。粗估算的旋转同样可能不准、有噪声。图3给出了两个例子:上面一行是旋转不准的样本,只优化平移根本补偿不了旋转误差,重投影误差很高;下面一行是旋转准的样本,只做平移优化就能得到合理的重建。所以,旋转优化必须跟上。

3.2 低纹理区域

自监督训练的反向传播依赖RGB图像的光度梯度变化。有有效光度变化的区域能提供强梯度,但低纹理区域——比如墙壁、地板——多个深度假设下的光度误差都接近零,网络很容易掉进局部极小值。这时候,深度估计全靠网络自身的推理能力。一些额外约束(比如光流、平面法线)可能有用,但需要额外监督,而且光流在低纹理区也会遇到同样问题。所以,从架构层面切入更靠谱:用Transformer替代CNN,因为Transformer的感受野不受限。另外,之前的工作也证明了标签蒸馏能提升深度网络的精度。

3.2.1 网络架构

整个框架由三个网络组成:深度网络Depth Network,尺度校正和残差平移预测网络AlignNet,以及残差姿态估计网络PoseNet。图2画出了训练架构。

为了增强低纹理区域的全局特征提取,深度编码器引入了Transformer编码器MPViT,其自注意力机制采用高效的分式实现:

其中C是嵌入维度,Q、K、V从视觉标记投影得到。解码器方面,用Convex upsampling替代了Monodepth2等常用的标准上采样,把4个尺度的深度图映射到全分辨率,用于后续的迭代自蒸馏。

算法1 迭代式自蒸馏系统ISD

3.2.2 迭代自我蒸馏

提出了一个过拟合驱动的迭代自蒸馏过程(ISD),目的是为每个训练样本找到像素重投影误差最小的深度图,作为更准确的伪标签。算法1给出了具体步骤:对每张训练图像多次迭代,每次都在所有尺度上选择每个像素的最小重建误差及其对应的预测深度,然后用当前最佳深度图与各尺度预测之间的深度损失来更新网络,重复多次。

3.3 训练损失

训练损失的核心是最小视图重建损失,结合了结构相似性指数(SSIM)和L1差异:

α通常设为0.85。为了缓解两视图之间的遮挡问题,取前向和后向相邻帧变形损失的最小值:

其中‘1’和‘-1’分别指前向和后向相邻帧。除此之外,边缘感知平滑损失用于改善反深度映射d:

其中表示平均归一化的反深度,并计算自动掩码μ过滤静止帧和重复纹理区域。最后,迭代自蒸馏损失根据算法1得到的伪标签,最小化预测深度与伪标签的对数误差:

总损失由视图重建损失(基于平移优化和旋转优化后分别计算的两个重建损失)、平滑损失和蒸馏项构成,所有损失都上采样到全分辨率后平均:

其中β、λ、μ分别设为0.2、0.001、0.1。

4. 实验结果

实验在三个室内数据集(NYUv2、7scenes、ScanNet)和一个室外数据集(KITTI)上展开。研究重点包括:使用COLMAP位姿和优化策略的效果、各组件的消融贡献、以及和现有先进方法的对比。结果很明确——GasMono在室内自监督单目深度估计上全面领先。

表1. 消融研究。

表2. 在室外KITTI数据集上测试了我们的ISD和不同基线方法。

表3. 在NYUv2上的评估结果。

表4. 在ScanNet上的零测量泛化结果。

表5. 在RGB-D 7场景上的零测量泛化结果。注意,Monoindoor++从每个视频序列中提取每30帧的第一张图像作为测试集,而我们遵循SC-Depthv2,从每10帧中提取第一张图像。

表6. 在RGB-D 7场景上微调后的结果。

可视化结果如下:

图4. 深度评估中的低纹理区域。

图5. 在NYUv2上的定性比较。我们的GasMono相比于基线方法Monodepth2和最近的工作SC-Depthv2,获得了更细致和更准确的深度估计。

图6. 在ScanNet和7scenes上的泛化比较。与TrainFlow、Monodepth2和SC-Depthv2相比,GasMono在新场景上显示出更准确和更细致的深度估计。

5. 结论

GasMono是一个利用几何信息的自监督单目深度估计框架,专为复杂的室内场景设计。通过缩放和精炼两步,解决了自监督训练中位姿不准导致的尺度不一致和深度不精确问题,有效发挥了几何粗略位姿的价值。实验表明,该方法在NYUv2和KITTI上显著且稳定地超越所有现有方法,在ScanNet和7scenes上也展现出很强的泛化能力。

来源:https://m.elecfans.com/article/2303762.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。