作者:PCIPG‑mach
三维点云实例分割是计算机视觉领域的一项关键任务。本文为您介绍一种概念简洁、通用性强的新型框架——3D‑BoNet。该框架遵循每点多层感知器(MLP)的简单设计理念,直接回归点云中所有实例的三维边界框(bounding boxes),同时预测每个实例的点级掩码(a point‑level mask)。它由一个骨干网络和两个并行网络分支组成:一个用于边界框回归,另一个用于点掩码预测。3D‑BoNet 是单级、无锚和端到端可训练的网络。与现有方法不同,它无需任何后处理步骤,且效率极高。
1. 研究背景与动机
实例分割的主要挑战在于点云本身具有无序、非结构化和非均匀的特性。广泛使用的卷积神经网络需要对三维点云进行体素化处理,这会产生高昂的计算和内存成本。此外,它们不可避免地需要一个后处理步骤(如均值移动聚类)来获得最终实例标签,这一步骤计算量巨大。另一种基于提议的方法(如 3D‑SIS 和 GSPN)则依赖两阶段训练和昂贵的非最大抑制来裁剪密集的对象提议。
本文提出了一个优雅、高效、新颖的三维实例分割框架,通过使用高效 MLP 的单向前向阶段来松散但唯一地检测对象,然后通过一个简单的点级二元分类器来精确分割每个实例。为此,我们引入了一个新的边界框预测模块和一系列精心设计的损失函数,以直接学习对象边界。我们的框架与现有方法(基于提议和无提议)有很大不同,因为我们能够高效地分割所有具有高对象性的实例,而无需依赖昂贵而密集的对象提议。

图 1 展示了我们的框架 3D‑BoNet,它是一种单级、无锚、端到端可训练的神经架构。它首先使用现有的骨干网络为每个点提取局部特征向量,并为整个输入点云提取全局特征向量。
骨干网络之后有两个分支:
- 1) 实例级边界框预测
- 2) 用于实例分割的点级掩码预测
总体而言,3D‑BoNet 在三个方面有别于所有现有的三维实例分割方法:
- 与无提议管道相比,我们的方法通过明确学习三维对象边界来分割对象度高的实例。
- 与广泛使用的基于提议的方法相比,我们的框架不需要昂贵而密集的提议。
- 我们的框架非常高效,因为实例级掩码只需一次前向学习,无需任何后处理步骤。
主要贡献如下:
- 提出了一种新的三维点云实例分割框架,单阶段、无锚、端到端可训练,无需后处理。
- 设计了一个新颖的边界框关联层,配合多标准损失函数监督边界框预测分支。
- 通过广泛的消融研究证明了与基线相比的显著改进,并提供了设计选择背后的直觉。

图 3:3D‑BoNet 框架的一般工作流程。
3D‑BoNet 的总体框架如图所示,主要由以下两个分支组成:
- Instance‑level bounding box prediction(实例级边界框预测)
- Point‑level mask prediction(点级掩码预测)
bounding box prediction 分支用于预测点云中每个实例的边界框;mask prediction 分支用于为边界框内的点预测一个 mask,进一步区分边界框内的点属于 instance 还是背景。
2. 3D‑BoNet 详解
2.1 边界框预测(Bounding Box Prediction)
边界框编码:在现有物体检测网络中,边界框通常由中心位置、三维长度(或残差)以及方向表示。为了简单起见,本文只用两个最小‑最大顶点来表示矩形边界框的参数:
(x_min, y_min, z_min, x_max, y_max, z_max)
神经层:如图 4 所示,全局特征向量通过两个全连接层,以 Leaky ReLU 作为非线性激活函数。然后再经过另外两个平行的全连接层:
- 一层输出 6H 维向量,然后重塑为 H × 2 × 3 张量(H 是预定义的固定边框数,也是整个网络可预测的最大边框数)。
- 另一层输出 H 维向量,用 sigmoid 函数表示边界框得分。分数越高,预测的边框越可能包含一个实例。

图 4:边界框回归分支的结构。在计算多标准损失之前,将预测的 H 个边界框与 T 个地面真实边界框进行优化关联。
边框关联层:给定先前预测的 H 个边界框,利用地面实况框来监督网络并不简单,因为:
- 没有预定义的锚点可以将每个预测框追溯到相应的地面实况框。
- 对于每个输入点云,地面实况框的数量 T 都是不同的,通常与预定义的数量 H 不同(但我们可以假设所有输入点云的 H 都大于实际实例数)。
- 预测方框和地面实况方框都没有固定的顺序。
最优关联公式:为了从 H 个预测框中为每个地面实况框关联一个唯一的预测边界框,我们将这一关联过程表述为一个最优分配问题。形式上,令 M 为布尔关联矩阵,如果第 i 个预测框被分配给第 j 个地面实况框,则元素为 1。令 C 为关联成本矩阵,其中 C_{ij} 表示第 i 个预测框被分配到第 j 个地面实况框的成本。成本代表两个方框之间的相似度:成本越小,两个方框越相似。边界框关联问题就是找到成本最小的最优分配矩阵 M*。
损失函数:在边框关联层之后,预测的边框和分数都将使用关联索引进行重新排序,从而使最先预测的 T 个边框和分数与 T 个地面实况边框配对。
边框预测的多标准损失:关联层根据最小成本为每个地面实况框找到最相似的预测框,最小成本包括:
- 顶点欧氏距离
- 点上的 sIoU 成本
- 交叉熵得分
因此,边界框预测的损失函数自然是为了持续最小化这些成本而设计的。其形式定义如下:
L_bbox = ...
注意:我们只最小化 T 个配对框的成本,其余 (H‑T) 个预测框将被忽略。因此这个子分支与预定义的 H 值无关。由于负预测没有受到惩罚,网络可能会对一个实例预测多个相似框。幸运的是,平行边框得分预测的损失函数能够缓解这一问题。
框选得分的预测差:预测的框得分旨在表明相应预测框的有效性。通过关联指数重新排序后,前 T 个得分的地面实况得分均为 “1”,其余无效的得分均为 “0”。我们使用交叉熵损失来完成二元分类任务:
L_score = ...
这个损失函数奖励预测正确的边界框,而隐含地惩罚对一个实例回归多个相似边界框的情况。

