游乐游手机版
首页/AI热点日报/热点详情

一种只用MLP实现高效三维实例分割的新方法

类型:热点整理2026-07-20
基于MLP实现的三维点云实例分割框架3D‑BoNet,采用单级、无锚、端到端设计,直接回归实例边界框并预测点级掩码,无需后处理。由骨干网络及边界框预测、点掩码预测两分支组成,通过多标准损失优化,在ScanNet和S3DIS数据集上取得高效分割结果。
# 3D-BoNet:一种简洁高效的三维点云实例分割框架

作者:PCIPG‑mach

三维点云实例分割是计算机视觉领域的一项关键任务。本文为您介绍一种概念简洁、通用性强的新型框架——3D‑BoNet。该框架遵循每点多层感知器(MLP)的简单设计理念,直接回归点云中所有实例的三维边界框(bounding boxes),同时预测每个实例的点级掩码(a point‑level mask)。它由一个骨干网络和两个并行网络分支组成:一个用于边界框回归,另一个用于点掩码预测。3D‑BoNet 是单级、无锚和端到端可训练的网络。与现有方法不同,它无需任何后处理步骤,且效率极高。

1. 研究背景与动机

实例分割的主要挑战在于点云本身具有无序、非结构化和非均匀的特性。广泛使用的卷积神经网络需要对三维点云进行体素化处理,这会产生高昂的计算和内存成本。此外,它们不可避免地需要一个后处理步骤(如均值移动聚类)来获得最终实例标签,这一步骤计算量巨大。另一种基于提议的方法(如 3D‑SIS 和 GSPN)则依赖两阶段训练和昂贵的非最大抑制来裁剪密集的对象提议。

本文提出了一个优雅、高效、新颖的三维实例分割框架,通过使用高效 MLP 的单向前向阶段来松散但唯一地检测对象,然后通过一个简单的点级二元分类器来精确分割每个实例。为此,我们引入了一个新的边界框预测模块和一系列精心设计的损失函数,以直接学习对象边界。我们的框架与现有方法(基于提议和无提议)有很大不同,因为我们能够高效地分割所有具有高对象性的实例,而无需依赖昂贵而密集的对象提议。

图 1 展示了我们的框架 3D‑BoNet,它是一种单级、无锚、端到端可训练的神经架构。它首先使用现有的骨干网络为每个点提取局部特征向量,并为整个输入点云提取全局特征向量。

骨干网络之后有两个分支:

  • 1) 实例级边界框预测
  • 2) 用于实例分割的点级掩码预测

总体而言,3D‑BoNet 在三个方面有别于所有现有的三维实例分割方法:

  • 与无提议管道相比,我们的方法通过明确学习三维对象边界来分割对象度高的实例。
  • 与广泛使用的基于提议的方法相比,我们的框架不需要昂贵而密集的提议。
  • 我们的框架非常高效,因为实例级掩码只需一次前向学习,无需任何后处理步骤。

主要贡献如下:

  • 提出了一种新的三维点云实例分割框架,单阶段、无锚、端到端可训练,无需后处理。
  • 设计了一个新颖的边界框关联层,配合多标准损失函数监督边界框预测分支。
  • 通过广泛的消融研究证明了与基线相比的显著改进,并提供了设计选择背后的直觉。

图 3:3D‑BoNet 框架的一般工作流程。

3D‑BoNet 的总体框架如图所示,主要由以下两个分支组成:

  • Instance‑level bounding box prediction(实例级边界框预测)
  • Point‑level mask prediction(点级掩码预测)

bounding box prediction 分支用于预测点云中每个实例的边界框;mask prediction 分支用于为边界框内的点预测一个 mask,进一步区分边界框内的点属于 instance 还是背景。

2. 3D‑BoNet 详解

2.1 边界框预测(Bounding Box Prediction)

边界框编码:在现有物体检测网络中,边界框通常由中心位置、三维长度(或残差)以及方向表示。为了简单起见,本文只用两个最小‑最大顶点来表示矩形边界框的参数:

(x_min, y_min, z_min, x_max, y_max, z_max)

神经层:如图 4 所示,全局特征向量通过两个全连接层,以 Leaky ReLU 作为非线性激活函数。然后再经过另外两个平行的全连接层:

  • 一层输出 6H 维向量,然后重塑为 H × 2 × 3 张量(H 是预定义的固定边框数,也是整个网络可预测的最大边框数)。
  • 另一层输出 H 维向量,用 sigmoid 函数表示边界框得分。分数越高,预测的边框越可能包含一个实例。

图 4:边界框回归分支的结构。在计算多标准损失之前,将预测的 H 个边界框与 T 个地面真实边界框进行优化关联。

边框关联层:给定先前预测的 H 个边界框,利用地面实况框来监督网络并不简单,因为:

  • 没有预定义的锚点可以将每个预测框追溯到相应的地面实况框。
  • 对于每个输入点云,地面实况框的数量 T 都是不同的,通常与预定义的数量 H 不同(但我们可以假设所有输入点云的 H 都大于实际实例数)。
  • 预测方框和地面实况方框都没有固定的顺序。

最优关联公式:为了从 H 个预测框中为每个地面实况框关联一个唯一的预测边界框,我们将这一关联过程表述为一个最优分配问题。形式上,令 M 为布尔关联矩阵,如果第 i 个预测框被分配给第 j 个地面实况框,则元素为 1。令 C 为关联成本矩阵,其中 C_{ij} 表示第 i 个预测框被分配到第 j 个地面实况框的成本。成本代表两个方框之间的相似度:成本越小,两个方框越相似。边界框关联问题就是找到成本最小的最优分配矩阵 M*

损失函数:在边框关联层之后,预测的边框和分数都将使用关联索引进行重新排序,从而使最先预测的 T 个边框和分数与 T 个地面实况边框配对。

边框预测的多标准损失:关联层根据最小成本为每个地面实况框找到最相似的预测框,最小成本包括:

  • 顶点欧氏距离
  • 点上的 sIoU 成本
  • 交叉熵得分

因此,边界框预测的损失函数自然是为了持续最小化这些成本而设计的。其形式定义如下:

L_bbox = ...

注意:我们只最小化 T 个配对框的成本,其余 (H‑T) 个预测框将被忽略。因此这个子分支与预定义的 H 值无关。由于负预测没有受到惩罚,网络可能会对一个实例预测多个相似框。幸运的是,平行边框得分预测的损失函数能够缓解这一问题。

框选得分的预测差:预测的框得分旨在表明相应预测框的有效性。通过关联指数重新排序后,前 T 个得分的地面实况得分均为 “1”,其余无效的得分均为 “0”。我们使用交叉熵损失来完成二元分类任务:

L_score = ...

这个损失函数奖励预测正确的边界框,而隐含地惩罚对一个实例回归多个相似边界框的情况。

来源:https://m.elecfans.com/article/2257934.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。