游乐游手机版
首页/AI热点日报/热点详情

BEV感知中Transformer算法详解

类型:热点整理2026-07-19
基于Transformer的自动驾驶感知模型,这两年发展得是真快。从最初的纯视觉方案,到后来跟激光雷达、毫米波雷达做深度融合,每条技术路线都有自己的亮点和痛点。下面整理了几种代表性方法,按技术路线分成两大类来聊。 1、Camera only 先看纯视觉方案。这个领域最核心的挑战是:怎么让2D图像里的

基于Transformer的自动驾驶感知模型,这两年发展得是真快。从最初的纯视觉方案,到后来跟激光雷达、毫米波雷达做深度融合,每条技术路线都有自己的亮点和痛点。下面整理了几种代表性方法,按技术路线分成两大类来聊。

1、Camera only

先看纯视觉方案。这个领域最核心的挑战是:怎么让2D图像里的信息,跟3D空间里的位置建立起可靠关联?不同团队给出了各自的解法。

BEVFormer

论文:https://arxiv.org/abs/2203.17270
这个方案的核心思想很直观:把BEV(鸟瞰图)下的每个网格格子当作一个“查询”(query)。具体怎么做?在高度方向上采样N个点,然后把每个点都投影到图像上,去获取对应位置的像素特征。这样一来,空间和时间的信息就都被用上了。最终得到的BEV特征,既能做目标检测,也能做语义分割。

两个关键模块值得注意:

  • Spatial Cross-Attention:把每个BEV grid作为query,在高度方向采样N个点,投影到图像特征上采样。这是实现2D到3D空间关联的核心。
  • Temporal Self-Attention:用self-attention来替代传统的运动补偿方法,把上一帧的feature对齐到当前帧的query上。这一招很巧妙,免去了显式的运动建模。

PETR(旷视)

论文:https://arxiv.org/pdf/2203.05625.pdf

PETR走了一条更简洁的路线:直接用一组预设的3D检测点作为查询。每个query对应一个3D reference point,然后反投影到图像上采样对应像素的特征。这种方式的好处是直观,但缺点也比较明显——它需要依赖一个预训练模型来初始化,而且随机初始化的query会导致训练收敛速度偏慢。

2、多模态

多模态融合是大势所趋。Camera和LiDAR(激光雷达)各有优劣,一个擅长语义理解,一个精于空间定位,如何把两者优势结合起来就成了关键。下面几个方案代表了不同的技术思路。

FUTR3D(清华)

论文:https://arxiv.org/pdf/2203.10642.pdf

FUTR3D的思路是在DETR框架基础上做的扩展。它将3D reference point直接投影到LiDAR voxel特征和radar point特征上,实现了一种相对简洁的跨模态特征融合。结构不算复杂,但是效果不错。

Transfusion(香港科技大学)

论文:https://arxiv.org/pdf/2203.11496.pdf

这个方案有一个很聪明的设计:利用CenterPoint在heatmap上获取Top K个点作为初始查询。这些K个点可以看作是经过了LiDAR网络初步“初始化”了每个目标的位置,而不是DETR那样用随机点开始。这样一来,收敛速度就能快得多。整体流程是:先经过LiDAR Transformer得到一个初步的proposal,这个proposal被当作query,再和image feature做cross attention。可以说是把激光雷达和视觉的优势都充分发挥了。

DeepFusion(Google)

论文:https://arxiv.org/abs/2203.08195

这个路子比较大胆:直接把LiDAR feature和Camera feature做cross attention。没有中间那些复杂的投影或者query转换,就是最简单粗暴地让两种特征在注意力机制里自由互动。老实说,如果不是看到这篇论文,我都不太敢相信直接做cross-attention居然能行得通。但结果证明,这种方法在某些场景下表现确实不错。不得不佩服Google团队敢想敢做的风格。

来源:https://m.elecfans.com/article/2234215.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。