概述

        BEVDet是面向自动驾驶多相机3D目标检测的鸟瞰图(BEV)范式框架,核心是实现精度与推理效率的优异平衡,其核心内容可分为以下六大模块:

一、研究背景与核心动机

1. 自动驾驶感知的痛点

        自动驾驶的核心感知任务(3D目标检测、BEV语义分割)长期采用不同范式:多相机3D检测主流为图像视角方法(如FCOS3D、PGD),而BEV语义分割由BEV视角方法主导,无法复用计算资源,且图像视角方法对目标位置、朝向、速度的感知精度有限。
        2D检测的范式革新(如Mask R-CNN)带来了性能与可扩展性的突破,启发业界探索自动驾驶感知的统一高效范式。

2. BEV视角的天然优势

        BEV空间与自动驾驶下游任务(路径规划、决策)的定义空间一致,更易精准感知目标的平移、尺度、朝向、运动速度等几何属性,且具备支撑多任务统一建模的潜力。

二、BEVDet整体框架设计

        采用模块化的四层架构,可充分复用各领域成熟组件,具备极强的可扩展性:

模块 功能与实现细节
图像视角编码器 提取多尺度图像特征,由主干网络+特征融合颈部组成:
- 主干可选ResNet、SwinTransformer等成熟图像编码器;
- 颈部默认采用FPN-LSS(将1/32分辨率特征上采样后与1/16分辨率特征拼接),也可替换为PAFPN、NAS-FPN等结构。
视图变换器 实现图像视角到BEV空间的特征转换,基于Lift-Splat-Shoot方案:
1. 对图像特征逐像素预测深度分类分布;
2. 结合深度得分与图像特征,将像素投影到预定义的3D点云空间;
3. 沿Z轴(垂直方向)池化,得到BEV平面特征,默认深度预测范围为1-60米。
BEV编码器 进一步编码BEV空间特征,结构与图像视角编码器类似:
- 主干采用ResNet残差块提取多尺度BEV特征;
- 颈部用FPN-LSS融合不同分辨率特征,精准建模BEV下的目标几何属性。
任务头 采用CenterPoint的第一阶段3D检测头,直接基于BEV特征预测目标类别、位置、尺度、朝向、速度等属性,未使用第二阶段精炼结构保证效率。

        图 1.所提出的 BEVDet 模型框架。BEVDet 采用模块化设计,由四个模块组成:图像视图编码器,包括一个骨干网络和一个颈部,首先用于图像特征提取。视图转换器将图像视图中的特征转换为 BEV 格式。BEV 编码器进一步对 BEV 特征进行编码。最后,基于 BVE 特征构建任务特定的头,并预测 3D 物体的目标值。以 BEVDet-Tiny 为例来说明不同模块的通道情况。

三、核心技术创新

1. 定制化双空间数据增强策略

        解决BEV空间训练易过拟合的问题:

  • 图像与BEV空间的增广独立性:视图变换器的像素级映射特性使得图像侧的翻转、裁剪、旋转等增广,经过逆变换校准后不会改变BEV空间的特征分布,两个空间的增广可独立设计。
  • 双空间增广组合
    • 图像侧增广:随机翻转、随机缩放、随机旋转、随机裁剪,增强图像特征提取的鲁棒性;
    • BEV侧增广:对BEV特征和3D标注同时做随机翻转、±22.5°旋转、0.95-1.05倍缩放,直接为BEV编码器和检测头提供正则化,大幅缓解过拟合。
      消融实验证明仅用图像增广对带BEV编码器的模型无增益,结合BEV增广后可将mAP从23.0%提升至31.6%,训练末期性能掉点从5.6%降至0.4%。

2. Scale-NMS后处理算法

        解决传统NMS在BEV空间对小目标失效的问题:

  • 传统NMS的局限:BEV空间不同类别目标的占地面积差异极大,行人、交通锥等小目标的冗余预测框与正样本框的IOU几乎为0,传统NMS无法滤除冗余框,导致重复检测。
  • Scale-NMS思路:根据类别先验,在执行NMS前按类别缩放目标框的尺寸,人为拉大冗余框与正样本框的IOU,适配传统NMS的判断逻辑;缩放因子通过验证集超参搜索获得,仅对除可变长度的路障外的所有类别生效。
  • 效果:整体mAP提升1.7%,其中行人AP提升4.8%,交通锥AP提升7.5%。

3. 推理加速优化

        针对Lift-Splat-Shoot中视图变换的累加求和操作延迟高的问题,引入辅助索引机制
        预计算固定相机内外参下的体素索引和重复计数辅助索引,推理时直接将特征分配到二维矩阵后沿辅助轴求和,避免逐点累加,将BEVDet-Tiny的推理延迟从137ms降至64ms,速度提升53.3%,精度几乎无损失。

四、实验验证与性能表现

        基于nuScenes自动驾驶基准测试:

1.核心配置性能

版本 输入分辨率 参数量 计算量 val集mAP/NDS 推理速度 对比优势
BEVDet-Tiny 704×256 53.7M 215.3 GFLOPs 31.2%/39.2% 15.6 FPS 精度超过FCOS3D,计算量仅为FCOS3D的11%,速度快9.2倍
BEVDet-Base 1600×640 126.6M 2962.6 GFLOPs 39.3%/47.2% 1.9 FPS 超过同期最优的PGD 5.8%mAP、6.3%NDS,推理速度与DETR3D相当

2.test集SOTA表现 

        BEVDet-Base在nuScenes test集取得42.2%mAP、48.2%NDS,超过同期所有纯视觉3D检测方法,精度甚至对标轻量版激光雷达方法PointPillars。

3.特性优势

        BEVDet在目标平移、尺度、朝向、速度预测误差上显著优于图像视角方法,但目标属性(如车辆类型、行人姿态)的预测精度低于图像视角方法,后续可通过双视角特征融合优化。

        表 2.在 nuScenes 验证集上对不同框架的比较。y 从 FCOS3D 主干网络初始化而来。x 采用测试时增强技术。# 采用模型组合。

五、消融实验关键结论

  • 分辨率影响:输入图像分辨率每提升一档,mAP提升约2%-3%,且计算量增长有限(BEV侧计算量固定);BEV特征分辨率从0.8m提升至0.4m,可提升mAP、降低平移和朝向误差,但计算量和延迟相应上升。
  • 主干网络选择:同参数量下,SwinTransformer-Tiny比ResNet-50的mAP高1.4%,更适合图像特征提取;高输入分辨率下,更深的ResNet-101比ResNet-50有更明显的性能增益。

六、研究局限与未来方向

  • 优化目标属性预测能力,可探索图像视角与BEV视角的特征融合方案;
  • 基于BEVDet的统一架构,拓展3D目标检测、BEV语义分割、地图构建等多任务联合学习,进一步降低整体推理开销。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐