论文解读--BEVDet: High-Performance Multi-Camera 3D Object Detection in Bird-Eye-View
概述
BEVDet是面向自动驾驶多相机3D目标检测的鸟瞰图(BEV)范式框架,核心是实现精度与推理效率的优异平衡,其核心内容可分为以下六大模块:
一、研究背景与核心动机
1. 自动驾驶感知的痛点
自动驾驶的核心感知任务(3D目标检测、BEV语义分割)长期采用不同范式:多相机3D检测主流为图像视角方法(如FCOS3D、PGD),而BEV语义分割由BEV视角方法主导,无法复用计算资源,且图像视角方法对目标位置、朝向、速度的感知精度有限。
2D检测的范式革新(如Mask R-CNN)带来了性能与可扩展性的突破,启发业界探索自动驾驶感知的统一高效范式。
2. BEV视角的天然优势
BEV空间与自动驾驶下游任务(路径规划、决策)的定义空间一致,更易精准感知目标的平移、尺度、朝向、运动速度等几何属性,且具备支撑多任务统一建模的潜力。
二、BEVDet整体框架设计
采用模块化的四层架构,可充分复用各领域成熟组件,具备极强的可扩展性:
| 模块 | 功能与实现细节 |
|---|---|
| 图像视角编码器 | 提取多尺度图像特征,由主干网络+特征融合颈部组成: - 主干可选ResNet、SwinTransformer等成熟图像编码器; - 颈部默认采用FPN-LSS(将1/32分辨率特征上采样后与1/16分辨率特征拼接),也可替换为PAFPN、NAS-FPN等结构。 |
| 视图变换器 | 实现图像视角到BEV空间的特征转换,基于Lift-Splat-Shoot方案: 1. 对图像特征逐像素预测深度分类分布; 2. 结合深度得分与图像特征,将像素投影到预定义的3D点云空间; 3. 沿Z轴(垂直方向)池化,得到BEV平面特征,默认深度预测范围为1-60米。 |
| BEV编码器 | 进一步编码BEV空间特征,结构与图像视角编码器类似: - 主干采用ResNet残差块提取多尺度BEV特征; - 颈部用FPN-LSS融合不同分辨率特征,精准建模BEV下的目标几何属性。 |
| 任务头 | 采用CenterPoint的第一阶段3D检测头,直接基于BEV特征预测目标类别、位置、尺度、朝向、速度等属性,未使用第二阶段精炼结构保证效率。 |

图 1.所提出的 BEVDet 模型框架。BEVDet 采用模块化设计,由四个模块组成:图像视图编码器,包括一个骨干网络和一个颈部,首先用于图像特征提取。视图转换器将图像视图中的特征转换为 BEV 格式。BEV 编码器进一步对 BEV 特征进行编码。最后,基于 BVE 特征构建任务特定的头,并预测 3D 物体的目标值。以 BEVDet-Tiny 为例来说明不同模块的通道情况。
三、核心技术创新
1. 定制化双空间数据增强策略
解决BEV空间训练易过拟合的问题:
- 图像与BEV空间的增广独立性:视图变换器的像素级映射特性使得图像侧的翻转、裁剪、旋转等增广,经过逆变换校准后不会改变BEV空间的特征分布,两个空间的增广可独立设计。
- 双空间增广组合:
- 图像侧增广:随机翻转、随机缩放、随机旋转、随机裁剪,增强图像特征提取的鲁棒性;
- BEV侧增广:对BEV特征和3D标注同时做随机翻转、±22.5°旋转、0.95-1.05倍缩放,直接为BEV编码器和检测头提供正则化,大幅缓解过拟合。
消融实验证明仅用图像增广对带BEV编码器的模型无增益,结合BEV增广后可将mAP从23.0%提升至31.6%,训练末期性能掉点从5.6%降至0.4%。
2. Scale-NMS后处理算法
解决传统NMS在BEV空间对小目标失效的问题:
- 传统NMS的局限:BEV空间不同类别目标的占地面积差异极大,行人、交通锥等小目标的冗余预测框与正样本框的IOU几乎为0,传统NMS无法滤除冗余框,导致重复检测。
- Scale-NMS思路:根据类别先验,在执行NMS前按类别缩放目标框的尺寸,人为拉大冗余框与正样本框的IOU,适配传统NMS的判断逻辑;缩放因子通过验证集超参搜索获得,仅对除可变长度的路障外的所有类别生效。
- 效果:整体mAP提升1.7%,其中行人AP提升4.8%,交通锥AP提升7.5%。
3. 推理加速优化
针对Lift-Splat-Shoot中视图变换的累加求和操作延迟高的问题,引入辅助索引机制:
预计算固定相机内外参下的体素索引和重复计数辅助索引,推理时直接将特征分配到二维矩阵后沿辅助轴求和,避免逐点累加,将BEVDet-Tiny的推理延迟从137ms降至64ms,速度提升53.3%,精度几乎无损失。
四、实验验证与性能表现
基于nuScenes自动驾驶基准测试:
1.核心配置性能
| 版本 | 输入分辨率 | 参数量 | 计算量 | val集mAP/NDS | 推理速度 | 对比优势 |
|---|---|---|---|---|---|---|
| BEVDet-Tiny | 704×256 | 53.7M | 215.3 GFLOPs | 31.2%/39.2% | 15.6 FPS | 精度超过FCOS3D,计算量仅为FCOS3D的11%,速度快9.2倍 |
| BEVDet-Base | 1600×640 | 126.6M | 2962.6 GFLOPs | 39.3%/47.2% | 1.9 FPS | 超过同期最优的PGD 5.8%mAP、6.3%NDS,推理速度与DETR3D相当 |
2.test集SOTA表现
BEVDet-Base在nuScenes test集取得42.2%mAP、48.2%NDS,超过同期所有纯视觉3D检测方法,精度甚至对标轻量版激光雷达方法PointPillars。
3.特性优势
BEVDet在目标平移、尺度、朝向、速度预测误差上显著优于图像视角方法,但目标属性(如车辆类型、行人姿态)的预测精度低于图像视角方法,后续可通过双视角特征融合优化。
表 2.在 nuScenes 验证集上对不同框架的比较。y 从 FCOS3D 主干网络初始化而来。x 采用测试时增强技术。# 采用模型组合。

五、消融实验关键结论
- 分辨率影响:输入图像分辨率每提升一档,mAP提升约2%-3%,且计算量增长有限(BEV侧计算量固定);BEV特征分辨率从0.8m提升至0.4m,可提升mAP、降低平移和朝向误差,但计算量和延迟相应上升。
- 主干网络选择:同参数量下,SwinTransformer-Tiny比ResNet-50的mAP高1.4%,更适合图像特征提取;高输入分辨率下,更深的ResNet-101比ResNet-50有更明显的性能增益。
六、研究局限与未来方向
- 优化目标属性预测能力,可探索图像视角与BEV视角的特征融合方案;
- 基于BEVDet的统一架构,拓展3D目标检测、BEV语义分割、地图构建等多任务联合学习,进一步降低整体推理开销。
更多推荐




所有评论(0)