一、研究背景与问题

1. 多相机3D目标检测的两大范式与痛点

  • 稠密BEV类方法:先通过视图变换构建稠密BEV特征图,再在BEV空间做检测,精度较高,但存在视图变换计算复杂、内存开销大的问题。
  • 稀疏查询类方法:基于query范式,无需显式构建稠密BEV特征,速度快但精度显著低于稠密方法,核心瓶颈是检测器在BEV空间和图像空间的自适应能力不足。

2. 核心观察

        要缩小稀疏方法与稠密方法的性能差距,需要同时提升检测器在BEV空间的多尺度特征聚合能力,以及在图像空间对不同大小、类别物体的自适应采样与解码能力。

二、SparseBEV核心设计

1. 查询(Query)表示:BEV柱体表示

        区别于传统方法使用3D参考点作为query初始化,SparseBEV采用BEV空间的柱体作为query初始形式:每个query包含位置(x,y,z)、尺寸(w,l,h)、旋转θ、速度[vx,vy]及对应的D维特征,z初始化为0、h初始化为4m,引入了更合理的空间先验,相比参考点可带来0.5NDS的性能提升。

2. 尺度自适应自注意力(Scale-adaptive Self Attention, SASA)

        针对普通多头自注意力全局感受野缺乏多尺度建模能力的问题,SASA通过以下设计实现BEV空间的自适应多尺度特征聚合:

  • 计算query中心在BEV平面的两两距离,将距离惩罚项引入注意力计算:

  • 每个注意力头的感受野控制参数τ由query特征通过线性层动态生成,不同头可学习到不同大小的感受野,实现类似FPN的多尺度特征聚合效果;且大物体(如公交、卡车)对应的query会自动学习到更大的感受野,小物体(如行人、交通锥)对应更小的感受野。
  • 相比普通多头自注意力,SASA可带来+2.2NDS、+4.0mAP的性能提升。

3. 自适应时空采样(Adaptive Spatio-temporal Sampling

        针对DETR3D单点采样感受野固定的问题,实现多帧、多视角、多尺度的自适应特征采样:

  • 自适应采样点生成:由query特征生成采样偏移,结合query柱体的尺寸、旋转信息生成3D采样点,可自适应覆盖不同大小的物体。
  • 时序对齐机制
    • 物体运动对齐:利用query的速度向量,将当前帧采样点回卷到历史帧的对应位置;
    • 自车运动对齐:利用数据集提供的自车位姿,将采样点先转换到全局坐标系,再转换到历史帧的自车局部坐标系。
  • 多视角多尺度采样:将对齐后的3D点投影到多个相机视角,在多尺度图像特征图上做双线性插值采样,采样权重由query特征动态生成。
  • 该模块可有效利用长时序信息,性能随输入帧数增加持续提升,最优配置为8帧输入、每帧16个采样点。

4. 自适应混合解码(Adaptive Mixing)

        针对采样特征的自适应解码需求,结合动态卷积与MLP-Mixer设计:

  • 通道混合:由query特征生成动态权重,对采样特征做通道维度的变换,增强语义信息;
  • 点混合:对特征转置后,用query生成的动态权重做采样点维度的变换,聚合不同位置、不同帧的采样特征;
  • 实验证明通道混合在前、点混合在后的顺序效果最优,相比普通注意力聚合方式可带来+6.5NDS的提升。

5. 可选双分支设计(Dual-branch SparseBEV)

        参考SlowFast网络设计,将输入分为两个分支:

  • 慢分支:低帧率、高分辨率输入,建模细粒度外观特征;
  • 快分支:高帧率、低分辨率输入,建模长时序运动信息;
    两个分支的采样特征拼接后送入自适应混合模块,可在少量增加计算量的前提下进一步提升性能。

        图 2:SparseBEV 的整体架构,这是一款完全基于稀疏数据的仅摄像头的 3D 物体检测器。查询最初被初始化为 BEV 空间中的稀疏柱体集合。尺度自适应的自注意力机制进一步通过自适应感受野对查询进行编码。接下来,多视角和多时间戳的特征通过自适应时空采样进行聚合,并通过自适应混合进行解码。解码器重复执行 L 次以生成最终预测结果。

三、实验结果与结论

1. 实验数据集

        nuScenes自动驾驶数据集,采用NDS(综合检测得分)、mAP(平均精度均值)、位置/尺度/朝向/速度/属性误差等作为评价指标。

2. 核心性能

  • 验证集(ResNet50 backbone,输入704×256):55.8NDS,推理速度23.5FPS,在精度和速度上均超越同期所有方法;
  • 测试集(V2-99 backbone,利用未来帧):67.5NDS,超越此前SOTA方法BEVFormerV2 2.7NDS,且backbone参数量仅为BEVFormerV2的1/4左右。

3. 消融实验结论

        柱体query表示、SASA、时序对齐、自适应混合等模块均对性能有显著贡献。

4. 局限性

        高度依赖自车位姿信息,位姿误差会导致性能大幅下降;推理延迟随输入帧数线性增长。

        表 1 在 nuScenes 验证集上的性能对比。† 该方法得益于视角预训练。‡ 表示使用了 CBGS [59] 方法,其训练周期将从 1 个周期延长至 4.5 个周期。

四、研究价值与方向

        1. 首次实现了完全稀疏的3D检测方法性能超越稠密BEV类方法,证明了稀疏范式在兼顾精度和速度上的巨大潜力。

        2. 为query类3D检测方法提供了通用的自适应优化思路,相关设计可扩展到BEV分割、占用预测、车道线检测等其他3D感知任务。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐