论文解读--RaCFormer: Towards High-Quality 3D Object Detection via Query-based Radar-Camera Fusion
核心要点
本文围绕3D目标检测任务,提出了RaCFormer——一种基于查询的雷达-相机融合Transformer框架,突破了传统BEV融合的性能瓶颈。

图1 RaCFormer 的动机。 (a) 以往的方法通常通过拼接或交叉注意力的方式将来自图像视角转换和雷达点云编码的 BEV 特征进行融合。 (b) 相比之下,RaCFormer 采用基于查询的融合框架,同时采样雷达增强的图像视角特征、摄像机变换后的 BEV 特征以及雷达编码的 BEV 特征。
主要内容可从背景与问题、核心设计、实验验证、价值与局限四个维度展开:
一、研究背景与问题提出
1. 任务价值与传感器选型
3D目标检测是自动驾驶、智能机器人的核心感知任务,相比成本高昂的激光雷达(LiDAR),多视角相机+毫米波雷达的方案成本更低、环境鲁棒性更强(不受雨雾、光线影响),是行业主流的落地方向。
2. 现有雷达-相机融合方案的痛点
现有SOTA方法多采用BEV(鸟瞰图)范式:将图像和雷达特征分别转换到BEV空间,再通过拼接、交叉注意力融合。但存在两个核心缺陷:
- 雷达本身空间分辨率低,生成的BEV特征高度稀疏;
- 相机图像转BEV的过程依赖深度估计,深度预测误差会导致相机BEV特征出现畸变,丢失原图的语义信息。仅依赖BEV空间的融合无法解决两类模态的特征差异,因此需要跨视角(原图视角+BEV视角)的异构特征融合方案。
二、RaCFormer核心设计
RaCFormer基于查询(Query)驱动的跨视角融合范式:以3D空间初始化的物体查询为介质,同时从原图和BEV空间采样实例相关特征,避免了BEV特征畸变、不对齐的问题,核心包含三大创新模块:
1. 线性递增的环形查询初始化
- 针对传统径向查询(Radial)分布近密远疏、远距离物体检测效果差的问题,将查询沿极坐标的同心环分布,从内到外每个环的查询数量按线性系数α递增,保证远近距离的查询密度更合理,匹配传感器投影特性。
- 当α=1时,该分布退化为传统径向分布,兼顾了兼容性;通过调整环数k、初始查询数n、增长系数α可适配不同感知范围需求。
2. 雷达感知的深度预测模块(优化相机BEV特征)
- 解决传统车载雷达垂直角分辨率低、点云高度误差大,难以直接辅助深度估计的问题:将所有雷达点的高度z固定为1,投影到图像平面后,将每个点的深度值沿图像高度方向扩展,生成粗雷达深度图。
- 结合雷达的RCS(雷达散射截面积)特征和位置嵌入,与图像特征拼接后输入深度头,优化深度预测结果,再通过Lift-Splat-Shoot方法生成更准确的相机BEV特征。
3. 隐式动态捕捉模块(优化雷达BEV特征)
- 利用雷达的多普勒测速特性,基于ConvGRU(卷积门控循环单元)建模多帧雷达BEV的时序信息:将当前帧雷达BEV特征和上一帧的隐藏状态输入ConvGRU,更新后与当前特征融合,再通过2D卷积输出增强后的雷达BEV特征,有效捕捉动态物体的运动信息,提升速度估计精度。
4. 跨视角特征采样与解码流程
Transformer解码器共L层,每层对每个查询对应的射线段进行采样:
- 分别从多帧、多相机的原图特征,以及对齐到自车坐标系的多帧BEV特征中采样实例相关特征;
- 经过尺度自适应自注意力、自适应特征混合后迭代更新查询,最终输出到分类头和回归头得到3D检测结果。

图 2 RaCFormer 的总体架构。图像编码器从多摄像头图像的多个帧中提取特征,而多帧雷达点则被进行体素化处理,并由柱状编码器进行处理。雷达特征被展平到鸟瞰图(BEV)中,并通过隐式动态捕获器进行增强。同时,雷达点被重新投影到图像平面上,其深度值扩展到整个图像高度,并与深度头中的图像特征合并,以优化深度预测。然后,经过优化的深度概率分布 D' 和图像特征被输入到提升-分散-发射(LSS)模块中,以创建相机鸟瞰图特征。变压器解码器以可调节的圆形分布初始化查询。在 L 层中,每个层内的光线采样模块提取图像视图和鸟瞰图特征以优化查询,从而通过后续的头实现精确的分类和回归。
三、实验验证与结论
1. 基准数据集与指标
- 采用自动驾驶领域主流的nuScenes数据集(1000个场景,包含多模态传感器数据)和VoD(View-of-Delft)数据集(复杂城市场景,包含3+1D雷达数据)验证;
- 核心指标:mAP(平均精度均值)、NDS(nuScenes检测综合得分),以及位置、尺寸、朝向、速度、属性误差等细分指标。

表 1. 在 nuScenes 验证集上对不同方法的比较。其中“C”和“R”分别代表相机和雷达。
2. SOTA性能表现
- nuScenes测试集:在使用VoVNet-99 backbone、6帧历史+6帧未来帧输入的配置下,达到64.9% mAP和70.2% NDS,超过同期雷达-相机融合方案,性能甚至优于部分激光雷达基模型,大幅缩小了模态差距。
- VoD数据集:全标注区域mAP达54.4%,感兴趣区域(自车行驶走廊)mAP达78.6%,位列榜单第一。
3. 消融实验验证模块有效性
- 跨视角采样:相比仅在BEV空间采样,同时采样原图特征可带来3.1% mAP、4.1% NDS的提升;
- 雷达深度+RCS嵌入:单独引入深度嵌入提升0.7% mAP,单独引入RCS嵌入提升0.5% mAP,二者结合共提升1.1% mAP;
- 隐式动态捕捉:对速度<5m/s的慢速物体mAP提升4.3%,速度>5m/s的快速物体mAP提升3.5%,速度估计误差显著降低;
- 环形查询初始化:相比传统网格分布提升1.5% mAP,α=1.25时性能最优。
4. 鲁棒性与落地性验证
- 极端环境适配:雨天、夜晚场景下,性能优于纯相机方案,达到激光雷达方案94%、89%的mAP,弥补了图像感知在恶劣环境下的短板;
- 传感器故障鲁棒性:完全缺失相机输入时仍有27.2%的车辆类AP,完全缺失雷达输入时保留52.8%的车辆类AP,优于同期融合方案;
- 实时性:轻量化版本在单张RTX 3090 GPU上可达到12FPS,满足自动驾驶实时感知需求。
四、研究价值与局限
1. 创新价值
突破了传统BEV融合的固有范式,首次提出查询驱动的跨视角雷达-相机融合框架,三个核心模块分别解决了查询分布不合理、相机BEV畸变、雷达时序信息利用不足的行业共性问题,为低成车规级3D感知提供了新的技术路线。
2. 局限与延伸方向
目前方案的未来帧输入会引入感知延迟,落地时可进一步优化时序建模方式降低延迟;同时雷达点云的稀疏性仍有优化空间,可结合半监督、自监督方法进一步提升小物体、极端遮挡场景的检测精度。
更多推荐




所有评论(0)