[Remote Sensing 2025] | MSDF-Mamba: Mutual-Spectrum Perception Deformable Fusion Mamba for Drone-Based Visible-Infrared Cross-Modality Vehicle Detection:面向无人机可见光-红外跨模态车辆检测的互谱感知可变形融合 Mamba

01 论文信息

在这里插入图片描述

  • 论文题目: MSDF-Mamba: Mutual-Spectrum Perception Deformable Fusion Mamba for Drone-Based Visible-Infrared Cross-Modality Vehicle Detection
  • 论文作者: Jiashuo Shen, Jun He, Qiuyu Liu, Zhilong Zhang, Guoyan Wang, Dawei Lu
  • 发表单位: College of Electronic Science and Technology, National University of Defense Technology, Changsha 410073, China
  • 发表会议\期刊: Remote Sensing, 2025, Vol. 17, Article 4037
  • DOI: 10.3390/rs17244037
  • 代码链接: 论文中未提供官方源码链接。

02 论文主要贡献

一句话概括:MSDF-Mamba 试图解决无人机可见光-红外目标检测中“跨模态目标位置不对齐”和“融合模型精度与复杂度难兼顾”的问题,提出了一个基于 YOLOv8 双流骨干、互谱感知可变形对齐模块 MSDA 和选择性扫描融合模块 SSF 的高精度低复杂度跨模态车辆检测框架。

无人机全天候目标检测通常需要同时利用可见光图像和红外图像。可见光图像提供纹理、颜色和清晰背景结构,但在夜间、低照度、强曝光、雨雪雾等条件下容易退化;红外图像对热目标更稳定,但缺少丰富纹理与颜色信息。因此,RGB-IR 融合检测的基本动机很自然:让两种模态互补,以提升全天候感知能力。

但这篇论文强调的核心困难并不是“是否融合”,而是如何在弱配准甚至错位的条件下有效融合。在无人机场景中,两类传感器可能存在成像时间差、视角差、视场差、标定误差和目标运动差异。论文图 1 直观展示了 DroneVehicle 数据集中可见光与红外标注框的错位:同一车辆在两个模态中的目标框并不完全重合。这种错位会导致简单相加、拼接或固定参考模态对齐的融合方式产生特征混淆。
在这里插入图片描述

先前方法大致有两类典型路线:

  1. 基于 CNN 或候选框的对齐融合方法。 例如区域特征对齐、proposal-guided feature mining、可变形卷积引导对齐等。这类方法能显式处理局部错位,但往往依赖某个固定参考模态。如果参考模态本身质量差,例如夜间可见光严重退化,则偏移估计可能被带偏。
  2. 基于 Transformer 或复杂多阶段融合的方法。 例如 C2Former、跨模态注意力融合等。这类方法能够建模全局依赖和互补关系,但 self-attention 带来较高计算与显存开销,对无人机平台的实时部署不友好。

MSDF-Mamba 的切入点是:对齐阶段不能只相信单一模态,融合阶段也不能靠昂贵的全局注意力堆复杂度。 因此作者提出两步策略:首先用 MSDA 模块让可见光和红外“互相查询、互相增强”,生成一个更可靠的共享参考特征,再用可变形卷积完成空间校正;随后用 SSF 模块把对齐后的模态特征映射到统一的 Mamba hidden state space 中,通过选择性扫描实现跨模态深度交互,同时保持较低复杂度。


03 论文创新点

  1. 提出 MSDF-Mamba 多模态无人机目标检测框架。 该框架以 YOLOv8 双流检测器为基础,引入 Mamba 风格的状态空间融合机制,同时针对可见光-红外目标检测中的位置错位与效率瓶颈进行专门设计。
  2. 设计 Mutual-Spectrum Deformable Alignment, MSDA 模块。 MSDA 通过双向 cross-attention 获取两个模态的互补增强特征,并将增强后的特征作为共享参考来预测可变形卷积偏移,从而避免传统方法过度依赖单一参考模态。
  3. 设计 Selective Scan Fusion, SSF 模块。 SSF 将对齐后的可见光、红外和初步融合特征映射到共享 hidden state space,通过选择性扫描机制实现跨模态特征交互,在保留 Mamba 线性复杂度优势的同时增强融合表达能力。

04 方法

4.1 整体架构

论文图 2 给出了 MSDF-Mamba 的整体结构。模型整体可以理解为一个双流 YOLOv8 检测框架 + 跨模态对齐模块 + Mamba 融合模块
在这里插入图片描述

输入是一对可见光图像和红外图像。模型首先使用两个结构一致的 YOLOv8 backbone,也就是 CSPDarkNet-S,分别提取 visible branch 与 infrared branch 的多尺度特征。论文选择最后三个阶段的特征进行融合,对应检测网络中常见的 P3P_3P3, P4P_4P4, P5P_5P5 层。每个尺度上,作者不是直接把两路特征相加,而是插入两个关键模块:

  • MSDA 模块: 负责处理可见光和红外特征之间的空间错位。它先通过双向 cross-attention 让两个模态互相增强,再基于增强特征预测 deformable convolution 的 offset 和 modulation scalar,最后对两路特征进行显式空间对齐。
  • SSF 模块: 负责对齐之后的深度融合。它将对齐后的可见光特征、红外特征以及二者的初步融合特征拼接起来,送入简化后的 Vision State Space 模块,通过 SS2D 选择性扫描完成跨模态长程依赖建模与特征交互。

经过 MSDA 和 SSF 后得到的融合特征进入 YOLOv8 的 neck 和 head,最终输出目标检测结果。损失函数沿用 YOLOv8 检测损失,由 box regression、classification 和 distribution focal loss 三部分构成。

从宏观上看,MSDF-Mamba 的核心思想是:先对齐,再融合;先建立互为参考的跨模态语义,再做几何偏移校正;最后借助 Mamba 的状态空间机制高效建模全局交互。 这与简单 early fusion、middle fusion 或单一参考模态校正有明显差异。


4.1.1 核心模块
模块一:YOLOv8 双流骨干网络

Input & Output:

输入为可见光图像 IvisI_{vis}Ivis 与红外图像 IirI_{ir}Iir。两者分别进入结构一致的 YOLOv8 backbone,输出多尺度特征。论文重点使用 backbone 最后三个阶段输出,对应 P3P_3P3, P4P_4P4, P5P_5P5

Internal Mechanism:

双流骨干的作用是让两个模态先在各自分支中完成初步特征提取,避免一开始就把原始图像简单堆叠造成模态冲突。可见光分支更容易捕获纹理、边缘、道路背景、车辆外观等信息;红外分支则更稳定地捕获热目标响应。

在 baseline 中,论文采用的是两个 YOLOv8 backbone 提取特征后做 element-wise addition,再送入 YOLOv8 neck/head。MSDF-Mamba 则在这一基础上加入 MSDA 和 SSF,替换掉“直接相加式”的粗糙融合逻辑。

Design Rationale:

作者选择 YOLOv8 作为基础框架,是一个偏工程可落地的选择。YOLOv8 在实时目标检测中有较成熟的 backbone-neck-head 结构,便于构建多尺度检测管线。无人机平台通常对 FPS 和模型规模敏感,因此从 YOLOv8 出发,比从大型 Transformer detector 出发更符合应用场景。


模块二:MSDA - 互谱感知可变形对齐模块

MSDA 是本文最关键的模块之一,对应论文图 3。
在这里插入图片描述

Input & Output:

输入是 backbone 提取到的 visible feature Fvis∈RC×H×WF_{vis} \in \mathbb{R}^{C \times H \times W}FvisRC×H×W 和 infrared feature Fir∈RC×H×WF_{ir} \in \mathbb{R}^{C \times H \times W}FirRC×H×W。输出包括对齐后的可见光特征 FvisalignedF^{aligned}_{vis}Fvisaligned、对齐后的红外特征 FiralignedF^{aligned}_{ir}Firaligned,以及二者相加得到的融合特征 FcF_cFc

Internal Mechanism:

MSDA 由两个部分构成:

  1. Mutual-Spectrum Perception, MSP: 通过双向 cross-attention 进行互补增强。可见光特征作为 query,从红外特征中查询热目标与边界信息;红外特征作为 query,从可见光特征中查询纹理和上下文信息。这样得到的不是单一模态特征,而是已经带有对方模态上下文的增强特征。
  2. Deformable Convolutional Alignment: 将增强后的两路特征在通道维拼接,送入轻量 offset generation network,预测 deformable convolution 需要的 spatial offset Δp\Delta pΔp 和 modulation scalar Δm\Delta mΔm。随后使用相同的 offset 对两个增强特征分别执行可变形卷积,完成空间校正。

论文的关键设计是:offset 不是由某一个模态单独预测,而是由双向增强后的共享参考特征预测。这一点直接回应了论文提出的痛点:单一参考模态可能因为低照度、遮挡、热噪声或域差异而不可靠。

Design Rationale:

传统对齐方法常见做法是“RGB 对齐到 IR”或“IR 对齐到 RGB”,本质上假设某个模态是可靠参考。但在无人机场景中,这个假设并不稳定。例如夜间可见光可能几乎不可用,白天红外细节可能不足。MSDA 的设计更合理:先让两个模态互相感知,再从融合语义中估计几何偏移。

这种设计可以被理解为:不要问“谁是参考模态”,而是让模型从两者的互补信息中学习一个动态共享参考。


模块三:SSF - 选择性扫描融合模块

在这里插入图片描述

SSF 是 MSDF-Mamba 的第二个核心模块,对应论文图 4。

Input & Output:

输入是 MSDA 输出的 FvisalignedF^{aligned}_{vis}FvisalignedFiralignedF^{aligned}_{ir}FiralignedFcF_cFc。输出是进一步融合后的双模态增强特征,随后进入 YOLOv8 neck/head。

Internal Mechanism:

SSF 的流程可以分为四步:

  1. FvisalignedF^{aligned}_{vis}FvisalignedFiralignedF^{aligned}_{ir}FiralignedFcF_cFc 沿通道维拼接,得到组合特征 Fˉ\bar{F}Fˉ
  2. 经过 LayerNorm 后送入 Vision State Space, VSS 模块,并加 residual connection,保证训练稳定性。
  3. 在 VSS 内部,组合特征再次被 split 成 visible、infrared 和 fusion 三个分支;每个分支先经过 Linear、DWConv 和 SiLU,再进入共享的 SS2D 模块。
  4. SS2D 将二维图像特征按多方向扫描展开到序列空间,在 hidden state space 中建模长程依赖,并输出 yvisy_{vis}yvisyiry_{ir}yirycy_cyc。随后通过 LayerNorm、Linear 和 FFN 生成最终融合特征。

Design Rationale:

Mamba/SSM 的优势在于能够以近似线性复杂度处理长序列依赖,避免 Transformer self-attention 的二次复杂度。对于无人机遥感图像,远距离上下文很重要:小车辆目标可能只占很少像素,是否为车辆往往需要结合道路结构、停车区域、热响应分布等全局信息。

SSF 不是简单将两个模态拼接后丢给 Mamba,而是额外保留一个初步融合分支 FcF_cFc。这有两个好处:一方面保留各模态的专有信息,避免过早融合造成信息稀释;另一方面让融合分支作为跨模态交互载体,给 visible 和 infrared 分支提供互补信息。


模块四:YOLOv8 Neck/Head 与检测损失

Input & Output:

输入为 SSF 融合后的多尺度特征,输出为检测框、类别概率和对应的定位质量估计。论文保持 YOLOv8 原始 neck 和 head 结构。

Internal Mechanism:

损失函数由三部分组成:分类损失、边界框损失和 distribution focal loss。整体形式为:

Loss=λ1Lossbox+λ2Losscls+λ3Lossdfl. Loss = \lambda_1 Loss_{box} + \lambda_2 Loss_{cls} + \lambda_3 Loss_{dfl}. Loss=λ1Lossbox+λ2Losscls+λ3Lossdfl.

论文设置:

λ1=7.5,λ2=0.5,λ3=1.5. \lambda_1 = 7.5, \qquad \lambda_2 = 0.5, \qquad \lambda_3 = 1.5. λ1=7.5,λ2=0.5,λ3=1.5.

Design Rationale:

这说明论文的主要创新不在检测头和损失函数,而在 backbone 特征融合之前的对齐与融合机制。保持 YOLOv8 head 不变,有利于把性能提升更清楚地归因到 MSDA 和 SSF。


4.1.2 关键公式与算法
关键公式一:MSP 双向 cross-attention

论文中 visible-guided 与 infrared-guided 的双向增强可以写为:

Fvisenh=Softmax(QvisKirTdk)Vir+Fvis, F^{enh}_{vis} = \mathrm{Softmax}\left(\frac{Q_{vis}K_{ir}^{T}}{\sqrt{d_k}}\right)V_{ir} + F_{vis}, Fvisenh=Softmax(dk QvisKirT)Vir+Fvis,

Firenh=Softmax(QirKvisTdk)Vvis+Fir. F^{enh}_{ir} = \mathrm{Softmax}\left(\frac{Q_{ir}K_{vis}^{T}}{\sqrt{d_k}}\right)V_{vis} + F_{ir}. Firenh=Softmax(dk QirKvisT)Vvis+Fir.

其中:

Qvis=WvisqFvis,Kir=WirkFir,Vir=WirvFir, Q_{vis} = W^q_{vis}F_{vis}, \qquad K_{ir} = W^k_{ir}F_{ir}, \qquad V_{ir} = W^v_{ir}F_{ir}, Qvis=WvisqFvis,Kir=WirkFir,Vir=WirvFir,

Qir=WirqFir,Kvis=WviskFvis,Vvis=WvisvFvis. Q_{ir} = W^q_{ir}F_{ir}, \qquad K_{vis} = W^k_{vis}F_{vis}, \qquad V_{vis} = W^v_{vis}F_{vis}. Qir=WirqFir,Kvis=WviskFvis,Vvis=WvisvFvis.

Objective: 该公式的目标不是直接完成融合检测,而是生成两个语义增强特征:FvisenhF^{enh}_{vis}FvisenhFirenhF^{enh}_{ir}Firenh。它们既保留原模态信息,又主动吸收另一模态的互补信息。

Meaning of Terms:

  • QQQ 表示当前模态想要查询的信息需求;
  • KKK 表示另一模态中可被匹配的语义索引;
  • VVV 表示另一模态中实际被聚合的信息;
  • dk\sqrt{d_k}dk 用于缩放 dot product,避免 softmax 过饱和;
  • residual term FvisF_{vis}FvisFirF_{ir}Fir 保留原始模态特性。

Intuition: 可见光图像可能告诉模型“这块区域像车、道路边界清晰”,红外图像可能告诉模型“这块区域有稳定热响应”。双向 cross-attention 让两者互相询问:可见光从红外找热目标,红外从可见光找纹理上下文。这样得到的增强特征更适合作为对齐参考。


关键公式二:基于增强特征的可变形对齐

MSDA 先用增强特征预测 offset:

{Δp,Δm}=Coff(Concat(Fvisenh,Firenh)). \{\Delta p, \Delta m\} = C_{off}\left(\mathrm{Concat}\left(F^{enh}_{vis}, F^{enh}_{ir}\right)\right). {Δp,Δm}=Coff(Concat(Fvisenh,Firenh)).

然后用 deformable convolution 生成对齐特征:

Fvisaligned=Cdef(Fvisenh,{Δp,Δm}), F^{aligned}_{vis} = C_{def}\left(F^{enh}_{vis}, \{\Delta p, \Delta m\}\right), Fvisaligned=Cdef(Fvisenh,{Δp,Δm}),

Firaligned=Cdef(Firenh,{Δp,Δm}). F^{aligned}_{ir} = C_{def}\left(F^{enh}_{ir}, \{\Delta p, \Delta m\}\right). Firaligned=Cdef(Firenh,{Δp,Δm}).

对于某个位置 ppp,可变形卷积的采样形式为:

Fmod,paligned=∑k=1Kwkx(p+pk+Δpk)⋅Δmk,mod∈{vis,ir}. F^{aligned}_{mod,p} = \sum_{k=1}^{K} w_k x(p + p_k + \Delta p_k) \cdot \Delta m_k, \qquad mod \in \{vis, ir\}. Fmod,paligned=k=1Kwkx(p+pk+Δpk)Δmk,mod{vis,ir}.

最后得到初步融合特征:

Fc=Fvisaligned+Firaligned. F_c = F^{aligned}_{vis} + F^{aligned}_{ir}. Fc=Fvisaligned+Firaligned.

Objective: 该公式的目标是让卷积核不再固定在规则网格采样,而是根据跨模态增强特征预测出的 offset 动态移动采样位置,从而校正目标错位。

Meaning of Terms:

  • ppp 是当前采样中心;
  • pkp_kpk 是普通卷积核的第 kkk 个固定采样偏移,例如 3×33 \times 33×3 卷积中的九宫格位置;
  • Δpk\Delta p_kΔpk 是模型学习到的额外偏移;
  • Δmk∈[0,1]\Delta m_k \in [0,1]Δmk[0,1] 是调制系数,用于控制该采样点的重要性;
  • CoffC_{off}Coff 是 offset generation network,论文明确提出是一个轻型卷积;
  • wkw_kwk 是第 kkk 个卷积核权重;
  • x(⋅)x(\cdot)x() 由于可能落在非整数坐标,论文采用 bilinear interpolation 处理。

Intuition: 如果 RGB 图像中的车辆框比 IR 图像偏右一点,普通卷积会在错误位置采样,导致融合后目标边界模糊或响应分裂。可变形卷积允许采样点“挪过去”,而这个挪动方向来自互谱增强特征,因此比单模态 offset 更稳健。


关键公式三:SSF 中的选择性扫描融合

SSF 首先拼接三类输入:

Fˉ=Concat(Fvisaligned,Firaligned,Fc). \bar{F} = \mathrm{Concat}\left(F^{aligned}_{vis}, F^{aligned}_{ir}, F_c\right). Fˉ=Concat(Fvisaligned,Firaligned,Fc).

随后经过 VSS 和残差连接:

Y1=VSS(LayerNorm(Fˉ)), Y_1 = VSS\left(\mathrm{LayerNorm}(\bar{F})\right), Y1=VSS(LayerNorm(Fˉ)),

F1=Fˉ+Y1. F_1 = \bar{F} + Y_1. F1=Fˉ+Y1.

在 VSS 内部,特征被拆成三支:

Fviss,Firs,Fcs=Split(Fˉ). F^s_{vis}, F^s_{ir}, F^s_c = \mathrm{Split}(\bar{F}). Fviss,Firs,Fcs=Split(Fˉ).

每一支经过投影、深度卷积和激活:

F~viss=SiLU(DWConv(Linear(Fviss))), \tilde{F}^s_{vis} = \mathrm{SiLU}\left(\mathrm{DWConv}(\mathrm{Linear}(F^s_{vis}))\right), F~viss=SiLU(DWConv(Linear(Fviss))),

F~irs=SiLU(DWConv(Linear(Firs))), \tilde{F}^s_{ir} = \mathrm{SiLU}\left(\mathrm{DWConv}(\mathrm{Linear}(F^s_{ir}))\right), F~irs=SiLU(DWConv(Linear(Firs))),

F~cs=SiLU(DWConv(Linear(Fcs))). \tilde{F}^s_c = \mathrm{SiLU}\left(\mathrm{DWConv}(\mathrm{Linear}(F^s_c))\right). F~cs=SiLU(DWConv(Linear(Fcs))).

然后送入共享 SS2D:

yvis=SS2D(F~viss),yir=SS2D(F~irs),yc=SS2D(F~cs). y_{vis} = SS2D(\tilde{F}^s_{vis}), \qquad y_{ir} = SS2D(\tilde{F}^s_{ir}), \qquad y_c = SS2D(\tilde{F}^s_c). yvis=SS2D(F~viss),yir=SS2D(F~irs),yc=SS2D(F~cs).

论文中进一步把三支扫描结果组合:

yvis=yviss+ycs, y_{vis} = y^s_{vis} + y^s_c, yvis=yviss+ycs,

yir=yirs+ycs, y_{ir} = y^s_{ir} + y^s_c, yir=yirs+ycs,

yc=ycs. y_c = y^s_c. yc=ycs.

Objective: SSF 的目标是把对齐后的双模态特征映射到统一 hidden state space,使跨模态信息在同一语义维度下交互,同时避免 Transformer 全局注意力的高复杂度。

Meaning of Terms:

  • SS2D(⋅)SS2D(\cdot)SS2D() 是二维选择性扫描,用多方向扫描把图像特征转成可由 SSM 处理的序列;
  • yvissy^s_{vis}yvissyirsy^s_{ir}yirsycsy^s_cycs 分别是三支选择性扫描输出;
  • ycsy^s_cycs 被加到 visible 和 infrared 输出上,相当于把初步融合分支作为互补信息注入到单模态分支。

Intuition: SSF 的设计像是让三个视角同时看同一个场景:visible 分支保纹理,infrared 分支保热目标,fusion 分支保跨模态共识。Mamba 的选择性扫描负责在大范围上下文中决定哪些信息应该被保留、传播和融合。


05 实验分析

5.1 实验设置

数据集
  1. DroneVehicle: 大规模无人机可见光-红外车辆检测数据集,包含 28,439 对可见光/红外图像,覆盖城市道路、乡村、住宅区、停车场等场景。数据按光照条件分为白天、夜间和极暗夜间。标注类别包括 car、truck、bus、van 和 freight car,总实例数为 953,087。论文采用官方划分:17,990 对训练、1,469 对验证、8,980 对测试。由于暗光环境下红外标注更完整,论文使用红外模态标签作为 ground truth。
  2. DVTOD: 面向无人机可见光-红外错位目标检测的 benchmark,包含 2,179 对图像、4,358 张图像和 6,142 个标注框。类别包括 person、car 和 bicycle。论文采用 1,606 对训练、573 对测试,所有图像统一 resize 到 640×640640 \times 640640×640
评价指标

论文使用 precision、recall、AP 与 mAP@0.5。对应公式为:

P=TPTP+FP, P = \frac{TP}{TP + FP}, P=TP+FPTP,

R=TPTP+FN, R = \frac{TP}{TP + FN}, R=TP+FNTP,

AP=∫01P(R)dR, AP = \int_0^1 P(R)dR, AP=01P(R)dR,

mAP=1n∑i=1nAPi. mAP = \frac{1}{n}\sum_{i=1}^{n} AP_i. mAP=n1i=1nAPi.

其中 nnn 表示类别数。

Baselines
  • 单模态检测方法: RetinaNet、R3Det、S2ANet、Faster R-CNN、RoITransformer、YOLOv8(OBB)。
  • 多模态检测方法: UA-CMDet、Halfway Fusion、CIAN、AR-CNN、MBNet、TSFADet、C2Former、DMM、OAFA、RemoteDet-Mamba。
  • DVTOD 对比方法: YOLOv3/5/6/7/8/10 单模态检测器,以及 YOLOv5 + Add、YOLOv5 + CMX、CFT、CMA-Det 等双模态方法。

5.2 主实验结果

5.2.1 DroneVehicle:相比单模态检测的提升

论文表 2 比较了 MSDF-Mamba 与单模态检测方法。YOLOv8(OBB) 是单模态方法中最强的基线:
在这里插入图片描述

  • RGB 输入下,YOLOv8(OBB) 的 mAP@0.5 为 74.5%74.5\%74.5%
  • IR 输入下,YOLOv8(OBB) 的 mAP@0.5 为 78.6%78.6\%78.6%
  • MSDF-Mamba 使用 RGB + IR,mAP@0.5 达到 82.5%82.5\%82.5%

也就是说,相比红外单模态 YOLOv8(OBB),MSDF-Mamba 提升了 3.93.93.9 个百分点;相比可见光单模态 YOLOv8(OBB),提升了 8.08.08.0 个百分点。类别上,truck、bus、van 的提升比较明显,说明双模态融合对容易受视角、光照和尺度影响的车辆类别更有帮助。

这个结果验证了论文的第一个假设:RGB 与 IR 的互补性确实能够显著提升无人机场景车辆检测,尤其是在单模态信息不足时。

5.2.2 DroneVehicle:相比多模态方法的提升

论文表 3 是更关键的对比,因为这里对手都是 RGB + IR 多模态方法。结果如下:
在这里插入图片描述

  • RemoteDet-Mamba:81.8%81.8\%81.8% mAP@0.5;
  • DMM:79.4%79.4\%79.4% mAP@0.5;
  • OAFA:79.4%79.4\%79.4% mAP@0.5;
  • MSDF-Mamba:82.5%82.5\%82.5% mAP@0.5。

MSDF-Mamba 相比第二名 RemoteDet-Mamba 提升 0.70.70.7 个百分点,相比 DMM/OAFA 提升 3.13.13.1 个百分点。分类别看,MSDF-Mamba 在 car、truck、bus 三类上取得最佳结果,分别为 98.6%98.6\%98.6%82.5%82.5\%82.5%96.9%96.9\%96.9%。freight car 类别上 OAFA 达到 73.3%73.3\%73.3%,MSDF-Mamba 为 69.8%69.8\%69.8%,不是最优;van 类别上 DMM 达到 68.6%68.6\%68.6%,MSDF-Mamba 为 64.5%64.5\%64.5%,也不是最优。

这说明 MSDF-Mamba 的总体优势主要来自主流车辆类别上的更强性能,而非每个类别都全面碾压。对于样本较少或形态差异较大的 freight car、van,方法仍存在提升空间。

论文图 5 的可视化结果也支持这一点:
在这里插入图片描述

单模态或简单双模态 baseline 容易出现 false positives 和 false negatives,尤其在遮挡、弱光和错位情况下;MSDF-Mamba 的检测框更接近 infrared label 的 ground truth,漏检和误检明显减少。这从定性上验证了 MSDA 对弱配准场景的价值。

5.2.3 DVTOD:跨数据集泛化能力

在这里插入图片描述

论文表 4 在 DVTOD 上比较了 YOLO 系列和多模态方法。值得注意的是,DVTOD 上可见光单模态 YOLO 表现很低,而红外单模态明显更强。例如 YOLOv3 的 person AP 从 RGB 的 25.1%25.1\%25.1% 提升到 IR 的 87.1%87.1\%87.1%。这说明 DVTOD 场景中红外信息对目标检测尤其关键。

在双模态方法中:

  • YOLOv5 + Add:79.2%79.2\%79.2%
  • YOLOv5 + CMX:81.6%81.6\%81.6%
  • CFT:82.7%82.7\%82.7%
  • CMA-Det:85.0%85.0\%85.0%
  • MSDF-Mamba:86.4%86.4\%86.4%

MSDF-Mamba 相比 CMA-Det 提升 1.41.41.4 个百分点;相比 CFT 提升 3.73.73.7 个百分点;相比简单相加的 YOLOv5 + Add 提升 7.27.27.2 个百分点。类别上,MSDF-Mamba 在 car 与 bicycle 上分别达到 83.3%83.3\%83.3%86.2%86.2\%86.2%,超过 CMA-Det 的 81.6%81.6\%81.6%83.1%83.1\%83.1%;person 类别为 89.8%89.8\%89.8%,略低于 CMA-Det 的 90.3%90.3\%90.3%

这表明 MSDF-Mamba 不仅适用于 DroneVehicle,还能迁移到另一种错位无人机 RGB-IR benchmark;不过 person 类别上未超过 CMA-Det,也说明其优势并非在所有类别上均等。


5.3 计算成本与速度分析

在这里插入图片描述

论文图 6 对比了不同方法的参数规模和推理速度。MSDF-Mamba 的结果为:

  • 参数规模:51.34 MB;
  • 推理速度:34.6 FPS 左右;
  • mAP@0.5:82.5%82.5\%82.5%

论文特别强调,相比 DMM baseline,MSDF-Mamba 参数量减少约 40%40\%40%,但检测性能更高。从 UAV 部署角度看,34.6 FPS 已经具备实时潜力。

不过这里需要注意一个公平性问题:表 5 中最简单的 dual-stream YOLOv8 baseline 只有 11.70 MB,并达到 337.05 FPS;加入完整 MSDF-Mamba 后变为 51.34 MB 和 34.65 FPS。也就是说,MSDF-Mamba 相比强融合方法更高效,但相比最轻量 baseline 并不轻。论文的“低复杂度”结论应理解为在较高检测精度下取得了相对合理的效率折中,而不是绝对轻量。


5.4 消融实验

论文表 5 展示了 MSDA 和 SSF 的独立贡献:

| 方法            | MSDA | SSF  | 参数规模 |    FPS |  mAP@0.5 |
| --------------- | ---- | ---- | -------: | -----: | -------: |
| Baseline        | 否   | 否   | 11.70 MB | 337.05 |  |
| Baseline + MSDA | 是   | 否   | 38.36 MB |  68.15 |  |
| Baseline + SSF  | 否   | 是   | 29.86 MB |  47.39 |  |
| Ours            | 是   | 是   | 51.34 MB |  34.65 |  |

在这里插入图片描述

MSDA 的贡献

加入 MSDA 后,mAP@0.5 从 78.9%78.9\%78.9% 提升到 80.8%80.8\%80.8%,增加 1.91.91.9 个百分点。论文图 7 用 Grad-CAM 热力图展示了 MSDA 的作用:加入 MSDA 后,特征响应更集中在车辆目标区域,非目标背景和错位区域响应被抑制。这说明 MSDA 确实帮助模型更好地定位目标区域。

在这里插入图片描述

但代价也明显:参数规模从 11.70 MB 增至 38.36 MB,FPS 从 337.05 降至 68.15。结合论文表 6,MSDA 的三个 stage 额外参数合计为 21.87 MB,其中 Stage 3 的 512512512 通道模块参数达到 16.33 MB,是主要开销来源。

SSF 的贡献

加入 SSF 后,表 5 数值显示 mAP@0.5 从 78.9%78.9\%78.9% 提升到 81.5%81.5\%81.5%,按表格计算为 2.62.62.6 个百分点。但论文正文写作中称提升为 2.2%2.2\%2.2%

在这里插入图片描述

论文图 8 的热力图显示,加入 SSF 后模型对目标区域的响应更强,对背景噪声的响应更弱。这说明 SSF 不只是做了一个抽象的 Mamba 模块替换,而是确实增强了跨模态特征选择和目标相关信息聚合能力。

两者结合的贡献

完整模型达到 82.5%82.5\%82.5%,相比 baseline 提升 3.63.63.6 个百分点。这个提升低于 MSDA 与 SSF 单独提升的线性相加,说明两个模块的贡献存在一定重叠:MSDA 已经做了语义互补增强和空间对齐,SSF 又进一步做特征交互,两者并非完全独立增益。

从方法论一致性看,消融实验支持论文主张:

  • MSDA 主要解决“错位导致融合不准”;
  • SSF 主要解决“对齐后融合表达不充分”;
  • 二者结合带来最佳检测性能。

5.5 具体实现细节

论文第 4.2 节给出的复现相关配置如下:

  • 硬件: Intel i9-13900HX CPU,NVIDIA GeForce RTX 4090 GPU。
  • 软件环境: CUDA 12.1,PyTorch 2.3.0。
  • 输入尺寸: 640×640640 \times 640640×640
  • 训练轮数: 150 epochs。
  • Batch size: 4。
  • 优化器: SGD。
  • Momentum: 0.937。
  • Weight decay: 0.0005。
  • Initial learning rate: 0.01。
  • 数据增强: Mosaic。
  • 标签选择: 使用红外模态标签作为 ground truth,因为暗光环境中红外标注更完整。
  • 预训练: 使用初始化的预训练权重训练双流特征提取网络,但论文未进一步说明预训练权重的具体来源与加载策略。
  • 损失权重: λ1=7.5\lambda_1 = 7.5λ1=7.5λ2=0.5\lambda_2 = 0.5λ2=0.5λ3=1.5\lambda_3 = 1.5λ3=1.5
  • 源码: 论文未提供官方源码链接,本次也没有源码包,因此无法检查模块实现细节,例如 MSDA 的 attention 具体 reshape 方式、SS2D 方向扫描实现、offset generation network 的层数和卷积核配置等。

这些实现细节对复现影响较大,尤其有三点需要注意:

  1. 红外标签作为 ground truth 会影响实验设定。 如果改用可见光标签或融合标签,检测框监督会发生变化,尤其在错位场景下可能显著影响结果。
  2. MSDA 的具体实现会强烈影响速度。 论文已指出 MSDA 中 attention 带来二次复杂度,若实现方式不同,FPS 可能差异很大。
  3. 没有源码会增加复现不确定性。 例如 SSF 中 shared SS2D 的状态矩阵共享方式、通道 split 比例、FFN 配置等,论文给出了算法流程,但工程细节仍需作者代码确认。

06 个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐