CVPR 2026 | DyFCLT:面向多模态微小目标检测的动态频率解耦跨模态学习 Transformer

整理日期: 2026 年 7 月 20 日
整理方式: 中文翻译、方法拆解与实验分析
核心主题: RGBT 微小目标检测、频域建模、跨模态交互、背景噪声抑制

01|论文信息


论文题目: DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection
中文题目: DyFCLT:面向多模态微小目标检测的动态频率解耦跨模态学习 Transformer
论文作者: Chaolang Li, Pengwen Dai(通讯作者), Jingyu Li, Siyuan Yao, Yuchen Jiang, Zhuoran Zheng
发表单位: 中山大学深圳校区网络空间安全学院、深圳市对抗人工智能重点实验室、齐鲁工业大学
发表会议: IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR 2026)
研究任务: 可见光—红外(RGBT)微小目标检测
代码链接: 论文正文未提供公开代码链接
原文页码: 11313–11323

1.1 论文研究背景

微小目标通常只有少量像素,容易受到低照度、遮挡、复杂背景和模态噪声影响。可见光图像能够提供纹理与颜色信息,但在夜间或极端光照条件下可靠性下降;红外图像能够突出热目标,却往往缺少细节。如何充分利用两种模态的互补信息,是 RGBT 微小目标检测的关键问题。

现有频域方法通常认为红外图像以低频信息为主、RGB 图像以高频信息为主,并据此设计较粗粒度的跨模态融合。本文通过 RGBT-Tiny 数据集的频率统计发现:随着目标尺寸减小,RGB 与红外两种模态中的中频和高频能量占比都会增加;即使在红外模态中,微小目标也包含跨多个频带的有效信息。

在这里插入图片描述

图 1。 (a) 不同尺度目标的归一化频率能量分布;(b) 遮挡与背景噪声共同干扰目标的示例。

1.2 论文要解决的核心问题

论文聚焦两个相互关联的问题:

  1. 如何对 RGB 与红外特征进行细粒度频带划分,并在对应频带内学习稳定的跨模态互补关系;
  2. 如何避免频率增强同时放大复杂背景噪声,并在多尺度融合中恢复微小目标的前景细节。

02|论文主要贡献


  1. 提出新的频率观察。 论文系统分析了 RGBT 场景中不同尺度目标的频率能量分布,指出微小目标在 RGB 和红外模态中都包含丰富的中高频信息,突破了“红外低频、RGB 高频”的简单二分假设。

  2. 提出 DyFCLT 框架。 该框架通过动态频带解耦跨模态注意力(DFCA)和选择性平滑增强(SSE),完成跨模态特征的“频率丰富—噪声精炼—多尺度融合”。

  3. 取得较强实验结果。 DyFCLT 在 RGBT-Tiny、RGBTDronePerson 和 FLIR 三个数据集上均达到最先进或最具竞争力的性能,说明该方法不仅适用于微小目标,也能泛化到包含常规尺度目标的场景。


03|论文创新点


(1)动态径向频带划分

论文不再使用固定的低频/高频二分方式,而是以可学习的径向边界将二维 Fourier 频谱划分为低频、中频和高频子带。频带边界在初始化时保持合理顺序,并可在训练中根据数据分布自适应调整。

(2)逐频带跨模态注意力

DFCA 同时对 Query、Key 和 Value 进行频带分解,在相同频带内部计算跨模态相关性,再聚合不同频带的交互结果。这样能够减少频率泄漏,并学习更干净、更稳定的带内跨模态对应关系。

(3)选择性背景平滑与前景引导上采样

SSE 使用二值前景掩码分离前景与背景,只对背景执行通道压缩和平滑,避免直接削弱目标信息;随后利用噪声抑制后的特征预测空间自适应动态核,引导高层特征上采样,从而恢复微小目标细节。

3.1 两个模块之间的逻辑关系

模块 主要作用 解决的问题
DFCA 挖掘不同频带内的跨模态互补信息 微小目标表征弱、粗粒度频域融合不足
IBS 平滑无关背景并保留前景 频率增强可能同步放大背景噪声
FREF 使用前景相关动态核引导上采样 高层语义特征中微小目标细节丢失

整体逻辑为:DFCA 负责“增加有效信息”,SSE 负责“去除无关噪声并恢复细节”。


04|方法


4.1 DyFCLT 整体架构

在这里插入图片描述

图 2。 DyFCLT 总体结构、动态频带解耦跨模态注意力、频带分解与逐频带注意力。

DyFCLT 由以下三部分组成:

  1. 双模态主干网络: 分别从可见光图像 IvisI_{vis}Ivis 和红外图像 IirI_{ir}Iir 中提取三层多尺度特征;
  2. 双分支 DyFCLT: 在 RGB 分支和红外分支中交替执行 DFCA、SSE 与多尺度 Fusion;
  3. Transformer 解码器与检测头: 将两个分支的多尺度输出拼接、展平,再利用带可变形注意力的解码器输出检测结果。

可见光与红外主干分别产生:

{Fvisl}l=1L=ϕvis(Ivis),{Firl}l=1L=ϕir(Iir), \{F_{vis}^{l}\}_{l=1}^{L}=\phi_{vis}(I_{vis}),\qquad \{F_{ir}^{l}\}_{l=1}^{L}=\phi_{ir}(I_{ir}), {Fvisl}l=1L=ϕvis(Ivis),{Firl}l=1L=ϕir(Iir),

其中 L=3L=3L=3。两个模态分支的结构对称,论文以红外分支为例说明具体操作。

4.1.1 整体数据流
RGB / IR 输入
    ↓
双流 ResNet-50 提取多尺度特征
    ↓
DFCA:动态频带划分与逐频带跨模态交互
    ↓
SSE:前景/背景分离、背景平滑、前景引导上采样
    ↓
双分支特征融合
    ↓
可变形 Transformer 解码器与检测头
    ↓
目标类别与边界框

4.2 动态频带解耦跨模态注意力(DFCA)

DFCA 的目标是在不同频率子带内部进行细粒度跨模态交互。其处理过程分为特征投影、动态频带分解、逐频带注意力和频带聚合四个阶段。

4.2.1 Query、Key、Value 特征生成

给定第 lll 层可见光特征 FvislF_{vis}^{l}Fvisl 和红外特征 Firl∈RC×H×WF_{ir}^{l}\in\mathbb{R}^{C\times H\times W}FirlRC×H×W

  • Query 特征 FqlF_q^lFql 由可见光特征 FvislF_{vis}^{l}Fvisl 生成;
  • Key 特征 FklF_k^lFkl 和 Value 特征 FvlF_v^lFvl 由红外特征 FirlF_{ir}^{l}Firl 生成;
  • 每个特征均依次经过 1×11\times11×1 逐点卷积和 3×33\times33×3 深度卷积。

该设计使红外分支能够使用可见光特征查询红外信息;RGB 分支则执行对称操作。

4.2.2 动态频带分解(FBD)

首先对 QQQKKKVVV 特征执行二维 FFT,再使用径向二值掩码分离各频率子带:

Fm,bl=Mb⊙F(Fml),m∈{q,k,v}. F_{m,b}^{l}=M_b\odot\mathcal{F}(F_m^l), \qquad m\in\{q,k,v\}. Fm,bl=MbF(Fml),m{q,k,v}.

bbb 个频带的掩码定义为:

Mb(u,v)={1,kb≤u2+v2<kb+1,0,其他情况. M_b(u,v)= \begin{cases} 1, & k_b\leq\sqrt{u^2+v^2}<k_{b+1},\\ 0, & \text{其他情况}. \end{cases} Mb(u,v)={1,0,kbu2+v2 <kb+1,其他情况.

其中,u2+v2\sqrt{u^2+v^2}u2+v2 表示二维频率分量到频谱中心的径向距离,[kb,kb+1)[k_b,k_{b+1})[kb,kb+1) 为第 bbb 个频带范围。依据 Nyquist 定理,归一化频率范围为 [0,12][0,\frac{1}{2}][0,21]

论文设置三个频带:

频带 主要包含的信息 对微小目标的作用
低频 整体结构、区域语义、平滑背景 提供目标与场景的全局信息
中频 局部形状、边缘过渡、结构变化 描述微小目标的主体轮廓
高频 边缘、纹理、细粒度变化 强化微小目标的可辨识细节

内部频带边界采用累积正增量参数化,以保证 k0<k1<⋯<kBk_0<k_1<\cdots<k_Bk0<k1<<kB。当 B=3B=3B=3 时,边界初始化为 {0,18,14,12}\{0,\frac{1}{8},\frac{1}{4},\frac{1}{2}\}{0,81,41,21},随后在训练中自适应更新。

4.2.3 逐频带频率注意力

在第 bbb 个频带内,先通过 Query 与 Key 的频域相关性计算跨模态权重:

Abl=F−1 ⁣(Fq,bl⊙Fk,bl‾). A_b^l=\mathcal{F}^{-1}\!\left( F_{q,b}^l\odot\overline{F_{k,b}^l} \right). Abl=F1(Fq,blFk,bl).

其中,(⋅)‾\overline{(\cdot)}() 表示复共轭,F−1\mathcal{F}^{-1}F1 表示逆 FFT。随后使用局部卷积与 Sigmoid 调制空间响应,并作用于对应频带的 Value 特征:

Rbl=σ ⁣(Conv⁡3×3(Abl))⊙F−1(Fv,bl). R_b^l= \sigma\!\left(\operatorname{Conv}_{3\times3}(A_b^l)\right) \odot\mathcal{F}^{-1}(F_{v,b}^l). Rbl=σ(Conv3×3(Abl))F1(Fv,bl).

这一过程相当于:先判断两个模态在当前频带、当前位置上的相关程度,再据此选择性增强红外 Value 特征。

4.2.4 频带聚合

最后,将不同频带的输出相加,并执行层归一化与线性投影:

F~irl=Proj⁡ ⁣[LN⁡ ⁣(∑bRbl)]. \widetilde{F}_{ir}^{l}= \operatorname{Proj}\!\left[ \operatorname{LN}\!\left(\sum_b R_b^l\right) \right]. F irl=Proj[LN(bRbl)].

得到的 F~irl\widetilde{F}_{ir}^{l}F irl 同时包含低频语义、中频结构和高频细节,并融合了可见光与红外之间的互补关系。

4.3 选择性平滑增强(SSE)

在这里插入图片描述

图 3。 SSE 由无关背景平滑(IBS)和前景相关增强融合(FREF)组成。

4.3.1 无关背景平滑(IBS)

DFCA 能够提取丰富的频率信息,但也可能放大树木、道路纹理、建筑边缘等背景高频噪声。IBS 首先预测二值前景掩码 MMM,再将特征分为前景和背景:

Ffgl=M⊙F~irl,Fbgl=(1−M)⊙F~irl. F_{fg}^{l}=M\odot\widetilde{F}_{ir}^{l},\qquad F_{bg}^{l}=(1-M)\odot\widetilde{F}_{ir}^{l}. Ffgl=MF irl,Fbgl=(1M)F irl.

背景特征依次经过通道压缩与通道恢复:

F^bgl=Conv⁡3×3C ⁣(Conv⁡3×3C/r(Fbgl)). \widehat{F}_{bg}^{l}= \operatorname{Conv}_{3\times3}^{C}\!\left( \operatorname{Conv}_{3\times3}^{C/r}(F_{bg}^{l}) \right). F bgl=Conv3×3C(Conv3×3C/r(Fbgl)).

通道压缩能够削弱背景中的高频干扰,同时保留前景区域不被直接平滑。最后,将原始前景与平滑背景重新组合:

Fbgsl=Ffgl+F^bgl. F_{bgs}^{l}=F_{fg}^{l}+\widehat{F}_{bg}^{l}. Fbgsl=Ffgl+F bgl.

二值掩码使用 focal Tversky loss 监督,以应对前景像素远少于背景像素的问题。

4.3.2 前景相关增强融合(FREF)

FREF 使用噪声抑制后的低层特征 FbgslF_{bgs}^{l}Fbgsl,引导更高层特征 F~irl+1\widetilde{F}_{ir}^{l+1}F irl+1 上采样。其主要步骤如下:

  1. FbgslF_{bgs}^{l}Fbgsl 预测每个空间位置对应的 K×KK\times KK×K 动态滤波核;
  2. 对动态核执行 pixel-unshuffle,使其分辨率与高层特征对齐;
  3. 将动态核分为四组,对高层特征的局部邻域进行空间自适应调制;
  4. 使用 pixel-shuffle 恢复空间分辨率;
  5. 将引导上采样结果与双线性上采样结果相加;
  6. FbgslF_{bgs}^{l}Fbgsl 拼接后,通过 CSPBlock 完成最终融合。

最终输出为:

Y^l+1=Yguidedl+1+Upsample⁡(F~irl+1), \widehat{Y}^{l+1} =Y_{guided}^{l+1} +\operatorname{Upsample}(\widetilde{F}_{ir}^{l+1}), Y l+1=Yguidedl+1+Upsample(F irl+1),

Foutl=Fusion⁡(Y^l+1,Fbgsl). F_{out}^{l}=\operatorname{Fusion} \left(\widehat{Y}^{l+1},F_{bgs}^{l}\right). Foutl=Fusion(Y l+1,Fbgsl).

与普通双线性插值相比,FREF 的上采样核随空间位置变化,可以优先恢复与微小目标有关的细节,而不是均匀放大所有区域。

4.4 方法逻辑总结

阶段 输入 关键操作 输出
模态特征提取 RGB、IR 图像 双流 ResNet-50 三层多尺度特征
频率解耦 Q/K/VQ/K/VQ/K/V 特征 FFT、动态径向掩码 低/中/高频子带
跨模态交互 对应频带特征 带内相关性与空间调制 互补频率表征
背景平滑 DFCA 输出 前景掩码、通道压缩 噪声抑制特征
引导上采样 低层精细特征、高层语义特征 动态核、pixel shuffle 前景增强的多尺度特征
检测输出 双分支融合特征 可变形 Transformer 类别与边界框

05|实验分析


5.1 数据集与训练设置

项目 RGBT-Tiny RGBTDronePerson FLIR
数据规模 9.3 万帧、120 万个目标 6,125 对图像、70,880 个实例 4,129 对训练图像、1,013 对测试图像
目标特点 超过 81% 小于 16×1616\times1616×16 像素 98% 的目标小于 20 像素 同时包含微小目标与常规尺度目标
训练轮数 20 20 50
学习率 0.00025 0.00025 0.00025
主干网络 ResNet-50 ResNet-50 ResNet-50

其他设置如下:

  • DFCA 频带数 B=3B=3B=3
  • 数据增强仅使用随机缩放、裁剪和翻转;
  • 检测器基线由双模态 RT-DETR 构成;
  • 解码器层数与 Query 数量等设置沿用 RT-DETR;
  • 实验在 NVIDIA A100 GPU 上完成。

5.2 与 SOTA 方法对比

5.2.1 RGBT-Tiny
对比项 AP AP50 APts AR
DQ-DETR(最佳单模态小目标检测器) 43.6 60.2 33.0 60.8
M²D-LIF(最强多模态基线) 38.7 54.9 29.0 51.7
DyFCLT 48.2 69.1 41.3 63.2

主要结论:

  • 相比 DQ-DETR,DyFCLT 的 AP 提升 4.6 个百分点,AR 提升 2.4 个百分点;
  • 相比 M²D-LIF,AP、AP50 和 AR 分别提升 9.5、14.2 和 11.5 个百分点;
  • APts=41.3%AP_{ts}=41.3\%APts=41.3%,说明该方法对最困难的微型目标具有明显优势;
  • 大目标 APls=100.0%AP_{ls}=100.0\%APls=100.0%,说明频率建模没有牺牲大尺度目标性能。
5.2.2 RGBTDronePerson
方法 AP50 AP50-tiny AP50-small
COXNet 45.5 47.1 29.7
DyFCLT 61.0 62.4 35.1

DyFCLT 相比 COXNet 的三个指标分别提升 15.5、15.3 和 5.4 个百分点。微型行人上的提升最大,进一步支持了论文关于“微小目标包含丰富跨频带信息”的核心判断。

5.2.3 FLIR
方法 AP50 AP
DINO(IR) 80.6 44.8
FD²Net 82.9
DyFCLT 84.1 45.0

FLIR 并非专门面向微小目标,但 DyFCLT 仍取得最佳性能,表明该框架对常规尺度目标和一般道路场景同样具有泛化能力。

5.3 消融实验

5.3.1 DFCA 与 SSE 的作用
DFCA IBS FREF AP AP50 APts
45.4 65.9 36.6
46.8 67.5 37.8
46.9 67.4 39.7
47.4 68.2 40.1
48.2 69.1 41.3

分析如下:

  • 单独加入 DFCA,AP 提升 1.4,说明逐频带跨模态交互本身有效;
  • 单独加入完整 SSE,AP 提升 1.5,APtsAP_{ts}APts 提升 3.1,说明背景平滑和引导上采样尤其有利于微小目标;
  • 同时使用 DFCA 与 SSE 时性能最佳,说明“丰富频率信息”和“抑制频率噪声”必须协同设计;
  • 在完整模型中移除 FREF,APtsAP_{ts}APts 从 41.3 降至 40.1,证明动态引导上采样能够恢复目标细节。
5.3.2 Q/K/VQ/K/VQ/K/V 解耦范围
解耦组件 AP AP50 APts
46.1 66.5 37.5
仅 Query 45.2 66.0 37.3
Query 与 Key 47.1 67.8 39.3
Key 与 Value 46.8 67.8 38.1
Query、Key 与 Value 48.2 69.1 41.3

仅分解 Query 会导致性能下降,因为 QQQ 与未分解的 K/VK/VK/V 不再位于一致的频带空间,容易产生频率泄漏。对 Q/K/VQ/K/VQ/K/V 全部分解后,模型能够在干净且一致的频带内建立相关性,因此性能最佳。

5.3.3 频带数量与边界类型
频带数量 边界类型 AP AP50 APts
1 不划分 46.1 66.5 37.5
2 可学习 46.4 66.7 37.8
3 可学习 48.2 69.1 41.3
3 静态 46.5 67.3 37.4
4 可学习 47.0 67.4 39.0

实验说明:

  • 三个可学习频带优于不划分、两频带和四频带;
  • 频带过少无法充分区分不同频率信息,频带过多则可能导致每个子带信息不足、学习难度上升;
  • 相同的三频带设置下,可学习边界比固定边界高 1.7 AP,验证了动态划分的必要性。

5.4 定性结果与特征可视化

在这里插入图片描述

图 4。 在低照度、树木遮挡和目标极小的场景中,DyFCLT 的漏检数量少于 CLANet、QFDet 和 RSDet,并能区分视觉相似的行人与骑行者。

在这里插入图片描述

图 5。 与基线相比,DyFCLT 的背景响应更弱,密集微小目标区域的激活更集中、更清晰。

5.5 实验结论与需要关注的问题

实验能够支持的结论:

  1. 跨模态频率学习对 RGBT 微小目标检测有效;
  2. 频带划分应当保持 Q/K/VQ/K/VQ/K/V 一致,并允许边界自适应学习;
  3. 仅增强频率信息不够,还必须显式抑制背景噪声;
  4. DFCA 与 SSE 对微型目标的增益大于对一般尺度目标的增益,符合模型设计目标。

阅读时需要注意:

  1. DyFCLT 参数量为 85.5M,高于 RT-DETR(42.0M)和 M²D-LIF(36.6M),性能提升伴随一定模型规模增加;
  2. 论文未报告 FLOPs、FPS、推理延迟和显存占用,因此尚不能仅根据现有结果判断其部署效率;
  3. 动态频带边界的具体训练轨迹与最终数值未可视化,频带是否在不同数据集上学习到一致模式仍值得进一步研究;
  4. 前景掩码需要额外监督,实际复现时应重点确认掩码标签生成方式、损失权重和通道压缩比 rrr

06|个人声明


本文为对论文 DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection 的中文学习笔记与结构化整理,不是原作者发布的官方中文版本。

本文内容依据论文原文进行翻译、归纳与分析,其中方法结构、实验数据和原始图表版权归论文作者及相关出版机构所有。整理过程中可能存在理解或表述偏差,如需进行学术研究、论文引用或模型复现,请以英文原文及作者公开资料为准。

如本文内容涉及侵权或存在事实性错误,请联系后及时更正或删除。


附录|术语速查

缩写 英文全称 中文含义
RGBT RGB-Thermal 可见光—热红外双模态
TOD Tiny Object Detection 微小目标检测
DyFCLT Dynamic Frequency-Decoupled Cross-Modal Learning Transformer 动态频率解耦跨模态学习 Transformer
DFCA Dynamic Frequency-Band Decoupled Cross-Modal Attention 动态频带解耦跨模态注意力
FBD Frequency Band Decomposition 频带分解
SSE Selective Smoothing Enhancement 选择性平滑增强
IBS Irrelevant Background Smoothing 无关背景平滑
FREF Foreground-Relevant Enhancement Fusion 前景相关增强融合
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐