arxiv 2026 | WD-FQDet:基于小波分解与频域感知查询学习的多光谱检测Transformer
01 论文信息
- 论文题目: WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning
- 论文作者: Chunjin Yang, Xiwei Zhang, Yiming Xiao, Fanman Meng
- 发表单位: 电子科技大学
- 发表会议\期刊: arxiv 2026
- 代码链接: 无
02 论文主要贡献
1.提出 WD‑FQDet,一种基于小波分解与频率感知查询学习的新型多光谱检测 Transformer,实现红外‑可见光互补信息的高效融合。
2.引入基于小波的特征分解与集成模块,在低频与高频域解耦模态共享与模态特有特征,包括低频同源性对齐模块与高频特异性保留模块。
3.提出混合特征增强模块,将同源与模态特有特征同空间特征集成,提升表征能力;同时设计频率感知查询选择模块,动态调节同源与特有特征的贡献权重。
4.在 FLIR、LLVIP、M3FD 基准数据集上的大量实验表明,WD‑FQDet 达到最优性能,验证了其有效性与优越性。
03 方法
3.1 整体框架

图 2 展示 WD‑FQDet 的整体架构,由三个主要模块组成:基于小波的特征分解与集成模块、混合特征增强模块、频率感知查询选择模块。对于给定的红外‑可见光图像对,首先通过共享骨干网络提取多尺度空间特征。随后通过小波变换将这些特征分解为低频同源与高频异质分量。低频同源性对齐模块同步共享特征,高频特异性保留模块保留双模态的模态特有特征。接着,混合增强模块强化频域表征。最后,增强后的特征输入频率感知查询选择模块,自适应平衡模态共享与特有特征的贡献,更新查询并送入 RT‑DETR 检测头生成边界框与分类分数。
3.2 基于小波的特征分解与集成模块(WDIM)
基于小波的特征分解模块首先采用哈尔小波变换将红外与可见光图像的空间特征分解为四个分量:LL、LH、HL、HH。随后将三个高频分量拼接并逐点卷积降维,得到最终的高频与低频特征。
3.2.1 低频同源性对齐(LFHA)
先通过通道交换对双模态低频同源特征初步融合,再通过高效通道注意力机制强化显著特征,最后通过跨模态注意力机制捕获红外与可见光特征间的模态关联,实现同源信息的精准对齐:
fLi=Softmax(fi(fLRi)gi(fLIi)TD)hi(fLIi)f_{L}^{i}=\text{Softmax}\left(\frac{f_{i}\left(f_{L}^{R_{i}}\right) g_{i}\left(f_{L}^{I_{i}}\right)^{T}}{\sqrt{D}}\right) h_{i}\left(f_{L}^{I_{i}}\right)fLi=Softmax(Dfi(fLRi)gi(fLIi)T)hi(fLIi)
其中f、g、h表示线性层,D表示特征编码维度。
3.2.2 高频特异性保留(HFSR)
首先对各模态高频模态特有特征施加多尺度卷积,捕获不同粒度的细节信息;随后通过方向梯度直方图(HOG)提取结构化边缘特征,并通过残差连接与原始高频特征融合。随后将增强后的特征拼接,并通过深度可分离卷积压缩通道,得到最终融合特征。为确保融合后的高频特征充分保留红外与可见光的模态特有特性,本文引入多尺度梯度一致性损失:
Lgrad=1N∑k=13[∥fHi−Gk(fHRi)∥1+∥fHi−Gk(fHIi)∥1]\mathcal{L}_{grad}=\frac{1}{N}\sum_{k=1}^{3}\left[\left\|f_{H}^{i}-G_{k}\left(f_{H}^{R_{i}}\right)\right\|_{1}+\left\|f_{H}^{i}-G_{k}\left(f_{H}^{I_{i}}\right)\right\|_{1}\right]Lgrad=N1∑k=13[
fHi−Gk(fHRi)
1+
fHi−Gk(fHIi)
1]
其中GkG_{k}Gk为多尺度梯度特征提取函数,通过 Sobel 算子与离散空洞卷积实现。通过上述特征融合与损失约束,HFSR 模块有效集成红外与可见光的模态特有特征,同时增强边缘、轮廓等细节表征。
3.3 混合特征增强模块(HFE)
本文进一步设计包含两个分支:自顶向下 FPN 与自底向上 PAN。
对fL(H)5f_{L(H)}^{5}fL(H)5施加自注意力机制得到fL(H)5∗f_{L(H)}^{5 *}fL(H)5∗。
FPN 过程定义为:
P4=Fusion4(U(fL(H)5∗),fL(H)4,fI(R)4)P_{4}=Fusion4\left(U\left(f_{L(H)}^{5 *}\right), f_{L(H)}^{4}, f_{I(R)}^{4}\right)P4=Fusion4(U(fL(H)5∗),fL(H)4,fI(R)4)
P3=Fusion3(U(P4),fL(H)3,fI(R)3)P_{3}=Fusion3\left(U\left(P_{4}\right), f_{L(H)}^{3}, f_{I(R)}^{3}\right)P3=Fusion3(U(P4),fL(H)3,fI(R)3)
其中U(⋅)U(\cdot)U(⋅)表示用于上采样的 1×1 卷积,Fusion3 与 Fusion4 是包含 N 个 RepBlocks 并按元素相加的融合块。
PAN 过程公式化为:
N4=Fusion4(D(P3),(P4)1×1,fI(R)4)N_{4}=Fusion 4\left(D\left(P_{3}\right),\left(P_{4}\right)_{1 × 1}, f_{I(R)}^{4}\right)N4=Fusion4(D(P3),(P4)1×1,fI(R)4)
N5=Fusion5(D(N4),(fL(H)5∗)1×1,fI(R)5)N_5 = \text{Fusion5}\left(D(N_4), \left(f_{L(H)}^{5*}\right)_{1\times1}, f_{I(R)}^5\right)N5=Fusion5(D(N4),(fL(H)5∗)1×1,fI(R)5)
其中D(⋅)D(\cdot)D(⋅)是步幅为 2 的 3×3 卷积,(.)1×1(.)_{1 ×1}(.)1×1表示 1×1 卷积的输出。
该模块最终输出增强后的低频同源特征与高频异质特征.
3.4 频域感知查询选择模块(FQS)

如图 3 所示,该模块首先通过 MLP 映射增强后的低频同源特征FLF_{L}FL与高频模态特有特征FHF_{H}FH,得到权重系数,再用于缩放对应特征:
FH←FH×MLP(Flatten(FH))F_{H} \leftarrow F_{H} \times MLP(\text{Flatten}(F_{H}))FH←FH×MLP(Flatten(FH))
FL←FL×MLP(Flatten(FL))F_{L} \leftarrow F_{L} \times MLP(\text{Flatten}(F_{L}))FL←FL×MLP(Flatten(FL))
将加权、展平后的特征拼接,并选择得分最高的 K 个特征作为初始查询:
z=TopK(Linear(Cat(Flatten(FH),Flatten(FL))))z=\text{TopK}\left(\text{Linear}\left(\text{Cat}\left(\text{Flatten}\left(F_{H}\right), \text{Flatten}\left(F_{L}\right)\right)\right)\right)z=TopK(Linear(Cat(Flatten(FH),Flatten(FL))))
随后施加多头自注意力模块,设Aq=(xq,yq,wq,hq)A_{q}=(x_{q}, y_{q}, w_{q}, h_{q})Aq=(xq,yq,wq,hq)表示第q个锚框,其内容与位置查询分别表示为zqz_{q}zq与Pq∈RDP_{q} \in \mathbb{R}^{D}Pq∈RD(D为解码器嵌入维度)。位置查询生成方式为:Pq=MLP(Aq)P_{q}=MLP\left(A_{q}\right)Pq=MLP(Aq).自注意力计算表示为:
Qq=zq+Pq,Kq=zq+Pq,Vq=zq,zq^=Softmax(QqKq⊤D)Vq. \begin{aligned} Q_{q} &= z_{q} + P_{q}, \\ K_{q} &= z_{q} + P_{q}, \\ V_{q} &= z_{q}, \\ \hat{z_{q}} &= \text{Softmax}\left(\frac{Q_{q} K_{q}^{\top}}{\sqrt{D}}\right) V_{q}. \end{aligned} QqKqVqzq^=zq+Pq,=zq+Pq,=zq,=Softmax(DQqKq⊤)Vq.
高频模态特有特征记为 hiI{h_{i}^{I}}hiI,低频模态共享特征记为 liI{l_{i}^{I}}liI。并以 bqb_{q}bq的归一化中心bq^\hat{b_{q}}bq^ 作为二维参考点,用于一致的位置对比。本文定义频率感知交叉注意力(FACA)模块为:
FACA(z^q,P^q,{li}i=1I,{hi}i=1I)=∑m=1MWm[∑i=1I∑k=1KAmiqk⋅Wm′(li(ϕ(p^q)+Δpmiqk))+∑i=1I∑k=1KAmiqk⋅Wm′(hi(ϕ(p^q)+Δpmiqk))] FACA\left(\hat{z}_{q}, \hat{P}_{q},\left\{l^{i}\right\}_{i=1}^{I},\left\{h^{i}\right\}_{i=1}^{I}\right)=\sum_{m=1}^{M} W_{m} \left[\sum_{i=1}^{I} \sum_{k=1}^{K} A_{m i q k} \cdot W_{m}'\left(l^{i}\left(\phi\left(\hat{p}_{q}\right)+\Delta p_{m i q k}\right)\right)+ \sum_{i=1}^{I} \sum_{k=1}^{K} A_{m i q k} \cdot W_{m}'\left(h^{i}\left(\phi\left(\hat{p}_{q}\right)+\Delta p_{m i q k}\right)\right)\right] FACA(z^q,P^q,{li}i=1I,{hi}i=1I)=m=1∑MWm[i=1∑Ik=1∑KAmiqk⋅Wm′(li(ϕ(p^q)+Δpmiqk))+i=1∑Ik=1∑KAmiqk⋅Wm′(hi(ϕ(p^q)+Δpmiqk))]
其中m、i、k分别索引注意力头、特征层级与采样点;Δpmiqk\Delta p_{miqk }Δpmiqk与AmiqkA_{m i q k}Amiqk分别表示第m个头、第i层级、第k个采样点的采样偏移与归一化注意力权重。
3.5 训练损失
Ltotal=Lbox+Lcls+Lgrad\mathcal{L}_{total} = \mathcal{L}_{box} + \mathcal{L}_{cls} + \mathcal{L}_{grad}Ltotal=Lbox+Lcls+Lgrad
其中Lbox\mathcal{L}_{box}Lbox 与 Lcls\mathcal{L}_{cls}Lcls采用与 RT‑DETR 相同的损失函数。
04 实验分析
4.1 FLIR 数据集对比

本文在 FLIR 数据集上开展实验,并与现有最优方法对比。如表 1 所示,与最优单模态方法 RT‑DETR 相比,本文方法mAP50mAP_{50}mAP50提升 6.8%,mAP75mAP_{75}mAP75提升 10.9%,mAP提升 7%。与多模态方法相比,性能同样提升:相比 FD2Net,mAP50mAP_{50}mAP50提升 4.1%;相比 GM‑DETR,mAP75mAP_{75}mAP75提升 7.3%;相比 TFDet,mAP提升 3.6%。部分检测结果如图 4 所示,证明本文方法显著优于现有方法,尤其在复杂背景下的小目标与弱目标检测上。
4.2 LLVIP 数据集对比

在 LLVIP 行人检测数据集上的实验表明,本文方法显著优于现有模型。如表 2 所示,与最优单模态方法 DINO 相比,本文方法mAP提升 4%,mAP50mAP_{50}mAP50提升 1.6%;与最优多模态方法 LRAF‑Net 相比,mAP提升 0.6%,mAP50mAP_{50}mAP50提升 0.3%。此外,与采用相似 DETR 检测头与 ResNet50 骨干的 MS‑DETR 相比,本文方法mAP提升 0.8%。这些结果证明本文方法在单类别目标检测中的有效性与优越性。
4.3 M3FD 数据集对比

本文在自动驾驶数据集 M3FD 上开展实验,并与现有最优方法对比。如表 3 所示,与最优单模态模型 YOLO 相比,本文方法mAP50mAP_{50}mAP50提升 13.5%,mAP提升 10.3%;与最优多模态方法 TFDet 相比,mAP50mAP_{50}mAP50提升 8.9%,mAP提升 5.4%。此外,与同样采用 ResNet50 作为骨干的 PSFusion 相比,本文方法mAP50mAP_{50}mAP50提升 12.6%,mAP提升 6.4%。
4.4 消融实验

基于小波的特征集成模块:本文将高频特异性保留(HFSR)与低频同源性对齐(LFHA)模块替换为沿通道维度拼接特征后 1×1 卷积降维的设计。如表 5 所示,实验结果表明移除任一模块都会导致性能显著下降,验证了所提方法的有效性。此外,本文可视化融合后的低频同源特征与高频特有特征的热力图(图 5 ©(d))。可以观察到,低频同源特征更关注全局结构信息,高频特有特征强调边缘轮廓等细节。这验证了小波域解耦的有效性。
混合特征增强模块:本文通过移除空间域特征、迫使模型仅依赖频域特征的消融实验,验证混合特征增强(HFE)模块的有效性。如表 5 所示,在 FLIR 数据集上,该修改导致mAP下降 2.3%,凸显 HFE 的关键作用。
频率感知查询选择模块:为验证频率感知查询选择(FQS)模块的有效性,本文开展实验,将 HFE 增强后的高频特有与低频特有特征直接相加,采用固定融合策略。如表 5 所示,结果显示mAP下降 3%,证明 FQS 模块的有效性。
05 个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。
更多推荐

所有评论(0)