ACM MM|面向红外目标检测的实例对齐与不确定性补偿多模态拆解蒸馏算法

论文信息

论文名称:Multimodal Decomposed Distillation with Instance Alignmentand Uncertainty Compensation for Thermal Object Detection
论文作者:Yanfeng Liu,Lefei Zhang∗
论文发表单位:武汉大学计算机学院、国家多媒体软件工程技术研究中心
论文期刊\会议:ACM MM
代码链接:https://github.com/lyf0801/DecomKD

论文贡献

1.框架层面:提出多模态分解蒸馏框架 DecomKD,依托 RGB-T 融合教师模型蒸馏得到轻量化、鲁棒的单红外检测器,摆脱推理阶段 RGB 分支,适配夜间、恶劣天气等 RGB 失效场景,兼顾检测精度与部署效率;方法具备模态无关、检测器架构无关特性,可同时适配无锚框 (FCOS)、有锚框 (RetinaNet) 检测器,既能训练红外学生,也可用于可见光单模态学生蒸馏。
2.特征分解创新:设计通道自适应提示分解 CAPD,打破传统一对一蒸馏,将学生特征拆分为双分支:一支保留红外独有特征、一支学习多模态融合知识,从根源消除跨模态语义冲突。
3.精细化蒸馏优化:分别从特征层、预测输出层设计实例对齐蒸馏 + 不确定性补偿逻辑,细化实例级知识迁移,弥补模糊样本预测缺陷;搭配频域动态融合模块完成双分支特征自适应聚合。

论文主要创新点

  1. 通道自适应提示分解(CAPD)
    传统蒸馏直接全特征对齐造成模态冲突,本模块通过全局池化 + 可学习提示池动态计算通道权重,Top-K 对半拆分特征通道,生成红外专属分支、跨模态蒸馏分支,双分支分别由教师的纯红外特征、RGB-T 融合特征监督,实现模态信息解耦。
  2. 频域引导动态融合模块(FGDI)
    首次在特征融合引入傅里叶频域分解,拆分高低频权重,通过频带动态调制 + 注意力加权动态卷积自适应融合双分支特征;结合空域自适应调制,兼顾细节低频纹理与全局高频语义,推理阶段丢弃辅助分支头,仅保留融合分支,保证轻量化。
  3. 实例特征对齐蒸馏(IFAD,特征层创新)
    摒弃全局 MSE 整体特征蒸馏,筛选模型置信度最高的前 K 个前景实例,对每个目标采样中心点 + 8 个边界极值点共 9 个关键点,通过 RoI Align 提取师生实例特征做归一化损失,过滤无效背景干扰,聚焦关键前景知识迁移。
  4. 不确定性感知 Logit 蒸馏(UALD,预测层创新)
    针对无锚检测器独有中心度 (centerness) 分支设计加权蒸馏损失:
    无效锚点(centerness=-1)固定蒸馏权重 = 1;
    有效目标依据中心度值通过对数函数计算不确定权重,中心度越靠近 0.5 不确定性越高、蒸馏损失权重越大;
    联合分类 KL 损失、边框 + 中心度 L1 损失,补偿模糊样本预测偏差(仅适配无锚检测器)。

方法

整体框架

在这里插入图片描述
本文提出了一种解耦式跨模态知识蒸馏框架。该框架首先利用RGB-T多模态教师网络提取融合语义和Thermal模态特征,并通过CAPD模块将学生特征解耦为Thermal分支和RGB-T分支,使不同模态知识能够分别迁移。随后,FGDI模块对两个分支特征进行动态融合,以增强学生检测表示能力。在蒸馏过程中,IFAD利用教师预测结果定位关键目标实例,并对教师与学生对应区域特征进行对齐,同时UALD进一步约束学生预测分布,使学生网络充分学习教师模型的特征知识和预测知识。通过上述设计,模型实现了多模态教师知识向单模态学生网络的有效迁移。
训练总损失
学生训练同时包含真值监督、特征蒸馏损失、预测蒸馏损失:
Ltotal=LDet+LIFAD+LUALD \mathcal{L}_{total} = \mathcal{L}_{Det} + \mathcal{L}_{IFAD} + \mathcal{L}_{UALD} Ltotal=LDet+LIFAD+LUALD

  • LDet\mathcal{L}_{Det}LDet:真值检测损失,同时监督红外分支检测头、融合联合检测头;
  • LIFAD\mathcal{L}_{IFAD}LIFAD:双分支特征对齐蒸馏损失;
  • LUALD\mathcal{L}_{UALD}LUALD:不确定性感知对数蒸馏损失。

通道自适应提示分解(CAPD)

CAPD 通过动态通道筛选实现特征解耦,两条分支各司其职:一条保留红外专属特征,一条学习多模态教师知识。

1. 全局平均池化提取通道全局表征

Xavg=1HW∑h=1H∑w=1WX[:,:,h,w]∈RB×C X_{avg} = \frac{1}{HW} \sum_{h=1}^{H} \sum_{w=1}^{W} X[:,:,h,w] \in \mathbb{R}^{B \times C} Xavg=HW1h=1Hw=1WX[:,:,h,w]RB×C

2. 全连接层非线性映射 + 动态提示池生成通道选择权重

S=softmax(τ⋅ϕ(Xavg)⊤⋅P∥ϕ(Xavg)∥⋅∥P∥)∈RB×C S = softmax\left( \tau \cdot \frac{\phi(X_{avg})^\top \cdot P}{\|\phi(X_{avg})\| \cdot \|P\|} \right) \in \mathbb{R}^{B \times C} S=softmax(τϕ(Xavg)Pϕ(Xavg)P)RB×C
SSS:动态通道选择矩阵;ϕ(⋅)\phi(\cdot)ϕ():两层全连接;τ\tauτ:可学习温度系数控制权重分布平滑度;PPP:动态提示池,随网络联合优化。

3. Top-K 通道拆分

设置 k=C/2k = C/2k=C/2,将通道均分:

  • Ti\mathcal{T}_iTi:前 k 通道索引 →\rightarrow 红外专属分支F1F_1F1
  • Ri\mathcal{R}_iRi:剩余通道索引 →\rightarrow 跨模态蒸馏分支F2F_2F2
    Ti=top−k(S[i,:]), Ri={1,...,C}−Ti \mathcal{T}_i = top-k\left(S[i,:]\right),\ \mathcal{R}_i = \{1,...,C\} - \mathcal{T}_i Ti=topk(S[i,:]), Ri={1,...,C}Ti

4. 分支内部特征增强

逐点卷积 + 空间注意力建模分支内部关联,叠加残差连接加速收敛,得到两条分支最终表征Y1Y_1Y1(红外保留)、Y2Y_2Y2(跨模态补偿)。

5. 双分支 IFAD 蒸馏损失

LIFAD=LIFAD(Y1,FPN(Tthermal))+LIFAD(Y2,Trgb+t) \mathcal{L}_{IFAD} = L_{IFAD}\big(Y_1, FPN(T_{thermal})\big) + L_{IFAD}\big(Y_2, T_{rgb+t}\big) LIFAD=LIFAD(Y1,FPN(Tthermal))+LIFAD(Y2,Trgb+t)
TthermalT_{thermal}Tthermal:教师红外骨干特征;Trgb+tT_{rgb+t}Trgb+t:教师 RGB-T 融合特征;FPN(⋅)FPN(\cdot)FPN():教师侧特征对齐适配器。

频域引导动态融合(FGDI)

为充分利用双分支频谱差异,提出频域动态调制融合模块,分为三部分:频域权重解耦调制、动态卷积核聚合、空频自适应融合。
输入双分支特征Y1,Y2Y_1,Y_2Y1,Y2,并行两条处理通路:

1. 基础融合通路:逐元素相加后 3×33 \times 33×3 卷积

Fdirect=C3×3(Y1+Y2) F_{direct} = C_{3 \times 3}\left(Y_1 + Y_2\right) Fdirect=C3×3(Y1+Y2)

2. 压缩通路:通道拼接后 1×11 \times 11×1 卷积降维

Fcomp=C1×1([Y1,Y2]) F_{comp} = C_{1 \times 1}\left(\left[Y_1, Y_2\right]\right) Fcomp=C1×1([Y1,Y2])

3. 频域权重分解

将卷积权重拆分为 K组独立频带(低频轮廓、中频纹理、高频细节)频带的实部、虚部复数权重:
Wk=WkR+jWkI W_k = W_k^R + j W_k^I Wk=WkR+jWkI

4. 频带调制系数

对压缩特征全局池化,通过 Tanh 生成各频带动态缩放系数:
MkR, MkI=tanh(C1×1(GAP(Fcomp))) M_k^R,\, M_k^I = tanh\left(C_{1 \times 1}\big(GAP\left(F_{comp}\right)\big)\right) MkR,MkI=tanh(C1×1(GAP(Fcomp)))
GAP(Fcomp)GAP(F_{comp})GAP(Fcomp):全局平均池化,将压缩特征 FcompF_{comp}Fcomp 的整张特征图压缩为一维通道向量,表征图像全局上下文信息。
C1×1C_{1 \times 1}C1×11×11 \times 11×1 卷积层,用于通道维度非线性变换。
tanh⁡(⋅)\tanh(\cdot)tanh():双曲正切激活函数,将输出值域约束于 [−1,1][-1,1][1,1],实现频带权重缩放调制。
MkRM_k^RMkRMkIM_k^IMkI:第 kkk 个频带对应的调制系数,分别对应复数卷积权重的实部、虚部调节因子。
维度 RCout×1×1\mathbb{R}^{C_{out} \times 1 \times 1}RCout×1×1:输出为通道维、空间维 1×11 \times 11×1 的向量,每个输出通道独立对应一组缩放系数。

5. 逆傅里叶变换生成空间卷积核

Wk=F−1(MkR⊙WkR, MkI⊙WkI) \mathcal{W}_k = \mathcal{F}^{-1}\left(M_k^R \odot W_k^R,\, M_k^I \odot W_k^I\right) Wk=F1(MkRWkR,MkIWkI)
⊙\odot:逐元素相乘运算符,使用频带调制系数 MkM_kMk 缩放基础频带卷积核 WkW_kWk
- 实部运算:MkR×WkRM_k^R \times W_k^RMkR×WkR
- 虚部运算:MkI×WkIM_k^I \times W_k^IMkI×WkI
F−1(⋅)\mathcal{F}^{-1}(\cdot)F1():逆快速傅里叶变换(IFFT),实现频域到像素空间域的转换
Wk\mathcal{W}_kWk:动态频带卷积核,为每张输入图像实时生成,不属于网络固定可学习参数

6. 频带注意力加权聚合动态卷积核

通过注意力权重α\alphaα融合所有频带卷积核,得到动态卷积WWW
W=∑k=1Kαk⋅Wk \mathcal{W} = \sum_{k=1}^{K} \alpha_k \cdot \mathcal{W}_k W=k=1KαkWk
α=softmax(ϕ(GAP(Fcomp)))∈RB×K \alpha = softmax\big(\phi\big(GAP(F_{comp})\big)\big) \in \mathbb{R}^{B \times K} α=softmax(ϕ(GAP(Fcomp)))RB×K
ϕ(⋅)\phi(\cdot)ϕ():两层全连接构成的非线性映射网络,用于提取通道全局特征并映射至频带注意力维度。
softmaxsoftmaxsoftmax:归一化激活函数,将输出转换为总和为1的一组注意力权重 α1,α2,…,αK\alpha_1,\alpha_2,\dots,\alpha_Kα1,α2,,αK,保证权重分布合法。
αk\alpha_kαk:第 kkk 个频带卷积核 Wk\mathcal{W}_kWk 的融合注意力权重,表征当前输入图像下该频带特征的重要程度。
求和算子 ∑\sum:对全部 KKK 组动态频带卷积核做加权求和,融合得到单一适配图像的 3×33 \times 33×3 动态卷积核 W\mathcal{W}W
频域动态卷积加工公式
Fcomp′′=ReLU(W⋅Fcomp′+B) F_{comp}'' = ReLU\left(\mathcal{W} \cdot F_{comp}' + \mathcal{B}\right) Fcomp′′=ReLU(WFcomp+B)
W⋅Fcomp′\mathcal{W} \cdot F_{comp}'WFcomp:采用加权融合后的动态卷积核对压缩通路特征 Fcomp′F_{comp}'Fcomp 执行卷积运算;
B\mathcal{B}B:卷积层可学习偏置参数;
ReLUReLUReLU:线性整流激活函数,截断负值特征,过滤无效负响应;
Fcomp′′F_{comp}''Fcomp′′:经过频域动态卷积精细化调制后输出的特征图。

7. 空频自适应融合输出

SMM=σ(C3×3(Fcomp)) SMM = \sigma\big(C_{3 \times 3}\left(F_{comp}\right)\big) SMM=σ(C3×3(Fcomp))
C3×3C_{3 \times 3}C3×33×33 \times 33×3 卷积层,逐像素提取空间维度重要性权重;
σ\sigmaσ:Sigmoid 激活函数,将输出约束至 (0,1)(0,1)(0,1),生成空间权重掩码;
维度匹配:SMM∈RB×Cout×H×WSMM \in \mathbb{R}^{B \times C_{out} \times H \times W}SMMRB×Cout×H×W,与频域加工特征 Fcomp′′F_{comp}''Fcomp′′ 维度完全一致,支持逐像素相乘调制。

生成空间调制矩阵 SMM,融合压缩通路特征与基础融合通路特征,得到最终融合特征FoutF_{out}Fout送入联合检测头:
Fout=Fcomp′′⊙SMM+Fdirect F_{out} = F_{comp}'' \odot SMM + F_{direct} Fout=Fcomp′′SMM+Fdirect
Fcomp′′F_{comp}''Fcomp′′:经频域动态卷积精细化处理的特征,承载图像轮廓、细节频域信息;
⊙\odot:逐元素相乘运算,通过空间掩码 SMMSMMSMM 筛选前景目标精细频域特征,抑制背景无效信息。
FdirectF_{direct}Fdirect:双分支特征逐元素相加后经 3×33\times33×3 卷积得到的基础粗融合特征;
总结构说明
输入压缩:红外分支特征 Y1Y_1Y1、跨模态分支特征 Y2Y_2Y2 通道拼接为 [Y1,Y2][Y_1,Y_2][Y1,Y2],经 1×11\times11×1 卷积降维得到 FcompF_{comp}Fcomp
双支路并行处理
支线A(频域支路):全局平均池化GAP → 频带注意力权重生成 → IFFT动态卷积 → 输出精细化频域特征 Fcomp′′F_{comp}''Fcomp′′(控制轮廓、细节强弱);
支线B(空间调制支路):3×33\times33×3 卷积 + Sigmoid激活,生成空间调制掩码 SMMSMMSMM(控制图像各空间位置重要程度);
3. 特征融合输出:两支路特征逐像素相乘做空间筛选,再叠加基础粗融合特征 FdirectF_{direct}Fdirect,得到最终融合表征 FoutF_{out}Fout

实例特征对齐蒸馏(IFAD)

传统全局特征蒸馏(MSE/L1 损失)强制整张特征图匹配,背景噪声会严重干扰蒸馏效果。IFAD 仅筛选高置信度前景实例做细粒度对齐,过滤无效背景。

  1. 筛选学生联合检测头预测置信度 Top-K 目标实例;
  2. 对每个实例采样 9 个关键点:目标中心 + 8 个边界极值点;
  3. RoIAlign 提取师生对应关键点特征,归一化后计算 MSE 对齐损失:
    LIFAD=1N∑i=1N∑p∈P∥A(Fti(p))∥A(Fti(p))∥2A(Fsi(p))∥A(Fsi(p))∥2∥2 \mathcal{L}_{IFAD} = \frac{1}{N}\sum_{i=1}^{N}\sum_{p\in \mathcal{P}} \left\| \frac{\mathcal{A}\left(F_t^i(p)\right)}{\left\|\mathcal{A}\left(F_t^i(p)\right)\right\|_2} \frac{\mathcal{A}\left(F_s^i(p)\right)}{\left\|\mathcal{A}\left(F_s^i(p)\right)\right\|_2} \right\|^2 LIFAD=N1i=1NpP A(Fti(p)) 2A(Fti(p))A(Fsi(p))2A(Fsi(p)) 2
    NNN:筛选实例数量;A\mathcal{A}A:RoIAlign;Ft/FsF_t/F_sFt/Fs:教师 / 学生多尺度特征;P\mathcal{P}P:9 个采样关键点集合。

3.5 感知不确定性对数蒸馏(UALD)

无锚框检测器(FCOS)额外输出中心度(centerness),衡量像素点距离目标中心远近,取值 [−1,1][-1,1][1,1]−1-11 代表无效背景点,[0,1][0,1][0,1] 为有效目标区域。传统蒸馏忽略中心度预测对齐,本文设计针对无锚框检测器的不确定性加权蒸馏损失。

1. 不确定性权重设计

  • 无效点 c=−1c = -1c=1:权重 γ=1\gamma = 1γ=1,整张图里大片空白背景,全部强制让学生模型模仿教师输出;
  • 有效点 0≤c≤10 \le c \le 10c1:中心度越接近 0.5 预测不确定性越高,权重:
    γ=ln⁡(2−∣2c−1∣)+0.5 \gamma = \ln\big(2 - |2c - 1|\big) + 0.5 γ=ln(2∣2c1∣)+0.5
    该权重公式通过|2c−1|计算中心度c与模糊临界值 0.5 的距离,ln(2−|2c−1|)让物体越模糊(c 越接近 0.5)取值越大、物体中心 / 最外沿取值归零;+0.5 避免清晰区域权重归零导致模型失学,最终模糊边缘权重最高、约束最强,清晰物体中心权重最低、训练约束更宽松。

2. 总预测蒸馏损失

LUALD=∑i=1Nγi⋅(KL(pti∥psi)∥bti−bsi∥1∥cti−csi∥1) \mathcal{L}_{UALD} = \sum_{i=1}^{N} \gamma^i \cdot \Big( KL\big(p_t^i \parallel p_s^i\big) \big\|b_t^i - b_s^i\big\|_1 \big\|c_t^i - c_s^i\big\|_1\Big) LUALD=i=1Nγi(KL(ptipsi) btibsi 1 cticsi 1)
pti, psi∈RKp_t^i,\, p_s^i \in \mathbb{R}^Kpti,psiRK:分类预测概率分布,KKK 为目标类别总数(行人、车辆、自行车等)
bti, bsi∈R4b_t^i,\, b_s^i \in \mathbb{R}^4bti,bsiR4:边界框回归预测,四维数值分别代表像素到目标框上、下、左、右四条边的偏移距离
cti, csi∈R1c_t^i,\, c_s^i \in \mathbb{R}^1cti,csiR1:无锚框检测器专属的中心度预测分支输出
包含三项监督:分类分布 KL 散度、边界框回归 L1 损失、中心度对齐 L1 损失。

实验

现有 SOTA 蒸馏方法对比

在这里插入图片描述

消融实验

在这里插入图片描述

表 4 在 FLIR 数据集 FCOS 上开展递进式消融,先给出 RGB-T 教师、纯红外学生两条基准;逐步叠加 CAPD、FGDI、IFAD、UALD 四大模块,AP 与(AP_{50})持续稳步上涨,证明每个组件均能独立带来正向性能增益,模块间协同生效,缺一不可,整套蒸馏方案有效拉近单红外学生与双流融合教师的精度差距。

个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐