YOLO26-RGBIR-DGF:官方 YOLO26 的 RGB + IR 双主干动态融合改进以及 M3FD-200 百轮实跑实验
YOLO26-RGBIR-DGF:官方 YOLO26 的 RGB + IR 双主干动态融合改进以及 M3FD-200 百轮实跑实验
Ai学术叫叫兽独家
关键词:YOLO26、RGB-IR、多模态目标检测、M3FD、动态门控融合、P3/P4/P5、模态权重热图、低光检测、热源干扰、遮挡鲁棒性
1. 介绍总结
本文参考的多模态检测思想主要来自 CVPR 工作 Target-Aware Dual Adversarial Learning and a Multi-Scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection。该工作提出 M3FD 多场景红外-可见光检测基准,强调红外图像能够在夜间、低照度、烟雾与弱纹理条件下突出热目标,可见光图像能够保留颜色、纹理、边缘和语义上下文。二者互补,但固定相加或单纯图像级融合容易把无效模态的噪声传递给检测头。
摘要翻译提炼:原文的核心观点是,红外与可见光融合不应只追求视觉上“更清楚”的融合图像,而应服务于目标检测任务本身。M3FD 提供配准的红外/可见光图像对与检测标注,使研究者能够直接评估融合策略对检测精度、误检抑制和跨场景鲁棒性的贡献。
介绍部分提炼:低光下 RGB 纹理退化,热目标在 IR 中更稳定;强热源或热反射场景下 IR 可能产生误检,RGB 的纹理和边缘反而更可靠;遮挡场景中,不同模态常在不同区域保留有效线索。因此,多模态检测需要“按场景、按尺度、按空间位置”动态选择模态,而不是使用固定权重。
参考来源:
| 来源 | 链接 |
|---|---|
| M3FD / TarDAL 官方仓库 | https://github.com/JinyuanLiu-CV/TarDAL |
| 本文开源代码 | https://github.com/Aixsjjs/YOLO26-RGBIR-.git |
| Github开源主页 | https://github.com/Aixsjjs |
2. 为什么要融合与改进模块核心结构
2.1 为什么 RGB 与 IR 不能固定相加
| 场景 | RGB 优势 | IR 优势 | 固定融合风险 | 动态融合目标 |
|---|---|---|---|---|
| 白天正常光照 | 纹理、颜色、边缘清晰 | 热目标未必突出 | 引入不必要热噪声 | RGB 权重更高 |
| 夜间低光 | 细节弱、噪声大 | 热轮廓稳定 | RGB 过强导致漏检 | IR 权重上升 |
| 热源干扰 | 可通过纹理区分伪目标 | 热响应可能过强 | 热斑误检 | 抑制平滑大热区 |
| 局部遮挡 | 残余边缘可用 | 热轮廓可补充 | 全局权重无法局部互补 | 空间位置级选择 |
| 烟雾弱纹理 | RGB 退化明显 | IR 穿透性更强 | 单模态不稳定 | 多尺度门控融合 |
本改进采用 RGBIR Dynamic Gated Fusion (RGBIR-DGF)。模型输入为 [R,G,B,IR],通过显式双主干分别编码 RGB 与 IR,在 P3/P4/P5 三个检测尺度进行动态融合,YOLO Detect Head 保持原结构。
2.2 改进模块核心公式
对于第 l 个尺度层:
F_rgb^l, F_ir^l, l ∈ {P3, P4, P5}
先构造跨模态关系:
Q^l = Concat(F_rgb^l, F_ir^l, |F_rgb^l - F_ir^l|, F_rgb^l × F_ir^l)
再由局部门控、全局门控与可靠性先验生成权重:
W^l = Softmax((G_local(Q^l) + G_global(Q^l) + λR^l) / τ)
最终输出:
F_fuse^l = Conv(Concat(W_rgb^l · F_rgb^l + W_ir^l · F_ir^l,
Detail(W_rgb^l · F_rgb^l, W_ir^l · F_ir^l, |F_rgb^l - F_ir^l|)))
| 结构 | 作用 | 针对问题 |
|---|---|---|
RGBIRSplit |
将 4 通道输入拆成 RGB 与 IR 两路 | 避免早期混合导致模态来源不可分 |
| 双主干 Backbone | RGB/IR 独立编码 | 保留各模态专属特征 |
G_local |
空间位置级权重 | 遮挡、局部热源、小目标 |
G_global |
整帧场景权重 | 白天、夜晚、低光、强热背景 |
可靠性先验 R^l |
强化纹理,抑制平滑热斑 | 热源干扰与伪目标 |
last_weights |
缓存权重 | 导出每层/每帧热图 |
3. 融合方法总览、优势特点、原理与网络结构图
3.1 三类融合策略对比
| 方法 | 融合位置 | 原理 | 优势 | 局限 | 实验角色 |
|---|---|---|---|---|---|
| Early Fusion | 输入层或 Stem | RGB 与 IR 早期拼接或轻量门控 | 简单、速度快、参数少 | 难解释模态退化来源 | 基线消融 |
| P3/P4/P5 DGF | Backbone 输出多尺度层 | 双主干独立编码,多尺度动态融合 | 可解释强,检测头不变,论文表达清晰 | 参数高于单主干 | 本文落地方案 |
3.2 本文采用的网络结构

3.3 100 轮对比实验结果
数据采用 M3FD 原始 RGB/IR 图像,不生成 TIFF。当前实验子集为 200 张:训练集 160 张,验证集 40 张,类别为 People, Car, Bus, Motorcycle, Lamp, Truck。
Best epoch 指标对比


3.4 热力图与检测效果对比
RGBIR 模型可导出 P3/P4/P5 每层每帧的 RGB/IR 权重;RGB-only 模型没有模态选择权重,因此热图对比的关键结论是:RGBIR 不仅给出检测结果,还给出“本帧本层为什么偏向 RGB 或 IR”的解释证据。



4. 原网络和融合后特点对比与注意事项
| 维度 | 原 YOLO26 RGB-only | YOLO26-RGBIR-P345DGF |
|---|---|---|
| 输入 | 3 通道 RGB | 4 通道 [R,G,B,IR] |
| 主干 | 单主干 | RGB/IR 双主干 |
| 融合位置 | 无 | P3/P4/P5 |
| 融合方式 | 无 | 动态门控,不固定相加 |
| 检测头 | 原 YOLO Detect | 保持原 YOLO Detect |
| 可解释性 | 只能看检测结果或常规曲线 | 输出每层/每帧 RGB/IR 权重热图 |
| 低光场景 | RGB 退化明显 | IR 权重可上升 |
| 热源干扰 | 无显式抑制 | 可靠性先验抑制平滑热斑 |
| 遮挡场景 | 单模态线索有限 | 空间位置级模态互补 |
| 工程代价 | 参数少、速度快 | 参数与显存增加,需要 RGB/IR 成对数据 |
关键注意事项
| 项目 | 说明 |
|---|---|
| 数据对齐 | M3FD 原始 RGB/IR 图像需要文件名和空间尺寸对应;若尺寸不同,读取阶段会将 IR resize 到 RGB 尺寸 |
| 标签格式 | 与 COCO128 风格一致,使用 images/train、images/val、labels/train、labels/val 文件夹 |
| 通道顺序 | 模型输入约定为 [R,G,B,IR] |
| RGB-only 对照 | 使用同一批 RGB 图像和标签,训练参数完全一致 |
| 热图解释 | RGBIR 热图是模态选择权重;RGB-only 不存在 RGB/IR 权重 |
写在最后
学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,关注UP:Ai学术叫叫兽
在所有B站资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。
因为经历过所以更懂小白的痛苦!
因为经历过所以更具有指向性的指导!
祝所有科研工作者都能够在自己的领域上更上一层楼!
微信公众号:Ai计算机视觉
更多推荐




所有评论(0)