YOLO26-RGBIR-DGF:官方 YOLO26 的 RGB + IR 双主干动态融合改进以及 M3FD-200 百轮实跑实验

Ai学术叫叫兽独家
关键词:YOLO26、RGB-IR、多模态目标检测、M3FD、动态门控融合、P3/P4/P5、模态权重热图、低光检测、热源干扰、遮挡鲁棒性


1. 介绍总结

本文参考的多模态检测思想主要来自 CVPR 工作 Target-Aware Dual Adversarial Learning and a Multi-Scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection。该工作提出 M3FD 多场景红外-可见光检测基准,强调红外图像能够在夜间、低照度、烟雾与弱纹理条件下突出热目标,可见光图像能够保留颜色、纹理、边缘和语义上下文。二者互补,但固定相加或单纯图像级融合容易把无效模态的噪声传递给检测头。

摘要翻译提炼:原文的核心观点是,红外与可见光融合不应只追求视觉上“更清楚”的融合图像,而应服务于目标检测任务本身。M3FD 提供配准的红外/可见光图像对与检测标注,使研究者能够直接评估融合策略对检测精度、误检抑制和跨场景鲁棒性的贡献。

介绍部分提炼:低光下 RGB 纹理退化,热目标在 IR 中更稳定;强热源或热反射场景下 IR 可能产生误检,RGB 的纹理和边缘反而更可靠;遮挡场景中,不同模态常在不同区域保留有效线索。因此,多模态检测需要“按场景、按尺度、按空间位置”动态选择模态,而不是使用固定权重。

参考来源:

来源 链接
M3FD / TarDAL 官方仓库 https://github.com/JinyuanLiu-CV/TarDAL
本文开源代码 https://github.com/Aixsjjs/YOLO26-RGBIR-.git
Github开源主页 https://github.com/Aixsjjs

2. 为什么要融合与改进模块核心结构

2.1 为什么 RGB 与 IR 不能固定相加

场景 RGB 优势 IR 优势 固定融合风险 动态融合目标
白天正常光照 纹理、颜色、边缘清晰 热目标未必突出 引入不必要热噪声 RGB 权重更高
夜间低光 细节弱、噪声大 热轮廓稳定 RGB 过强导致漏检 IR 权重上升
热源干扰 可通过纹理区分伪目标 热响应可能过强 热斑误检 抑制平滑大热区
局部遮挡 残余边缘可用 热轮廓可补充 全局权重无法局部互补 空间位置级选择
烟雾弱纹理 RGB 退化明显 IR 穿透性更强 单模态不稳定 多尺度门控融合

本改进采用 RGBIR Dynamic Gated Fusion (RGBIR-DGF)。模型输入为 [R,G,B,IR],通过显式双主干分别编码 RGB 与 IR,在 P3/P4/P5 三个检测尺度进行动态融合,YOLO Detect Head 保持原结构。

2.2 改进模块核心公式

对于第 l 个尺度层:

F_rgb^l, F_ir^l,  l ∈ {P3, P4, P5}

先构造跨模态关系:

Q^l = Concat(F_rgb^l, F_ir^l, |F_rgb^l - F_ir^l|, F_rgb^l × F_ir^l)

再由局部门控、全局门控与可靠性先验生成权重:

W^l = Softmax((G_local(Q^l) + G_global(Q^l) + λR^l) / τ)

最终输出:

F_fuse^l = Conv(Concat(W_rgb^l · F_rgb^l + W_ir^l · F_ir^l,
                       Detail(W_rgb^l · F_rgb^l, W_ir^l · F_ir^l, |F_rgb^l - F_ir^l|)))
结构 作用 针对问题
RGBIRSplit 将 4 通道输入拆成 RGB 与 IR 两路 避免早期混合导致模态来源不可分
双主干 Backbone RGB/IR 独立编码 保留各模态专属特征
G_local 空间位置级权重 遮挡、局部热源、小目标
G_global 整帧场景权重 白天、夜晚、低光、强热背景
可靠性先验 R^l 强化纹理,抑制平滑热斑 热源干扰与伪目标
last_weights 缓存权重 导出每层/每帧热图

3. 融合方法总览、优势特点、原理与网络结构图

3.1 三类融合策略对比

方法 融合位置 原理 优势 局限 实验角色
Early Fusion 输入层或 Stem RGB 与 IR 早期拼接或轻量门控 简单、速度快、参数少 难解释模态退化来源 基线消融
P3/P4/P5 DGF Backbone 输出多尺度层 双主干独立编码,多尺度动态融合 可解释强,检测头不变,论文表达清晰 参数高于单主干 本文落地方案

3.2 本文采用的网络结构

在这里插入图片描述

weights

weights

weights

Input: R,G,B,IR

RGBIRSplit

RGB Backbone

IR Backbone

P3 RGB

P4 RGB

P5 RGB

P3 IR

P4 IR

P5 IR

RGBIR-DGF P3

RGBIR-DGF P4

RGBIR-DGF P5

YOLO26 PAN/FPN

Original YOLO Detect Head

P3 RGB/IR Heatmap

P4 RGB/IR Heatmap

P5 RGB/IR Heatmap

3.3 100 轮对比实验结果

数据采用 M3FD 原始 RGB/IR 图像,不生成 TIFF。当前实验子集为 200 张:训练集 160 张,验证集 40 张,类别为 People, Car, Bus, Motorcycle, Lamp, Truck

Best epoch 指标对比

| Method               | Epoch |      P |      R |      |  mAP50 | mAP50-95 |
| -------------------- | ----: | -----: | -----: | -----: | -----: | -------: |
| YOLO26-RGBIR-P345DGF |    99 | 0.5101 | 0.2559 | | 0.2463 |   0.1037 |
| YOLO26-RGB           |    91 | 0.6325 | 0.1846 |  | 0.1913 |   0.0941 |

在这里插入图片描述

3.4 热力图与检测效果对比

RGBIR 模型可导出 P3/P4/P5 每层每帧的 RGB/IR 权重;RGB-only 模型没有模态选择权重,因此热图对比的关键结论是:RGBIR 不仅给出检测结果,还给出“本帧本层为什么偏向 RGB 或 IR”的解释证据。

在这里插入图片描述

在这里插入图片描述
在这里插入图片描述



4. 原网络和融合后特点对比与注意事项

维度 原 YOLO26 RGB-only YOLO26-RGBIR-P345DGF
输入 3 通道 RGB 4 通道 [R,G,B,IR]
主干 单主干 RGB/IR 双主干
融合位置 P3/P4/P5
融合方式 动态门控,不固定相加
检测头 原 YOLO Detect 保持原 YOLO Detect
可解释性 只能看检测结果或常规曲线 输出每层/每帧 RGB/IR 权重热图
低光场景 RGB 退化明显 IR 权重可上升
热源干扰 无显式抑制 可靠性先验抑制平滑热斑
遮挡场景 单模态线索有限 空间位置级模态互补
工程代价 参数少、速度快 参数与显存增加,需要 RGB/IR 成对数据

关键注意事项

项目 说明
数据对齐 M3FD 原始 RGB/IR 图像需要文件名和空间尺寸对应;若尺寸不同,读取阶段会将 IR resize 到 RGB 尺寸
标签格式 与 COCO128 风格一致,使用 images/trainimages/vallabels/trainlabels/val 文件夹
通道顺序 模型输入约定为 [R,G,B,IR]
RGB-only 对照 使用同一批 RGB 图像和标签,训练参数完全一致
热图解释 RGBIR 热图是模态选择权重;RGB-only 不存在 RGB/IR 权重

写在最后

学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,关注UP:Ai学术叫叫兽
在所有B站资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。
因为经历过所以更懂小白的痛苦!
因为经历过所以更具有指向性的指导!

祝所有科研工作者都能够在自己的领域上更上一层楼!

微信公众号:Ai计算机视觉

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐