整理infrared最近热点
#long-distance-relationship
#所爱隔山海 山海皆可平
#插播一个电脑卡掉的办法(也是打开电脑输入密码的)alt+control+delete 跳出任务管理器
一、web of science
找热点的筛选方法:
Usage (all time) / (last 180 days)(使用次数):指WoS平台上的用户点击、下载或保存全文的次数。“所有时间”看历史总热度,“最近180天”看近期爆款(刚发表不久但下载量飙升的论文),能帮你发现当下的研究热点。
Date: newest first / oldest first(出版日期):按期刊或会议的正式出版年份排序。想看最新的研究成果选“最新优先”,想追溯经典老文献选“最旧优先”。
Citations: highest first / lowest first(被引频次):按这篇论文被其他人引用的次数排序。“最高优先”会把该领域最经典、认可度最高的“顶梁柱”文献排在前面,是写综述时最常用的排序。
小总结:写综述/开题:优先选 Citations(被引频次最高优先),快速锁定领域内的高影响力经典。追热点/找创新点:优先选 Date(最新优先) 或 Usage(近180天使用次数最多),看大家都在关注什么新方向。
二、我读!
1.多层感知器融合网络,用于红外小目标检测MLP-Net: Multilayer Perceptron Fusion Network for Infrared Small Target Detection
代码:GitHub - Zhishe-Wang/MLP-Net · GitHub
有用的两个模块:
模块 A(PTIM / 全局雷达)解决的是:“看不清全局” 的子问题——即传统CNN只看局部,容易把复杂背景误判为目标(虚警高)或漏掉远处小目标,PTIM通过全图信息交互来抑制背景干扰。
模块 B(CSFM / 高清修图师)解决的是:“轮廓画不准” 的子问题——即深层语义(知道是啥)和浅层细节(知道在哪儿)在融合时容易模糊边界,CSFM通过动态筛选有用信息来精确保留小目标的边缘形状。
🧩 模块 A:PTIM(并行令牌交互混合器)—— 翻译成“全局雷达”
- 它要解决什么问题?
普通的 CNN(卷积)像个近视眼,只能看清鼻子底下的一小块区域(局部特征)。如果小目标躲在远处角落,CNN 就看不见它。
PTIM 的作用:给它装上一个“全景雷达”。它能让图片左上角和右下角的像素“打电话”,把全图扫一遍,找到那个躲在复杂背景里的小亮点。
- 它长什么样?(看它的接口)
你不需要管它内部怎么算,只看它的“快递收发室”:
-
- 输入:一张
H x W x C的特征图(比如 16x16x256)。 - 输出:一张
H x W x C的特征图(尺寸、通道数完全没变,还是 16x16x256)。
- 输入:一张
- 为什么说它是“即插即用”?
因为尺寸没变,它就像个“滤镜”或“插件”。你可以把它塞进任何网络的中间。至于它里面是怎么扫的,那是作者的事,你只要知道它能“看清全局”就行。
🧩 模块 B:CSFM(上下文选择融合模块)—— 翻译成“高清修图师”
- 它要解决什么问题?
Decoder 阶段要把小图放大成原图。但有个矛盾:
-
- 深层特征(大后期):知道“这是个飞机”(语义准),但轮廓模糊。
- 浅层特征(前期):知道“边缘在这里”(位置准),但容易把杂草也当成目标。
CSFM 的作用:当个聪明的修图师。它把深层的“大框架”和浅层的“细边缘”拿过来,挑出最可靠的部分拼在一起。哪个通道有用就保留,哪个空间位置是噪声就扔掉。
- 它长什么样?(看它的接口)
它至少要接收 2 个输入:
-
- 输入 1:来自深层的大尺度语义特征(
Φ_p^l,比较糊)。 - 输入 2:来自浅层的小尺度细节特征(
Φ_p^{l-1},比较清楚)。 - 输出:一张融合后更精准的新特征图。
- 输入 1:来自深层的大尺度语义特征(
- 为什么说它是“特征金字塔改进”?
因为 YOLO 传统的融合就是粗暴地“加起来”或“拼起来”,而这个 CSFM 是“带脑子”地去挑选和加权,融合效果通常会更好。
🔗 这三个东西在你的模型里怎么串起来?(灵魂画手时间)
假设你有一个基础的 CNN 网络(比如 YOLO 的骨架):
- 图片进来 →
- 经过 CNN 骨干(Encoder),提取出不同层级的特征(浅层细节、深层语义)→
- (在这里插入你的模块 A) 把提取出来的特征丢进 PTIM(全局雷达),让网络把全图关系看清楚,减少背景误报 →
- 进入 Decoder(上采样放大),准备还原图像大小 →
- (在这里插入你的模块 B) 在放大的过程中,把深层和浅层的特征丢进 CSFM(高清修图师),让边缘轮廓更精确 →
- 输出最终的检测结果。
插曲:看一个特征金字塔的介绍视频(抖音)
为啥用FPN(feature pyramid network特征金字塔网络?)
-因为R-CNN啥的太粗糙无法检测到小物体
下面第一张是以前传统的图像金字塔



介绍FPN


2.用于红外小目标检测的频域解耦双向交互注意力网络FDDBA-NET: Frequency Domain Decoupling Bidirectional Interactive Attention Network for Infrared Small Target Detection
有用模块:
模块 C(FDD / 频谱分离器)解决的是“目标和背景长得太像分不清”的问题——即在输入端通过FFT把图像拆成频率信号,用两个可学习的筛子分别提取目标专属频谱和背景频谱,让网络只盯着目标看,放在网络最前端(预处理层),即插即用。
模块 D(BIAM / 双向传话筒)解决的是“深层语义(有脑子但模糊)和浅层细节(有眼睛但没脑子)融合不充分”的问题——即通过双向交互让深层特征和浅层特征互相传递信息(不仅深层指挥浅层,浅层也反向补充细节给深层),放在网络中部/后部(特征融合层),是和CSFM同功能但实现不同的替代方案。
模块 C:FDD(频域解耦模块)—— 翻译成“频谱分离器”
-
它解决什么子问题? 你之前问过“目标和背景长得像怎么办?” 这篇就专门解决这个问题。它在输入阶段就把图像变换到频率域,用两个可学习的“筛子(Mask)”把目标和背景的频谱强行分开。
-
位置:网络最前端(预处理层),在所有卷积操作之前。
-
输入/输出:
-
输入:原始红外图像(H×W×C)。
-
输出:分离后的两张图——“目标专属图(I_ts)”和“背景一致图(I_tg)”(尺寸和原图一模一样)。
-
-
潜力判断:✅ 这是一个前端预处理插件。它可以接在任何骨干网络(YOLO、UNet)前面!而且作者在实验里专门说了(Table V),这个 FDD 模块可以 “即插即用(Plug-and-Play)” 地挂载到其他网络上提升性能。
模块 D:BIAM(双向交互注意力模块)—— 翻译成“双向传话筒”
-
它解决什么子问题? 解决“深层语义(远景)”和“浅层细节(近景)”融合不好的问题。但你注意到没有,这和第一篇的 CSFM(高清修图师) 解决的其实是同一个大类问题(特征融合)!只是实现方法不同:
-
CSFM(第一篇):是“单方向”的,主要把深层语义传给浅层去精修轮廓。
-
BIAM(这篇):是“双向”的,不仅深层传给浅层,浅层的细节也反向传给深层,让深层特征也能看清细节。
-
-
位置:网络中部/后部(特征融合层/Decoder),和第一篇的 CSFM 位置重叠。
-
潜力判断:⚠️ 和 CSFM 功能重叠(都在做融合)。你将来设计模型时,大概率要二选一,或者把其中一个作为对比实验(看看谁效果好)。
🔍 重点读什么?
作为本科生,你现在绝对不要去抠公式(3)(6)(7)的数学推导,那会把你绕晕。你只需要去论文里挖这3个地方的结论性句子:
看 Table V(第11页):作者把 FDD 模块挂载到其他网络(ACM、DNANet)上,指标都涨了。这证明了 FDD 是个“即插即用”的好模块——这就是你将来要用的证据!
看 Table VII(第13页):作者对比了 5 种不同的特征融合方法(加法、拼接、乘法、单向、双向)。结果 BIAM(双向)排第一,单项(SLOD)排第二。这证明“双向交互”比“单向”更有效。
看 Table VIII(第14页):作者发现“交替训练”比“一起训练”效果好。这给你提了个醒:如果你将来把 FDD 和检测网络拼在一起,训练策略可能也得专门设计。
主要内容一张图(论文里的figure4)

📍 整体布局(图片分为 4 个区域)
这张图的布局是:(a) (b) (c) (d)
🅰️ 区域 (a) —— 左侧(输入端)—— “频谱分离器” FDD
| 图里的英文标签 | 中文翻译 | 大白话解释 |
| Original infrared image I | 原始红外图像 | 输入的图片 |
| FFT | 快速傅里叶变换 | 把图片从“空间域”转换到“频率域”的数学操作 |
| Amplitude Spectrum (I^A) | 振幅谱 | 频谱的一部分,代表“信号的强度/能量” |
| Phase Spectrum (I^P) | 相位谱 | 频谱的另一部分,代表“信号的位置/结构” |
| Learnable Specific Mask (\xi_{ts}) | 可学习的目标专用掩码 | 一个可训练的“筛子”,专门提取目标频段 |
| Learnable Background Mask (\xi_{tg}) | 可学习的背景掩码 | 一个可训练的“筛子”,专门提取背景频段 |
| I_ts(Specific Feature) | 目标专属特征 | 分离出来的“有用图”(只含目标频谱) |
| I_tg(Consistent Feature) | 背景一致特征 | 分离出来的“有害图”(只含背景频谱) |
第一步:左侧 —— 输入端(把目标和背景的“频率信号”拆开)
- 输入:一张原始红外图像(就一张普通灰度图)。
- FFT(快速傅里叶变换):把这张图从“空间位置”转换成“频率信号”——就像把一首歌拆成“高音、中音、低音”一样。
- 拆成两份:
- 振幅谱:记录信号强度(哪些频率能量大)。
- 相位谱:记录信号位置(这些频率在图像的什么位置)。
- 两个可学习的“筛子(掩码)”:
- 筛子①(目标专用):从振幅谱里筛出“目标特有的频率” → 得到 “目标分离图”(只剩下目标的信号)。
- 筛子②(背景专用):从振幅谱里筛出“背景特有的频率” → 得到 “背景分离图”(只剩下背景的信号)。
- 输出:两张图和原图一样大:“目标分离图” 和 “背景分离图”。
对应你图(a)的产出:就是那两条向下的箭头,指向中间的大框。
🅱️ 区域 (b) —— 中间(特征提取)—— “U-Net 骨架”
| 图里的英文标签 | 中文翻译 | 大白话解释 |
| U-shape Dense Network | U形密集网络 | 骨干网络,用来提取特征(类似UNet的结构) |
| Shared U-shape Dense Network | 共享权重的U形密集网络 | 两个输入(有用图+有害图)共用同一个网络(权重一样) |
| ST0, ST1, ST2, ST3, ST4 | 目标特征图(第0~4层) | 有用图经过网络后,每一层输出的特征 |
| PB0, PB1, PB2, PB3, PB4 | 背景特征图(第0~4层) | 有害图经过网络后,每一层输出的特征 |
第二步:中间 —— 特征提取(分别提取目标和背景的“特征”)
两条路径:
把 “目标分离图” 送进一个 U-Net 网络 → 提取出 5层“目标特征图”(从浅层到深层,编号0~4)。
把 “背景分离图” 送进 同一个 U-Net 网络(权重共享,保证公平) → 提取出 5层“背景特征图”(从浅层到深层,编号0~4)。
这里的关键:U-Net 每层输出的特征图,分辨率不一样——浅层(第0层)最大(细节丰富),深层(第4层)最小(语义抽象)。
对应你图(b)的产出:左边一排是“目标特征图 0~4”,右边一排是“背景特征图 0~4”。
【关于分辨率不同】

🅲 区域 (c) —— 右上方(IRSTD Head)—— “检测头”
| 图里的英文标签 | 中文翻译 | 大白话解释 |
| IRSTD Head | 红外小目标检测头 | 负责输出最终检测结果的网络头 |
| 1×1 conv | 1×1 卷积 | 把特征图压缩成单通道的置信度图 |
| Result | 检测结果 | 输出最终的置信度图(哪里有小目标) |
| Detection Loss | 检测损失函数 | 计算预测结果和真实标签的误差,用来训练网络 |
第三步:右上方 —— 检测头(输出目标在哪)
- 输入:从“目标特征图”里挑一些层(或者融合后的特征)。
- 1×1 卷积:把多通道的特征图压缩成 “单通道的置信度图”(即每个像素 0~1 的概率值)。
- 输出结果:一张置信度图(亮的地方就是模型预测的目标位置)。
- 计算检测损失:把这张预测图和“人工标注的真实图”做对比,算出差距 → 用来训练网络,让它下次预测更准。
对应你图(c):就是这个分支最终产出“检测结果”。
🅳 区域 (d) —— 右下方(Contrastive Head)—— “对比头”
| 图里的英文标签 | 中文翻译 | 大白话解释 |
| Contrastive Head | 对比头 | 专门用来拉大“目标特征”和“背景特征”差距的分支 |
| ROI Align | 兴趣区域对齐 | 把目标区域的像素抠出来,统一成相同大小 |
| Contrastive Loss 0~4 | 对比损失(第0~4层) | 在每一层都计算一次“目标和背景的差距”,加起来作为总损失 |
第四步:右下方 —— 对比头(强行拉大目标和背景的差距)
这个分支 不参与最终检测输出,它只在 训练阶段 起作用,目的是让网络学会更好地分离目标和背景。
输入:从中间步骤拿到的“目标特征图 04”和“背景特征图 04”。
ROI Align(兴趣区域对齐):把目标所在区域的特征“抠出来”,统一缩放到相同大小(比如 9×9)。
计算对比损失:
让 同一张图里不同目标的特征 尽量相似(拉近)。
让 目标和背景的特征 尽量不相似(拉远)。
结果:网络被“惩罚”后,会调整那两个筛子(掩码),让“目标分离图”更纯净、背景压得更干净。
对应你图(d):这个分支只负责在训练时“督导”前端学习,推理(实际使用时)会被扔掉。
🔗 完整串联(从头到尾读一遍)
输入一张红外图 →
FFT 转成频率信号 →
两个筛子分别提取“目标频率”和“背景频率” →
得到两张图:目标分离图 + 背景分离图 →
分别送进 U-Net,各自提取 5 层特征 →
分两条路走:
- 路①(检测):拿目标特征 → 1×1 卷积压成置信度图 → 输出预测结果 → 算检测损失(监督检测准不准)。
- 路②(对比):拿目标特征和背景特征 → 抠出目标区域 → 算对比损失(监督目标和背景分得开不开)。
两条路的损失加起来,反向传播更新整个网络。在实际使用(推理)时,路②被丢掉,只走路①输出结果。
插曲:
看到置信度(不是yolo里边的)但是看不懂 所以去了解了一下yolo参数
(1)IoU就是红色预测框和绿色实际检测狂的交集除以并集

(2)TP,FP,FN值
TP:IoU交并比大于设定阈值的框的数量
FP:IoU交并比小于设定阈值的框的数量(检测出来的框总数-TP)
FN:真实的框总数-TP



(3)P精度和R召回率
P=TP/TP+FP
R=TP/TP+FN



(4)置信度:模型认为检测到目标框的可能概率
置信度越高就说明检测到目标框的可能越大
下图特点:
①
②


(5)AP平均精度
就是根据前面的PR曲线画出来一张图,积分求面积(0-1区间)



(6)结果分析

后面就没看了
更多推荐



所有评论(0)