#long-distance-relationship

#所爱隔山海 山海皆可平

#插播一个电脑卡掉的办法(也是打开电脑输入密码的)alt+control+delete 跳出任务管理器

一、web of science

找热点的筛选方法:

  • Usage (all time) / (last 180 days)(使用次数)指WoS平台上的用户点击、下载或保存全文的次数。“所有时间”看历史总热度,“最近180天”看近期爆款(刚发表不久但下载量飙升的论文),能帮你发现当下的研究热点。

  • Date: newest first / oldest first(出版日期):按期刊或会议的正式出版年份排序。想看最新的研究成果选“最新优先”,想追溯经典老文献选“最旧优先”。

  • Citations: highest first / lowest first(被引频次)按这篇论文被其他人引用的次数排序。“最高优先”会把该领域最经典、认可度最高的“顶梁柱”文献排在前面,是写综述时最常用的排序。

  • 小总结:写综述/开题:优先选 Citations(被引频次最高优先),快速锁定领域内的高影响力经典。追热点/找创新点:优先选 Date(最新优先) 或 Usage(近180天使用次数最多),看大家都在关注什么新方向。

二、我读!

1.多层感知器融合网络,用于红外小目标检测MLP-Net: Multilayer Perceptron Fusion Network for Infrared Small Target Detection

代码:GitHub - Zhishe-Wang/MLP-Net · GitHub

有用的两个模块:

  • 模块 A(PTIM / 全局雷达)解决的是“看不清全局” 的子问题——即传统CNN只看局部,容易把复杂背景误判为目标(虚警高)或漏掉远处小目标,PTIM通过全图信息交互来抑制背景干扰。

  • 模块 B(CSFM / 高清修图师)解决的是“轮廓画不准” 的子问题——即深层语义(知道是啥)和浅层细节(知道在哪儿)在融合时容易模糊边界,CSFM通过动态筛选有用信息来精确保留小目标的边缘形状。

🧩 模块 A:PTIM(并行令牌交互混合器)—— 翻译成“全局雷达”

  • 它要解决什么问题?

普通的 CNN(卷积)像个近视眼,只能看清鼻子底下的一小块区域(局部特征)。如果小目标躲在远处角落,CNN 就看不见它。

PTIM 的作用:给它装上一个“全景雷达”。它能让图片左上角和右下角的像素“打电话”,把全图扫一遍,找到那个躲在复杂背景里的小亮点。

  • 它长什么样?(看它的接口)

你不需要管它内部怎么算,只看它的“快递收发室”

    • 输入:一张 H x W x C 的特征图(比如 16x16x256)。
    • 输出:一张 H x W x C 的特征图(尺寸、通道数完全没变,还是 16x16x256)。
  • 为什么说它是“即插即用”?

因为尺寸没变,它就像个“滤镜”“插件”。你可以把它塞进任何网络的中间。至于它里面是怎么扫的,那是作者的事,你只要知道它能“看清全局”就行。


🧩 模块 B:CSFM(上下文选择融合模块)—— 翻译成“高清修图师”

  • 它要解决什么问题?

Decoder 阶段要把小图放大成原图。但有个矛盾:

    • 深层特征(大后期):知道“这是个飞机”(语义准),但轮廓模糊。
    • 浅层特征(前期):知道“边缘在这里”(位置准),但容易把杂草也当成目标。

CSFM 的作用:当个聪明的修图师。它把深层的“大框架”和浅层的“细边缘”拿过来,挑出最可靠的部分拼在一起。哪个通道有用就保留,哪个空间位置是噪声就扔掉。

  • 它长什么样?(看它的接口)

它至少要接收 2 个输入

    • 输入 1:来自深层的大尺度语义特征(Φ_p^l,比较糊)。
    • 输入 2:来自浅层的小尺度细节特征(Φ_p^{l-1},比较清楚)。
    • 输出:一张融合后更精准的新特征图。
  • 为什么说它是“特征金字塔改进”?

因为 YOLO 传统的融合就是粗暴地“加起来”或“拼起来”,而这个 CSFM 是“带脑子”地去挑选和加权,融合效果通常会更好。


🔗 这三个东西在你的模型里怎么串起来?(灵魂画手时间)

假设你有一个基础的 CNN 网络(比如 YOLO 的骨架):

  1. 图片进来
  2. 经过 CNN 骨干(Encoder),提取出不同层级的特征(浅层细节、深层语义)→
  3. (在这里插入你的模块 A) 把提取出来的特征丢进 PTIM(全局雷达),让网络把全图关系看清楚,减少背景误报 →
  4. 进入 Decoder(上采样放大),准备还原图像大小 →
  5. (在这里插入你的模块 B) 在放大的过程中,把深层和浅层的特征丢进 CSFM(高清修图师),让边缘轮廓更精确 →
  6. 输出最终的检测结果

插曲:看一个特征金字塔的介绍视频(抖音)

为啥用FPN(feature pyramid network特征金字塔网络?)

-因为R-CNN啥的太粗糙无法检测到小物体

下面第一张是以前传统的图像金字塔

介绍FPN

2.用于红外小目标检测的频域解耦双向交互注意力网络FDDBA-NET: Frequency Domain Decoupling Bidirectional Interactive Attention Network for Infrared Small Target Detection

有用模块:

模块 C(FDD / 频谱分离器)解决的是“目标和背景长得太像分不清”的问题——即在输入端通过FFT把图像拆成频率信号,用两个可学习的筛子分别提取目标专属频谱和背景频谱,让网络只盯着目标看,放在网络最前端(预处理层),即插即用。

模块 D(BIAM / 双向传话筒)解决的是“深层语义(有脑子但模糊)和浅层细节(有眼睛但没脑子)融合不充分”的问题——即通过双向交互让深层特征和浅层特征互相传递信息(不仅深层指挥浅层,浅层也反向补充细节给深层),放在网络中部/后部(特征融合层),是和CSFM同功能但实现不同的替代方案。

模块 C:FDD(频域解耦模块)—— 翻译成“频谱分离器”
  • 它解决什么子问题? 你之前问过“目标和背景长得像怎么办?” 这篇就专门解决这个问题。它在输入阶段就把图像变换到频率域,用两个可学习的“筛子(Mask)”把目标和背景的频谱强行分开。

  • 位置网络最前端(预处理层),在所有卷积操作之前。

  • 输入/输出

    • 输入:原始红外图像(H×W×C)。

    • 输出:分离后的两张图——“目标专属图(I_ts)”和“背景一致图(I_tg)”(尺寸和原图一模一样)。

  • 潜力判断:✅ 这是一个前端预处理插件。它可以接在任何骨干网络(YOLO、UNet)前面!而且作者在实验里专门说了(Table V),这个 FDD 模块可以 “即插即用(Plug-and-Play)” 地挂载到其他网络上提升性能。

模块 D:BIAM(双向交互注意力模块)—— 翻译成“双向传话筒”
  • 它解决什么子问题? 解决“深层语义(远景)”和“浅层细节(近景)”融合不好的问题。但你注意到没有,这和第一篇的 CSFM(高清修图师) 解决的其实是同一个大类问题(特征融合)!只是实现方法不同:

    • CSFM(第一篇):是“单方向”的,主要把深层语义传给浅层去精修轮廓。

    • BIAM(这篇):是“双向”的,不仅深层传给浅层,浅层的细节也反向传给深层,让深层特征也能看清细节。

  • 位置网络中部/后部(特征融合层/Decoder),和第一篇的 CSFM 位置重叠。

  • 潜力判断:⚠️ 和 CSFM 功能重叠(都在做融合)。你将来设计模型时,大概率要二选一,或者把其中一个作为对比实验(看看谁效果好)。

🔍 重点读什么?

作为本科生,你现在绝对不要去抠公式(3)(6)(7)的数学推导,那会把你绕晕。你只需要去论文里挖这3个地方的结论性句子

  1. 看 Table V(第11页):作者把 FDD 模块挂载到其他网络(ACM、DNANet)上,指标都涨了。这证明了 FDD 是个“即插即用”的好模块——这就是你将来要用的证据!

  2. 看 Table VII(第13页):作者对比了 5 种不同的特征融合方法(加法、拼接、乘法、单向、双向)。结果 BIAM(双向)排第一,单项(SLOD)排第二。这证明“双向交互”比“单向”更有效。

  3. 看 Table VIII(第14页):作者发现“交替训练”比“一起训练”效果好。这给你提了个醒:如果你将来把 FDD 和检测网络拼在一起,训练策略可能也得专门设计。

主要内容一张图(论文里的figure4)

📍 整体布局(图片分为 4 个区域)

这张图的布局是:(a) (b) (c) (d)


🅰️ 区域 (a) —— 左侧(输入端)—— “频谱分离器” FDD

图里的英文标签

中文翻译

大白话解释

Original infrared image I

原始红外图像

输入的图片

FFT

快速傅里叶变换

把图片从“空间域”转换到“频率域”的数学操作

Amplitude Spectrum (I^A)

振幅谱

频谱的一部分,代表“信号的强度/能量”

Phase Spectrum (I^P)

相位谱

频谱的另一部分,代表“信号的位置/结构”

Learnable Specific Mask (\xi_{ts})

可学习的目标专用掩码

一个可训练的“筛子”,专门提取目标频段

Learnable Background Mask (\xi_{tg})

可学习的背景掩码

一个可训练的“筛子”,专门提取背景频段

I_ts(Specific Feature)

目标专属特征

分离出来的“有用图”(只含目标频谱)

I_tg(Consistent Feature)

背景一致特征

分离出来的“有害图”(只含背景频谱)

第一步:左侧 —— 输入端(把目标和背景的“频率信号”拆开)

  1. 输入:一张原始红外图像(就一张普通灰度图)。
  2. FFT(快速傅里叶变换):把这张图从“空间位置”转换成“频率信号”——就像把一首歌拆成“高音、中音、低音”一样。
  3. 拆成两份
    • 振幅谱:记录信号强度(哪些频率能量大)。
    • 相位谱:记录信号位置(这些频率在图像的什么位置)。
  4. 两个可学习的“筛子(掩码)”
    • 筛子①(目标专用):从振幅谱里筛出“目标特有的频率” → 得到 “目标分离图”(只剩下目标的信号)。
    • 筛子②(背景专用):从振幅谱里筛出“背景特有的频率” → 得到 “背景分离图”(只剩下背景的信号)。
  5. 输出:两张图和原图一样大:“目标分离图”“背景分离图”
对应你图(a)的产出:就是那两条向下的箭头,指向中间的大框。

🅱️ 区域 (b) —— 中间(特征提取)—— “U-Net 骨架”

图里的英文标签

中文翻译

大白话解释

U-shape Dense Network

U形密集网络

骨干网络,用来提取特征(类似UNet的结构)

Shared U-shape Dense Network

共享权重的U形密集网络

两个输入(有用图+有害图)共用同一个网络(权重一样)

ST0, ST1, ST2, ST3, ST4

目标特征图(第0~4层)

有用图经过网络后,每一层输出的特征

PB0, PB1, PB2, PB3, PB4

背景特征图(第0~4层)

有害图经过网络后,每一层输出的特征

第二步:中间 —— 特征提取(分别提取目标和背景的“特征”)

两条路径:

把 “目标分离图” 送进一个 U-Net 网络 → 提取出 5层“目标特征图”(从浅层到深层,编号0~4)。

把 “背景分离图” 送进 同一个 U-Net 网络(权重共享,保证公平) → 提取出 5层“背景特征图”(从浅层到深层,编号0~4)。

这里的关键:U-Net 每层输出的特征图,分辨率不一样——浅层(第0层)最大(细节丰富),深层(第4层)最小(语义抽象)。

对应你图(b)的产出:左边一排是“目标特征图 0~4”,右边一排是“背景特征图 0~4”。

【关于分辨率不同】


🅲 区域 (c) —— 右上方(IRSTD Head)—— “检测头”

图里的英文标签

中文翻译

大白话解释

IRSTD Head

红外小目标检测头

负责输出最终检测结果的网络头

1×1 conv

1×1 卷积

把特征图压缩成单通道的置信度图

Result

检测结果

输出最终的置信度图(哪里有小目标)

Detection Loss

检测损失函数

计算预测结果和真实标签的误差,用来训练网络

第三步:右上方 —— 检测头(输出目标在哪)

  1. 输入:从“目标特征图”里挑一些层(或者融合后的特征)。
  2. 1×1 卷积:把多通道的特征图压缩成 “单通道的置信度图”(即每个像素 0~1 的概率值)。
  3. 输出结果:一张置信度图(亮的地方就是模型预测的目标位置)。
  4. 计算检测损失:把这张预测图和“人工标注的真实图”做对比,算出差距 → 用来训练网络,让它下次预测更准。
对应你图(c):就是这个分支最终产出“检测结果”。

🅳 区域 (d) —— 右下方(Contrastive Head)—— “对比头”

图里的英文标签

中文翻译

大白话解释

Contrastive Head

对比头

专门用来拉大“目标特征”和“背景特征”差距的分支

ROI Align

兴趣区域对齐

把目标区域的像素抠出来,统一成相同大小

Contrastive Loss 0~4

对比损失(第0~4层)

在每一层都计算一次“目标和背景的差距”,加起来作为总损失

第四步:右下方 —— 对比头(强行拉大目标和背景的差距)

这个分支 不参与最终检测输出,它只在 训练阶段 起作用,目的是让网络学会更好地分离目标和背景。

输入:从中间步骤拿到的“目标特征图 04”和“背景特征图 04”。

ROI Align(兴趣区域对齐):把目标所在区域的特征“抠出来”,统一缩放到相同大小(比如 9×9)。

计算对比损失:

让 同一张图里不同目标的特征 尽量相似(拉近)。

让 目标和背景的特征 尽量不相似(拉远)。

结果:网络被“惩罚”后,会调整那两个筛子(掩码),让“目标分离图”更纯净、背景压得更干净。

对应你图(d):这个分支只负责在训练时“督导”前端学习,推理(实际使用时)会被扔掉。


🔗 完整串联(从头到尾读一遍)

输入一张红外图

FFT 转成频率信号

两个筛子分别提取“目标频率”和“背景频率”

得到两张图:目标分离图 + 背景分离图

分别送进 U-Net,各自提取 5 层特征

分两条路走

  • 路①(检测):拿目标特征 → 1×1 卷积压成置信度图 → 输出预测结果 → 算检测损失(监督检测准不准)。
  • 路②(对比):拿目标特征和背景特征 → 抠出目标区域 → 算对比损失(监督目标和背景分得开不开)。

两条路的损失加起来,反向传播更新整个网络。在实际使用(推理)时,路②被丢掉,只走路①输出结果。

插曲:

看到置信度(不是yolo里边的)但是看不懂 所以去了解了一下yolo参数

b站:yolo系列检测模型参数和训练结果分析_哔哩哔哩_bilibili

(1)IoU就是红色预测框和绿色实际检测狂的交集除以并集

(2)TP,FP,FN值

TP:IoU交并比大于设定阈值的框的数量

FP:IoU交并比小于设定阈值的框的数量(检测出来的框总数-TP)

FN:真实的框总数-TP

(3)P精度和R召回率

P=TP/TP+FP

R=TP/TP+FN

(4)置信度:模型认为检测到目标框的可能概率

置信度越高就说明检测到目标框的可能越大

下图特点:

(5)AP平均精度

就是根据前面的PR曲线画出来一张图,积分求面积(0-1区间)

(6)结果分析

后面就没看了

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐