[1]段学龙,袁运栋,董楠,等.面向油气管道巡检的弱监督图像显著性目标检测方法[J].油气储运,2026,45(5):539-549.

1. 研究目的

        图像显著性目标检测(Image Salient Object Detection, ISOD)能够快速定位图像中的关键区域,具备良好的应用潜力,但存在标注成本高、目标形态复杂、样本不均衡等挑战。在油气管道巡检任务中,像素级真实标注成本高、获取难度大,且现有公开数据集匮乏。

        故论文中提出了弱监督图像显著性目标检测,可在弱标注条件下完成显著区域学习,因此具备降低标注成本与提升跨场景泛化的潜力。

2. 知识补充(ISOD发展)

        2.1 SISOD

           SISOD(Supervised Image Salient Object Detection), 即全监督图像显著性目标检测。SISOD 的核心特征是依赖像素级真实标注。这意味着训练模型时,每张图像都必须有精确到每个像素的掩码,明确指出哪个像素属于“管道”,哪个属于“背景”。

        但原文中也提到了,尽管SISOD方 法在检测精度方面表现突出,但其高度依赖像素级真实标注数据,标注成本高且获取困难。铺开来说,1. 标注成本高。油气管道过于长,导致遥感图像无法全面覆盖,标注一张图可能需要很久。 2. 数据获取困难。油气管道属于国家关键基础设施,数据保密性强,公开数据集几乎为零。 3.  目标形态极端复杂。 油气管道是细长线性目标,且常与道路、沟渠高度相似。容易分辨错,引入噪声。

        2.2 WSISOD

        WSISOD(Weakly Supervised Image Salient Object Detection),弱监督图像显著性目标检测。引入图像级标签、点标注、边界框 标注及涂鸦标注等弱监督信息,在降低标注成本的同 时引导模型学习显著区域的空间分布。在论文中,作者选择了边界框作为弱监督信号。因为在所有弱监督形式中,边界框的标注成本极低,且能提供目标的位置和大致尺度信息,信息量比图像级标签丰富得多。

        WSISOD缓解样本不均衡,通过框的约束,强制模型“关注框内区域”,起到了先验注意力机制的作用。与此同时,WSISOD应对形态剧变:管道在不同航拍高度下尺度变化巨大。WSISOD 不依赖固定的像素模板,而是让模型学习“框内区域的共性特征”,对尺度变化更鲁棒。

3. 论文核心  

        整体框架

            3.1 SAM2初始伪标签生成

                SAM2初始伪标签生成,其目的是将低成本的边界框标注,转化为高质量的像素级伪标签。

                第一步 设计专用的边界框。论文中也提到了如何设计专用的边界框(1. 单管单框:为图像中每一条独立的管道分别绘制一个矩形框,避免多条管道被混淆在一个框内。2. 宽度适配:框的宽度约为管道可见宽度的2-3倍,以包含足够的上下文信息。3. 长度覆盖:框的长度尽可能覆盖管道的整个可见部分4. 方向对齐:框的方向与管道的主轴方向保持一致,对于弯曲管道,则使用能覆盖该段的最小矩形框。5. 允许重叠:允许相邻管道的边界框之间存在重叠。)

                第二步 SAM2多框联合推理。

        

  • 多提示输入:利用SAM2支持多个提示输入的特性,将一张图片里的所有边界框作为一个“提示序列”一次性输入模型。

  • 联合推理:SAM2会同时处理这些框提示,在统一上下文中进行推理。这有助于模型理解多目标之间的关系,避免独立处理时可能产生的分割冲突。

  • 输出合并:SAM2会为每一个输入的边界框生成一个对应的二值掩码(即该管道区域的像素级分割结果)。最后,将同一张图里所有框的掩码合并,就得到了覆盖所有管道的最终伪标签。

                第三步 提纯。

  • 后处理:对合并后的结果进行连通域分析,并利用面积阈值细长形态约束,剔除不符合管道线性结构的小面积碎片区域,以抑制背景干扰。

  • 质量筛选:这是确保后续模型训练质量的关键。研究人员会人工评估所有生成的伪标签,只保留那些结构完整、线性特征清晰的高质量样本。

        3.2 HFCNet

        HFCNet在网络设计上采用混合异构编码器结构,通过融合CNN与Transformer的互补优势,实现对局部细节与全局空间依赖的协同建模。

        混合异构编码器由VGG16分支与Swin-B分支构成,其中 VGG16分支通过逐层卷积提取管道的局部边缘与纹理细节,Swin-B分支基于层级化自注意力机制建模长距离空间依赖,用于刻画管道的整体分布结构。

        而如何融合CNN和transformer,其实在前面的论文分析中也有提到(论文分析5),同样也是自适应融合,在这篇论文中,称之为自适应全局-局部融合模块(AGLI),其中包含了两个子模块:

  • GFAM(全局特征对齐模块):在全局语义层面,让两个分支的特征在高层空间对齐。

  • PFAM(像素级特征对齐模块):在像素层面,约束两类特征在细节上保持一致。

        HFCNet在解码阶段采用显著性引导注意力增强解码器,以深层显著性特征作为先验,引导浅层特征逐级恢复空间细节,并通过通道增强模块 (Channel Enhancement Module, CEM)、空间增强模块 (Spatial Enhancement Module, SEM)分别对特征的通道维度、空间维度进行加权调制。

  • 先验引导:利用最深层的显著性特征作为先验知识,指导浅层特征恢复空间细节。

  • CEM(通道增强模块):在通道维度上加权,强化对管道响应强烈的通道,抑制无关通道(如纯天空或纯地面)。

  • SEM(空间增强模块):在空间维度上突出管道区域,抑制背景干扰(如道路、建筑物)。经过双维度的调制,最终生成的显著图结构连续性极好。

        在论文中,也提出了HFCNet的一个作用,迭代优化

                        

  1. 冷启动:先用SAM2筛选出的163张高质量伪标签训练HFCNet。

  2. 预测与更新:用训练好的HFCNet去预测剩余的637张图,生成新的、更准确的伪标签(相比SAM2初始生成的,HFCNet预测的更符合管道线性规律)。

  3. 重训练:用这组新伪标签(含初始高质量的 + HFCNet新预测的)再次训练HFCNet。

  4. 循环:重复上述过程,论文提到迭代 4轮 后收敛(平均交并比达到0.9)。

4. 论文实验

        构建专用数据集(RSOGP-SODD),填补数据空白:作者团队自建了一个包含1000张高分辨率图像的数据集,覆盖了多种地理环境和管道形态(并行、弯曲等)。

        

        与全监督方法相比,弱监督方法约有14%的性能损失,但换来了人工标注成本的显著降低

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐