论文分析8:多尺度特征感知的无人机小目标检测算法
[1]钟志峰,彭宅琨,黄培沛,等.多尺度特征感知的无人机小目标检测算法[J/OL].计算机工程,1-15[2026-07-15].https://doi.org/10.19678/j.issn.1000-3428.0252593.
1.研究目的
HOG(Histogram of Oriented Gradient)对光照变化较为敏感,在多变环境下缺乏鲁棒性。SURF(Speeded Up Robust Features)作为SIFT(Scale Invariant Feature Transform)的改进版本,在保持鲁棒性的同时提高了计算速度。然而,其计算成本仍然较高,使其在资源受限的环境中应用受限。这些算法的一个共同缺陷是依赖于人工设计的特征进行目标检测和分类。
近年来,深度学习的突破性进展极大地推动了目标 检测技术的发展,这些算法主要分为两大类:两阶段检测方法和单阶段检测方法。传统两阶段检测方法以 R-CNN、Fast R-CNN和 Faster R-CNN等算法为代表,首先生成候选区域,然后对其进行分类并回归边界框。尽管此类方法的检测精度较高,但推理速度较慢。相比之 下,单阶段检测算法如YOLO系列、单发多框检测器 SSD和 RetinaNet省略了候选区域生成步骤,直接在整幅图像上执行目标分类并调整边界框。这种方法提高 了检测速度,确保了快速响应,实现了实时检测,但精度相对较低。
如今,YOLO系列模型因其卓越的性能被广泛应用于 各种检测任务。然而,在无人机航拍场景下,模型在小目标检测方面的准确率往往受到以下因素的影响:(1)分辨率降低:由于下采样过程导致细粒度信息丢失;(2)尺度变化:目标尺寸差异较大,增加了检测难度;(3)光照干扰和背景遮挡:影响目标的区分能力;(4)锚框的设计不合理:与小目标的尺寸和长宽比不匹配。与此同时,虽然YOLO系列也在不断改进,但还是存在一下问题:其一,浅层高分辨率特征未被充分利用,限制了模型对小目标的感知能力;其二,检测头对非规则形变目标缺乏动态适应性,导致边界框拟合不准;其 三,当前主流损失函数在小目标定位上仍存在偏差,难以保证预测框对目标实际轮廓的拟合质量。
于是在本文中,提出了改进YOLOv8s模型的AC-YOLO(Accurate-YOLO)。
2. AC-YOLO检测框架
AC-YOLO 沿用了经典的单阶段检测器结构, 由Backbone(主干网络)、Neck(颈部网络)和 Head(检测头)三部分组成。

AC-YOLO的检测框架以优化小目标检测性能为核心目标,在特征提取、融合、感知与定位四个关键层级引入了针对性的结构增强模块。通过跨模块的信息联动与功能互补,AC-YOLO 在感受野控制、浅层细粒度信息保留、多尺度特征感知以及几何形状拟合等方面实现了协同增益,从而构建了一个高效的闭环检测系统。它并不是简单的模块堆砌,而是一个从“特征提取”到“特征融合”再到“动态感知”与“精确定位”的闭环协同优化系统。
2.1 优化主干网络
C2f 模块作为YOLOv8主干网络的核心结构, 融合了残差连接与特征重用机制,在兼顾计算效率的前提下有效提升了特征表达能力。但,C2f 模块仍 存在两个关键局限:由于 Bottleneck 主要采用局部感受野的标准卷积堆叠方式,缺乏对广域上下文信息的建模能力,导致模型在处理复杂背景或目标间隔较远的小目标时易发生特征混淆。其次,多级Bottleneck 的串联可能引入特征与计算冗余,降低网络的整体推理效率,尤其在资源受限的无人机平台部署中不具优势。
故作者提出了C2_MDCRf模块
第一步:特征图分割
特征图进入 MDCR 后,沿通道维度均匀划分为 4 个子特征图,每个子特征图通道数为原来的 C/4。
第二步:并行多尺度空洞卷积
将 4 个子特征图分别输入深度可分离空洞卷积,但每个分支的膨胀率不同:
-
d1=1:聚焦局部细节。
-
d2,d3:中等膨胀率,捕获中等范围上下文。
-
d4=4:利用稀疏采样极大扩展感受野,建模背景与远距离依赖。
第三步:跨分支通道交错重组
-
将每个分支输出的特征 ai′拆分为单通道切片。
-
强制交错重组:将来自 4 个不同膨胀率分支的对应通道,按跨分支方式重新组合成新的特征组 hj。
-
公式对应:

第四步:点卷积校准与输出
-
重组后的特征组先经过组内逐点卷积实现跨通道信息聚合。
-
最后通过全局逐点卷积恢复原始通道维度C,并经过批归一化(BN)和 ReLU 激活输出。
2.2 优化颈部网络
原Neck的缺陷在于原 YOLOv8 的颈部依赖标准卷积和 C2f 模块进行上采样与拼接。标准卷积计算冗余大,且深层特征图压缩了太多像素信息,导致小目标的纹理在传递中丢失。
故作者引用了Slim-neck 结构,做出了以下优化:
一.轻量化卷积模块
Slim-Neck 结构用轻量化卷积,将标准卷积拆解为稀疏卷积 + 深度卷积 + Shuffle(通道混洗),标准卷积复杂度为为 O(W⋅H⋅K1⋅K2⋅C1⋅C2),而GSConv 的复杂度为O(W⋅H⋅K1⋅K2⋅C2)/2⋅(C1+1),故GSConv的计算成本大约是标准卷积的50%到60%,但它对模型学习能力的贡献是相当的。
跨阶段部分连接模块(VoV-GSCSP),它不是简单地堆叠 GSConv,而是借鉴了跨阶段部分网络(CSPNet)思想,采用一次性聚合方法来处理不同阶段的特征图。

二.新增 P2 小目标检测层
-
从主干网络的 P2 层(分辨率 160×160) 引出特征图。
-
通过残差连接与上采样,将 P2 层的高分辨率浅层特征(富含边缘、轮廓细节)与深层语义特征进行跨层级融合。
2.3 检测头改进:DCNv3-dyhead
核心思想:结合可变形卷积(DCNv3) 与动态检测头(DynamicHead),实现空间、尺度、通道三维注意力协同;
实现方式:
-
尺度感知模块:动态融合多尺度特征;
-
空间感知模块:DCNv3学习偏移量,适应目标形变;
-
通道感知模块:动态激活/抑制通道,适配不同任务;
改进的动态检测头通过级联尺度、空间和通道注意模块,增强特征映射,使其能够在不同尺度上进行动态的自适应特征提取。这种方法有助于模型在 处理小目标时关注细粒度的局部细节,减少由于浅 层下采样导致的小目标特征损失。
2.4 改进的损失函数
YOLOv8s采用完全交并CIoU损失函数来计算边界框回归损失。然而,在小目标检测场景中, CIoU损失函数的表现可能受到明显制约。
故提出了Inner-shapeIoU(结合Inner-IoU与Shape-IoU):
-
Inner-IoU引入辅助框,降低边缘噪声影响;
-
Shape-IoU强调形状与位置偏差;
注:整个推导模式没有完全看懂,可以看原论文来看2.3和2.4。
3. 实验结果分析
3.1 消融实验

结论:各模块均有正向贡献,组合后实现精度与效率的协同优化。
3.2 对比实验 
-
与Faster-RCNN、RetinaNet、YOLOv5~v11、Drone-YOLO、UAV-YOLOv8、MBFE-DETR等方法对比;
-
AC-YOLO在mAP50(52.6%)和mAP50-95(32.6%)上均最优;
-
参数量(17.0M)远低于Drone-YOLO(76.2M),适合边缘部署。
更多推荐




所有评论(0)