一、经典卷积神经网络

1. AlexNet —— 深度学习的复兴之作

AlexNet由Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton于2012年提出,在ImageNet LSVRC-2010竞赛中以top-1错误率37.5%、top-5错误率17.0% 大幅领先传统方法,开启了深度学习时代。

网络结构

  • 8层可学习层:5层卷积层 + 3层全连接层
  • 约6000万参数,65万神经元
  • 最后输出1000类的Softmax

核心改进

改进点 具体做法
激活函数 采用ReLU替代Sigmoid/Tanh,缓解梯度消失
正则化 全连接层后使用Dropout(以概率p随机关闭神经元)
数据增强 随机裁剪(224×224)、水平翻转、颜色抖动等
池化层 均采用最大池化,且有重叠(步长小于核尺寸)
训练策略 双GPU并行,只在特定层通信

第一层卷积核可视化:96个11×11×3的卷积核,可学习到边缘、方向等底层特征。

💡 AlexNet证明了深度CNN在大型图像识别任务中的巨大潜力,为后续网络设计奠定了基础。


2. VGG-16 —— 小而深的统一架构

VGG(Visual Geometry Group)由牛津大学Simonyan和Zisserman提出,核心贡献是使用多个3×3小卷积核堆叠来替代大卷积核,从而在相同感受野下增加网络深度和非线性。

网络特点

  • 16~19个权重层(VGG-16为13个卷积层+3个全连接层)
  • 所有卷积核均为3×3,池化核均为2×2(步长2)
  • 结构规整:每经过一次池化,特征图尺寸减半,通道数翻倍
  • 参数总量约1.38亿

优势

  • 小卷积核堆叠能减少参数量(两个3×3卷积相当于一个5×5卷积,但参数量更少)
  • 更深的网络带来更强的特征表达能力

VGG在ImageNet 2014定位任务中获得第一,分类任务中获得第二。


3. ResNet —— 残差网络突破深度瓶颈

随着网络加深,出现了退化问题:训练误差和测试误差反而比浅层网络更高,且梯度消失成为训练极深网络的障碍。

梯度消失原因
反向传播时,梯度包含多个形如 w_j·σ'(z_j) 的因子。由于Sigmoid导数最大值为1/4,且权重初始化为高斯分布(|w|<1),乘积会指数级衰减。

残差块设计

  • 让网络学习残差映射 F(x) = H(x) - x,而非直接学习 H(x)
  • 引入恒等捷径连接,将输入直接加到输出上:y = F(x, {Wi}) + x
  • 梯度可通过捷径直接回流到浅层,有效缓解梯度消失

ResNet系列

网络 层数 特点
ResNet-18 18 基本残差块
ResNet-34 34 基本残差块
ResNet-50 50 瓶颈块(1×1→3×3→1×1)
ResNet-101 101 瓶颈块
ResNet-152 152 瓶颈块

设计规则

  • 输出特征图尺寸相同时,过滤器数量相同
  • 特征图尺寸减半时,过滤器数量加倍(保持时间复杂度一致)
  • 全部使用3×3卷积(除首层7×7)

ResNet-34只有36亿FLOPs,仅为VGG-19的18%,在CIFAR-10上更深的网络取得更低的训练和测试误差。


二、计算机视觉常用数据集

数据集 规模 用途 特点
MNIST 6万训练+1万测试,28×28灰度 手写数字识别(10类) 经典入门
CIFAR-10 5万训练+1万测试,32×32彩图 物体识别(10类) 小尺寸,适合快速实验
PASCAL VOC 约1万张,20类 目标检测、分割 2012版最常用,标注含XML
MS COCO 33万张,20万标注,80类 目标检测、分割、关键点 复杂日常场景,竞赛标杆
ImageNet 1400万张,2.1万类 大规模图像分类 ILSVRC竞赛推动CNN发展
JFT-300M 3亿张,超10亿标签 预训练(Google内部) 规模巨大

📌 如今ImageNet竞赛已停办,COCO竞赛成为目标检测领域最权威的评估平台。


三、目标检测评价指标

1. 精确率(Precision)与召回率(Recall)

对于二分类问题,定义混淆矩阵:

真实\预测 正例(1) 负例(0)
正例(1) TP FN
负例(0) FP TN
  • 精确率 P = TP/(TP+FP) —— 预测为正的样本中有多少是真的正例(“挑剔”程度)
  • 召回率 R = TP/(TP+FN) —— 真正的正例中有多少被正确检出(“通过”程度)
  • 准确率 Accuracy = (TP+TN)/(全部)

P-R曲线:通过改变分类阈值,得到一组(P,R)点,曲线下面积越大,模型性能越好。通常精确率越高,召回率越低。

2. 平均精度(AP)与 mAP

AP(Average Precision):对P-R曲线进行积分,近似计算公式为

AP=∑k=1NP(k)⋅Δr(k)AP = \sum_{k=1}^{N} P(k) \cdot \Delta r(k)AP=k=1NP(k)Δr(k)

其中 (P(k)) 是识别出k个样本时的精确率,(\Delta r(k)) 是召回率的变化量。

mAP(mean Average Precision):对所有类别的AP取均值,是多类别目标检测的标准评价指标。

实际计算时,先对模型输出的所有预测按置信度排序,然后依次计算P-R曲线上的点。


四、目标检测与YOLO算法

目标检测任务

不仅要识别图像中的物体类别,还要定位物体的边界框。挑战在于:物体尺度变化大、姿态多样、可能出现任意位置、且存在多类别。

发展脉络

  • R-CNN:区域提议 + CNN分类(慢)
  • SPP-Net:空间金字塔池化,加速特征提取
  • Fast R-CNN:共享卷积特征,引入RoI池化
  • Faster R-CNN:区域提议网络(RPN)端到端训练
  • YOLO:回归思想,一步到位

YOLO(You Only Look Once)核心思想

将目标检测视为回归问题,直接在图像上预测边界框和类别概率。

基本流程

  1. 将输入图像划分为 S×S 的网格
  2. 每个网格负责预测 B 个边界框(含位置、大小、置信度)
  3. 同时预测 C 个类别的条件概率
  4. 最后通过非极大抑制(NMS)去除冗余框

优点

  • 极快(45 fps,快速版本达155 fps)
  • 全局推理,背景误检少
  • 泛化能力强

损失函数:包含坐标误差、置信度误差和分类误差,使用平方和误差。

YOLO后续版本(v2~v8)不断改进,已成为工业界最流行的实时检测框架之一。


总结与思考

模型/概念 核心贡献 关键技术
AlexNet 深度CNN成功应用 ReLU、Dropout、数据增强、双GPU
VGG 小卷积核堆叠 3×3 conv、规整结构
ResNet 极深网络训练 残差块、恒等捷径连接
常用数据集 提供标准benchmark MNIST、CIFAR、VOC、COCO、ImageNet
mAP 检测评价标准 P-R曲线、AP平均
YOLO 实时目标检测 网格划分、回归思想

课后思考

  • 既然浅层网络已经可用,为什么要不断加深网络?(答案:深层网络能学习更抽象、更具判别力的特征,ResNet解决了梯度消失问题)
  • 尝试推导卷积层和池化层的误差反向传播公式(参见课件详细推导)
  • 解释VGG-16中各层尺寸和参数变化规律

本文为课堂学习总结,详细公式推导和代码实现请参考原课件及配套材料。
如有错误或遗漏,欢迎交流指正!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐