神经网络与深度学习上课记录(二)
一、经典卷积神经网络
1. AlexNet —— 深度学习的复兴之作
AlexNet由Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton于2012年提出,在ImageNet LSVRC-2010竞赛中以top-1错误率37.5%、top-5错误率17.0% 大幅领先传统方法,开启了深度学习时代。
网络结构:
- 8层可学习层:5层卷积层 + 3层全连接层
- 约6000万参数,65万神经元
- 最后输出1000类的Softmax
核心改进:
| 改进点 | 具体做法 |
|---|---|
| 激活函数 | 采用ReLU替代Sigmoid/Tanh,缓解梯度消失 |
| 正则化 | 全连接层后使用Dropout(以概率p随机关闭神经元) |
| 数据增强 | 随机裁剪(224×224)、水平翻转、颜色抖动等 |
| 池化层 | 均采用最大池化,且有重叠(步长小于核尺寸) |
| 训练策略 | 双GPU并行,只在特定层通信 |
第一层卷积核可视化:96个11×11×3的卷积核,可学习到边缘、方向等底层特征。
💡 AlexNet证明了深度CNN在大型图像识别任务中的巨大潜力,为后续网络设计奠定了基础。
2. VGG-16 —— 小而深的统一架构
VGG(Visual Geometry Group)由牛津大学Simonyan和Zisserman提出,核心贡献是使用多个3×3小卷积核堆叠来替代大卷积核,从而在相同感受野下增加网络深度和非线性。
网络特点:
- 16~19个权重层(VGG-16为13个卷积层+3个全连接层)
- 所有卷积核均为3×3,池化核均为2×2(步长2)
- 结构规整:每经过一次池化,特征图尺寸减半,通道数翻倍
- 参数总量约1.38亿
优势:
- 小卷积核堆叠能减少参数量(两个3×3卷积相当于一个5×5卷积,但参数量更少)
- 更深的网络带来更强的特征表达能力
VGG在ImageNet 2014定位任务中获得第一,分类任务中获得第二。
3. ResNet —— 残差网络突破深度瓶颈
随着网络加深,出现了退化问题:训练误差和测试误差反而比浅层网络更高,且梯度消失成为训练极深网络的障碍。
梯度消失原因:
反向传播时,梯度包含多个形如 w_j·σ'(z_j) 的因子。由于Sigmoid导数最大值为1/4,且权重初始化为高斯分布(|w|<1),乘积会指数级衰减。
残差块设计:
- 让网络学习残差映射
F(x) = H(x) - x,而非直接学习H(x) - 引入恒等捷径连接,将输入直接加到输出上:
y = F(x, {Wi}) + x - 梯度可通过捷径直接回流到浅层,有效缓解梯度消失
ResNet系列:
| 网络 | 层数 | 特点 |
|---|---|---|
| ResNet-18 | 18 | 基本残差块 |
| ResNet-34 | 34 | 基本残差块 |
| ResNet-50 | 50 | 瓶颈块(1×1→3×3→1×1) |
| ResNet-101 | 101 | 瓶颈块 |
| ResNet-152 | 152 | 瓶颈块 |
设计规则:
- 输出特征图尺寸相同时,过滤器数量相同
- 特征图尺寸减半时,过滤器数量加倍(保持时间复杂度一致)
- 全部使用3×3卷积(除首层7×7)
ResNet-34只有36亿FLOPs,仅为VGG-19的18%,在CIFAR-10上更深的网络取得更低的训练和测试误差。
二、计算机视觉常用数据集
| 数据集 | 规模 | 用途 | 特点 |
|---|---|---|---|
| MNIST | 6万训练+1万测试,28×28灰度 | 手写数字识别(10类) | 经典入门 |
| CIFAR-10 | 5万训练+1万测试,32×32彩图 | 物体识别(10类) | 小尺寸,适合快速实验 |
| PASCAL VOC | 约1万张,20类 | 目标检测、分割 | 2012版最常用,标注含XML |
| MS COCO | 33万张,20万标注,80类 | 目标检测、分割、关键点 | 复杂日常场景,竞赛标杆 |
| ImageNet | 1400万张,2.1万类 | 大规模图像分类 | ILSVRC竞赛推动CNN发展 |
| JFT-300M | 3亿张,超10亿标签 | 预训练(Google内部) | 规模巨大 |
📌 如今ImageNet竞赛已停办,COCO竞赛成为目标检测领域最权威的评估平台。
三、目标检测评价指标
1. 精确率(Precision)与召回率(Recall)
对于二分类问题,定义混淆矩阵:
| 真实\预测 | 正例(1) | 负例(0) |
|---|---|---|
| 正例(1) | TP | FN |
| 负例(0) | FP | TN |
- 精确率
P = TP/(TP+FP)—— 预测为正的样本中有多少是真的正例(“挑剔”程度) - 召回率
R = TP/(TP+FN)—— 真正的正例中有多少被正确检出(“通过”程度) - 准确率
Accuracy = (TP+TN)/(全部)
P-R曲线:通过改变分类阈值,得到一组(P,R)点,曲线下面积越大,模型性能越好。通常精确率越高,召回率越低。
2. 平均精度(AP)与 mAP
AP(Average Precision):对P-R曲线进行积分,近似计算公式为
AP=∑k=1NP(k)⋅Δr(k)AP = \sum_{k=1}^{N} P(k) \cdot \Delta r(k)AP=∑k=1NP(k)⋅Δr(k)
其中 (P(k)) 是识别出k个样本时的精确率,(\Delta r(k)) 是召回率的变化量。
mAP(mean Average Precision):对所有类别的AP取均值,是多类别目标检测的标准评价指标。
实际计算时,先对模型输出的所有预测按置信度排序,然后依次计算P-R曲线上的点。
四、目标检测与YOLO算法
目标检测任务
不仅要识别图像中的物体类别,还要定位物体的边界框。挑战在于:物体尺度变化大、姿态多样、可能出现任意位置、且存在多类别。
发展脉络
- R-CNN:区域提议 + CNN分类(慢)
- SPP-Net:空间金字塔池化,加速特征提取
- Fast R-CNN:共享卷积特征,引入RoI池化
- Faster R-CNN:区域提议网络(RPN)端到端训练
- YOLO:回归思想,一步到位
YOLO(You Only Look Once)核心思想
将目标检测视为回归问题,直接在图像上预测边界框和类别概率。
基本流程:
- 将输入图像划分为 S×S 的网格
- 每个网格负责预测 B 个边界框(含位置、大小、置信度)
- 同时预测 C 个类别的条件概率
- 最后通过非极大抑制(NMS)去除冗余框
优点:
- 极快(45 fps,快速版本达155 fps)
- 全局推理,背景误检少
- 泛化能力强
损失函数:包含坐标误差、置信度误差和分类误差,使用平方和误差。
YOLO后续版本(v2~v8)不断改进,已成为工业界最流行的实时检测框架之一。
总结与思考
| 模型/概念 | 核心贡献 | 关键技术 |
|---|---|---|
| AlexNet | 深度CNN成功应用 | ReLU、Dropout、数据增强、双GPU |
| VGG | 小卷积核堆叠 | 3×3 conv、规整结构 |
| ResNet | 极深网络训练 | 残差块、恒等捷径连接 |
| 常用数据集 | 提供标准benchmark | MNIST、CIFAR、VOC、COCO、ImageNet |
| mAP | 检测评价标准 | P-R曲线、AP平均 |
| YOLO | 实时目标检测 | 网格划分、回归思想 |
课后思考:
- 既然浅层网络已经可用,为什么要不断加深网络?(答案:深层网络能学习更抽象、更具判别力的特征,ResNet解决了梯度消失问题)
- 尝试推导卷积层和池化层的误差反向传播公式(参见课件详细推导)
- 解释VGG-16中各层尺寸和参数变化规律
本文为课堂学习总结,详细公式推导和代码实现请参考原课件及配套材料。
如有错误或遗漏,欢迎交流指正!
更多推荐




所有评论(0)