神经网络与深度学习 课程 第二周 课程总结
一、卷积神经网络基础
1.1 为什么需要卷积层?
全连接网络参数过多,例如输入 1000×1000图像、隐含层 1M 节点时,参数数量达 10^12 量级,容易过拟合且难以收敛。卷积层通过局部连接和权值共享大幅减少参数。
1.2 卷积操作
-
卷积核:在输入上滑动,计算对应位置的点积和。
-
填充(Padding):在边界补0或复制像素,保持输出尺寸。
-
步长(Stride):卷积核每次移动的步数,步长>1可降采样。
-
多通道卷积:每个通道用不同卷积核,结果相加。
1.3 池化(Pooling)
-
作用:降低特征维度,提高平移不变性。
-
常见类型:最大池化(Max Pooling)、平均池化(Mean Pooling)。
-
窗口大小 2×2、步长2 时,特征图尺寸减半。
1.4 卷积神经网络的反向传播
对于卷积层,误差传播涉及局部感受野。输出层误差为:
隐含层误差反向传播:
权值更新:
池化层的反向传播:平均池化将误差均分到池化窗口;最大池化只将误差回传给窗口中最大值的位置。
二、经典卷积神经网络
2.1 LeNet-5
-
结构:输入 → Conv1 → Pool1 → Conv2 → Pool2 → FC3 → FC4 → Softmax
-
特点:平均池化,Sigmoid/Tanh激活,约6万参数,用于手写数字识别。
2.2 AlexNet
-
贡献:使用ReLU激活函数,最大池化,数据增强(随机裁剪、水平翻转、光照抖动),双GPU并行。
-
结构:5个卷积层 + 3个全连接层,约6000万参数。
2.3 VGG-16
-
特点:全部使用 3×3小卷积核,网络深度达到16~19层,结构规整,参数约1.38亿。
2.4 残差网络(ResNet)
-
背景:网络过深会出现梯度消失(梯度在反向传播中指数级衰减)。
-
核心思想:引入跳跃连接,让浅层特征直接绕过权重层传到深层。
-
残差块:输出为 F(x)+x,其中 F(x)为卷积层学习到的残差映射。
-
优势:缓解梯度消失,可训练极深网络(如152层)。
三、常用数据集
| 数据集 | 规模 | 用途 |
|---|---|---|
| MNIST | 6万训练+1万测试,28×28灰度 | 手写数字识别 |
| Fashion-MNIST | 同上,但为服装图像 | 替代MNIST的基准 |
| CIFAR-10 | 5万训练+1万测试,32×32彩色 | 10类物体分类 |
| PASCAL VOC | 20类,约1.1万图像 | 目标检测、分割 |
| MS COCO | 33万图像,80类,超150万个体 | 检测、分割、关键点 |
| ImageNet | 1400万图像,2.1万类 | 大规模图像分类 |
四、模型评估指标
-
精确率(Precision):
,预测为正例中实际为正的比例。
-
召回率(Recall):
,实际正例中被正确检测的比例。
-
AP(Average Precision):P-R曲线下的面积。
-
mAP:所有类别AP的平均值,常用于目标检测任务。
五、目标检测与YOLO
目标检测需要同时完成定位(bounding box)和分类。YOLO(You Only Look Once)将检测视为回归问题,直接在图像上划分网格,每个网格预测边界框和类别概率,实现端到端的单次前向推理。
六、全卷积网络与语义分割
6.1 语义分割任务
对图像中的每个像素分类,输出与输入同尺寸的标签图。
6.2 全卷积网络(FCN)
-
核心思想:将传统CNN最后的全连接层替换为卷积层,使网络可以接受任意尺寸输入,并输出与输入尺寸相同的特征图。
-
上采样(转置卷积)将粗特征图恢复至原图尺寸,实现像素级分类。
-
跳跃连接:融合浅层细节与深层语义,提升分割精度。
更多推荐




所有评论(0)