一、卷积神经网络基础

1.1 为什么需要卷积层?

全连接网络参数过多,例如输入 1000×1000图像、隐含层 1M 节点时,参数数量达 10^12 量级,容易过拟合且难以收敛。卷积层通过局部连接权值共享大幅减少参数。

1.2 卷积操作

  • 卷积核:在输入上滑动,计算对应位置的点积和。

  • 填充(Padding):在边界补0或复制像素,保持输出尺寸。

  • 步长(Stride):卷积核每次移动的步数,步长>1可降采样。

  • 多通道卷积:每个通道用不同卷积核,结果相加。

1.3 池化(Pooling)

  • 作用:降低特征维度,提高平移不变性。

  • 常见类型:最大池化(Max Pooling)、平均池化(Mean Pooling)。

  • 窗口大小 2×2、步长2 时,特征图尺寸减半。

1.4 卷积神经网络的反向传播

对于卷积层,误差传播涉及局部感受野。输出层误差为:

\delta_i^{[l]} = f'(z_i^{[l]}) e_i

隐含层误差反向传播:

\delta_i^{[l]} = \left[ \sum_{j=1}^{m} w_{ji}^{[l+1]} \delta_j^{[l+1]} \right] f'(z_i^{[l]})

权值更新:

\Delta w_{ij}^{[l]} = \alpha \cdot \delta_i^{[l]} \cdot a_j^{[l-1]}

池化层的反向传播:平均池化将误差均分到池化窗口;最大池化只将误差回传给窗口中最大值的位置。

二、经典卷积神经网络

2.1 LeNet-5

  • 结构:输入 → Conv1 → Pool1 → Conv2 → Pool2 → FC3 → FC4 → Softmax

  • 特点:平均池化,Sigmoid/Tanh激活,约6万参数,用于手写数字识别。

2.2 AlexNet

  • 贡献:使用ReLU激活函数,最大池化,数据增强(随机裁剪、水平翻转、光照抖动),双GPU并行。

  • 结构:5个卷积层 + 3个全连接层,约6000万参数。

2.3 VGG-16

  • 特点:全部使用 3×3小卷积核,网络深度达到16~19层,结构规整,参数约1.38亿。

2.4 残差网络(ResNet)

  • 背景:网络过深会出现梯度消失(梯度在反向传播中指数级衰减)。

  • 核心思想:引入跳跃连接,让浅层特征直接绕过权重层传到深层。

  • 残差块:输出为 F(x)+x,其中 F(x)为卷积层学习到的残差映射。

  • 优势:缓解梯度消失,可训练极深网络(如152层)。

三、常用数据集

数据集 规模 用途
MNIST 6万训练+1万测试,28×28灰度 手写数字识别
Fashion-MNIST 同上,但为服装图像 替代MNIST的基准
CIFAR-10 5万训练+1万测试,32×32彩色 10类物体分类
PASCAL VOC 20类,约1.1万图像 目标检测、分割
MS COCO 33万图像,80类,超150万个体 检测、分割、关键点
ImageNet 1400万图像,2.1万类 大规模图像分类

四、模型评估指标

  • 精确率(Precision)P = \frac{TP}{TP+FP},预测为正例中实际为正的比例。

  • 召回率(Recall)R = \frac{TP}{TP+FN},实际正例中被正确检测的比例。

  • AP(Average Precision):P-R曲线下的面积。

AP = \sum_{k=1}^{N} P(k) \Delta r(k)

  • mAP:所有类别AP的平均值,常用于目标检测任务。

五、目标检测与YOLO

目标检测需要同时完成定位(bounding box)分类。YOLO(You Only Look Once)将检测视为回归问题,直接在图像上划分网格,每个网格预测边界框和类别概率,实现端到端的单次前向推理。

六、全卷积网络与语义分割

6.1 语义分割任务

对图像中的每个像素分类,输出与输入同尺寸的标签图。

6.2 全卷积网络(FCN)

  • 核心思想:将传统CNN最后的全连接层替换为卷积层,使网络可以接受任意尺寸输入,并输出与输入尺寸相同的特征图。

  • 上采样(转置卷积)将粗特征图恢复至原图尺寸,实现像素级分类。

  • 跳跃连接:融合浅层细节与深层语义,提升分割精度。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐