神经网络与深度学习上课记录(一)
引言
深度学习作为人工智能的核心技术,其基础在于神经网络的设计与训练。本文将从多层前馈网络与误差反向传播(BP)算法出发,逐步过渡到卷积神经网络(CNN)的基本原理与经典架构,帮助大家理清知识脉络。
第一部分:多层前馈网络与BP算法
1. 为什么需要多层感知机?
单层感知机无法解决线性不可分问题,例如经典的**XOR(异或)**问题。Minsky(1969)指出这一点,促使研究者转向多层结构。
解决方案:在输入层和输出层之间加入一个或多个隐层,构成多层感知机(MLP)。三层网络(输入层-隐层-输出层)即可解决XOR问题,通过隐层神经元组合出非线性决策边界。
重要定理:
- 三层阈值节点网络可以实现任意二值逻辑函数。
- 三层S型非线性节点网络可以一致逼近紧集上的连续函数。
2. 多层前馈网络与BP算法
多层前馈网络是指信号从输入层经隐层向输出层单向传播,相邻层之间全连接。反向传播(Backpropagation, BP)算法是其标准训练方法,本质是梯度下降法在多层网络中的应用。
BP算法流程:
- 正向传播:输入信号经过各层计算得到输出,若与期望一致则结束;否则进入反向传播。
- 反向传播:将输出误差沿原连接通路反向计算,利用梯度下降法调整各层权值和阈值,使误差减小。
优缺点:
- 优点:学习完全自主,可逼近任意非线性函数。
- 缺点:不保证全局收敛、收敛速度慢、学习率难选、网络结构(层数/节点数)设计依赖经验。
第二部分:卷积神经网络基础
1. 全连接网络的问题
对于图像等高维输入,全连接网络参数爆炸。例如:输入 1000×1000 图像,隐层1M节点,则输入到隐层的参数数量高达 10^12 量级,导致计算慢、难收敛、易过拟合。
解决思路:
- 局部连接:每个神经元只连接到输入图像的局部区域(感受野)。
- 权值共享:同一个卷积核在整个图像上滑动,极大减少参数量。
这构成了**卷积神经网络(CNN)**的基本思想。
2. 卷积基本概念
- 卷积核(filter):一个小尺寸矩阵,与输入图像局部区域做点积,提取特征。
- 填充(Padding):在输入边界补零或复制像素,以控制输出尺寸。
- 步长(Stride):卷积核滑动的步幅。
- 多通道卷积:如RGB三通道,每个卷积核与所有输入通道分别卷积后求和。
3. 池化层(下采样)
通过局部统计(最大池化、平均池化)降低特征图尺寸,减少参数量,增强平移不变性。
4. 卷积神经网络的反向传播
BP算法同样适用于CNN,但需要处理卷积层和池化层的梯度回传:
- 池化层:无权重,平均池化误差均匀回传;最大池化误差只回传给窗口中最大值的位置。
- 卷积层:梯度计算涉及卷积操作,形式上类似于对误差图与输入特征图做相关运算。
5. LeNet-5 —— CNN的开山之作
Yann LeCun 提出的 LeNet-5 用于手写数字识别,结构如下:
| 层 | 类型 | 说明 |
|---|---|---|
| C1 | 卷积层 | 6个5×5卷积核,输出28×28×6 |
| S2 | 池化层 | 平均池化,2×2,步长2 |
| C3 | 卷积层 | 16个5×5卷积核 |
| S4 | 池化层 | 平均池化 |
| C5 | 卷积层 | 120个5×5卷积核(实际是全连接) |
| F6 | 全连接层 | 84个神经元 |
| Output | RBF单元 | 10个类别 |
特点:无填充、平均池化、Sigmoid/tanh激活函数、参数约6万。
第三部分:经典卷积神经网络
1. AlexNet —— 深度学习的复兴
2012年ImageNet竞赛冠军,首次证明GPU训练深层CNN的威力。
主要改进:
- 使用ReLU激活函数,缓解梯度消失,加速收敛。
- Dropout:全连接层后随机丢弃部分神经元,防止过拟合。
- 数据增强:随机裁剪、水平翻转、颜色抖动等。
- 双GPU并行:将模型拆分到两块GPU上训练。
网络结构:5个卷积层(部分后跟最大池化)+ 3个全连接层,约6000万参数。
2. VGG-16 —— 更深的统一架构
牛津大学Visual Geometry Group提出,核心思想是使用小卷积核(3×3)堆叠,增加网络深度(16~19层)。
优点:相同感受野下参数量更少,非线性更强。VGG-16在ImageNet分类和定位任务中取得优异成绩。
3. 残差网络(ResNet)—— 突破深度瓶颈
问题:网络过深会导致梯度消失,深层网络反而比浅层网络误差更大。
解决方案:引入残差块,让网络学习恒等映射的残差 F(x) = H(x) - x,使得梯度可以沿“捷径连接”直接回传。
残差块结构:
输入 → 两个卷积层 → 输出与原始输入相加 → ReLU
ResNet-50/101/152等超深网络由此成为可能,并在多个任务上刷新纪录。
总结与思考
| 网络 | 核心贡献 | 关键技术 |
|---|---|---|
| BP网络 | 多层感知机训练 | 梯度下降、误差反向传播 |
| LeNet-5 | CNN雏形 | 卷积+池化+全连接 |
| AlexNet | 深度CNN复兴 | ReLU、Dropout、数据增强 |
| VGG | 小卷积核堆叠 | 3×3卷积、深层结构 |
| ResNet | 极深网络训练 | 残差连接、恒等映射 |
更多推荐




所有评论(0)