引言

深度学习作为人工智能的核心技术,其基础在于神经网络的设计与训练。本文将从多层前馈网络与误差反向传播(BP)算法出发,逐步过渡到卷积神经网络(CNN)的基本原理与经典架构,帮助大家理清知识脉络。


第一部分:多层前馈网络与BP算法

1. 为什么需要多层感知机?

单层感知机无法解决线性不可分问题,例如经典的**XOR(异或)**问题。Minsky(1969)指出这一点,促使研究者转向多层结构。

解决方案:在输入层和输出层之间加入一个或多个隐层,构成多层感知机(MLP)。三层网络(输入层-隐层-输出层)即可解决XOR问题,通过隐层神经元组合出非线性决策边界。

重要定理

  • 三层阈值节点网络可以实现任意二值逻辑函数。
  • 三层S型非线性节点网络可以一致逼近紧集上的连续函数。

2. 多层前馈网络与BP算法

多层前馈网络是指信号从输入层经隐层向输出层单向传播,相邻层之间全连接。反向传播(Backpropagation, BP)算法是其标准训练方法,本质是梯度下降法在多层网络中的应用。

BP算法流程

  1. 正向传播:输入信号经过各层计算得到输出,若与期望一致则结束;否则进入反向传播。
  2. 反向传播:将输出误差沿原连接通路反向计算,利用梯度下降法调整各层权值和阈值,使误差减小。

优缺点

  • 优点:学习完全自主,可逼近任意非线性函数。
  • 缺点:不保证全局收敛、收敛速度慢、学习率难选、网络结构(层数/节点数)设计依赖经验。

第二部分:卷积神经网络基础

1. 全连接网络的问题

对于图像等高维输入,全连接网络参数爆炸。例如:输入 1000×1000 图像,隐层1M节点,则输入到隐层的参数数量高达 10^12 量级,导致计算慢、难收敛、易过拟合

解决思路

  • 局部连接:每个神经元只连接到输入图像的局部区域(感受野)。
  • 权值共享:同一个卷积核在整个图像上滑动,极大减少参数量。

这构成了**卷积神经网络(CNN)**的基本思想。

2. 卷积基本概念

  • 卷积核(filter):一个小尺寸矩阵,与输入图像局部区域做点积,提取特征。
  • 填充(Padding):在输入边界补零或复制像素,以控制输出尺寸。
  • 步长(Stride):卷积核滑动的步幅。
  • 多通道卷积:如RGB三通道,每个卷积核与所有输入通道分别卷积后求和。

3. 池化层(下采样)

通过局部统计(最大池化、平均池化)降低特征图尺寸,减少参数量,增强平移不变性。

4. 卷积神经网络的反向传播

BP算法同样适用于CNN,但需要处理卷积层和池化层的梯度回传:

  • 池化层:无权重,平均池化误差均匀回传;最大池化误差只回传给窗口中最大值的位置。
  • 卷积层:梯度计算涉及卷积操作,形式上类似于对误差图与输入特征图做相关运算。

5. LeNet-5 —— CNN的开山之作

Yann LeCun 提出的 LeNet-5 用于手写数字识别,结构如下:

类型 说明
C1 卷积层 6个5×5卷积核,输出28×28×6
S2 池化层 平均池化,2×2,步长2
C3 卷积层 16个5×5卷积核
S4 池化层 平均池化
C5 卷积层 120个5×5卷积核(实际是全连接)
F6 全连接层 84个神经元
Output RBF单元 10个类别

特点:无填充、平均池化、Sigmoid/tanh激活函数、参数约6万。


第三部分:经典卷积神经网络

1. AlexNet —— 深度学习的复兴

2012年ImageNet竞赛冠军,首次证明GPU训练深层CNN的威力。

主要改进

  • 使用ReLU激活函数,缓解梯度消失,加速收敛。
  • Dropout:全连接层后随机丢弃部分神经元,防止过拟合。
  • 数据增强:随机裁剪、水平翻转、颜色抖动等。
  • 双GPU并行:将模型拆分到两块GPU上训练。

网络结构:5个卷积层(部分后跟最大池化)+ 3个全连接层,约6000万参数。

2. VGG-16 —— 更深的统一架构

牛津大学Visual Geometry Group提出,核心思想是使用小卷积核(3×3)堆叠,增加网络深度(16~19层)。

优点:相同感受野下参数量更少,非线性更强。VGG-16在ImageNet分类和定位任务中取得优异成绩。

3. 残差网络(ResNet)—— 突破深度瓶颈

问题:网络过深会导致梯度消失,深层网络反而比浅层网络误差更大。

解决方案:引入残差块,让网络学习恒等映射的残差 F(x) = H(x) - x,使得梯度可以沿“捷径连接”直接回传。

残差块结构
输入 → 两个卷积层 → 输出与原始输入相加 → ReLU

ResNet-50/101/152等超深网络由此成为可能,并在多个任务上刷新纪录。


总结与思考

网络 核心贡献 关键技术
BP网络 多层感知机训练 梯度下降、误差反向传播
LeNet-5 CNN雏形 卷积+池化+全连接
AlexNet 深度CNN复兴 ReLU、Dropout、数据增强
VGG 小卷积核堆叠 3×3卷积、深层结构
ResNet 极深网络训练 残差连接、恒等映射
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐