深度学习八大经典神经网络学习笔记
深度学习八大经典神经网络学习笔记
目录
- 前置基础(CNN、自编码器,零基础必看)
- ResNet 残差网络(通用视觉骨干)
- FCN 全卷积网络(初代语义分割)
- U-Net 对称编解码分割网络(医学分割标杆)
- YOLOv8 一阶段目标检测网络(工程落地)
- RNN 基础循环神经网络(时序入门)
- LSTM 长短期记忆网络(解决RNN梯度消失)
- GRU 门控循环单元(轻量化LSTM)
- Transformer 自注意力通用网络(图像/文本/时序大一统)
- 八大网络横向对比汇总
- 通用训练原理、损失函数、高频报错解决方案
- 零基础学习顺序与实操实验规划
前置基础知识(0基础入门铺垫)
1. CNN核心基础
卷积、池化、上采样、padding、stride、通道、特征图
- 卷积层:提取局部纹理、边缘、形状特征,3×3卷积是标准;
- 池化层(最大池化/平均池化):下采样,缩小图像尺寸,减少计算量,但丢失像素细节;
- 上采样:放大特征图,用于分割网络恢复原图分辨率;
- 填充padding:卷积前后图片尺寸不变,避免边缘信息丢失;
尺寸计算公式:Output=Input+2Padding−KernelStride+1Output=\frac{Input+2Padding-Kernel}{Stride}+1Output=StrideInput+2Padding−Kernel+1
2. 自编码器AutoEncoder
结构:编码器(下采样压缩图像)+ 解码器(上采样重建图像)
- 编码器:不断卷积+池化,把原图压缩为低维特征向量;
- 解码器:上采样还原图像,输入与输出尺寸完全一致;
- 缺陷:仅简单拼接全局特征,无浅层细节复用,分割效果差;
U-Net、FCN均基于自编码器结构改良。
3. 深度学习统一训练流程(所有网络通用)
- 数据预处理:归一化、划分训练/验证集、分批加载;
- 梯度清零
optimizer.zero_grad(); - 前向传播:数据输入网络,输出预测结果;
- 损失计算:对比预测值与真实标签;
- 反向传播
loss.backward():链式法则计算梯度; - 参数更新
optimizer.step():梯度下降更新权重; - 循环多轮训练,观察训练损失、验证损失变化。
4. 梯度消失/梯度爆炸(贯穿八大网络核心痛点)
- 梯度消失:深层网络、长时序序列,梯度数值无限趋近0,权重无法更新,模型停止学习;
- 梯度爆炸:梯度数值过大,损失剧烈震荡,模型不收敛;
各网络分别使用残差、门控、自注意力、梯度裁剪解决该问题。
一、ResNet 残差网络(通用视觉骨干网络)
1. 研究背景与痛点
早期CNN存在网络退化现象:网络层数不断加深,训练集精度反而下降。
原因:深层网络反向传播时梯度逐层衰减,浅层权重无法更新。
2015年ResNet提出残差跳跃连接,允许搭建几十、上百层深度网络,成为所有视觉任务通用主干。
2. 核心创新:残差块 Shortcut 跳跃连接
2.1 BasicBlock(ResNet18/34使用,浅层网络)
数学表达式:H(x)=F(x)+xH(x)=F(x)+xH(x)=F(x)+x
- xxx:残差块输入原始特征;
- F(x)F(x)F(x):两层卷积+BN+ReLU学习到的残差映射;
- H(x)H(x)H(x):模块最终输出;
逻辑:网络不需要学习完整映射,只需要学习输入与输出之间的差值,梯度可通过shortcut直接回传,不会消失。
维度不匹配处理:
当输入输出通道、尺寸不一致时,增加downsample1×1卷积,同步调整通道与步长,保证F(x)F(x)F(x)与xxx可以相加。
2.2 Bottleneck瓶颈块(ResNet50/101深层网络)
三层卷积结构:1×1降维 → 3×3特征提取 → 1×1升维
作用:大幅减少深层网络参数量与计算量,适合超深网络。
3. ResNet完整网络结构(以ResNet18为例)
- 输入层:3通道RGB图像;
- 初始卷积块:7×7卷积(stride=2)+ BN + ReLU + 3×3最大池化,快速下采样;
- 四层残差层layer1~layer4:逐层下采样,通道数64→128→256→512;
- 全局平均池化GAP:替代传统全连接层,不限定输入图像尺寸,减少参数量;
- 全连接输出头:输出分类类别概率。
4. 理论知识点详细拆解
- He初始化:卷积层权重专用初始化方式,适配ReLU激活,避免深层网络收敛缓慢;
- 迁移学习:使用ImageNet预训练ResNet权重,再微调适配自定义数据集,大幅减少训练轮次;
- 骨干复用:ResNet可直接替换YOLO、U-Net的编码器主干,提升特征提取能力;
- 网络区分:
- ResNet18/34:轻量,本地电脑训练无压力;
- ResNet50/101:精度更高,显存占用大。
5. 优缺点完整总结
优点
- 彻底解决深层CNN梯度消失、网络退化问题;
- 通用性极强,分类、分割、检测均可作为主干;
- 预训练权重丰富,迁移学习落地简单;
- 结构标准化,代码易复现、调试简单。
缺点
- 纯卷积仅捕捉局部特征,远距离全局依赖建模能力弱;
- 深层ResNet50训练显存开销高;
- 无多尺度特征融合原生设计,做检测任务需额外搭配FPN。
6. 适用场景
图像分类、医学影像特征提取、YOLO系列骨干替换、分割网络编码器主干。
7. 实操实验要点
- 对照实验:普通深层CNN vs ResNet,同步训练20轮,对比损失与精度,直观观察网络退化;
- 替换YOLOv8骨干:将原生C2f主干替换为ResNet18,测试自定义数据集检测精度变化;
- 高频报错与解决方案:
- shortcut通道维度不匹配:添加1×1卷积downsample;
- 深层模型收敛极慢:使用He权重初始化;
- 替换骨干后精度下降:统一多尺度特征图尺寸。
8. 核心代码逻辑
构建残差块、多层堆叠、自适应下采样、全局平均池化分类头。
二、FCN 全卷积语义分割网络(首个端到端像素分割模型)
1. 诞生背景
传统CNN最后一层为全连接层,输出一维向量,只能输出整张图片类别,无法实现像素级预测。
FCN核心创新:全部使用卷积层替代全连接层,输入图像尺寸无限制,输出和原图同等分辨率的分割图,开创语义分割领域。
2. 完整网络结构
(1)编码器(下采样)
基于VGG16卷积网络,提取三层关键特征图:
- pool3:下采样8倍,浅层细节特征;
- pool4:下采样16倍,中层特征;
- pool5:下采样32倍,深层语义特征。
(2)全卷积转换
将VGG末尾全连接层替换为1×1卷积,不改变特征图尺寸,仅调整通道数为分割类别数。
(3)反卷积上采样
转置卷积实现图像放大,恢复分辨率;
(4)多阶段特征融合(FCN-32s / FCN-16s / FCN-8s)
- FCN-32s:仅使用pool5深层特征,直接32倍上采样,分割边缘极度模糊;
- FCN-16s:pool5上采样后,与pool4中层特征相加融合,细节小幅提升;
- FCN-8s:融合pool5、pool4、pool3三层特征,浅层轮廓信息最丰富,分割效果最优。
3. 核心理论知识点
- 全卷积特性:输入任意尺寸图像均可推理,无需固定输入;
- 1×1卷积作用:通道维度变换,不改变特征图长宽;
- 逐像素交叉熵损失:每个像素独立分类,适用于二分类/多分类分割;
- 特征相加融合:浅层、深层特征数值直接叠加。
4. 优缺点
优点
- 分割领域开山之作,是U-Net、DeepLab所有分割模型的理论基础;
- 结构简洁,训练速度快,适合入门学习;
- 无固定尺寸限制,适配各类数据集。
缺点
- 转置卷积上采样易产生棋盘格伪影,分割边缘锯齿、模糊;
- 特征融合为逐元素相加,浅层细节保留能力弱;
- 无对称编解码结构,小目标分割精度差于U-Net。
5. 适用场景
图像分割教学基线、简单自然图像分割、轻量化快速分割项目。
6. 实操踩坑与优化方案
- 棋盘格伪影:废弃转置卷积,使用双线性插值上采样+普通3×3卷积;
- 特征融合尺寸错位:统一所有卷积层padding、stride参数;
- 小目标分割效果差:增加随机缩放、翻转、灰度扰动数据增强。
7. 实操实验规划
- 复用医学灰度影像数据集,搭建FCN-32s/16s/8s三组对照;
- 可视化三类模型分割掩码,对比边缘精细程度;
- FCN与U-Net横向对比训练速度、分割精度。
三、U-Net 对称编解码分割网络(医学分割行业标准)
1. 设计背景
基于自编码器+FCN思想改良,专为小样本医学影像设计(CT、病理切片、细胞分割)。
医学数据集普遍标注少,FCN分割边缘丢失严重,U-Net通过跳跃拼接Concatenate大幅保留浅层像素细节。
2. 三段式完整结构
1)编码器(下采样路径,左半部分)
4组卷积块,每组2次3×3卷积+BN+ReLU;每一组结束使用2×2最大池化下采样,分辨率减半、通道翻倍;
每一层输出特征图完整保存,用于后续跳跃连接。
2)瓶颈层
网络最底部,分辨率最低、通道数最多,融合全局深层语义特征。
3)解码器(上采样路径,右半部分)
- 转置卷积2倍上采样,放大特征图尺寸;
- 跳跃拼接:将编码器同层级浅层特征图与解码器当前特征图在通道维度拼接;
- 两层卷积融合拼接后的特征,逐层恢复图像细节;
- 输出层1×1卷积,输出单通道分割掩码(二分类医学分割)。
3. 核心创新点详细解析
- 对称编解码结构:编码器与解码器层数、通道完全对称,结构规整易搭建;
- 跳跃拼接(Concatenate):通道维度直接拼接,相比FCN的相加融合,完整保留浅层边缘、纹理信息,解决池化造成的像素丢失;
- 适配小样本:参数量小,几百张医学影像即可收敛。
4. 损失函数适配
- 二分类交叉熵:常规分割任务;
- Dice Loss:解决医学影像前景背景样本不均衡,优化边缘分割效果;
- 组合损失:交叉熵+Dice Loss,训练更稳定。
5. 优缺点
优点
- 跳跃拼接完美保留轮廓细节,分割边缘精度远超FCN;
- 小数据集表现优异,医学影像领域通用标准;
- 结构对称,代码逻辑清晰,调试难度低;
- 可拓展变体:UNet++、TransUNet等。
缺点
- 仅适用于像素分割,无法完成检测、分类任务;
- 超高分辨率医学图像训练显存占用高;
- 无原生多尺度融合,远距离大区域分割效果一般。
6. 适用场景
医学CT/病理切片分割、遥感地物分割、工业产品缺陷像素检测。
7. 实操常见问题
- 跳跃连接通道维度不匹配:严格对齐每层卷积输出通道数量;
- 训练损失持续震荡:降低学习率、适当增大batch size;
- 分割掩码边缘模糊、过拟合:引入Dice损失、扩充数据增强策略。
8. 实操实验内容
- 灰度医学影像数据集处理、划分训练/验证集;
- 手动逐层搭建完整U-Net,计算每层特征图尺寸;
- 完整训练15轮,绘制训练/验证损失曲线;
- 原图、真实掩码、预测结果可视化对比;
- 优化实验:引入Dice损失、数据增强,改善分割效果。
四、YOLOv8 一阶段目标检测网络(工程落地首选)
1. 检测任务基础概念
目标检测两大输出:目标边界框坐标、物体类别、置信度;
两类检测模型:
- 两阶段(Faster R-CNN):先生成候选框再分类,精度高、速度慢;
- 一阶段YOLO系列:单次前向传播同时输出框与类别,速度快,适合实时工程。
2. YOLOv8三大核心模块
1)Backbone骨干网络(C2f模块)
堆叠C2f卷积块,多层下采样提取多尺度特征,相比YOLOv5的C3模块梯度流通更好,小目标特征提取能力提升。
2)PAN-FPN 特征融合颈层
自上而下:高层语义特征向下传递;
自下而上:低层细节特征向上融合;
输出三种尺寸特征图,分别对应大、中、小目标:
- 20×20:大物体;
- 40×40:中等物体;
- 80×80:微小物体。
3)Decoupled Head 解耦检测头
Anchor-Free无锚框设计,分类分支、回归分支完全分离,不需要手动设置锚框尺寸,大幅降低调参难度。
3. 配套推理流程
- 模型前向推理输出大量预测框;
- NMS非极大值抑制:过滤重叠冗余检测框,保留置信度最高框;
- 置信度阈值筛选:过滤低置信误检框。
4. 训练相关理论
- 复合损失:分类损失+边界框回归损失+置信度损失;
- 数据集标注格式:txt文本标注(类别+归一化xywh);
- 轻量化版本:n/s/m/l/x,nano版本可部署移动端。
5. 优缺点
优点
- 速度与精度均衡,工业落地主流算法;
- ultralytics官方工具链完善:数据集处理、训练、推理、模型导出一站式;
- 无锚框设计,减少锚框适配调试工作量;
- 支持自定义数据集,零基础易上手。
缺点
- 超微小目标检测精度弱于两阶段检测网络;
- 数据集标注、路径配置错误极易导致训练直接报错;
- 密集遮挡目标漏检、误检较多。
6. 适用场景
实时摄像头物体识别、工业缺陷检测、自动驾驶目标识别、自定义物品检测项目。
7. 实操踩坑完整总结
- 标注文件路径错误、类别数量不匹配:修改数据集yaml配置文件;
- 大量低置信冗余检测框:调高conf置信阈值;
- 图片输入通道错乱:统一输入RGB三通道图像;
- 锚框与目标尺寸不匹配:开启自适应锚框计算。
8. 实操实验内容
- 制作自定义小型数据集,完成图片标注;
- 加载轻量化预训练权重,修改类别参数;
- 设置迭代轮次、输入尺寸、置信阈值启动训练;
- 单图/批量图片推理,可视化检测结果;
- 进阶实验:模型轻量化、批量推理、模型导出部署。
五、RNN 基础循环神经网络(时序任务入门)
1. 适用数据类型
有序序列数据:文本句子、时间序列、语音信号;
CNN只能处理独立图像,无法记录前后顺序信息,RNN引入隐藏状态存储历史时序信息。
2. 核心结构与数学公式
输入:xtx_txt 第t时刻序列数据
隐藏状态:hth_tht 存储当前与历史信息
更新公式:ht=tanh(Wxhxt+Whhht−1)h_t = tanh(W_{xh}x_t + W_{hh}h_{t-1})ht=tanh(Wxhxt+Whhht−1)
输出:yt=Whyhty_t = W_{hy}h_tyt=Whyht
逻辑:每一步计算依赖上一时刻隐藏状态ht−1h_{t-1}ht−1,实现时序记忆。
3. 致命缺陷:长序列梯度消失
序列长度过长时,梯度多次乘以小于1的权重,梯度无限趋近于0;
模型只能记住最近几步信息,远距离历史数据完全丢失,无法处理长文本、长期时序预测。
4. 优缺点
优点
- 结构极简,时序建模入门最佳模型;
- 参数量极小,训练速度快;
缺点
- 长序列梯度消失,长距离依赖完全失效;
- 串行逐时间步计算,无法并行加速,训练效率低。
5. 适用场景
极短文本分类、简单时序预测、课堂教学演示。
6. 实操问题
- 张量维度不匹配:统一输入shape
[batch_size, seq_len, embed_dim]; - 长序列训练损失剧烈震荡:梯度裁剪、降低学习率。
六、LSTM 长短期记忆网络(RNN改进版)
1. 解决RNN痛点
引入细胞状态Cell State作为信息高速通道,搭配三大门控机制控制信息留存/丢弃,梯度可跨长序列传递,彻底解决长序列梯度消失。
2. 三大门控详细作用
- 遗忘门 Forget Gate
sigmoid输出0~1,控制上一时刻细胞状态保留多少信息;数值越接近0,丢弃越多历史信息。 - 输入门 Input Gate
控制当前时刻新数据多少信息存入细胞状态;结合tanh生成新候选信息。 - 输出门 Output Gate
控制细胞状态的信息多少传递到当前隐藏状态hth_tht,作为当前时刻输出。
3. 细胞状态更新逻辑
细胞状态Ct贯穿全部时序步,梯度流通不受限制,长期记忆稳定保存。
4. 优缺点
优点
- 稳定捕捉长距离时序依赖,长文本、长时间序列标准基线;
- 门控机制有效抑制梯度消失与梯度爆炸;
缺点
- 三门控结构复杂,计算量大,训练速度慢;
- 参数量大,硬件开销更高。
5. 适用场景
长文本情感分类、气象/股票长时间序列预测、语音识别。
6. 实操实验
搭建文本二分类、单变量时序预测实验,对比RNN、LSTM损失与精度,直观体现LSTM优势。
七、GRU 门控循环单元(轻量化LSTM)
1. 简化设计思路
合并LSTM遗忘门与输入门为更新门,新增重置门;删除独立细胞状态,仅保留隐藏状态,大幅简化计算。
两个核心门控
- 更新门 Update Gate:决定保留多少历史隐藏状态;
- 重置门 Reset Gate:控制历史信息对当前输入的影响程度。
2. 对比LSTM优势
参数量减少约30%,训练速度显著提升,精度与LSTM差距极小,轻量化场景首选。
3. 优缺点
优点
训练速度快、调参简单、显存占用低;
缺点
超长距离序列建模能力略弱于LSTM。
4. 适用场景
嵌入式设备时序预测、轻量文本分类、实时时序数据处理。
5. RNN/LSTM/GRU横向对比表
| 模型 | 核心结构 | 长序列能力 | 训练速度 | 参数量 |
|---|---|---|---|---|
| RNN | 单一循环单元 | 极差(梯度消失) | 最快 | 最小 |
| LSTM | 遗忘/输入/输出三门 | 最优 | 最慢 | 最大 |
| GRU | 更新门+重置门 | 良好 | 中等 | 中等 |
6. 时序网络通用实操问题
- 序列截断长度不合理:过长梯度震荡,过短丢失关键信息;
- 门控网络学习率敏感:选用更小学习率训练。
八、Transformer 自注意力通用网络(图像/文本/时序大一统)
1. 诞生背景
CNN仅捕捉局部特征、RNN串行计算、长依赖效果差;Transformer依靠自注意力机制,序列任意位置元素直接交互,全局信息一次性建模,完全并行训练,是大模型底层基础。
2. 核心模块详解
1)多头自注意力 Multi-Head Attention
- Q查询、K键、V值:将输入特征映射三组向量;
- 注意力分数:Attn(Q,K,V)=softmax(QKTdk)VAttn(Q,K,V)=softmax(\frac{QK^T}{\sqrt{d_k}})VAttn(Q,K,V)=softmax(dkQKT)V,计算所有位置关联权重;
- 多头拆分:多组注意力头并行捕捉不同维度特征关联,最后拼接融合;
作用:模型自动关注序列中关键信息,远距离依赖建模能力远超CNN、RNN。
2)位置编码 Positional Encoding
注意力机制本身不感知序列顺序,手动添加位置编码,区分文本词语、图像块的先后顺序。
3)Transformer Encoder编码器层
单层编码器结构:
多头自注意力 → 残差连接 + LayerNorm归一化 → MLP前馈网络 → 残差+归一化;
多层堆叠构成完整模型。
3. 两大应用分支
- 时序Transformer:文本分类、机器翻译、时间序列预测;
- ViT视觉Transformer:图像分块嵌入,替代CNN完成分类、分割、检测。
4. 优缺点
优点
- 全局建模能力顶尖,长序列、高分辨率图像效果最优;
- 完全并行计算,GPU训练效率远高于RNN;
- 通用架构,图像、文本、语音多模态任务均可使用;
缺点
- 自注意力计算显存消耗极大,本地硬件易内存溢出;
- 理论抽象,注意力数学推导理解难度高于卷积、循环网络;
- 小数据集无CNN辅助时极易过拟合。
5. 适用场景
大语言模型LLM底层、多模态图像文本任务、超长文本处理、高精度视觉识别。
6. 显存不足优化实操方案
- 梯度累积、混合精度训练;
- 减少注意力头数量、缩短序列长度;
- 分块计算注意力。
7. 实操实验
- 时序Transformer:文本二分类,对比LSTM精度;
- 简易ViT图像分类;
- 可视化注意力热力图,观察模型关注区域。
九、八大网络综合对比总表
| 网络 | 任务类型 | 核心创新 | 核心优势 | 短板 |
|---|---|---|---|---|
| ResNet | 图像分类/通用骨干 | 残差Shortcut跳跃连接 | 支持百层深度网络,全视觉任务通用主干 | 仅捕捉局部特征,全局建模弱 |
| FCN | 语义分割 | 全卷积替代全连接层 | 首个像素级分割基线,结构简单易入门 | 分割边缘模糊,小目标精度差 |
| U-Net | 医学像素分割 | 对称编解码+通道拼接跳跃连接 | 小样本分割效果顶尖,细节保留强 | 仅分割专用,通用性差 |
| YOLOv8 | 实时目标检测 | PAN-FPN多尺度融合、解耦无锚头 | 速度快、工具链完善,工业落地首选 | 微小目标、密集遮挡易漏检 |
| RNN | 短时序序列 | 循环隐藏状态存储时序信息 | 结构最简单,零基础入门 | 长序列梯度消失,无法捕捉长期依赖 |
| LSTM | 长时序序列 | 三门控+细胞状态信息通道 | 稳定处理长距离时序依赖 | 计算量大,训练速度慢 |
| GRU | 轻量化时序 | 双门控简化LSTM结构 | 速度快、参数量小,兼顾效果 | 超长序列效果略低于LSTM |
| Transformer | 图像/文本/时序通用 | 多头自注意力全局建模 | 全局关联捕捉强、可并行训练 | 显存开销巨大,小数据集易过拟合 |
十、通用损失函数完整笔记(八大网络共用)
- 分类任务(ResNet、ViT、文本分类):交叉熵CrossEntropyLoss;
- 二分类分割(U-Net、FCN):BCE Loss、Dice Loss;
- 目标检测(YOLOv8):分类损失+CIoU框回归损失+置信度损失;
- 时序预测(RNN/LSTM/GRU):MSE均方误差;
- 多类别分割:多分类交叉熵。
十一、全网络通用高频报错与解决方案
- 张量通道/尺寸维度不匹配
成因:上下采样缩放倍数错误、跳跃连接通道不一致;
解决:统一padding与stride,使用1×1卷积适配通道。 - 训练损失震荡、收敛缓慢
解决:降低学习率、梯度裁剪、He初始化、增加数据增强。 - 过拟合(训练损失下降,验证损失上升)
解决:数据增强、Dropout、Dice损失、早停、减小模型规模。 - 梯度消失
深层CNN:ResNet残差;长时序:LSTM门控;全局任务:Transformer自注意力。 - 显存溢出
缩小batch、混合精度、梯度累积、轻量化模型、降低输入分辨率。
十二、零基础循序渐进学习路线
- 前置:CNN卷积池化、自编码器、反向传播基础;
- 视觉主干:ResNet(理解残差与深层网络);
- 分割模型:FCN → U-Net(掌握编解码、跳跃连接);
- 检测模型:YOLOv8(多尺度特征、一阶段检测工程流程);
- 时序模型:RNN → LSTM → GRU(吃透梯度消失、门控机制);
- 高阶通用模型:Transformer(自注意力、全局建模);
- 综合实操:骨干替换、多模型对照实验、项目调优、整理报错方案。
更多推荐




所有评论(0)