深度学习八大经典神经网络学习笔记

目录

  1. 前置基础(CNN、自编码器,零基础必看)
  2. ResNet 残差网络(通用视觉骨干)
  3. FCN 全卷积网络(初代语义分割)
  4. U-Net 对称编解码分割网络(医学分割标杆)
  5. YOLOv8 一阶段目标检测网络(工程落地)
  6. RNN 基础循环神经网络(时序入门)
  7. LSTM 长短期记忆网络(解决RNN梯度消失)
  8. GRU 门控循环单元(轻量化LSTM)
  9. Transformer 自注意力通用网络(图像/文本/时序大一统)
  10. 八大网络横向对比汇总
  11. 通用训练原理、损失函数、高频报错解决方案
  12. 零基础学习顺序与实操实验规划

前置基础知识(0基础入门铺垫)

1. CNN核心基础

卷积、池化、上采样、padding、stride、通道、特征图

  1. 卷积层:提取局部纹理、边缘、形状特征,3×3卷积是标准;
  2. 池化层(最大池化/平均池化):下采样,缩小图像尺寸,减少计算量,但丢失像素细节;
  3. 上采样:放大特征图,用于分割网络恢复原图分辨率;
  4. 填充padding:卷积前后图片尺寸不变,避免边缘信息丢失;
    尺寸计算公式:Output=Input+2Padding−KernelStride+1Output=\frac{Input+2Padding-Kernel}{Stride}+1Output=StrideInput+2PaddingKernel+1

2. 自编码器AutoEncoder

结构:编码器(下采样压缩图像)+ 解码器(上采样重建图像)

  • 编码器:不断卷积+池化,把原图压缩为低维特征向量;
  • 解码器:上采样还原图像,输入与输出尺寸完全一致;
  • 缺陷:仅简单拼接全局特征,无浅层细节复用,分割效果差;
    U-Net、FCN均基于自编码器结构改良。

3. 深度学习统一训练流程(所有网络通用)

  1. 数据预处理:归一化、划分训练/验证集、分批加载;
  2. 梯度清零 optimizer.zero_grad()
  3. 前向传播:数据输入网络,输出预测结果;
  4. 损失计算:对比预测值与真实标签;
  5. 反向传播 loss.backward():链式法则计算梯度;
  6. 参数更新 optimizer.step():梯度下降更新权重;
  7. 循环多轮训练,观察训练损失、验证损失变化。

4. 梯度消失/梯度爆炸(贯穿八大网络核心痛点)

  • 梯度消失:深层网络、长时序序列,梯度数值无限趋近0,权重无法更新,模型停止学习;
  • 梯度爆炸:梯度数值过大,损失剧烈震荡,模型不收敛;
    各网络分别使用残差、门控、自注意力、梯度裁剪解决该问题。

一、ResNet 残差网络(通用视觉骨干网络)

1. 研究背景与痛点

早期CNN存在网络退化现象:网络层数不断加深,训练集精度反而下降。
原因:深层网络反向传播时梯度逐层衰减,浅层权重无法更新。
2015年ResNet提出残差跳跃连接,允许搭建几十、上百层深度网络,成为所有视觉任务通用主干。

2. 核心创新:残差块 Shortcut 跳跃连接

2.1 BasicBlock(ResNet18/34使用,浅层网络)

数学表达式:H(x)=F(x)+xH(x)=F(x)+xH(x)=F(x)+x

  • xxx:残差块输入原始特征;
  • F(x)F(x)F(x):两层卷积+BN+ReLU学习到的残差映射;
  • H(x)H(x)H(x):模块最终输出;
    逻辑:网络不需要学习完整映射,只需要学习输入与输出之间的差值,梯度可通过shortcut直接回传,不会消失。

维度不匹配处理:
当输入输出通道、尺寸不一致时,增加downsample1×1卷积,同步调整通道与步长,保证F(x)F(x)F(x)xxx可以相加。

2.2 Bottleneck瓶颈块(ResNet50/101深层网络)

三层卷积结构:1×1降维 → 3×3特征提取 → 1×1升维
作用:大幅减少深层网络参数量与计算量,适合超深网络。

3. ResNet完整网络结构(以ResNet18为例)

  1. 输入层:3通道RGB图像;
  2. 初始卷积块:7×7卷积(stride=2)+ BN + ReLU + 3×3最大池化,快速下采样;
  3. 四层残差层layer1~layer4:逐层下采样,通道数64→128→256→512;
  4. 全局平均池化GAP:替代传统全连接层,不限定输入图像尺寸,减少参数量;
  5. 全连接输出头:输出分类类别概率。

4. 理论知识点详细拆解

  1. He初始化:卷积层权重专用初始化方式,适配ReLU激活,避免深层网络收敛缓慢;
  2. 迁移学习:使用ImageNet预训练ResNet权重,再微调适配自定义数据集,大幅减少训练轮次;
  3. 骨干复用:ResNet可直接替换YOLO、U-Net的编码器主干,提升特征提取能力;
  4. 网络区分:
    • ResNet18/34:轻量,本地电脑训练无压力;
    • ResNet50/101:精度更高,显存占用大。

5. 优缺点完整总结

优点

  1. 彻底解决深层CNN梯度消失、网络退化问题;
  2. 通用性极强,分类、分割、检测均可作为主干;
  3. 预训练权重丰富,迁移学习落地简单;
  4. 结构标准化,代码易复现、调试简单。

缺点

  1. 纯卷积仅捕捉局部特征,远距离全局依赖建模能力弱;
  2. 深层ResNet50训练显存开销高;
  3. 无多尺度特征融合原生设计,做检测任务需额外搭配FPN。

6. 适用场景

图像分类、医学影像特征提取、YOLO系列骨干替换、分割网络编码器主干。

7. 实操实验要点

  1. 对照实验:普通深层CNN vs ResNet,同步训练20轮,对比损失与精度,直观观察网络退化;
  2. 替换YOLOv8骨干:将原生C2f主干替换为ResNet18,测试自定义数据集检测精度变化;
  3. 高频报错与解决方案:
    • shortcut通道维度不匹配:添加1×1卷积downsample;
    • 深层模型收敛极慢:使用He权重初始化;
    • 替换骨干后精度下降:统一多尺度特征图尺寸。

8. 核心代码逻辑

构建残差块、多层堆叠、自适应下采样、全局平均池化分类头。


二、FCN 全卷积语义分割网络(首个端到端像素分割模型)

1. 诞生背景

传统CNN最后一层为全连接层,输出一维向量,只能输出整张图片类别,无法实现像素级预测。
FCN核心创新:全部使用卷积层替代全连接层,输入图像尺寸无限制,输出和原图同等分辨率的分割图,开创语义分割领域。

2. 完整网络结构

(1)编码器(下采样)

基于VGG16卷积网络,提取三层关键特征图:

  • pool3:下采样8倍,浅层细节特征;
  • pool4:下采样16倍,中层特征;
  • pool5:下采样32倍,深层语义特征。

(2)全卷积转换

将VGG末尾全连接层替换为1×1卷积,不改变特征图尺寸,仅调整通道数为分割类别数。

(3)反卷积上采样

转置卷积实现图像放大,恢复分辨率;

(4)多阶段特征融合(FCN-32s / FCN-16s / FCN-8s)

  1. FCN-32s:仅使用pool5深层特征,直接32倍上采样,分割边缘极度模糊;
  2. FCN-16s:pool5上采样后,与pool4中层特征相加融合,细节小幅提升;
  3. FCN-8s:融合pool5、pool4、pool3三层特征,浅层轮廓信息最丰富,分割效果最优。

3. 核心理论知识点

  1. 全卷积特性:输入任意尺寸图像均可推理,无需固定输入;
  2. 1×1卷积作用:通道维度变换,不改变特征图长宽;
  3. 逐像素交叉熵损失:每个像素独立分类,适用于二分类/多分类分割;
  4. 特征相加融合:浅层、深层特征数值直接叠加。

4. 优缺点

优点

  1. 分割领域开山之作,是U-Net、DeepLab所有分割模型的理论基础;
  2. 结构简洁,训练速度快,适合入门学习;
  3. 无固定尺寸限制,适配各类数据集。

缺点

  1. 转置卷积上采样易产生棋盘格伪影,分割边缘锯齿、模糊;
  2. 特征融合为逐元素相加,浅层细节保留能力弱;
  3. 无对称编解码结构,小目标分割精度差于U-Net。

5. 适用场景

图像分割教学基线、简单自然图像分割、轻量化快速分割项目。

6. 实操踩坑与优化方案

  1. 棋盘格伪影:废弃转置卷积,使用双线性插值上采样+普通3×3卷积;
  2. 特征融合尺寸错位:统一所有卷积层padding、stride参数;
  3. 小目标分割效果差:增加随机缩放、翻转、灰度扰动数据增强。

7. 实操实验规划

  1. 复用医学灰度影像数据集,搭建FCN-32s/16s/8s三组对照;
  2. 可视化三类模型分割掩码,对比边缘精细程度;
  3. FCN与U-Net横向对比训练速度、分割精度。

三、U-Net 对称编解码分割网络(医学分割行业标准)

1. 设计背景

基于自编码器+FCN思想改良,专为小样本医学影像设计(CT、病理切片、细胞分割)。
医学数据集普遍标注少,FCN分割边缘丢失严重,U-Net通过跳跃拼接Concatenate大幅保留浅层像素细节。

2. 三段式完整结构

1)编码器(下采样路径,左半部分)

4组卷积块,每组2次3×3卷积+BN+ReLU;每一组结束使用2×2最大池化下采样,分辨率减半、通道翻倍;
每一层输出特征图完整保存,用于后续跳跃连接。

2)瓶颈层

网络最底部,分辨率最低、通道数最多,融合全局深层语义特征。

3)解码器(上采样路径,右半部分)

  1. 转置卷积2倍上采样,放大特征图尺寸;
  2. 跳跃拼接:将编码器同层级浅层特征图与解码器当前特征图在通道维度拼接;
  3. 两层卷积融合拼接后的特征,逐层恢复图像细节;
  4. 输出层1×1卷积,输出单通道分割掩码(二分类医学分割)。

3. 核心创新点详细解析

  1. 对称编解码结构:编码器与解码器层数、通道完全对称,结构规整易搭建;
  2. 跳跃拼接(Concatenate):通道维度直接拼接,相比FCN的相加融合,完整保留浅层边缘、纹理信息,解决池化造成的像素丢失;
  3. 适配小样本:参数量小,几百张医学影像即可收敛。

4. 损失函数适配

  1. 二分类交叉熵:常规分割任务;
  2. Dice Loss:解决医学影像前景背景样本不均衡,优化边缘分割效果;
  3. 组合损失:交叉熵+Dice Loss,训练更稳定。

5. 优缺点

优点

  1. 跳跃拼接完美保留轮廓细节,分割边缘精度远超FCN;
  2. 小数据集表现优异,医学影像领域通用标准;
  3. 结构对称,代码逻辑清晰,调试难度低;
  4. 可拓展变体:UNet++、TransUNet等。

缺点

  1. 仅适用于像素分割,无法完成检测、分类任务;
  2. 超高分辨率医学图像训练显存占用高;
  3. 无原生多尺度融合,远距离大区域分割效果一般。

6. 适用场景

医学CT/病理切片分割、遥感地物分割、工业产品缺陷像素检测。

7. 实操常见问题

  1. 跳跃连接通道维度不匹配:严格对齐每层卷积输出通道数量;
  2. 训练损失持续震荡:降低学习率、适当增大batch size;
  3. 分割掩码边缘模糊、过拟合:引入Dice损失、扩充数据增强策略。

8. 实操实验内容

  1. 灰度医学影像数据集处理、划分训练/验证集;
  2. 手动逐层搭建完整U-Net,计算每层特征图尺寸;
  3. 完整训练15轮,绘制训练/验证损失曲线;
  4. 原图、真实掩码、预测结果可视化对比;
  5. 优化实验:引入Dice损失、数据增强,改善分割效果。

四、YOLOv8 一阶段目标检测网络(工程落地首选)

1. 检测任务基础概念

目标检测两大输出:目标边界框坐标、物体类别、置信度;
两类检测模型:

  1. 两阶段(Faster R-CNN):先生成候选框再分类,精度高、速度慢;
  2. 一阶段YOLO系列:单次前向传播同时输出框与类别,速度快,适合实时工程。

2. YOLOv8三大核心模块

1)Backbone骨干网络(C2f模块)

堆叠C2f卷积块,多层下采样提取多尺度特征,相比YOLOv5的C3模块梯度流通更好,小目标特征提取能力提升。

2)PAN-FPN 特征融合颈层

自上而下:高层语义特征向下传递;
自下而上:低层细节特征向上融合;
输出三种尺寸特征图,分别对应大、中、小目标:

  • 20×20:大物体;
  • 40×40:中等物体;
  • 80×80:微小物体。

3)Decoupled Head 解耦检测头

Anchor-Free无锚框设计,分类分支、回归分支完全分离,不需要手动设置锚框尺寸,大幅降低调参难度。

3. 配套推理流程

  1. 模型前向推理输出大量预测框;
  2. NMS非极大值抑制:过滤重叠冗余检测框,保留置信度最高框;
  3. 置信度阈值筛选:过滤低置信误检框。

4. 训练相关理论

  1. 复合损失:分类损失+边界框回归损失+置信度损失;
  2. 数据集标注格式:txt文本标注(类别+归一化xywh);
  3. 轻量化版本:n/s/m/l/x,nano版本可部署移动端。

5. 优缺点

优点

  1. 速度与精度均衡,工业落地主流算法;
  2. ultralytics官方工具链完善:数据集处理、训练、推理、模型导出一站式;
  3. 无锚框设计,减少锚框适配调试工作量;
  4. 支持自定义数据集,零基础易上手。

缺点

  1. 超微小目标检测精度弱于两阶段检测网络;
  2. 数据集标注、路径配置错误极易导致训练直接报错;
  3. 密集遮挡目标漏检、误检较多。

6. 适用场景

实时摄像头物体识别、工业缺陷检测、自动驾驶目标识别、自定义物品检测项目。

7. 实操踩坑完整总结

  1. 标注文件路径错误、类别数量不匹配:修改数据集yaml配置文件;
  2. 大量低置信冗余检测框:调高conf置信阈值;
  3. 图片输入通道错乱:统一输入RGB三通道图像;
  4. 锚框与目标尺寸不匹配:开启自适应锚框计算。

8. 实操实验内容

  1. 制作自定义小型数据集,完成图片标注;
  2. 加载轻量化预训练权重,修改类别参数;
  3. 设置迭代轮次、输入尺寸、置信阈值启动训练;
  4. 单图/批量图片推理,可视化检测结果;
  5. 进阶实验:模型轻量化、批量推理、模型导出部署。

五、RNN 基础循环神经网络(时序任务入门)

1. 适用数据类型

有序序列数据:文本句子、时间序列、语音信号;
CNN只能处理独立图像,无法记录前后顺序信息,RNN引入隐藏状态存储历史时序信息。

2. 核心结构与数学公式

输入:xtx_txt 第t时刻序列数据
隐藏状态:hth_tht 存储当前与历史信息
更新公式:ht=tanh(Wxhxt+Whhht−1)h_t = tanh(W_{xh}x_t + W_{hh}h_{t-1})ht=tanh(Wxhxt+Whhht1)
输出:yt=Whyhty_t = W_{hy}h_tyt=Whyht

逻辑:每一步计算依赖上一时刻隐藏状态ht−1h_{t-1}ht1,实现时序记忆。

3. 致命缺陷:长序列梯度消失

序列长度过长时,梯度多次乘以小于1的权重,梯度无限趋近于0;
模型只能记住最近几步信息,远距离历史数据完全丢失,无法处理长文本、长期时序预测。

4. 优缺点

优点

  1. 结构极简,时序建模入门最佳模型;
  2. 参数量极小,训练速度快;

缺点

  1. 长序列梯度消失,长距离依赖完全失效;
  2. 串行逐时间步计算,无法并行加速,训练效率低。

5. 适用场景

极短文本分类、简单时序预测、课堂教学演示。

6. 实操问题

  1. 张量维度不匹配:统一输入shape [batch_size, seq_len, embed_dim]
  2. 长序列训练损失剧烈震荡:梯度裁剪、降低学习率。

六、LSTM 长短期记忆网络(RNN改进版)

1. 解决RNN痛点

引入细胞状态Cell State作为信息高速通道,搭配三大门控机制控制信息留存/丢弃,梯度可跨长序列传递,彻底解决长序列梯度消失。

2. 三大门控详细作用

  1. 遗忘门 Forget Gate
    sigmoid输出0~1,控制上一时刻细胞状态保留多少信息;数值越接近0,丢弃越多历史信息。
  2. 输入门 Input Gate
    控制当前时刻新数据多少信息存入细胞状态;结合tanh生成新候选信息。
  3. 输出门 Output Gate
    控制细胞状态的信息多少传递到当前隐藏状态hth_tht,作为当前时刻输出。

3. 细胞状态更新逻辑

细胞状态Ct贯穿全部时序步,梯度流通不受限制,长期记忆稳定保存。

4. 优缺点

优点

  1. 稳定捕捉长距离时序依赖,长文本、长时间序列标准基线;
  2. 门控机制有效抑制梯度消失与梯度爆炸;

缺点

  1. 三门控结构复杂,计算量大,训练速度慢;
  2. 参数量大,硬件开销更高。

5. 适用场景

长文本情感分类、气象/股票长时间序列预测、语音识别。

6. 实操实验

搭建文本二分类、单变量时序预测实验,对比RNN、LSTM损失与精度,直观体现LSTM优势。


七、GRU 门控循环单元(轻量化LSTM)

1. 简化设计思路

合并LSTM遗忘门与输入门为更新门,新增重置门;删除独立细胞状态,仅保留隐藏状态,大幅简化计算。

两个核心门控

  1. 更新门 Update Gate:决定保留多少历史隐藏状态;
  2. 重置门 Reset Gate:控制历史信息对当前输入的影响程度。

2. 对比LSTM优势

参数量减少约30%,训练速度显著提升,精度与LSTM差距极小,轻量化场景首选。

3. 优缺点

优点

训练速度快、调参简单、显存占用低;

缺点

超长距离序列建模能力略弱于LSTM。

4. 适用场景

嵌入式设备时序预测、轻量文本分类、实时时序数据处理。

5. RNN/LSTM/GRU横向对比表

模型 核心结构 长序列能力 训练速度 参数量
RNN 单一循环单元 极差(梯度消失) 最快 最小
LSTM 遗忘/输入/输出三门 最优 最慢 最大
GRU 更新门+重置门 良好 中等 中等

6. 时序网络通用实操问题

  1. 序列截断长度不合理:过长梯度震荡,过短丢失关键信息;
  2. 门控网络学习率敏感:选用更小学习率训练。

八、Transformer 自注意力通用网络(图像/文本/时序大一统)

1. 诞生背景

CNN仅捕捉局部特征、RNN串行计算、长依赖效果差;Transformer依靠自注意力机制,序列任意位置元素直接交互,全局信息一次性建模,完全并行训练,是大模型底层基础。

2. 核心模块详解

1)多头自注意力 Multi-Head Attention

  1. Q查询、K键、V值:将输入特征映射三组向量;
  2. 注意力分数:Attn(Q,K,V)=softmax(QKTdk)VAttn(Q,K,V)=softmax(\frac{QK^T}{\sqrt{d_k}})VAttn(Q,K,V)=softmax(dk QKT)V,计算所有位置关联权重;
  3. 多头拆分:多组注意力头并行捕捉不同维度特征关联,最后拼接融合;
    作用:模型自动关注序列中关键信息,远距离依赖建模能力远超CNN、RNN。

2)位置编码 Positional Encoding

注意力机制本身不感知序列顺序,手动添加位置编码,区分文本词语、图像块的先后顺序。

3)Transformer Encoder编码器层

单层编码器结构:
多头自注意力 → 残差连接 + LayerNorm归一化 → MLP前馈网络 → 残差+归一化;
多层堆叠构成完整模型。

3. 两大应用分支

  1. 时序Transformer:文本分类、机器翻译、时间序列预测;
  2. ViT视觉Transformer:图像分块嵌入,替代CNN完成分类、分割、检测。

4. 优缺点

优点

  1. 全局建模能力顶尖,长序列、高分辨率图像效果最优;
  2. 完全并行计算,GPU训练效率远高于RNN;
  3. 通用架构,图像、文本、语音多模态任务均可使用;

缺点

  1. 自注意力计算显存消耗极大,本地硬件易内存溢出;
  2. 理论抽象,注意力数学推导理解难度高于卷积、循环网络;
  3. 小数据集无CNN辅助时极易过拟合。

5. 适用场景

大语言模型LLM底层、多模态图像文本任务、超长文本处理、高精度视觉识别。

6. 显存不足优化实操方案

  1. 梯度累积、混合精度训练;
  2. 减少注意力头数量、缩短序列长度;
  3. 分块计算注意力。

7. 实操实验

  1. 时序Transformer:文本二分类,对比LSTM精度;
  2. 简易ViT图像分类;
  3. 可视化注意力热力图,观察模型关注区域。

九、八大网络综合对比总表

网络 任务类型 核心创新 核心优势 短板
ResNet 图像分类/通用骨干 残差Shortcut跳跃连接 支持百层深度网络,全视觉任务通用主干 仅捕捉局部特征,全局建模弱
FCN 语义分割 全卷积替代全连接层 首个像素级分割基线,结构简单易入门 分割边缘模糊,小目标精度差
U-Net 医学像素分割 对称编解码+通道拼接跳跃连接 小样本分割效果顶尖,细节保留强 仅分割专用,通用性差
YOLOv8 实时目标检测 PAN-FPN多尺度融合、解耦无锚头 速度快、工具链完善,工业落地首选 微小目标、密集遮挡易漏检
RNN 短时序序列 循环隐藏状态存储时序信息 结构最简单,零基础入门 长序列梯度消失,无法捕捉长期依赖
LSTM 长时序序列 三门控+细胞状态信息通道 稳定处理长距离时序依赖 计算量大,训练速度慢
GRU 轻量化时序 双门控简化LSTM结构 速度快、参数量小,兼顾效果 超长序列效果略低于LSTM
Transformer 图像/文本/时序通用 多头自注意力全局建模 全局关联捕捉强、可并行训练 显存开销巨大,小数据集易过拟合

十、通用损失函数完整笔记(八大网络共用)

  1. 分类任务(ResNet、ViT、文本分类):交叉熵CrossEntropyLoss;
  2. 二分类分割(U-Net、FCN):BCE Loss、Dice Loss;
  3. 目标检测(YOLOv8):分类损失+CIoU框回归损失+置信度损失;
  4. 时序预测(RNN/LSTM/GRU):MSE均方误差;
  5. 多类别分割:多分类交叉熵。

十一、全网络通用高频报错与解决方案

  1. 张量通道/尺寸维度不匹配
    成因:上下采样缩放倍数错误、跳跃连接通道不一致;
    解决:统一padding与stride,使用1×1卷积适配通道。
  2. 训练损失震荡、收敛缓慢
    解决:降低学习率、梯度裁剪、He初始化、增加数据增强。
  3. 过拟合(训练损失下降,验证损失上升)
    解决:数据增强、Dropout、Dice损失、早停、减小模型规模。
  4. 梯度消失
    深层CNN:ResNet残差;长时序:LSTM门控;全局任务:Transformer自注意力。
  5. 显存溢出
    缩小batch、混合精度、梯度累积、轻量化模型、降低输入分辨率。

十二、零基础循序渐进学习路线

  1. 前置:CNN卷积池化、自编码器、反向传播基础;
  2. 视觉主干:ResNet(理解残差与深层网络);
  3. 分割模型:FCN → U-Net(掌握编解码、跳跃连接);
  4. 检测模型:YOLOv8(多尺度特征、一阶段检测工程流程);
  5. 时序模型:RNN → LSTM → GRU(吃透梯度消失、门控机制);
  6. 高阶通用模型:Transformer(自注意力、全局建模);
  7. 综合实操:骨干替换、多模型对照实验、项目调优、整理报错方案。
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐