神经网络与深度学习上课记录(三)
·
🧠 深度学习视觉应用 + Transformer 模型上课笔记
📁 一、深度学习视觉应用
1. 常用数据集一览
| 数据集 | 特点 | 用途 |
|---|---|---|
| MNIST | 手写数字,28x28 灰度图,60k/10k | 入门分类 |
| Fashion-MNIST | 商品图,格式同 MNIST | 替代 MNIST 测试算法 |
| CIFAR-10 | 32x32 彩色图,10 类 | 图像分类 |
| PASCAL VOC | 20 类,目标检测/分割常用 | 检测/分割 |
| MS COCO | 80 类,复杂场景,33 万张图 | 检测/分割/关键点 |
| ImageNet | 1400 万张图,2.1 万类 | 大规模分类/预训练 |
📌 小贴士:COCO 是目前目标检测领域最权威的 benchmark,ImageNet 则推动了深度学习复兴。
2. 评价指标:精确率、召回率、AP、mAP
混淆矩阵基础
| 真实 \ 预测 | 正类 | 负类 |
|---|---|---|
| 正类 | TP | FN |
| 负类 | FP | TN |
- 精确率(Precision) = TP / (TP + FP) → “预测为正中有多少是对的”
- 召回率(Recall) = TP / (TP + FN) → “真正的正类找到了多少”
- 精度(Accuracy) = (TP + TN) / 总样本
AP 与 mAP
- AP(Average Precision):P-R 曲线下的面积
- mAP(mean AP):所有类别的 AP 取平均 → 目标检测中最核心指标
✨ 示例:在飞机 vs 大雁的分类中,调整置信度阈值会改变 P/R 值,AP 综合反映了模型性能。
3. 目标检测:YOLO
- 核心思想:You Only Look Once,将检测视为回归问题
- 优势:端到端、实时、全局建模
- 发展脉络:R-CNN → SPPNet → Fast R-CNN → Faster R-CNN → YOLO
📌 YOLO 是一个集大成者,理解其前序方法有助于掌握设计思想。
4. 语义分割:FCN 与 DeepLab
- FCN:全卷积网络,端到端语义分割的开山之作
- DeepLabv3:现代常用方法,支持空洞卷积与多尺度融合
配套材料中提供了
deeplab.ipynb演示,建议课后运行体验。
🧩 二、Transformer 模型综述
1. 诞生与优势
- 论文:《Attention Is All You Need》,Google 2017
- 两大优势:
- 捕捉长距离语义依赖
- 高度并行化,训练效率高
2. 模型架构四大部分
| 模块 | 组成 |
|---|---|
| 输入部分 | 源/目标文本嵌入 + 位置编码 |
| 编码器 | N 层,每层包含多头自注意力 + 前馈网络 + 残差 & 归一化 |
| 解码器 | N 层,每层包含掩码自注意力 + 交叉注意力 + 前馈网络 |
| 输出部分 | 线性层 + Softmax |
3. 词嵌入与位置编码
- 词嵌入:将独热向量映射为低维稠密向量(如 Word2Vec)
- 位置编码:使用正弦/余弦函数,解决单词顺序问题
# PyTorch 示例
ebd = nn.Embedding(5, 24) # 5个词,24维嵌入
4. 注意力机制核心
- 公式:
Attention(Q,K,V)=softmax(QKTdk)V \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V Attention(Q,K,V)=softmax(dkQKT)V - Q/K/V:查询、键、值矩阵,来自输入的不同变换
- 自注意力:关注序列内部关系
- 多头注意力:多组 Q/K/V 并行,捕捉不同语义子空间
5. 编码器 & 解码器细节
- Add & Norm:残差连接 + 层归一化,加速收敛
- FeedForward:两层全连接,激活函数 ReLU
- 掩码操作:解码器中防止看到未来信息
6. 训练与结果
- 数据集:WMT 2014 英德(450 万句对)
- 硬件:8 张 P100 GPU
- 结果:
- 英德任务 BLEU:28.4(big 模型)
- 英法任务 BLEU:41.0
BLEU 是机器翻译中常用的评价指标,值越高越好。
🧠 总结与感悟
- 计算机视觉与 NLP 正在深度融合,YOLO 和 Transformer 都是端到端建模的典范
- 注意力机制正逐步取代 RNN/CNN 成为主流建模手段
- 评价指标(如 mAP、BLEU)是理解模型性能的关键
更多推荐




所有评论(0)