🧠 深度学习视觉应用 + Transformer 模型上课笔记

📁 一、深度学习视觉应用

1. 常用数据集一览

数据集 特点 用途
MNIST 手写数字,28x28 灰度图,60k/10k 入门分类
Fashion-MNIST 商品图,格式同 MNIST 替代 MNIST 测试算法
CIFAR-10 32x32 彩色图,10 类 图像分类
PASCAL VOC 20 类,目标检测/分割常用 检测/分割
MS COCO 80 类,复杂场景,33 万张图 检测/分割/关键点
ImageNet 1400 万张图,2.1 万类 大规模分类/预训练

📌 小贴士:COCO 是目前目标检测领域最权威的 benchmark,ImageNet 则推动了深度学习复兴。


2. 评价指标:精确率、召回率、AP、mAP

混淆矩阵基础
真实 \ 预测 正类 负类
正类 TP FN
负类 FP TN
  • 精确率(Precision) = TP / (TP + FP) → “预测为正中有多少是对的”
  • 召回率(Recall) = TP / (TP + FN) → “真正的正类找到了多少”
  • 精度(Accuracy) = (TP + TN) / 总样本
AP 与 mAP
  • AP(Average Precision):P-R 曲线下的面积
  • mAP(mean AP):所有类别的 AP 取平均 → 目标检测中最核心指标

✨ 示例:在飞机 vs 大雁的分类中,调整置信度阈值会改变 P/R 值,AP 综合反映了模型性能。


3. 目标检测:YOLO

  • 核心思想:You Only Look Once,将检测视为回归问题
  • 优势:端到端、实时、全局建模
  • 发展脉络:R-CNN → SPPNet → Fast R-CNN → Faster R-CNN → YOLO

📌 YOLO 是一个集大成者,理解其前序方法有助于掌握设计思想。


4. 语义分割:FCN 与 DeepLab

  • FCN:全卷积网络,端到端语义分割的开山之作
  • DeepLabv3:现代常用方法,支持空洞卷积与多尺度融合

配套材料中提供了 deeplab.ipynb 演示,建议课后运行体验。


🧩 二、Transformer 模型综述

1. 诞生与优势

  • 论文:《Attention Is All You Need》,Google 2017
  • 两大优势
    • 捕捉长距离语义依赖
    • 高度并行化,训练效率高

2. 模型架构四大部分

模块 组成
输入部分 源/目标文本嵌入 + 位置编码
编码器 N 层,每层包含多头自注意力 + 前馈网络 + 残差 & 归一化
解码器 N 层,每层包含掩码自注意力 + 交叉注意力 + 前馈网络
输出部分 线性层 + Softmax

3. 词嵌入与位置编码

  • 词嵌入:将独热向量映射为低维稠密向量(如 Word2Vec)
  • 位置编码:使用正弦/余弦函数,解决单词顺序问题
# PyTorch 示例
ebd = nn.Embedding(5, 24)  # 5个词,24维嵌入

4. 注意力机制核心

  • 公式
    Attention(Q,K,V)=softmax(QKTdk)V \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V Attention(Q,K,V)=softmax(dk QKT)V
  • Q/K/V:查询、键、值矩阵,来自输入的不同变换
  • 自注意力:关注序列内部关系
  • 多头注意力:多组 Q/K/V 并行,捕捉不同语义子空间

5. 编码器 & 解码器细节

  • Add & Norm:残差连接 + 层归一化,加速收敛
  • FeedForward:两层全连接,激活函数 ReLU
  • 掩码操作:解码器中防止看到未来信息

6. 训练与结果

  • 数据集:WMT 2014 英德(450 万句对)
  • 硬件:8 张 P100 GPU
  • 结果:
    • 英德任务 BLEU:28.4(big 模型)
    • 英法任务 BLEU:41.0

BLEU 是机器翻译中常用的评价指标,值越高越好。


🧠 总结与感悟

  • 计算机视觉与 NLP 正在深度融合,YOLO 和 Transformer 都是端到端建模的典范
  • 注意力机制正逐步取代 RNN/CNN 成为主流建模手段
  • 评价指标(如 mAP、BLEU)是理解模型性能的关键
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐