机器学习·第4章 深度学习 笔记

一、深度学习崛起背景

  • 核心驱动:算法突破、海量标注数据、超强算力、专用芯片、成熟应用生态。
  • 里程碑:AlphaGo、自动驾驶、ChatGPT、DeepSeek等,推动第三次神经网络复兴。

二、主要深度学习任务

1. 计算机视觉(CV)

  • 图像分类:输入图片→类别(MNIST、CIFAR、ImageNet)。
  • 目标检测:定位+分类(PASCAL VOC、COCO)。
  • 语义分割:逐像素分类(医疗影像、遥感、自动驾驶)。

2. 自然语言处理(NLP)

  • 基础:文本分类、实体识别、机器翻译、问答、AIGC。
  • 模型:RNN/LSTM→Word2Vec→Transformer→BERT→GPT/ChatGPT。

三、卷积神经网络(CNN)

1. 核心结构

  • 卷积层:卷积核滑动提取局部特征(步长、感受野)。
  • 池化层:最大/平均池化,降维+特征选择。
  • 全连接层:特征整合,输出结果。
  • Softmax:输出归一化概率,用于分类。

2. 关键技术

  • 激活函数:ReLU(常用,避免梯度消失)、Sigmoid、Tanh。
  • 正则化:Dropout(随机失活,防过拟合)、数据增强(旋转/翻转等)。
  • 经典模型:LeNet-5(手写数字)、AlexNet、VGG、ResNet。

3. LeNet-5(MindSpore示例)

  • 结构:2卷积+2池化+3全连接。
  • 流程:数据加载→预处理→模型定义→训练→保存→推理。

四、Transformer(NLP核心)

1. 整体架构(2017,Google)

  • 编码器(Encoder)×6:多头自注意力+前馈网络。
  • 解码器(Decoder)×6:掩码多头注意力+交叉注意力+前馈网络。

2. 核心机制

  • 自注意力 ,捕捉长距离依赖。
  • 多头注意力:多组注意力并行,提取不同语义特征。
  • 位置编码:给序列加位置信息(正弦/余弦函数)。
  • Add & Norm:残差连接防退化,层归一化加速收敛。

3. 衍生模型

  • BERT:仅Encoder,双向编码。
  • GPT/ChatGPT:仅Decoder,自回归生成。

五、MindSpore深度学习框架

1. 核心组件

  • Tensor:多维数组,基础数据结构。
  • Dataset:数据加载、预处理、增强、分批。
  • nn.Cell:网络层/模型基类(定义 __init__construct)。
  • Model:封装网络、损失、优化器,负责训练/推理。

2. 开发流程

  1. 数据:加载(MNIST/CIFAR)→预处理(归一化/通道转换)→增强。
  2. 模型:继承 nn.Cell,搭建网络(卷积/全连接)。
  3. 训练:选择损失(交叉熵)、优化器(SGD/Adam),训练模型。
  4. 保存/推理:Checkpoint/MindIR保存,加载部署。

3. 核心代码(LeNet-5)

class LeNet5(nn.Cell):
    def __init__(self):
        super().__init__()
        self.features = nn.SequentialCell(
            nn.Conv2d(165), nn.ReLU(), nn.MaxPool2d(2),
            nn.Conv2d(6165), nn.ReLU(), nn.MaxPool2d(2),
            nn.Flatten(),
            nn.Dense(400120), nn.ReLU(),
            nn.Dense(12084), nn.ReLU(),
            nn.Dense(8410)
        )
    def construct(self, x):
        return self.features(x)

本文由 mdnice 多平台发布

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐