机器学习・第 4 章 深度学习 笔记
·
机器学习·第4章 深度学习 笔记
一、深度学习崛起背景
-
核心驱动:算法突破、海量标注数据、超强算力、专用芯片、成熟应用生态。 -
里程碑:AlphaGo、自动驾驶、ChatGPT、DeepSeek等,推动第三次神经网络复兴。
二、主要深度学习任务
1. 计算机视觉(CV)
-
图像分类:输入图片→类别(MNIST、CIFAR、ImageNet)。 -
目标检测:定位+分类(PASCAL VOC、COCO)。 -
语义分割:逐像素分类(医疗影像、遥感、自动驾驶)。
2. 自然语言处理(NLP)
-
基础:文本分类、实体识别、机器翻译、问答、AIGC。 -
模型:RNN/LSTM→Word2Vec→Transformer→BERT→GPT/ChatGPT。
三、卷积神经网络(CNN)
1. 核心结构
-
卷积层:卷积核滑动提取局部特征(步长、感受野)。 -
池化层:最大/平均池化,降维+特征选择。 -
全连接层:特征整合,输出结果。 -
Softmax:输出归一化概率,用于分类。
2. 关键技术
-
激活函数:ReLU(常用,避免梯度消失)、Sigmoid、Tanh。 -
正则化:Dropout(随机失活,防过拟合)、数据增强(旋转/翻转等)。 -
经典模型:LeNet-5(手写数字)、AlexNet、VGG、ResNet。
3. LeNet-5(MindSpore示例)
-
结构:2卷积+2池化+3全连接。 -
流程:数据加载→预处理→模型定义→训练→保存→推理。
四、Transformer(NLP核心)
1. 整体架构(2017,Google)
-
编码器(Encoder)×6:多头自注意力+前馈网络。 -
解码器(Decoder)×6:掩码多头注意力+交叉注意力+前馈网络。
2. 核心机制
-
自注意力: ,捕捉长距离依赖。 -
多头注意力:多组注意力并行,提取不同语义特征。 -
位置编码:给序列加位置信息(正弦/余弦函数)。 -
Add & Norm:残差连接防退化,层归一化加速收敛。
3. 衍生模型
-
BERT:仅Encoder,双向编码。 -
GPT/ChatGPT:仅Decoder,自回归生成。
五、MindSpore深度学习框架
1. 核心组件
-
Tensor:多维数组,基础数据结构。 -
Dataset:数据加载、预处理、增强、分批。 -
nn.Cell:网络层/模型基类(定义 __init__和construct)。 -
Model:封装网络、损失、优化器,负责训练/推理。
2. 开发流程
-
数据:加载(MNIST/CIFAR)→预处理(归一化/通道转换)→增强。 -
模型:继承 nn.Cell,搭建网络(卷积/全连接)。 -
训练:选择损失(交叉熵)、优化器(SGD/Adam),训练模型。 -
保存/推理:Checkpoint/MindIR保存,加载部署。
3. 核心代码(LeNet-5)
class LeNet5(nn.Cell):
def __init__(self):
super().__init__()
self.features = nn.SequentialCell(
nn.Conv2d(1, 6, 5), nn.ReLU(), nn.MaxPool2d(2),
nn.Conv2d(6, 16, 5), nn.ReLU(), nn.MaxPool2d(2),
nn.Flatten(),
nn.Dense(400, 120), nn.ReLU(),
nn.Dense(120, 84), nn.ReLU(),
nn.Dense(84, 10)
)
def construct(self, x):
return self.features(x)
本文由 mdnice 多平台发布
更多推荐




所有评论(0)