一、课程概述与人工智能背景

  • 人工智能的三大方法论

    • 仿生角度:神经网络、深度学习

    • 符号学角度:机器学习(统计、逻辑、搜索)

    • 行为学角度:控制论、强化学习

  • 深度学习是AI第三次崛起的核心技术,其发展得益于:

    • 大规模数据(非结构化数据)

    • 计算能力提升(GPU、TPU)

    • 算法突破(如BP算法、ReLU、Dropout等)

二、线性回归与线性分类

1. 线性回归

目标:拟合输入与输出之间的线性关系。

模型形式:

y = \theta^T x = \sum_{i=1}^{n} \theta_i x_i

损失函数(最小二乘):

J(\theta) = \frac{1}{2} \sum_{i=1}^{N} (y^{(i)} - h_\theta(x^{(i)}))^2

解析解:

\theta = (X^T X)^{-1} X^T y

2. 线性分类与Sigmoid函数

引入Sigmoid函数将输出映射到概率空间:

h_\theta(x) = \frac{1}{1 + e^{-\theta^T x}}

损失函数(交叉熵):

J(\theta) = -\sum_i \left[ y^{(i)} \log(h_\theta(x^{(i)})) + (1 - y^{(i)}) \log(1 - h_\theta(x^{(i)})) \right]

3. Softmax多分类

输出概率向量:

h_\theta(x) = \frac{1}{1 + e^{-\theta^T x}}J(\theta) = -\sum_i \left[ y^{(i)} \log(h_\theta(x^{(i)})) + (1 - y^{(i)}) \log(1 - h_\theta(x^{(i)})) \right]

损失函数:

J(\theta) = -\sum_{i=1}^N \sum_{k=1}^K 1\{y^{(i)} = k\} \log \frac{e^{\theta_k^T x^{(i)}}}{\sum_{j=1}^K e^{\theta_j^T x^{(i)}}}

三、感知机与神经元模型

  • M-P模型:模拟生物神经元,输入加权求和后经激活函数输出。

  • Hebb规则:权重更新与输入输出乘积成正比。

  • 感知机模型

y = \text{sign}(w^T x)

损失函数(误分类点):

L(w) = -\frac{1}{\|w\|} \sum y^{(i)}(w^T x^{(i)})

迭代更新:

w_{k+1} = w_k + \eta y^{(i)} x^{(i)}

四、多层感知机与BP算法

1. XOR问题与多层结构

单层感知机无法解决XOR问题,引入隐层后可以:

y = f(w_1^{[2]} y_1^{[1]} + w_2^{[2]} y_2^{[1]} - \theta)

2. BP算法(误差反向传播)

  • 前向传播:计算网络输出

  • 反向传播:计算误差梯度,更新权重

输出层误差:

\delta_i^{[L]} = a_i(1 - a_i) e_i

隐含层误差:

\delta_i^{[l]} = \left( \sum_j w_{ji}^{[l+1]} \delta_j^{[l+1]} \right) a_i^{[l]} (1 - a_i^{[l]})

权重更新:

\Delta w_{ij}^{[l]} = \alpha \delta_i^{[l]} a_j^{[l-1]}

五、卷积神经网络基础

1. 为什么需要卷积?

全连接网络参数爆炸,局部连接 + 权值共享大幅减少参数量。

2. 卷积与池化

  • 卷积:滤波器在输入上滑动,提取局部特征。

  • 填充(Padding):控制输出尺寸。

  • 步长(Stride):滑动步长。

  • 池化:下采样,常用最大池化或平均池化。

3. 经典CNN结构

LeNet-5
  • 输入:32x32

  • C1:6个5x5卷积核 → 28x28

  • S2:平均池化 → 14x14

  • C3:16个5x5卷积核 → 10x10

  • S4:池化 → 5x5

  • C5:120个5x5卷积 → 1x1

  • F6:84个神经元

  • 输出:10类(RBF)

AlexNet
  • 使用ReLU、Dropout、数据增强

  • 在ImageNet上取得突破

VGG-16
  • 全部使用3x3卷积,结构规整

  • 参数约1.38亿

ResNet
  • 引入残差块解决梯度消失问题

残差块定义:

a^{[l+1]} = f(a^{[l]} + \text{conv}(a^{[l]}))

六、总结与思考

  • 深度学习通过分层特征提取,解决了传统机器学习中“特征工程”的瓶颈。

  • 从线性模型到感知机、BP网络、CNN,模型能力逐步提升。

  • 残差网络的出现使得训练更深网络成为可能。

  • 当前主流框架(如PyTorch)极大简化了模型实现与训练流程。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐