机器学习·第3章 神经网络 笔记

一、模型流派与背景

  • 模型流派:神经网络(模拟大脑)、统计模型(线性回归)、概率模型(朴素贝叶斯)、几何模型(KNN)、信息论模型(决策树)、博弈论模型(GAN)、生物模型(进化算法)。
  • 发展:80-90年代兴盛→算力不足衰退→近年复兴;各国推进脑科学计划(含中国脑计划)。

二、神经元模型(MP/感知器)

1. MP神经元(1943,McCulloch-Pitts)

  • 输入加权求和+激活函数(阈值):输出0/1。
  • 公式: 为阶跃函数。

2. 感知器(1958,Rosenblatt)

  • 首个可学习神经元,数据驱动调权重。
  • 逻辑门实现:
    • 与:
    • 或:
    • 非:

3. 单层局限与多层突破

  • 单层感知器: 只能解决线性可分问题(无法处理异或XOR)。
  • 1969年Minsky指出缺陷→神经网络第一次寒冬。
  • 多层感知器(MLP):用两层感知器可解决XOR,实现非线性分类。

三、神经网络结构

1. 基础结构

  • 三层: 输入层、隐藏层、输出层
  • 万能近似定理:足够多隐藏层单元,可逼近任意复杂函数。

2. 前向传播(向量化)

  • 输入:
  • 隐藏层:
  • 输出层:
  • :常用Sigmoid、ReLU等激活函数。

四、反向传播(BP)算法

1. 核心思想

  • 本质: 梯度下降+链式求导,从输出层反向传误差,更新权重。
  • 目标:最小化代价函数(交叉熵/均方误差)。

2. 代价函数

  • 二元交叉熵(分类):
  • 均方误差(回归):

3. 误差项(δ)

  • 输出层: (交叉熵)
  • 隐藏层:

4. 权重更新

  • 梯度:
  • 更新: 为学习率)

5. BP流程

  1. 随机初始化权重
  2. 前向传播:计算
  3. 计算误差:
  4. 反向更新:梯度下降调权重
  5. 迭代至收敛

本文由 mdnice 多平台发布

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐