第九章:Logistic Regression (1) — 知识点笔记

综合来源:Lecture 09 PDF(73页)、课堂笔记(CSDN)


占位图
在这里插入图片描述

9.1 分类任务

三种分类问题

类型 输出 例子
二分类(Binary) y∈{0,1}y \in \{0,1\}y{0,1} 垃圾邮件检测、疾病诊断
多分类(Multi-class) y∈{1,…,K}y \in \{1,\ldots,K\}y{1,,K} 图像标注、情感分析
结构化预测 结构化对象 翻译、ChatGPT

为什么不能直接用最小二乘?⭐⭐

问题 说明
输出范围不匹配 线性回归输出(−∞,∞)(-\infty,\infty)(,),但分类需要[0,1][0,1][0,1] → 截断不自然
MSE非凸 在逻辑回归参数空间中MSE有多个局部最小值
MSE惩罚有界 最大误差被封顶在1(预测值限于[0,1],标签0/1 → MSE≤1)
高斯噪声假设不成立 最小二乘隐含高斯噪声→不适用于{0,1}二值数据

结论:分类需要新的模型+新的误差函数!


9.2 Sigmoid函数 ⭐

定义

σ(t)=11+e−t\sigma(t) = \frac{1}{1 + e^{-t}}σ(t)=1+et1

性质

性质 说明
定义域 (−∞,+∞)(-\infty, +\infty)(,+)
值域 (0,1)(0, 1)(0,1) → 天然适合表示概率
对称性 关于(0,0.5)(0, 0.5)(0,0.5)中心对称:σ(−t)=1−σ(t)\sigma(-t) = 1 - \sigma(t)σ(t)=1σ(t)
导数 σ′(t)=σ(t)(1−σ(t))\sigma'(t) = \sigma(t)(1-\sigma(t))σ(t)=σ(t)(1σ(t))(简洁!)
反函数 Logit函数:ln⁡p1−p\ln\frac{p}{1-p}ln1pp

缩放和平移

  • AAA增大→水平压缩→更陡峭
  • BBB增大→负水平平移

9.3 逻辑回归模型 ⭐⭐

模型形式

P(y=1∣x)=σ(wTx)=11+e−wTxP(y=1|\mathbf{x}) = \sigma(\mathbf{w}^T\mathbf{x}) = \frac{1}{1 + e^{-\mathbf{w}^T\mathbf{x}}}P(y=1∣x)=σ(wTx)=1+ewTx1

P(y=0∣x)=1−σ(wTx)=σ(−wTx)P(y=0|\mathbf{x}) = 1 - \sigma(\mathbf{w}^T\mathbf{x}) = \sigma(-\mathbf{w}^T\mathbf{x})P(y=0∣x)=1σ(wTx)=σ(wTx)

  • 线性模型的Sigmoid非线性变换 → 广义线性模型
  • 决策边界:wTx=0\mathbf{w}^T\mathbf{x}=0wTx=0(线性边界)

基函数扩展

P(y=1∣x)=σ(wTϕ(x))P(y=1|\mathbf{x}) = \sigma(\mathbf{w}^T\phi(\mathbf{x}))P(y=1∣x)=σ(wTϕ(x))

  • 基函数可将非线性可分数据映射到线性可分空间

9.4 交叉熵损失函数 ⭐⭐⭐

MLE推导

似然函数(伯努利分布):
p(t∣w)=∏nσ(wTxn)tn(1−σ(wTxn))1−tnp(\mathbf{t}|\mathbf{w}) = \prod_n \sigma(\mathbf{w}^T\mathbf{x}_n)^{t_n}(1-\sigma(\mathbf{w}^T\mathbf{x}_n))^{1-t_n}p(tw)=nσ(wTxn)tn(1σ(wTxn))1tn

负对数似然 = 交叉熵(Cross-Entropy)
E(w)=−∑n[tnln⁡σ(wTxn)+(1−tn)ln⁡(1−σ(wTxn))]E(\mathbf{w}) = -\sum_n [t_n \ln \sigma(\mathbf{w}^T\mathbf{x}_n) + (1-t_n)\ln(1-\sigma(\mathbf{w}^T\mathbf{x}_n))]E(w)=n[tnlnσ(wTxn)+(1tn)ln(1σ(wTxn))]

MSE vs 交叉熵对比 ⭐⭐

MSE 交叉熵
凸性 ❌ 非凸(多局部最小值) 凸函数(保证全局最优)
惩罚 ❌ 有界(最大=1) 无界:错得离谱→损失→∞
优化 可能陷入局部最小值 梯度下降→全局最优

交叉熵的直观理解

  • t=1t=1t=1,预测p→0p\to0p0−ln⁡(p)→∞-\ln(p)\to\inftyln(p) → 巨大惩罚!
  • t=0t=0t=0,预测p→1p\to1p1−ln⁡(1−p)→∞-\ln(1-p)\to\inftyln(1p) → 巨大惩罚!
  • MSE:最大惩罚=1,对"自信但错误"太温和

通过ln放大了误差同时将其凸化!


9.5 正则化与优化

线性可分数据的退化问题

  • 数据线性可分→w\mathbf{w}w可无限增大→Sigmoid变阶跃→过拟合
  • 加入正则化:E(w)+λ∥w∥2E(\mathbf{w}) + \lambda\|\mathbf{w}\|^2E(w)+λw2

无闭式解

  • 交叉熵梯度=0 → 非线性方程→无闭式解
  • 需梯度下降等迭代优化(后续章节讲)

梯度(用于优化)

∇E(w)=∑n(σ(wTxn)−tn)xn\nabla E(\mathbf{w}) = \sum_n (\sigma(\mathbf{w}^T\mathbf{x}_n) - t_n)\mathbf{x}_nE(w)=n(σ(wTxn)tn)xn

形式简洁!误差(pn−tn)(p_n - t_n)(pntn)乘输入xn\mathbf{x}_nxn → 与线性回归梯度类似。


9.6 决策 = 后验 + 损失

决策流程

Input x→模型输出P(y∣x)→决策规则→预测类别\text{Input }\mathbf{x} \to \text{模型输出} P(y|\mathbf{x}) \to \text{决策规则} \to \text{预测类别}Input x模型输出P(yx)决策规则预测类别

  • 默认:P(y=1∣x)>0.5P(y=1|\mathbf{x}) > 0.5P(y=1∣x)>0.5 → 预测类别1
  • 可调整阈值(考虑不等代价)
  • 拒绝选项:当概率在[1−θ,θ][1-\theta, \theta][1θ,θ]之间时拒绝决策

期望损失最小化

  • 不同错误类型有不同代价→选择使期望损失最小的决策

笔记中的图片索引

序号 图片内容描述 来源位置
图1 线性回归拟合二分类数据(输出超出[0,1]) Lecture 09 第11-13页
图2 Sigmoid函数曲线及性质 Lecture 09 第29-32页
图3 逻辑回归Sigmoid拟合二分类 Lecture 09 第37页
图4 MSE vs 交叉熵误差曲面(凸vs非凸) Lecture 09 第53页
图5 线性可分数据的退化问题 Lecture 09 第58-59页

笔记整理时间:2026年6月28日

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐