机器学习与模式识别 第九章 逻辑回归1 考点压缩
第九章:Logistic Regression (1) — 知识点笔记
综合来源:Lecture 09 PDF(73页)、课堂笔记(CSDN)
占位图
9.1 分类任务
三种分类问题
| 类型 | 输出 | 例子 |
|---|---|---|
| 二分类(Binary) | y∈{0,1}y \in \{0,1\}y∈{0,1} | 垃圾邮件检测、疾病诊断 |
| 多分类(Multi-class) | y∈{1,…,K}y \in \{1,\ldots,K\}y∈{1,…,K} | 图像标注、情感分析 |
| 结构化预测 | 结构化对象 | 翻译、ChatGPT |
为什么不能直接用最小二乘?⭐⭐
| 问题 | 说明 |
|---|---|
| 输出范围不匹配 | 线性回归输出(−∞,∞)(-\infty,\infty)(−∞,∞),但分类需要[0,1][0,1][0,1] → 截断不自然 |
| MSE非凸 | 在逻辑回归参数空间中MSE有多个局部最小值 |
| MSE惩罚有界 | 最大误差被封顶在1(预测值限于[0,1],标签0/1 → MSE≤1) |
| 高斯噪声假设不成立 | 最小二乘隐含高斯噪声→不适用于{0,1}二值数据 |
结论:分类需要新的模型+新的误差函数!
9.2 Sigmoid函数 ⭐
定义
σ(t)=11+e−t\sigma(t) = \frac{1}{1 + e^{-t}}σ(t)=1+e−t1
性质
| 性质 | 说明 |
|---|---|
| 定义域 | (−∞,+∞)(-\infty, +\infty)(−∞,+∞) |
| 值域 | (0,1)(0, 1)(0,1) → 天然适合表示概率 |
| 对称性 | 关于(0,0.5)(0, 0.5)(0,0.5)中心对称:σ(−t)=1−σ(t)\sigma(-t) = 1 - \sigma(t)σ(−t)=1−σ(t) |
| 导数 | σ′(t)=σ(t)(1−σ(t))\sigma'(t) = \sigma(t)(1-\sigma(t))σ′(t)=σ(t)(1−σ(t))(简洁!) |
| 反函数 | Logit函数:lnp1−p\ln\frac{p}{1-p}ln1−pp |
缩放和平移
- AAA增大→水平压缩→更陡峭
- BBB增大→负水平平移
9.3 逻辑回归模型 ⭐⭐
模型形式
P(y=1∣x)=σ(wTx)=11+e−wTxP(y=1|\mathbf{x}) = \sigma(\mathbf{w}^T\mathbf{x}) = \frac{1}{1 + e^{-\mathbf{w}^T\mathbf{x}}}P(y=1∣x)=σ(wTx)=1+e−wTx1
P(y=0∣x)=1−σ(wTx)=σ(−wTx)P(y=0|\mathbf{x}) = 1 - \sigma(\mathbf{w}^T\mathbf{x}) = \sigma(-\mathbf{w}^T\mathbf{x})P(y=0∣x)=1−σ(wTx)=σ(−wTx)
- 线性模型的Sigmoid非线性变换 → 广义线性模型
- 决策边界:wTx=0\mathbf{w}^T\mathbf{x}=0wTx=0(线性边界)
基函数扩展
P(y=1∣x)=σ(wTϕ(x))P(y=1|\mathbf{x}) = \sigma(\mathbf{w}^T\phi(\mathbf{x}))P(y=1∣x)=σ(wTϕ(x))
- 基函数可将非线性可分数据映射到线性可分空间
9.4 交叉熵损失函数 ⭐⭐⭐
MLE推导
似然函数(伯努利分布):
p(t∣w)=∏nσ(wTxn)tn(1−σ(wTxn))1−tnp(\mathbf{t}|\mathbf{w}) = \prod_n \sigma(\mathbf{w}^T\mathbf{x}_n)^{t_n}(1-\sigma(\mathbf{w}^T\mathbf{x}_n))^{1-t_n}p(t∣w)=n∏σ(wTxn)tn(1−σ(wTxn))1−tn
负对数似然 = 交叉熵(Cross-Entropy):
E(w)=−∑n[tnlnσ(wTxn)+(1−tn)ln(1−σ(wTxn))]E(\mathbf{w}) = -\sum_n [t_n \ln \sigma(\mathbf{w}^T\mathbf{x}_n) + (1-t_n)\ln(1-\sigma(\mathbf{w}^T\mathbf{x}_n))]E(w)=−n∑[tnlnσ(wTxn)+(1−tn)ln(1−σ(wTxn))]
MSE vs 交叉熵对比 ⭐⭐
| MSE | 交叉熵 | |
|---|---|---|
| 凸性 | ❌ 非凸(多局部最小值) | ✅ 凸函数(保证全局最优) |
| 惩罚 | ❌ 有界(最大=1) | ✅ 无界:错得离谱→损失→∞ |
| 优化 | 可能陷入局部最小值 | 梯度下降→全局最优 |
交叉熵的直观理解
- t=1t=1t=1,预测p→0p\to0p→0:−ln(p)→∞-\ln(p)\to\infty−ln(p)→∞ → 巨大惩罚!
- t=0t=0t=0,预测p→1p\to1p→1:−ln(1−p)→∞-\ln(1-p)\to\infty−ln(1−p)→∞ → 巨大惩罚!
- MSE:最大惩罚=1,对"自信但错误"太温和
通过ln放大了误差同时将其凸化!
9.5 正则化与优化
线性可分数据的退化问题
- 数据线性可分→w\mathbf{w}w可无限增大→Sigmoid变阶跃→过拟合
- 加入正则化:E(w)+λ∥w∥2E(\mathbf{w}) + \lambda\|\mathbf{w}\|^2E(w)+λ∥w∥2
无闭式解
- 交叉熵梯度=0 → 非线性方程→无闭式解
- 需梯度下降等迭代优化(后续章节讲)
梯度(用于优化)
∇E(w)=∑n(σ(wTxn)−tn)xn\nabla E(\mathbf{w}) = \sum_n (\sigma(\mathbf{w}^T\mathbf{x}_n) - t_n)\mathbf{x}_n∇E(w)=n∑(σ(wTxn)−tn)xn
形式简洁!误差(pn−tn)(p_n - t_n)(pn−tn)乘输入xn\mathbf{x}_nxn → 与线性回归梯度类似。
9.6 决策 = 后验 + 损失
决策流程
Input x→模型输出P(y∣x)→决策规则→预测类别\text{Input }\mathbf{x} \to \text{模型输出} P(y|\mathbf{x}) \to \text{决策规则} \to \text{预测类别}Input x→模型输出P(y∣x)→决策规则→预测类别
- 默认:P(y=1∣x)>0.5P(y=1|\mathbf{x}) > 0.5P(y=1∣x)>0.5 → 预测类别1
- 可调整阈值(考虑不等代价)
- 拒绝选项:当概率在[1−θ,θ][1-\theta, \theta][1−θ,θ]之间时拒绝决策
期望损失最小化
- 不同错误类型有不同代价→选择使期望损失最小的决策
笔记中的图片索引
| 序号 | 图片内容描述 | 来源位置 |
|---|---|---|
| 图1 | 线性回归拟合二分类数据(输出超出[0,1]) | Lecture 09 第11-13页 |
| 图2 | Sigmoid函数曲线及性质 | Lecture 09 第29-32页 |
| 图3 | 逻辑回归Sigmoid拟合二分类 | Lecture 09 第37页 |
| 图4 | MSE vs 交叉熵误差曲面(凸vs非凸) | Lecture 09 第53页 |
| 图5 | 线性可分数据的退化问题 | Lecture 09 第58-59页 |
笔记整理时间:2026年6月28日
更多推荐




所有评论(0)