准大二学生从0开始学AI——机器学习Day6
---
type: daily_note
title: Phase 2.1 Day 6 — 逻辑回归 + 决策边界 + 交叉熵损失
date: 2026-07-25
person: 吴恩达
phase: "2.1"
day: 6
topics:
[
逻辑回归,
Sigmoid函数,
决策边界,
交叉熵损失,
逻辑回归梯度下降,
逻辑回归 vs 线性回归,
]
---
# 2026-07-25 学习笔记
## 笔记区
### 核心观点
- **逻辑回归是做分类的**,虽然叫"回归"但实际是分类算法(历史命名问题)。输出是 [0,1] 的概率,不是连续值
- **Sigmoid 函数** σ(z) = 1/(1+e⁻ᶻ):把任意实数(wx+b 的结果)压到 0-1 之间,变成概率
- **决策边界**:模型画一条线,线这边判定为 1,另一边判定为 0。分界线是 σ(z) = 0.5 的地方,即 z = wx+b = 0
- **逻辑回归和线性回归的梯度下降长得一模一样**,只是 f(x) 表达式不同:
- 线性回归:f(x) = wx+b
- 逻辑回归:f(x) = σ(wx+b) = 1/(1+e⁻ᶻ)
- 梯度公式结构相同:∂J/∂wⱼ = 1/m × Σ(f(xⁱ) - yⁱ) × xⱼⁱ
- **交叉熵损失为什么不用 MSE**:MSE 在逻辑回归上是非凸函数,很多局部最优,梯度下降找不到全局最优。交叉熵损失是凸的,保证能找到全局最优
- **log 放大惩罚**:预测和真实值差得越远,log 损失惩罚越狠,梯度下降越用力修正。用户原话:"log 可以很好地放大 loss 的惩罚,这样机器学习也会更高效"
### 交叉熵损失公式(重要,记一下)
分情况:
- y=1 时:**-log(ŷ)**
- y=0 时:**-log(1 - ŷ)**
合起来写成一条:Loss = **-[y·log(ŷ) + (1-y)·log(1-ŷ)]**
### 关键方法/流程
**MSE vs 交叉熵损失对比(真实 y=1):**
| 预测 ŷ | MSE = (1-ŷ)² | 交叉熵 = -log(ŷ) | 说明 |
| --------------- | ------------ | ---------------- | -------------- |
| 0.9(接近正确) | 0.01 | 0.105 | 两者差别不大 |
| 0.1(错得离谱) | 0.81 | 2.3(≈3倍) | log 惩罚狠得多 |
**1 和 0 的分配要看具体问题定义**,不是固定说 1=故障。可以在题目里自己定义,但要交代清楚。
### 实战记录
- **Lab02 Sigmoid function**:看 Sigmoid 曲线——z 越负越靠近 0,z 越正越靠近 1,z=0 时正好是 0.5
- **Lab03 Decision Boundary**:看决策边界图——模型画一条线把两类分开
- **Lab04 Logistic Loss**:看交叉熵损失曲线——预测错时损失急剧上升,比 MSE 陡得多
---
## 线索区
**Q: 逻辑回归的损失函数公式(带 log 的)我直接记住就好了吗?**
A: 不用硬背公式本身,但要理解为什么长这样——预测对了惩罚小,预测错了惩罚大。y=1 时预测 f=0.9 损失小,预测 f=0.1 损失无穷大。记住分情况:y=1 用 -log(ŷ),y=0 用 -log(1-ŷ)。合起来是 -[y·log(ŷ) + (1-y)·log(1-ŷ)]。
**Q: 逻辑回归和线性回归的梯度下降是不是长得一样,只是 f(x) 不同?**
A: 对。两个的梯度公式 ∂J/∂wⱼ = 1/m × Σ(f(xⁱ) - yⁱ) × xⱼⁱ 结构完全一样。只是线性回归 f(x)=wx+b,逻辑回归 f(x)=σ(wx+b)=1/(1+e⁻ᶻ)。这是逻辑回归最优雅的地方——梯度下降是通用优化方法,换模型只是换了 f(x)。
**Q: 1 默认是故障吗?还是 0 是故障?**
A: 取决于你怎么定义问题,不是固定的。你在题目里说故障=1那就是 1 是故障,说故障=0 那就是 0 是故障。公式本身对两种都适用,关键是要说清楚自己的设定。(这个点要记住:不要想当然认为 1 就是"坏"的)
**Q: MSE 是指线性回归的吗?线性回归的损失是不是直接 (ŷ - y)²,逻辑回归的损失就是 -log(预测值)?**
A: 对。MSE = (ŷ - y)²,线性回归用这个。逻辑回归用交叉熵损失,分两种情况:y=1 时 -log(ŷ),y=0 时 -log(1-ŷ)。MSE 不是线性回归专属(它只是一个计算差的平方的公式),但线性回归确实用它。
**Q: 为什么逻辑回归不用 MSE?**
A: MSE 在逻辑回归上是非凸函数,有很多局部最优,梯度下降会卡住。交叉熵损失是凸函数,只有一个全局最低点,梯度下降保证能找到。吴恩达在视频里讲了这个核心区别。
**Q: 为什么 log 在错得离谱的时候惩罚比 MSE 大得多?**
A: 因为 log 函数的特性——ŷ → 0 时 -log(ŷ) → ∞。y=1 预测 0.1,MSE 损失只有 0.81,但交叉熵损失是 2.3(≈3 倍)。错得越离谱,log 惩罚越是指数级增长,梯度下降越用力修正。这就是"放大惩罚"的效果。
---
## 总结
逻辑回归用 Sigmoid 把输出变概率,梯度下降结构和线性回归一样只换 f(x),交叉熵损失比 MSE 更合适因为凸函数+放大惩罚。
---
## 复习卡片
| 概念 | 一句话 | 我的场景 |
| ---------------- | ------------------------------------------------ | --------------------------------- |
| 逻辑回归 | 用 Sigmoid 把线性输出映射成 [0,1] 概率做二分类 | 电池是否故障、贷款是否违约 |
| Sigmoid 函数 | σ(z)=1/(1+e⁻ᶻ),把任意实数压到 0~1 之间 | z=0 → 0.5,z>0 → >0.5,z<0 → <0.5 |
| 决策边界 | σ(z) ≥ 0.5 判为 1,< 0.5 判为 0,分界是 z=wx+b=0 | 模型画一条线分两类 |
| 交叉熵损失 | y=1 时 -log(ŷ),y=0 时 -log(1-ŷ) | 分类问题的默认损失函数 |
| 逻辑回归梯度下降 | 公式和线性回归一样,只是 f(x)=σ(wx+b) | 记住:结构相同,f(x) 不同 |
| 1/0 分配 | 看具体问题定义,不是固定的 | 说清楚自己的设定就行 |
更多推荐



所有评论(0)