---

type: daily_note

title: Phase 2.1 Day 6 — 逻辑回归 + 决策边界 + 交叉熵损失

date: 2026-07-25

person: 吴恩达

phase: "2.1"

day: 6

topics:

  [

    逻辑回归,

    Sigmoid函数,

    决策边界,

    交叉熵损失,

    逻辑回归梯度下降,

    逻辑回归 vs 线性回归,

  ]

---

 

# 2026-07-25 学习笔记

 

## 笔记区

 

### 核心观点

 

- **逻辑回归是做分类的**,虽然叫"回归"但实际是分类算法(历史命名问题)。输出是 [0,1] 的概率,不是连续值

- **Sigmoid 函数** σ(z) = 1/(1+e⁻ᶻ):把任意实数(wx+b 的结果)压到 0-1 之间,变成概率

- **决策边界**:模型画一条线,线这边判定为 1,另一边判定为 0。分界线是 σ(z) = 0.5 的地方,即 z = wx+b = 0

- **逻辑回归和线性回归的梯度下降长得一模一样**,只是 f(x) 表达式不同:

  - 线性回归:f(x) = wx+b

  - 逻辑回归:f(x) = σ(wx+b) = 1/(1+e⁻ᶻ)

  - 梯度公式结构相同:∂J/∂wⱼ = 1/m × Σ(f(xⁱ) - yⁱ) × xⱼⁱ

- **交叉熵损失为什么不用 MSE**:MSE 在逻辑回归上是非凸函数,很多局部最优,梯度下降找不到全局最优。交叉熵损失是凸的,保证能找到全局最优

- **log 放大惩罚**:预测和真实值差得越远,log 损失惩罚越狠,梯度下降越用力修正。用户原话:"log 可以很好地放大 loss 的惩罚,这样机器学习也会更高效"

 

### 交叉熵损失公式(重要,记一下)

 

分情况:

 

- y=1 时:**-log(ŷ)**

- y=0 时:**-log(1 - ŷ)**

 

合起来写成一条:Loss = **-[y·log(ŷ) + (1-y)·log(1-ŷ)]**

 

### 关键方法/流程

 

**MSE vs 交叉熵损失对比(真实 y=1):**

 

| 预测 ŷ | MSE = (1-ŷ)² | 交叉熵 = -log(ŷ) | 说明 |

| --------------- | ------------ | ---------------- | -------------- |

| 0.9(接近正确) | 0.01 | 0.105 | 两者差别不大 |

| 0.1(错得离谱) | 0.81 | 2.3(≈3倍) | log 惩罚狠得多 |

 

**1 和 0 的分配要看具体问题定义**,不是固定说 1=故障。可以在题目里自己定义,但要交代清楚。

 

### 实战记录

 

- **Lab02 Sigmoid function**:看 Sigmoid 曲线——z 越负越靠近 0,z 越正越靠近 1,z=0 时正好是 0.5

- **Lab03 Decision Boundary**:看决策边界图——模型画一条线把两类分开

- **Lab04 Logistic Loss**:看交叉熵损失曲线——预测错时损失急剧上升,比 MSE 陡得多

 

---

 

## 线索区

 

**Q: 逻辑回归的损失函数公式(带 log 的)我直接记住就好了吗?**

A: 不用硬背公式本身,但要理解为什么长这样——预测对了惩罚小,预测错了惩罚大。y=1 时预测 f=0.9 损失小,预测 f=0.1 损失无穷大。记住分情况:y=1 用 -log(ŷ),y=0 用 -log(1-ŷ)。合起来是 -[y·log(ŷ) + (1-y)·log(1-ŷ)]。

 

**Q: 逻辑回归和线性回归的梯度下降是不是长得一样,只是 f(x) 不同?**

A: 对。两个的梯度公式 ∂J/∂wⱼ = 1/m × Σ(f(xⁱ) - yⁱ) × xⱼⁱ 结构完全一样。只是线性回归 f(x)=wx+b,逻辑回归 f(x)=σ(wx+b)=1/(1+e⁻ᶻ)。这是逻辑回归最优雅的地方——梯度下降是通用优化方法,换模型只是换了 f(x)。

 

**Q: 1 默认是故障吗?还是 0 是故障?**

A: 取决于你怎么定义问题,不是固定的。你在题目里说故障=1那就是 1 是故障,说故障=0 那就是 0 是故障。公式本身对两种都适用,关键是要说清楚自己的设定。(这个点要记住:不要想当然认为 1 就是"坏"的)

 

**Q: MSE 是指线性回归的吗?线性回归的损失是不是直接 (ŷ - y)²,逻辑回归的损失就是 -log(预测值)?**

A: 对。MSE = (ŷ - y)²,线性回归用这个。逻辑回归用交叉熵损失,分两种情况:y=1 时 -log(ŷ),y=0 时 -log(1-ŷ)。MSE 不是线性回归专属(它只是一个计算差的平方的公式),但线性回归确实用它。

 

**Q: 为什么逻辑回归不用 MSE?**

A: MSE 在逻辑回归上是非凸函数,有很多局部最优,梯度下降会卡住。交叉熵损失是凸函数,只有一个全局最低点,梯度下降保证能找到。吴恩达在视频里讲了这个核心区别。

 

**Q: 为什么 log 在错得离谱的时候惩罚比 MSE 大得多?**

A: 因为 log 函数的特性——ŷ → 0 时 -log(ŷ) → ∞。y=1 预测 0.1,MSE 损失只有 0.81,但交叉熵损失是 2.3(≈3 倍)。错得越离谱,log 惩罚越是指数级增长,梯度下降越用力修正。这就是"放大惩罚"的效果。

 

---

 

## 总结

 

逻辑回归用 Sigmoid 把输出变概率,梯度下降结构和线性回归一样只换 f(x),交叉熵损失比 MSE 更合适因为凸函数+放大惩罚。

 

---

 

## 复习卡片

 

| 概念 | 一句话 | 我的场景 |

| ---------------- | ------------------------------------------------ | --------------------------------- |

| 逻辑回归 | 用 Sigmoid 把线性输出映射成 [0,1] 概率做二分类 | 电池是否故障、贷款是否违约 |

| Sigmoid 函数 | σ(z)=1/(1+e⁻ᶻ),把任意实数压到 0~1 之间 | z=0 → 0.5,z>0 → >0.5,z<0 → <0.5 |

| 决策边界 | σ(z) ≥ 0.5 判为 1,< 0.5 判为 0,分界是 z=wx+b=0 | 模型画一条线分两类 |

| 交叉熵损失 | y=1 时 -log(ŷ),y=0 时 -log(1-ŷ) | 分类问题的默认损失函数 |

| 逻辑回归梯度下降 | 公式和线性回归一样,只是 f(x)=σ(wx+b) | 记住:结构相同,f(x) 不同 |

| 1/0 分配 | 看具体问题定义,不是固定的 | 说清楚自己的设定就行 |

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐