Week2:机器学习线性回归、梯度下降与误差分析专题
摘要
这周继续跟着李宏毅的机器学习课程学习,重点攻克了线性回归、梯度下降和模型误差分析三大内容。课程全程用宝可梦进化 CP 值预测做案例,跟着案例走完了线性回归从建模到评估的完整流程。我手动推导了梯度下降的全套公式和迭代步骤,慢慢搞懂了参数更新的逻辑。另外也理清了偏差、方差的概念,分清了欠拟合和过拟合,明白了模型复杂度和泛化能力之间的取舍,把监督学习回归任务的基础打得更扎实了。
1 线性回归模型基础
回归是监督学习中典型的数值预测任务,核心特点是输出连续型数值结果,在多个领域有着广泛应用,常见场景包括金融指数预测、自动驾驶方向盘角度预测、各类数值评估预测等。本周课程选用宝可梦进化后CP值预测作为贯穿全程的实战案例,将宝可梦初始CP、血量、体型、属性等多维特征作为模型输入,以宝可梦进化后的真实CP值作为预测目标,系统且完整地讲解了线性回归模型的建模全思路。
1.1 建模三大核心步骤
延续机器学习通用建模逻辑,线性回归模型的搭建流程可拆解为三大核心步骤,分别是定义模型函数集合、评估模型优劣、求解最优模型,三步层层递进,构成完整的回归建模体系。
1.1.1 定义函数集合(模型)
建模第一步是划定所有可行的模型函数范围,课程从简单的单特征模型出发,逐步拓展至多特征模型,贴合实际数据拟合需求:
单特征线性模型
以宝可梦初始CP为唯一输入特征,构建基础线性模型,基础表达式:
![]()
其中 w 为权重,用于表征特征对预测结果的影响程度;b 为偏置项,用于微调模型基线、适配基础数据偏差。w 与 b 均为模型可学习参数,不同的参数组合对应不同的拟合模型,参数的变化会直接改变模型的预测效果。
多特征线性模型
为提升模型拟合精度,引入血量、身高、体重等多个输入特征,构建通用多特征线性模型,通用表达式:
![]()
多特征模型能够整合数据的多维信息,突破单特征模型的拟合局限,更全面地捕捉数据内在规律,有效提升模型整体拟合能力。
1.1.2 定义损失函数(模型评估)
完成模型定义后,需要量化评估不同模型的拟合优劣,课程采用平方误差损失函数衡量模型预测值与真实值的差距,核心逻辑为损失值越小,模型拟合效果越优异。针对宝可梦预测样本,损失函数公式:

(n从1到N)
式中 ŷⁿ 为第 n 个样本的真实标签数值,通过累加所有样本的预测误差平方,量化模型的整体误差,该损失函数也是后续模型优化、参数更新的核心依据。课程结合损失函数等高线图进行直观展示,等高线中心位置对应的损失值最小,相对应的 w、b 参数即为最优基础参数。
1.1.3 确定优化目标
线性回归建模的最终目标,是从所有可行的模型函数中,筛选出使损失函数数值最小的最优参数组合,数学表达为:
![]()
线性回归的最优参数无法通过简单计算直接得出,该最优解需要依靠梯度下降算法经过多次迭代求解得到。
2 梯度下降算法
梯度下降是机器学习中最常用、最基础的参数优化算法,适配绝大多数模型的参数迭代更新。其核心思想为:沿着损失函数梯度的反方向持续更新模型参数,逐步降低整体损失值,反复迭代直至损失值趋于稳定、模型完成收敛。本周完整完成梯度下降的公式推导与迭代流程梳理,吃透算法底层运行逻辑。
2.1 单参数梯度下降
仅保留权重参数 w 时,梯度下降的完整执行流程如下:
1. 随机初始化参数 w⁰,确定参数初始值;
2. 计算损失函数在当前参数位置的导数,即梯度 dL/dw,明确损失值的变化方向与速率;
3. 结合学习率 η 更新参数,更新公式:
![]()
4. 循环迭代上述梯度计算与参数更新步骤,直到损失值基本不再变化,模型达到收敛状态。
2.2 双参数梯度下降
针对线性回归模型包含 w、b 两个可学习参数的场景,算法要求同步更新两个参数,不可分步计算、分步更新,避免参数更新偏差影响模型效果,具体流程与公式如下:
1. 随机初始化 w⁰、b⁰,确定双参数初始值;
2. 分别计算损失函数对权重 w、偏置 b 的偏导数,共同构成梯度向量;
3. 同步更新参数,更新公式:

2.3 关键特性与注意事项
通过课程学习与公式推导,总结出梯度下降在线性回归场景下的核心特性与使用注意事项:
1.学习率:作为核心超参数,主要控制参数更新的步长。学习率设置过大会导致损失值持续震荡、无法收敛;学习率设置过小会导致迭代速度极慢,耗费大量训练时间,效率极低。
2. 凸函数特性:线性回归所用的平方损失函数属于典型凸函数,不存在局部最优解。无论初始参数如何随机选择,梯度下降迭代最终都能稳定找到全局最优解,保证模型拟合的最优性。
3. 迭代可视化:参数迭代过程可通过损失函数等高线图直观展示,参数点会持续沿着负梯度方向移动,不断向等高线中心的最优参数位置靠拢,直至收敛。
3 模型误差分析
在完成回归建模与梯度下降优化的基础上,课程深入讲解模型误差的核心来源,重点区分偏差、方差两大核心指标,从原理层面解释模型出现欠拟合、过拟合问题的根本原因,明确模型调优的核心思路。
3.1 总误差的组成
模型在全新测试集上产生的整体误差主要由三部分组成,分别为:偏差(Bias)、方差(Variance)、随机噪声。其中随机噪声是数据集本身自带的固有误差,由数据采集、环境等客观因素导致,无法通过模型训练与参数优化消除。因此,模型调优、泛化能力提升的核心,主要围绕平衡并降低偏差与方差展开。
3.2 偏差(Bias)
偏差主要用于描述模型本身的基础拟合能力,反映模型结构与数据真实规律的匹配程度:
偏差偏大时,代表模型结构过于简单,拟合能力不足,无法充分学习、捕捉数据的内在核心规律,进而出现欠拟合问题;
核心表现:模型在训练集、测试集上的误差均处于较高水平,整体拟合效果差,泛化能力薄弱。
3.3 方差(Variance)
方差主要用于描述模型训练的稳定性与抗干扰能力,反映模型对数据波动的敏感程度:
方差偏大时,代表模型结构过于复杂,拟合能力过剩,不仅学习了训练集的通用数据规律,还过度拟合了训练数据中的随机噪声、个别样本的特殊细节,进而出现过拟合问题;
核心表现:模型在训练集上误差极低、拟合效果极佳,但在全新的测试集上误差大幅上升,泛化能力严重下降。
3.4 偏差与方差的权衡
模型复杂度与偏差、方差呈对立制衡关系,二者无法同时降低,具体规律如下:
1. 模型越简单 → 拟合能力越弱,偏差升高、方差降低,极易出现欠拟合;
2. 模型越复杂 → 拟合能力越强,偏差降低、方差升高,极易出现过拟合。
在工程实践与模型训练中,需要根据数据规模、数据特征不断调整模型复杂度,在偏差与方差之间寻找最优平衡点,确保模型在训练集和测试集上均能保持良好的拟合效果与泛化能力。
3.5 过拟合现象补充
当模型复杂度远高于当前数据所需的拟合复杂度时,会出现严重的过拟合现象。此时模型不再学习数据的通用规律,而是机械“死记”训练样本的全部细节,导致模型适配性极差,面对陌生的测试数据时表现糟糕。课程补充说明,针对过拟合问题,行业常用优化手段主要包括扩充训练数据集、添加正则化约束等,可有效缓解过拟合,提升模型泛化能力。
总结
本周把线性回归、梯度下降、误差分析整套内容串联了起来,从建模、优化到模型评估形成了完整的知识链路。结合宝可梦案例理解抽象公式会轻松很多,手动推导公式也让我吃透了底层逻辑。目前我已经能分清偏差、方差、过拟合与欠拟合,但公式熟练度还不够。
更多推荐




所有评论(0)