Week1:机器学习基础+线性回归
目录
3.3.1.对 编辑求梯度并令梯度等于零向量(凸函数极值条件)
一、学习摘要
学习内容:本周学习了李宏毅老师的机器学习课程第 1 讲《机器学习基础介绍》和 第 2 讲《Regression 线性回归》
本周公式推导:
- MSE 均方误差损失函数的凸性完整证明;
- 线性回归最小二乘解析解(矩阵形式)完整求导推导。
学习目标:
- 建立标准化机器学习三要素数学定义;
- 从矩阵、凸优化角度理解线性回归最优解来源;
二、基础概念
2.1 机器学习三要素
任意机器学习任务由三组数学对象构成:
- 模型集 H:所有候选预测函数构成的集合 ( h(x) );
- 损失函数
:量化预测值与真实标签的偏差; - 优化算法:寻找使整体损失最小的最优模型。
2.2 期望风险与经验风险最小化
真实全局损失为数据分布下的期望损失:
真实数据分布P(data) 未知,用训练集 N 个样本均值近似,得到经验损失:
机器学习核心优化目标:
2.3 任务划分
- 回归任务:输出 y属于R的连续实数;
- 分类任务:输出 y属于0到C中离散有限集合。
本周仅研究回归任务,以线性回归为基础模型。
三、核心推导
3.1 线性回归数学模型
单样本原始模型(分开权重与偏置):
其中 w特征权重, b 偏置项;为简化矩阵运算,构造增广向量:
模型简化为无偏置统一形式:
全部N个训练集写成矩阵形式:
其中:
:设计矩阵,第 i 行是
;
:全部样本预测值向量;
:真实标签向量。
3.2 MSE 损失函数 + 凸性完整证明
3.2.1损失函数表达式
单样本平方损失:
整体经验均方误差损失:
展开二范数:
3.2.2凸性严格证明
凸二次函数判定定理:
为凸函数
A半正定。
观察损失函数二次项矩阵
,对任意非零向量 v:![]()
满足半正定定义,因此二次项
是凸函数;
为线性函数(凸 + 凹),常数项
为常数凸函数;
有限个凸函数相加仍为凸函数,因此
是凸损失函数。
推论:凸函数不存在局部最优≠全局最优,梯度为 0 的点一定是全局最小点。
3.3 最小二乘解析解完整矩阵求导
优化目标:
系数 1/N 不改变最优权重,可直接省略。
3.3.1.对
求梯度并令梯度等于零向量(凸函数极值条件)
3.3.2 . 代入两条核心矩阵求导公式
是对称矩阵
,因此第一项梯度简化为:
;第二项梯度:
;常数项梯度为 0。
3.3.3.合并梯度等式
两边消去系数 2:
3.3.4.求解最优权重
若
可逆(特征线性无关、无多重共线性),等式两侧左乘逆矩阵,得到最小二乘闭式解:
补充:
称为矩阵 X的摩尔-彭若斯伪逆;当特征存在多重共线性时,
奇异不可逆,无唯一解析解,需引入正则化。
四、难点分析
4.1 解析解的理论局限性
矩阵求逆时间复杂度为 O(d^3) ,d 为特征维度;高维大数据场景下计算成本极高,因此实际工程采用梯度下降迭代求解,两种方法无优劣,仅适用场景不同。
4.2 凸损失的现实意义
线性回归训练不会陷入局部极小,无论初始权重如何,梯度下降最终都会收敛至全局最优,这是线性模型相比非线性网络的核心理论优势。
4.3 多重共线性理论后果
若两个特征线性相关,
行列式为 0,不可逆;此时有无穷多组权重均可达到相同最小损失,模型参数无唯一解释性。
更多推荐




所有评论(0)