目录

一、学习摘要

二、基础概念

2.1 机器学习三要素

2.2 期望风险与经验风险最小化

2.3 任务划分

三、核心推导

3.1 线性回归数学模型

3.2 MSE 损失函数 + 凸性完整证明

3.2.1损失函数表达式

3.2.2凸性严格证明

3.3 最小二乘解析解完整矩阵求导

3.3.1.对 ​编辑求梯度并令梯度等于零向量(凸函数极值条件)

 3.3.2 . 代入两条核心矩阵求导公式

3.3.3.合并梯度等式

3.3.4.求解最优权重

四、难点分析

4.1 解析解的理论局限性

4.2 凸损失的现实意义

4.3 多重共线性理论后果

一、学习摘要

学习内容:本周学习了李宏毅老师的机器学习课程第 1 讲《机器学习基础介绍》和 第 2 讲《Regression 线性回归》

本周公式推导:

  1. MSE 均方误差损失函数的凸性完整证明;
  2. 线性回归最小二乘解析解(矩阵形式)完整求导推导。

学习目标:

  • 建立标准化机器学习三要素数学定义;
  • 从矩阵、凸优化角度理解线性回归最优解来源;

二、基础概念

2.1 机器学习三要素

任意机器学习任务由三组数学对象构成:

  • 模型集 H:所有候选预测函数构成的集合 ( h(x) );
  • 损失函数:量化预测值与真实标签的偏差;
  • 优化算法:寻找使整体损失最小的最优模型。

2.2 期望风险与经验风险最小化

真实全局损失为数据分布下的期望损失:\mathcal{L}(h) = \mathbb{E}_{(\boldsymbol{x},y)\sim P_{data}}\big[L(h(\boldsymbol{x}),y)\big]

真实数据分布P(data) 未知,用训练集  N 个样本均值近似,得到经验损失:\hat{\mathcal{L}}(h) = \frac{1}{N}\sum_{i=1}^N L\big(h(\boldsymbol{x}_i),y_i\big)

机器学习核心优化目标:\min_{h\in \mathcal{H}} \hat{\mathcal{L}}(h)

2.3 任务划分

  • 回归任务:输出 y属于R的连续实数;
  • 分类任务:输出 y属于0到C中离散有限集合。

本周仅研究回归任务,以线性回归为基础模型。

三、核心推导

3.1 线性回归数学模型

单样本原始模型(分开权重与偏置):\hat{y}_i = \boldsymbol{w}^T \boldsymbol{x}_i + b

 其中 w特征权重, b 偏置项;为简化矩阵运算,构造增广向量:

\tilde{\boldsymbol{x}}_i = \begin{bmatrix}1 \\ x_{i1} \\ x_{i2} \\ \vdots \\ x_{id}\end{bmatrix},\quad \tilde{\boldsymbol{w}} = \begin{bmatrix}b \\ w_1 \\ w_2 \\ \vdots \\ w_d\end{bmatrix}

模型简化为无偏置统一形式:\hat{y}_i = \tilde{\boldsymbol{w}}^T \tilde{\boldsymbol{x}}_i

全部N个训练集写成矩阵形式:\hat{\boldsymbol{Y}} = \boldsymbol{X}\tilde{\boldsymbol{w}}

其中:

  • :设计矩阵,第 i 行是
  • :全部样本预测值向量;
  • :真实标签向量。

3.2 MSE 损失函数 + 凸性完整证明

3.2.1损失函数表达式

单样本平方损失:L(\hat{y}_i,y_i)=(\hat{y}_i-y_i)^2

 整体经验均方误差损失:\mathcal{L}(\tilde{\boldsymbol{w}}) = \frac{1}{N}\big\|\boldsymbol{X}\tilde{\boldsymbol{w}} - \boldsymbol{Y}\big\|_2^2

展开二范数: \mathcal{L}(\tilde{\boldsymbol{w}}) = \frac{1}{N}\Big[\tilde{\boldsymbol{w}}^T\boldsymbol{X}^T\boldsymbol{X}\tilde{\boldsymbol{w}} - 2\tilde{\boldsymbol{w}}^T\boldsymbol{X}^T\boldsymbol{Y} + \boldsymbol{Y}^T\boldsymbol{Y}\Big]

3.2.2凸性严格证明

凸二次函数判定定理为凸函数A半正定。

观察损失函数二次项矩阵,对任意非零向量 v:

满足半正定定义,因此二次项 是凸函数;

为线性函数(凸 + 凹),常数项为常数凸函数;

有限个凸函数相加仍为凸函数,因此 是凸损失函数。

推论:凸函数不存在局部最优≠全局最优,梯度为 0 的点一定是全局最小点。

3.3 最小二乘解析解完整矩阵求导

优化目标: \min_{\tilde{\boldsymbol{w}}} \big\| \boldsymbol{X}\tilde{\boldsymbol{w}} - \boldsymbol{Y} \big\|_2^2

系数 1/N 不改变最优权重,可直接省略。

3.3.1.对 求梯度并令梯度等于零向量(凸函数极值条件)
\nabla_{\tilde{\boldsymbol{w}}}\Big[\tilde{\boldsymbol{w}}^T\boldsymbol{X}^T\boldsymbol{X}\tilde{\boldsymbol{w}} - 2\tilde{\boldsymbol{w}}^T\boldsymbol{X}^T\boldsymbol{Y} + \boldsymbol{Y}^T\boldsymbol{Y}\Big] = \boldsymbol{0}
 3.3.2 . 代入两条核心矩阵求导公式

\nabla_{\boldsymbol{z}} \boldsymbol{z}^T A \boldsymbol{z} = (A+A^T)\boldsymbol{z}

\nabla_{\boldsymbol{z}} \boldsymbol{z}^T \boldsymbol{c} = \boldsymbol{c}

是对称矩阵 ,因此第一项梯度简化为:;第二项梯度:;常数项梯度为 0。

3.3.3.合并梯度等式

2\boldsymbol{X}^T\boldsymbol{X}\tilde{\boldsymbol{w}} - 2\boldsymbol{X}^T\boldsymbol{Y} = \boldsymbol{0}

两边消去系数 2:

\boldsymbol{X}^T\boldsymbol{X}\tilde{\boldsymbol{w}} = \boldsymbol{X}^T\boldsymbol{Y}

3.3.4.求解最优权重

若   可逆(特征线性无关、无多重共线性),等式两侧左乘逆矩阵,得到最小二乘闭式解:

\tilde{\boldsymbol{w}}^* = \big(\boldsymbol{X}^T\boldsymbol{X}\big)^{-1}\boldsymbol{X}^T \boldsymbol{Y}

补充称为矩阵 X的摩尔-彭若斯伪逆;当特征存在多重共线性时,奇异不可逆,无唯一解析解,需引入正则化。

四、难点分析

4.1 解析解的理论局限性

矩阵求逆时间复杂度为 O(d^3) ,d 为特征维度;高维大数据场景下计算成本极高,因此实际工程采用梯度下降迭代求解,两种方法无优劣,仅适用场景不同。

4.2 凸损失的现实意义

线性回归训练不会陷入局部极小,无论初始权重如何,梯度下降最终都会收敛至全局最优,这是线性模型相比非线性网络的核心理论优势。

4.3 多重共线性理论后果

若两个特征线性相关,行列式为 0,不可逆;此时有无穷多组权重均可达到相同最小损失,模型参数无唯一解释性。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐