目录

摘要

Abstract

1简介

2回归模型原理(Model)

2.1基础线性回归模型

2.2模型泛化能力(Generalization)

3模型优劣评估与正则化优化(Goodness of Function)

3.1基础损失函数(均方误差 MSE)

3.2正则化(Regularization)优化(解决过拟合)

3.2.1L2正则化(岭回归,最常用)

3.2.2L1正则化(Lasso回归)

4梯度下降算法(Gradient Descent)

4.1梯度公式推导(带L2正则)

4.2参数迭代更新公式

4.3迭代收敛逻辑

4.4常见梯度下降变体

5总结


摘要

本文系统梳理了机器学习中回归算法的核心知识体系,包括线性回归模型原理、模型评估与优化方法。重点讲解了均方误差损失函数、梯度下降优化算法及其三种变体实现,深入分析了过拟合问题的产生机制及L1/L2正则化解决方案,并阐述了冲激信号在系统建模中的基础作用。全文构建了从模型构建→参数优化→性能评估→正则化改进的完整学习闭环,揭示了回归算法中模型训练与泛化能力提升的内在逻辑关系,为机器学习实践提供了系统的理论基础和方法指导。

Abstract

This article systematically reviews the core knowledge system of regression algorithms in machine learning, including the principles of linear regression models and methods for model evaluation and optimization. It focuses on explaining the mean squared error loss function, gradient descent optimization algorithm and its three variants, dives into the mechanisms behind overfitting and the L1/L2 regularization solutions, and elaborates on the fundamental role of impulse signals in system modeling. The whole text builds a complete learning loop from model building → parameter optimization → performance evaluation → regularization improvement, revealing the internal logic of model training and improving generalization ability in regression algorithms, providing a solid theoretical foundation and practical guidance for machine learning.

1简介

本次学习聚焦机器学习基础核心的回归(Regression)算法体系,系统掌握了回归模型建模逻辑、模型优化方法及配套核心基础概念,涵盖梯度下降优化、模型泛化能力、过拟合问题、正则化约束及信号基础冲激信号知识。

回归是机器学习经典的监督学习算法,核心任务是通过学习输入特征与连续输出标签之间的线性/非线性映射关系,实现数值预测,区别于分类任务的离散类别判断。在回归模型训练落地过程中,会衍生两大核心问题:一是模型训练的优化求解问题(梯度下降),二是模型性能的泛化问题(过拟合、正则化)。同时,冲激信号作为信号与系统的基础单元,是理解模型系统响应、卷积运算、数据特征提取的底层理论支撑,为回归模型的信号输入、特征建模提供理论依据。

本次学习核心关联链路:回归模型建模 → 梯度下降求解最优参数 → 模型性能评估 → 过拟合导致泛化能力下降 → 正则化约束优化模型 → 结合冲激信号完成系统级建模认知。

2回归模型原理(Model)

2.1基础线性回归模型

以最基础的多元线性回归为核心模型,假设输入特征与输出标签呈线性映射关系。设输入特征向量为

x=[x_1,x_2,...,x_n]

模型权重参数为

w=[w_1,w_2,...,w_n]

偏置项为

b

则回归预测模型公式为:

y=\sum\limits^n_{i=1}{} w_i x_i+b=W^T X+b

其中:y为模型预测值,W为参数矩阵,X为特征矩阵。模型的核心目标是通过训练数据,求解出最优的权重W和偏置b,让预测值无限逼近真实值。

2.2模型泛化能力(Generalization)

泛化能力是衡量回归模型优劣的核心指标,指模型在从未见过的全新测试数据上的预测能力。模型在训练集上拟合效果好仅为基础,只有具备优秀的泛化能力,才能适配真实业务场景。

根据泛化性能可将模型状态分为三类:

  • 正常拟合:训练集误差小,测试集误差小,模型学到数据通用规律,泛化能力优秀;
  • 欠拟合(Underfitting):模型结构过于简单,无法拟合训练数据的基础规律,训练、测试误差均大;
  • 过拟合(Overfitting):模型结构过于复杂,过度学习训练集噪声、随机误差,死记硬背训练样本,训练误差极小、测试误差极大、泛化能力极差,是回归模型训练的核心痛点。

3模型优劣评估与正则化优化(Goodness of Function)

通过损失函数量化模型预测误差,以此评判函数拟合效果,同时引入正则化解决过拟合问题,优化模型泛化能力。

3.1基础损失函数(均方误差 MSE)

回归任务最常用的损失函数为均方误差损失,用于计算预测值与真实值的整体偏差,公式推导如下:

设训练集样本量为m,单样本真实值为y_i,预测值为\widehat{y_i},则总损失函数:

L(W,b)=\frac{1}{2m}\sum\limits^m_{i=1}\left ( \widehat{y_i} - y_i \right )^{2} = \frac{1}{2m}\sum\limits^m_{i=1}\left ( W^{T}X_i + b - y_i \right )^{2}

引入系数\frac{1}{2m}是为了后续梯度求导时简化计算,不影响损失函数的极值位置。损失函数越小,代表模型在训练集上拟合效果越好。

3.2正则化(Regularization)优化(解决过拟合)

基础损失函数仅关注训练误差,无法约束模型复杂度,复杂模型易出现过拟合。正则化通过增加参数惩罚项,抑制权重参数过大,降低模型复杂度,提升泛化能力。核心公式:总损失 = 原始拟合损失 + 正则惩罚损失

3.2.1L2正则化(岭回归,最常用)

对所有权重参数的平方和进行惩罚,平滑约束参数大小,不会将参数置零,适配绝大多数回归场景。带L2正则的损失函数:

L(W,b)=\frac{1}{2m}\sum\limits^m_{i=1}\left ( \widehat{y_i} - y_i \right )^{2} +\frac{\partial }{2}\sum\limits^n_{i=1}w_i^{2}

其中\partial为正则系数:\partial=0无正则,易过拟合;\partial越大,惩罚力度越强,参数越收敛,可有效抑制过拟合。

3.2.2L1正则化(Lasso回归)

对权重参数绝对值求和惩罚,可将不重要特征的权重压缩至0,实现自动特征筛选,简化模型。带L1正则的损失函数:

L(W,b)=\frac{1}{2m}\sum\limits^m_{i=1}\left ( \widehat{y_i} - y_i \right )^{2} +\partial \sum\limits^n_{i=1}\left |w_i \right |

4梯度下降算法(Gradient Descent)

损失函数构建完成后,无法直接求解最优参数,需通过梯度下降迭代优化,最小化损失函数,是回归模型参数求解的核心优化算法。

核心原理:沿着梯度的反方向(损失函数下降最快的方向),以固定学习率小幅迭代更新参数,直至损失函数收敛,得到最优模型参数。

4.1梯度公式推导(带L2正则)

基于带L2正则的损失函数,分别对权重w和偏置b求偏导:

(1)偏置项梯度

\frac{\partial L}{\partial b}=\frac{1}{m}\sum\limits^m_{i=1}(\widehat{y_i} - y_i)

(2)权重项梯度

\frac{\partial L}{\partial b}=\frac{1}{m}\sum\limits^m_{i=1}(\widehat{y_i} - y_i)x_{ij}+\partial w_j

相较于无正则的梯度公式,权重梯度新增\partial w_j惩罚项,强制权重参数向0收敛,从根源抑制模型复杂度与过拟合。

4.2参数迭代更新公式

设学习率为 \eta(控制迭代步长),每次迭代同步更新所有权重和偏置:

b=b-\eta \cdot \frac{1}{m}\sum\limits^m_{i=1}(\widehat{y_i} - y_i)

w_j = w_j-\eta \cdot \left (\frac{1}{m}\sum\limits^m_{i=1}(\widehat{y_i} - y_i)x_{ij}+\partial w_j \right )

4.3迭代收敛逻辑

  1. 初始化权重w、偏置b;
  2. 计算当前损失函数与参数梯度;
  3. 沿梯度反方向更新参数;
  4. 重复迭代,直至损失函数不再下降、参数趋于稳定,完成模型训练。

4.4常见梯度下降变体

  • 批量梯度下降(BGD):用全部样本计算梯度,迭代稳定,但大数据量时计算速度慢;
  • 随机梯度下降(SGD):单样本迭代更新,速度快,可跳出局部最优;
  • 小批量梯度下降(Mini-Batch GD):折中方案,取部分样本迭代,兼顾速度与稳定性,工业界最常用。

5总结

本次学习形成完整的回归模型训练闭环:以冲激信号为数据与系统建模基础,构建回归预测模型;通过MSE损失函数评估拟合效果;针对模型训练产生的过拟合问题,引入L1/L2正则化约束模型复杂度、提升泛化能力;最终依靠梯度下降算法迭代求解最优模型参数,实现模型的精准拟合与良好泛化。所有知识点层层递进,覆盖了回归模型建模、评估、优化、求解的全流程核心逻辑。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐