深度学习基础 Week6 逻辑回归基础知识
目录
摘要
逻辑回归是机器学习中经典的线性二分类判别式模型,通过Sigmoid函数将线性输出映射为概率。其核心优势包括模型简洁、可解释性强及输出概率值,采用交叉熵损失函数避免梯度消失问题。虽然原生模型仅能处理线性可分数据,但可通过正则化、特征变换和级联结构进行优化拓展。逻辑回归适合高维稀疏数据和需可解释性的场景,但存在线性局限、依赖特征工程等不足。该模型涵盖了概率建模、梯度优化等机器学习核心思想,是分类任务的基础模型和深度学习的重要组成单元。
Abstract
Logistic regression is a classic linear binary classification model in machine learning that maps linear outputs to probabilities using the Sigmoid function. Its main advantages include a simple model, strong interpretability, and probability outputs, and it uses the cross-entropy loss function to avoid the vanishing gradient problem. Although the original model can only handle linearly separable data, it can be optimized and extended through regularization, feature transformation, and cascade structures. Logistic regression is suitable for high-dimensional sparse data and scenarios where interpretability is needed, but it has limitations like linear constraints and dependence on feature engineering. This model covers core machine learning concepts such as probabilistic modeling and gradient optimization, making it a fundamental model for classification tasks and an important part of deep learning.
1概述
本次学习系统掌握了逻辑回归(Logistic Regression)的完整理论体系,涵盖模型核心原理、数学推导、损失函数选择依据、参数优化方法、决策边界特性,同时结合平方误差、交叉熵损失、判别式与生成式模型、特征变换、级联模型、神经网络等相关知识点,完成了知识串联。逻辑回归是机器学习中最经典的线性二分类判别式模型,兼具简洁性、可解释性与实用性,是分类任务的基线模型,也是深度学习的基础单元。
2模型核心简介
2.1模型定位
逻辑回归名称中包含“回归”,但本质为二分类模型,用于预测样本属于某一类别的概率,输出区间为(0,1)。区别于线性回归的连续值预测,逻辑回归通过激活函数将线性输出映射为概率,解决了普通线性回归无法处理分类任务、输出无概率意义、异常值敏感的问题。
同时,逻辑回归属于判别式模型(Discriminative Model),不学习数据的生成分布P(X|Y),也不假设数据服从特定分布,直接学习条件概率P(Y|X),拟合类别间的决策边界。
2.2核心结构
逻辑回归由线性单元 + Sigmoid激活函数组成,是单层神经网络的基础单元。
3模型数学原理
3.1线性基础单元
延续线性回归的线性加权公式,输入特征向量x、权重w、偏置b,得到线性得分:
其中,无概率含义,无法直接用于分类判断。
3.2Sigmoid激活函数(核心映射)
为将无限区间的线性得分压缩至(0,1)概率区间,引入Sigmoid函数:
结合线性单元,得到逻辑回归最终预测公式:
函数核心特性
-
,可直接定义为类别概率;值域约束:
,可直接定义为类别概率;
-
分类判定阈值:默认以0.5为分界,
判定为正类y=1,
判定为负类y=0;
-
单调递增、处处可导,满足梯度下降优化条件。
3.3对数几率理论(模型由来)
定义几率(Odds):正类概率与负类概率的比值,表征事件发生的相对可能性。对几率取对数得到对数几率(Logit):
逻辑回归的本质是:用线性模型拟合样本的对数几率,通过公式变形即可推导出Sigmoid概率映射公式。
4损失函数选择与原理对比
逻辑回归不使用平方误差(Square Error/MSE),统一采用二元交叉熵损失(BCE),核心原因是优化稳定性与函数凹凸性差异。
4.1平方误差的缺陷
若强行使用平方误差损失:,存在两大致命问题:
-
非凸函数:Sigmoid嵌套平方运算后,损失曲面存在大量局部最优解,梯度下降无法收敛到全局最优;
-
梯度消失严重:梯度公式包含
衰减项,当模型预测趋于自信(
或
)时,梯度趋近于0,参数停止更新、训练停滞。
4.2二元交叉熵损失(标准损失函数)
针对二分类标签,单个样本损失公式:
对m个训练样本的整体代价函数:
核心优势
-
严格凸函数,仅存在唯一全局最优解,优化稳定;
-
梯度无衰减,避免梯度消失问题,训练收敛高效。
5参数优化:梯度下降法
逻辑回归无解析解,通过梯度下降迭代最小化损失函数,更新权重和偏置b。对损失函数求偏导,得到梯度公式:
设定学习率,参数迭代更新规则:
反复迭代直至损失函数收敛,得到最优模型参数。
6决策边界与模型特性
逻辑回归的决策边界由推导得出,此时
。
-
二维特征:决策边界为直线;
-
高维特征:决策边界为超平面。
由此可证:原生逻辑回归是严格线性分类器,仅能处理线性可分数据,无法拟合非线性决策边界。
7正则化(过拟合抑制)
为解决高维特征、复杂场景下的过拟合问题,逻辑回归引入正则化惩罚项,约束权重大小。
7.1L2正则(默认)
惩罚所有权重,使参数趋于平滑,避免过拟合
7.2L1正则与弹性网
L1正则可产生稀疏权重,实现自动特征筛选;弹性网结合L1、L2优势,适配高维稀疏数据。
8模型拓展与进阶变体
8.1多分类拓展:Softmax回归
原生逻辑回归仅支持二分类,多分类任务将Sigmoid替换为Softmax激活函数,输出所有类别的概率且总和为1,损失函数替换为多分类交叉熵,广泛用于图像、文本多分类场景。
8.2级联逻辑回归模型
单层逻辑回归仅具备线性拟合能力,通过多层逻辑回归串行级联,将前一层的概率输出作为新特征输入下一层,通过多次Sigmoid非线性映射,让模型具备非线性拟合能力,无需手动构造复杂特征,是浅层神经网络的雏形。区别于深度学习端到端训练,级联逻辑回归采用逐层贪婪训练,可解释性更强。
9特征变换适配优化
针对逻辑回归线性局限,需通过特征变换弥补模型缺陷,核心变换方式:
-
标准化:统一特征量纲,加速梯度下降收敛;
-
多项式变换:生成平方、交叉特征,将低维线性不可分数据映射为高维可分数据,实现非线性分类;
-
对数变换:修正长尾偏态数据,削弱异常值干扰;
-
特征交叉:人工构造特征交互关系,弥补模型无法自动学习特征关联的缺陷。
10模型对比:判别式与生成式模型
10.1逻辑回归(判别式)
直接学习,拟合分类边界,无数据分布假设,大数据场景精度高、灵活度高。
10.2生成式模型(GDA/朴素贝叶斯)
学习联合分布,需假设数据分布,小样本场景更稳定,具备数据生成能力,但大数据场景精度弱于逻辑回归。
11逻辑回归优缺点总结
11.1优点
-
模型简单、训练速度快、部署成本低;
-
可解释性极强:权重可量化特征对分类结果的影响;
-
输出概率值,可灵活调整分类阈值,适配风控、推荐等场景;
-
适配高维稀疏数据,鲁棒性优于多数复杂模型。
11.2局限性
-
严格线性模型,无法自动学习非线性特征关系与特征交互;
-
极度依赖人工特征工程,原始数据复杂时模型上限低;
-
对异常值、噪声、多重共线性敏感;
-
对类别不均衡数据集适配性差,少数类识别效果差;
-
拟合能力有限,复杂任务精度低于树模型、神经网络。
12学习总结
本次学习完整掌握了逻辑回归的数学原理、训练机制、优劣与拓展应用。逻辑回归看似简单,却涵盖了机器学习核心思想:概率建模、损失优化、梯度下降、正则化、特征工程等。同时通过与平方误差、交叉熵、生成式模型、神经网络、级联模型的对比,明确了模型的适用边界:作为线性判别式基线模型,适合结构化数据、高可解释性要求的工业场景;面对复杂非线性任务,需通过特征变换、级联结构或升级深度学习模型提升效果。
更多推荐




所有评论(0)