【机器学习入门三剑客】线性回归、逻辑回归、K-Means聚类原理+代码实战详解
一、前言
初学机器学习最先接触三类经典算法:线性回归、逻辑回归、K-Means聚类,分别对应机器学习三大任务:连续值回归预测、有监督二分类、无监督自动聚类。
线性回归:根据特征预测连续数值(房价、销量)
逻辑回归:在线性基础上改造,解决0/1二分类(是否违约、是否患病)
K-Means:不需要标签,依靠数据距离自动对样本分组(用户分层、商品聚类)
本文结合原理推导、算法流程图、可落地Python代码+可视化图表,从理论到实操一站式吃透三大基础算法。
【配图位置1:封面拼图:三张子图分别是回归线拟合图、二分类分割线图、Kmeans聚类散点图】
二、三大算法原理与执行流程
2.1 线性回归|监督学习·回归任务
核心原理
目标:寻找最优超平面 \hat y = wX+b,最小化真实值与预测值误差。
损失函数:均方误差
均方误差(MSE)的计算公式为:
$$MSE=\frac1n\sum_{i=1}^n(y_i-\hat y_i)^2
通过梯度下降迭代更新权重w和偏置b,损失收敛即模型训练完成。
算法执行流程图
适用场景
房价预测、销量预估、温度、成本等输出为连续实数的场景。
【配图位置2:线性回归拟合效果图:散点+拟合直线】
2.2 逻辑回归|监督学习·二分类任务(名字是回归,实际做分类)
核心原理
- 先用线性公式 z=wX+b 得到线性结果
- 套Sigmoid激活函数,把值域压缩在[0,1]概率:
\sigma(z)=\frac{1}{1+e^{-z}} - 判定规则:概率>0.5→正类(1);概率<0.5→负类(0)
- 损失使用交叉熵损失,解决MSE在分类任务梯度失效问题。
算法执行流程图
适用场景
信贷违约判断、疾病二分类、垃圾邮件识别、用户流失预测。
【配图位置3:逻辑回归分类图:两类散点+分类决策边界】
2.3 K-Means聚类|无监督学习·自动分组(无需标签)
核心原理
- 自定义聚类数量K,随机初始化K个簇中心点
- 分配:所有样本按欧式距离划分到距离最近的簇
d=\sqrt{(x_1-x_2)2+(y_1-y_2)2} - 更新:每个簇取样本平均值生成新质心
- 循环迭代,直到质心不再变化,聚类结束
算法执行流程图
适用场景
用户分群、商品分层、异常值检测、图片像素聚类。
三、三种算法核心信息比对表
四、业务选型快速指南
- 有标注数据、想要预测一个具体数字 → 选用线性回归
例:用房屋面积、楼层预测房价; - 有标注数据、需要区分两类结果(是/否) → 选用逻辑回归
例:根据收入、负债判断用户会不会逾期; - 没有任何标签,希望机器自动把相似数据归为一类 → 选用K-Means
例:基于消费金额、频次自动划分高/中/低消费用户群。
五、总结
线性回归是机器学习数值预测的基础基石,逻辑回归依托线性结构+Sigmoid激活拓展到分类领域,而K-Means跳出标签约束开启无监督学习思路。
三者构成机器学习入门最核心的三类范式:监督回归、监督分类、无监督聚类。
建议读者分步运行代码,对照生成的可视化图表,直观理解算法收敛与数据分组逻辑,后续进阶各类复杂模型都是在这三类基础思想上演变而来。
更多推荐




所有评论(0)